TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2025年12月26日
ノーコードで言語モデルの「学習」を体験できるMN-Core Playground / SLM Customizeの遊び方背景 大規模言語モデル(LLM)の普及により、AIとの対話は身近なものになりました。一方で、特定の用途に特化した小規模なモデルをローカル環境で動かす試みも関心を集めています。 自分好みの喋り方などを言語モデルにさせるため […] 投稿 ノーコードで言語モデルの「学習」を体験できるMN-Core Playground / SLM Customizeの遊び方 は Preferred Net…
Preferred Networks
2026年2月20日
日本語の自然さを測る評価手法の検証Preferred Networksでは大規模言語モデル (LLM) PLaMoの開発を継続して行っています。 LLMを開発するにあたってその能力を評価するベンチマークは非常に重要です。英語においては様々なベンチマークが […] 投稿 日本語の自然さを測る評価手法の検証 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年2月25日
コード生成ベンチマークのためのサンドボックス環境の開発はじめに Preferred Networksでは、大規模言語モデル「PLaMo」の開発を行っています。 PLaMoは開発サイクルにて様々なベンチマークによりその能力を評価していますが、今回はコード生成ベンチマークにてモ […] 投稿 コード生成ベンチマークのためのサンドボックス環境の開発 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年4月28日
存在感が高まる中国AI「Kimi」、コーディング能力の高さを米国勢も評価中国発のAI「Kimi」がコーディング分野で高く評価され、国際的な認知を広げている。同サービスを展開するMoonshot AIによれば、プログラミング能力が米国企業からも注目を集めており、アジア発のAIツールとして存在感を増しているという。 Kimiのコーディング性能は、複雑なプログラミングタスクの解決能力の高さが評価されている。このような技術的な競争力は、中国のAI開発が世界的な水準に達していることを示す指標となっている。 従来、大規模言語モデルの開発はOpenAIやGoogleといった米国企業が主導してきた。Kimiの台頭は、AI開発における地域的な多様化が進行していることを意味している。技術革新の中心が複数の国や企業に分散する傾向は、今後のAI産業の発展に新たな競争軸をもたらす可能性がある。 中国のAI企業による国際的な評価獲得は、今後のグローバルなAI市場において、新しい選択肢の登場を示唆している。 (出典:Moonshot AI)
Moonshot AI (Kimi)
2026年5月11日
BalCapRL: RL ベースのMLLM画像キャプション生成用のバランス型フレームワーク画像キャプション生成はコンピュータビジョンの最も基本的なタスクの一つです。その開放性の性質により、マルチモーダル大規模言語モデル(MLLM)の時代に多大な関心を集めています。
Apple Machine Learning Research
2026年5月15日
ゼロデイエクスプロイトがWindows 11のデフォルトBitLocker保護を完全に無効化エクスプロイトの動作メカニズムは完全には明らかではありません。マイクロソフトが調査中です。
Ars Technica AI
2026年5月16日
肝臓病メカニズムの発見を加速させるフィリッポ・メノラシーナはCo-Scientistを使用して、新しい肝臓病治療法を特定し、既存の薬が特定の患者にしか効かない理由を解明しています。
Google DeepMind
2026年5月18日
pretrained model向けのベンチマークの構築Preferred Networks では、大規模言語モデル PLaMo の開発を継続して行っています。 LLM を開発するうえで、モデルの能力を適切に測定するベンチマークは重要です。英語ではさまざまなベンチマークが日々 […] 投稿 pretrained model向けのベンチマークの構築 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年5月19日
遺伝子の高速スクリーニングで細胞老化を逆転させる細胞の老化メカニズムの解明に向けて、重要な進展がもたらされました。Google DeepMindの研究チームが、AI技術を活用した遺伝子スクリーニング手法を用いて、ヒト細胞の若返りに関わる新たな遺伝的因子の発見に成功しました。 この研究では、Co-Scientistと呼ばれるツールを使用し、膨大な遺伝子データの中から細胞老化の逆転に関連する候補因子を効率的に特定しました。従来の手法では時間を要していた遺伝子分析が、高速化されたことにより、新規因子の同定が可能になったとされています。 細胞老化は、加齢に関連する疾患の発症に深く関わっており、この逆転メカニズムの理解は、アンチエイジング医療や加齢関連疾患の治療開発に大きな可能性を秘めています。今回の発見は、遺伝子レベルでの老化制御への理解を深め、将来的な医療応用に向けた基礎研究として期待されます。 (Google DeepMind)
Google DeepMind
2026年5月19日
EpiCache: リソース制約のある環境での長期会話向けのエピソード的KVキャッシュ管理最新の大規模言語モデル(LLM)は、コンテキスト長を数百万トークンまで拡張し、長い会話履歴に基づいた一貫性のあるパーソナライズされた応答を実現しています。しかし、キー・バリュー(KV)キャッシュが...
Apple Machine Learning Research
2026年5月22日
VSAS-Bench:ビジュアルストリーミングアシスタントモデルのリアルタイム評価ストリーミング視覚言語モデル(VLM)は、命令プロンプトとオンラインの入力フレームストリームが与えられるとリアルタイムで応答を生成し続けます。これはリアルタイムビジュアルアシスタントの中核メカニズムです。
Apple Machine Learning Research
2026年5月28日
イラン、「米軍が撤退約束」と主張 トランプ大統領、海峡管理容認せず―開戦3カ月、散発的衝突継続米イラン紛争が開戦から3カ月を経過し、散発的な衝突が継続しています。イランは米軍の撤退を約束したと主張していますが、トランプ大統領はこれを否定し、ホルムズ海峡の管理容認も拒否しています。この対立の根底には、世界のエネルギー輸送の大動脈であるホルムズ海峡の支配権をめぐる戦略的競合があります。両国間に妥協可能なシナリオが極めて限定的であり、外交メカニズムの機能不全により、軍事的偶発事態がエスカレーションしやすい危機的状況が続いています。
時事通信
2026年5月28日
米イラン戦闘終結覚書、トランプ大統領の最終判断を待つ状態米国とイランの軍事的対峙を終わらせる覚書交渉が最終段階に入り、トランプ大統領の判断待ちとなっています。1979年の革命以降、両国は軍事衝突と外交的断絶を繰り返してきましたが、今回の交渉は過去数十年の対立構造の転換を示唆するものです。ただし覚書は国際条約より拘束力が低く、実効性には詳細な実行メカニズムが不可欠とされています。またイスラエルやサウジアラビアといった同盟国の懸念も大きく、米国外交の信頼性が問われる複雑な状況となっています。
時事通信
2026年5月29日
Amazon SageMakerでアゼルバイジャン言語モデルの構築アゼルバイジャンの大手通信事業者であるアゼルセル・テレコムLLCは、通信ユースケースとカスタマー向けアプリケーション用にAmazon SageMaker AIでアゼルバイジャン大規模言語モデル(LLM)を構築したいと考えている。
AWS Machine Learning Blog
2026年5月29日
「ミュトス」級AI一般公開へ 新型「オーパス4.8」も発表―米アンソロピック米アンソロピックが高性能AI基盤モデル「ミュトス」級を一般公開し、新型「オーパス4.8」を発表しました。これまで限定利用に止めていた同社の方針転換は、OpenAIやGoogleの急速な技術進化と商用化への競争対応を示しており、大規模言語モデルの性能差縮小に伴い、アクセス可能性と価格競争力が市場シェアの決定要因へと変わりつつあることを反映しています。一般公開により、金融や製造、医療などAI導入の障壁が高かった領域での実装が加速し、スタートアップなど小規模企業による高性能モデル利用の民主化効果が期待される一方で、著作権問題やディープフェイク悪用、バイアス拡大など規制・倫理面での新たな課題が生じる可能性があります。
時事通信
2026年5月29日
連続時間因果基盤モデルに向けて離散時間因果Prior-data Fitted Networksを時系列から連続時間に拡張することは、メカニズムを確率微分方程式(SDE)として記述することを招く。しかし、SDEが観測ギャップごとに一度積分される場合、軌跡の法則は観測時期に依存し、事前分布が残る。
arXiv cs.LG
2026年5月29日
言語優先性の脱却: モダリティ認識ポリシー最適化によるオーディオ推論の後期段階モダリティ崩壊の軽減オーディオと全モダリティ大規模言語モデルは印象的なクロスモーダル推論能力を示すが、これらのモデルに標準的な強化学習後処理アルゴリズムを適用すると、GRPO のような方法がすべてのトークンに均一なポリシー勾配を適用する構造的脆弱性が露呈する。
arXiv cs.CL
2026年5月29日
クロスモデルエントロピーによるラベル不要強化学習強化学習を用いた大規模言語モデルの事後学習は報酬信号によってボトルネックとなっている。既存のアプローチは、自動正確性チェック(数学やコード実行など)のある領域に訓練を制限する検証可能な報酬か、人間の選好ラベルのいずれかを必要とする。
arXiv cs.LG
2026年5月29日
LCO: LLMベースの制約最適化によるより安全なエージェントLLM実世界タスク対応大規模言語モデル(LLM)は自律エージェントとしてますます機能していますが、環境との継続的なインタラクションはコンテキスト内報酬ハッキング(ICRH)につながる可能性があり、これはLLMがプロキシ目標を最大化するために行動を反復的に最適化し、意図しない有害な副作用を生み出す現象です。
arXiv cs.CL
2026年5月29日
BenchTrace:LLMエージェントの反省能力と制御された進化をテストするベンチマークarXiv:2605.29225v1 文書の発表。自己進化型エージェントは過去の失敗を反省することで時間とともに改善されますが、既存の評価には2つの制限があります。タスクスコアのみを測定して反省の質は不明であり、エージェント自身のエピソード実行に依存して特定の失敗パターンに対応するメカニズムがありません。本論文では新しいアプローチを提示しています。
arXiv cs.AI
2026年5月29日
カリキュラムのカスタマイズ:動的データ・モデル互換性による学生中心の推論蒸留arXiv:2605.29229v1 文書の発表。推論蒸留は大規模言語モデル(LLM)から小規模モデルへ複雑な推論能力を転移させますが、その成功は訓練データが学生モデルとどの程度合致しているかに依存します。本論文では、データ・モデル互換性(DMC)メトリクスを導入し、その適合性を評価するために使用できます。
arXiv cs.AI
2026年5月29日
CosmicFish-HRM: コンパクト言語モデルにおける階層的回帰メカニズムを介した適応的推論大規模言語モデルは強力な推論能力を実現しているが、膨大なパラメータ数と高い推論コストが課題である。本研究では、コンパクト言語モデルにおける適応的推論深度の異なるアプローチを探索し、CosmicFish-HRMを提案している
arXiv cs.LG
2026年5月29日
幻覚は有用か?システムI/IIの推論連鎖によるSLMでの多段階質問解決最近、小規模言語モデル(SLM)が注目を集めています。これらは高速で良好な性能を示し、大規模言語モデル(LLM)よりもハードウェア要件が低いです。しかし、SLMはLLMよりも頻繁に幻覚を生じ、複雑な多段階推論問題を解く能力に影響を与えます。
arXiv cs.CL
2026年5月29日
カタストロフィック・フォーゲッティングの機序的起源:RLがSFTよりも回路をよく保持する理由大規模言語モデル(LLM)のファインチューニングはしばしば以前の能力のカタストロフィック・フォーゲッティングを引き起こす。最近の研究によれば、強化学習(RL)は教師あり学習(SFT)よりも効果的に以前の能力を保持し、ポリシー勾配更新がより近い状態に留まることに起因している。
arXiv cs.LG
2026年5月29日
モデルが一致しない場合:公開コメント分析向けLLM評価の再考連邦機関は公開コメント・コーパスを分類するために大規模言語モデル(LLM)を展開しており、モデルの記録の編成は政策立案者が見るものと登録される議論を形作ります。小規模な検証セットに対する姿勢精度に基づく標準的な評価は、モデルが相違する時期を検出できません。
arXiv cs.AI
2026年5月29日
UniMaia: 人間らしいプレイのための言語によるチェス戦略の操舵大規模言語モデルの最近の進歩により、自然言語は複雑なシステムを制御するための柔軟なインターフェースとして機能するようになったが、大規模な多モーダル訓練またはドメイン固有の帰納バイアスの弱化が必要である。チェスなどの構造化意思決定領域では、専門的なアプローチが優先される。
arXiv cs.CL
2026年5月29日
ARから拡散へ:厳密に因果的で柔軟な地平線を持つ大規模言語モデルの効率的な適応拡散モデルは効率的な並列テキスト生成を約束していますが、双方向アテンションに依存しており、事前学習済みの自動回帰(AR)モデルとの構造的な不一致を生じています。この非互換性はロバストなAR事前知識の再利用を排除し、スクラッチからの禁止的な事前学習が必要になります。
arXiv cs.CL
2026年5月29日
UNIQUE: 訓練不要な推論とスパーシティ対応訓練のための普遍的トップkスパース注意大規模言語モデルの長文脈推論は、自己注意キー値キャッシュの線形増加によってボトルネックとなっている。トップkスパース注意はキャッシュの一部のみをロードすることで緩和するが、キャッシュ重要度を正確かつ安価に推定することが課題である。
arXiv cs.CL
2026年5月29日
トーンに気をつけよう:トーンはLLMのパフォーマンスを変えるか?大規模言語モデル(LLM)の使用が増加していますが、プロンプトのスタイルとトーンによってパフォーマンスが異なることが観察されています。本研究では、プロンプトのトーンの変動が客観的な多肢選択問題に対するLLMの精度にどのような影響を与えるかを調査しています。
arXiv cs.AI
2026年5月29日
潜在推論による堅牢で効率的なガードレール大規模言語モデル(LLM)の安全性維持は、現実世界のアプリケーションへの導入が増加する中で極めて重要です。既存の安全ガードレールは通常、単一パス分類に依存するか、より最近では蒸留推論を使用しています。推論ベースのガードレールは従来の分類方法を大幅に上回ります。
arXiv cs.AI