TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2025年12月8日
Kubernetesスケジューラのベンチマークテスト本記事は、PFNのインターンシップを経て現在はアルバイトとして勤務されている上田蒼一朗さんによる寄稿です。 はじめに Preferred Networks(以下PFN)ではKubernetesを用いた機械学習基盤の開発・ […] 投稿 Kubernetesスケジューラのベンチマークテスト は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2025年12月26日
ノーコードで言語モデルの「学習」を体験できるMN-Core Playground / SLM Customizeの遊び方背景 大規模言語モデル(LLM)の普及により、AIとの対話は身近なものになりました。一方で、特定の用途に特化した小規模なモデルをローカル環境で動かす試みも関心を集めています。 自分好みの喋り方などを言語モデルにさせるため […] 投稿 ノーコードで言語モデルの「学習」を体験できるMN-Core Playground / SLM Customizeの遊び方 は Preferred Net…
Preferred Networks
2026年2月20日
日本語の自然さを測る評価手法の検証Preferred Networksでは大規模言語モデル (LLM) PLaMoの開発を継続して行っています。 LLMを開発するにあたってその能力を評価するベンチマークは非常に重要です。英語においては様々なベンチマークが […] 投稿 日本語の自然さを測る評価手法の検証 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年2月25日
コード生成ベンチマークのためのサンドボックス環境の開発はじめに Preferred Networksでは、大規模言語モデル「PLaMo」の開発を行っています。 PLaMoは開発サイクルにて様々なベンチマークによりその能力を評価していますが、今回はコード生成ベンチマークにてモ […] 投稿 コード生成ベンチマークのためのサンドボックス環境の開発 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年4月28日
存在感が高まる中国AI「Kimi」、コーディング能力の高さを米国勢も評価中国発のAI「Kimi」がコーディング分野で高く評価され、国際的な認知を広げている。同サービスを展開するMoonshot AIによれば、プログラミング能力が米国企業からも注目を集めており、アジア発のAIツールとして存在感を増しているという。 Kimiのコーディング性能は、複雑なプログラミングタスクの解決能力の高さが評価されている。このような技術的な競争力は、中国のAI開発が世界的な水準に達していることを示す指標となっている。 従来、大規模言語モデルの開発はOpenAIやGoogleといった米国企業が主導してきた。Kimiの台頭は、AI開発における地域的な多様化が進行していることを意味している。技術革新の中心が複数の国や企業に分散する傾向は、今後のAI産業の発展に新たな競争軸をもたらす可能性がある。 中国のAI企業による国際的な評価獲得は、今後のグローバルなAI市場において、新しい選択肢の登場を示唆している。 (出典:Moonshot AI)
Moonshot AI (Kimi)
2026年5月11日
BalCapRL: RL ベースのMLLM画像キャプション生成用のバランス型フレームワーク画像キャプション生成はコンピュータビジョンの最も基本的なタスクの一つです。その開放性の性質により、マルチモーダル大規模言語モデル(MLLM)の時代に多大な関心を集めています。
Apple Machine Learning Research
2026年5月15日
DatabricksがGPT-5.5をエンタープライズエージェントワークフローに導入DatabricksがOfficeQA Proベンチマークで最先端の成績を達成したGPT-5.5をエンタープライズエージェントワークフローに活用しています。
OpenAI
2026年5月18日
pretrained model向けのベンチマークの構築Preferred Networks では、大規模言語モデル PLaMo の開発を継続して行っています。 LLM を開発するうえで、モデルの能力を適切に測定するベンチマークは重要です。英語ではさまざまなベンチマークが日々 […] 投稿 pretrained model向けのベンチマークの構築 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年5月19日
EpiCache: リソース制約のある環境での長期会話向けのエピソード的KVキャッシュ管理最新の大規模言語モデル(LLM)は、コンテキスト長を数百万トークンまで拡張し、長い会話履歴に基づいた一貫性のあるパーソナライズされた応答を実現しています。しかし、キー・バリュー(KV)キャッシュが...
Apple Machine Learning Research
2026年5月27日
NVIDIA Vera CPUが競合製品に対して「強力なパンチを繰り出している」エージェンシャルAIへのシフトは、AIファクトリーの新しいCPU要件を生み出します:高速コア、膨大なメモリ帯域幅、およびすべてのコアがアクティブな場合でも高いパフォーマンスを維持する能力です。初期ベンチマークでは...
NVIDIA Blog
2026年5月29日
Amazon Bedrock AgentCoreのデータセット管理でエージェントとともに成長するテストスイートを構築エージェント評価は、急速に変化するオンラインシグナルと安定したオフラインベースラインを組み合わせることで最も強力になります。エージェントが時間とともに本当に改善されているかどうかを理解するには、固定ベンチマークが必要です。
AWS Machine Learning Blog
2026年5月29日
Amazon SageMakerでアゼルバイジャン言語モデルの構築アゼルバイジャンの大手通信事業者であるアゼルセル・テレコムLLCは、通信ユースケースとカスタマー向けアプリケーション用にAmazon SageMaker AIでアゼルバイジャン大規模言語モデル(LLM)を構築したいと考えている。
AWS Machine Learning Blog
2026年5月29日
「ミュトス」級AI一般公開へ 新型「オーパス4.8」も発表―米アンソロピック米アンソロピックが高性能AI基盤モデル「ミュトス」級を一般公開し、新型「オーパス4.8」を発表しました。これまで限定利用に止めていた同社の方針転換は、OpenAIやGoogleの急速な技術進化と商用化への競争対応を示しており、大規模言語モデルの性能差縮小に伴い、アクセス可能性と価格競争力が市場シェアの決定要因へと変わりつつあることを反映しています。一般公開により、金融や製造、医療などAI導入の障壁が高かった領域での実装が加速し、スタートアップなど小規模企業による高性能モデル利用の民主化効果が期待される一方で、著作権問題やディープフェイク悪用、バイアス拡大など規制・倫理面での新たな課題が生じる可能性があります。
時事通信
2026年5月29日
UNIQUE: 訓練不要な推論とスパーシティ対応訓練のための普遍的トップkスパース注意大規模言語モデルの長文脈推論は、自己注意キー値キャッシュの線形増加によってボトルネックとなっている。トップkスパース注意はキャッシュの一部のみをロードすることで緩和するが、キャッシュ重要度を正確かつ安価に推定することが課題である。
arXiv cs.CL
2026年5月29日
幻覚は有用か?システムI/IIの推論連鎖によるSLMでの多段階質問解決最近、小規模言語モデル(SLM)が注目を集めています。これらは高速で良好な性能を示し、大規模言語モデル(LLM)よりもハードウェア要件が低いです。しかし、SLMはLLMよりも頻繁に幻覚を生じ、複雑な多段階推論問題を解く能力に影響を与えます。
arXiv cs.CL
2026年5月29日
言語優先性の脱却: モダリティ認識ポリシー最適化によるオーディオ推論の後期段階モダリティ崩壊の軽減オーディオと全モダリティ大規模言語モデルは印象的なクロスモーダル推論能力を示すが、これらのモデルに標準的な強化学習後処理アルゴリズムを適用すると、GRPO のような方法がすべてのトークンに均一なポリシー勾配を適用する構造的脆弱性が露呈する。
arXiv cs.CL
2026年5月29日
UniMaia: 人間らしいプレイのための言語によるチェス戦略の操舵大規模言語モデルの最近の進歩により、自然言語は複雑なシステムを制御するための柔軟なインターフェースとして機能するようになったが、大規模な多モーダル訓練またはドメイン固有の帰納バイアスの弱化が必要である。チェスなどの構造化意思決定領域では、専門的なアプローチが優先される。
arXiv cs.CL
2026年5月29日
CosmicFish-HRM: コンパクト言語モデルにおける階層的回帰メカニズムを介した適応的推論大規模言語モデルは強力な推論能力を実現しているが、膨大なパラメータ数と高い推論コストが課題である。本研究では、コンパクト言語モデルにおける適応的推論深度の異なるアプローチを探索し、CosmicFish-HRMを提案している
arXiv cs.LG
2026年5月29日
クロスモデルエントロピーによるラベル不要強化学習強化学習を用いた大規模言語モデルの事後学習は報酬信号によってボトルネックとなっている。既存のアプローチは、自動正確性チェック(数学やコード実行など)のある領域に訓練を制限する検証可能な報酬か、人間の選好ラベルのいずれかを必要とする。
arXiv cs.LG
2026年5月29日
LCO: LLMベースの制約最適化によるより安全なエージェントLLM実世界タスク対応大規模言語モデル(LLM)は自律エージェントとしてますます機能していますが、環境との継続的なインタラクションはコンテキスト内報酬ハッキング(ICRH)につながる可能性があり、これはLLMがプロキシ目標を最大化するために行動を反復的に最適化し、意図しない有害な副作用を生み出す現象です。
arXiv cs.CL
2026年5月29日
多言語LLMタスク実行における言語役割の分離多言語LLMは、指示、ソースコンテンツ、および必要な応答言語が一致しない場合にますます使用されています。既存のベンチマークは多言語命令追従評価を拡張していますが、完全にクロスされた設計内でこれら3つの役割を分離することはめったにありません。MTM-Benchを導入します。
arXiv cs.CL
2026年5月29日
BenchTrace:LLMエージェントの反省能力と制御された進化をテストするベンチマークarXiv:2605.29225v1 文書の発表。自己進化型エージェントは過去の失敗を反省することで時間とともに改善されますが、既存の評価には2つの制限があります。タスクスコアのみを測定して反省の質は不明であり、エージェント自身のエピソード実行に依存して特定の失敗パターンに対応するメカニズムがありません。本論文では新しいアプローチを提示しています。
arXiv cs.AI
2026年5月29日
モデルが一致しない場合:公開コメント分析向けLLM評価の再考連邦機関は公開コメント・コーパスを分類するために大規模言語モデル(LLM)を展開しており、モデルの記録の編成は政策立案者が見るものと登録される議論を形作ります。小規模な検証セットに対する姿勢精度に基づく標準的な評価は、モデルが相違する時期を検出できません。
arXiv cs.AI
2026年5月29日
GTA:スケーラブルなWebエージェント用ロングホライズンタスク生成arXiv:2605.29218v1 文書の発表。言語モデルをブラウジングおよびツール使用機能と組み合わせたWebエージェントは、オープンなWebアシスタントとしての可能性を示していますが、スケーラブルなプロセスレベルの監督の不足により進展が制限されています。既存のベンチマークは主に手動で構築されており、粗い開始ゴール注釈のみを提供しています。
arXiv cs.AI
2026年5月29日
カリキュラムのカスタマイズ:動的データ・モデル互換性による学生中心の推論蒸留arXiv:2605.29229v1 文書の発表。推論蒸留は大規模言語モデル(LLM)から小規模モデルへ複雑な推論能力を転移させますが、その成功は訓練データが学生モデルとどの程度合致しているかに依存します。本論文では、データ・モデル互換性(DMC)メトリクスを導入し、その適合性を評価するために使用できます。
arXiv cs.AI
2026年5月29日
カタストロフィック・フォーゲッティングの機序的起源:RLがSFTよりも回路をよく保持する理由大規模言語モデル(LLM)のファインチューニングはしばしば以前の能力のカタストロフィック・フォーゲッティングを引き起こす。最近の研究によれば、強化学習(RL)は教師あり学習(SFT)よりも効果的に以前の能力を保持し、ポリシー勾配更新がより近い状態に留まることに起因している。
arXiv cs.LG
2026年5月29日
トーンに気をつけよう:トーンはLLMのパフォーマンスを変えるか?大規模言語モデル(LLM)の使用が増加していますが、プロンプトのスタイルとトーンによってパフォーマンスが異なることが観察されています。本研究では、プロンプトのトーンの変動が客観的な多肢選択問題に対するLLMの精度にどのような影響を与えるかを調査しています。
arXiv cs.AI
2026年5月29日
ARから拡散へ:厳密に因果的で柔軟な地平線を持つ大規模言語モデルの効率的な適応拡散モデルは効率的な並列テキスト生成を約束していますが、双方向アテンションに依存しており、事前学習済みの自動回帰(AR)モデルとの構造的な不一致を生じています。この非互換性はロバストなAR事前知識の再利用を排除し、スクラッチからの禁止的な事前学習が必要になります。
arXiv cs.CL
2026年5月29日
ReverseMath: 数学問題生成の拡張可能性と検証可能性を実現する逆向き回答手法数学推論ベンチマークはLLMの評価に不可欠だが、多くは静的で公開評価やトレーニングパイプラインを通じて繰り返し露出しており、真の推論と暗記を区別することが困難である。一方、新しい数学問題の手動構築は...
arXiv cs.CL
2026年5月29日
潜在推論による堅牢で効率的なガードレール大規模言語モデル(LLM)の安全性維持は、現実世界のアプリケーションへの導入が増加する中で極めて重要です。既存の安全ガードレールは通常、単一パス分類に依存するか、より最近では蒸留推論を使用しています。推論ベースのガードレールは従来の分類方法を大幅に上回ります。
arXiv cs.AI