TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
読解か推測か?古代ギリシャ版のOCRにおけるビジョン言語モデルの視覚的グラウンディング失敗視覚言語モデル(VLM)を光学文字認識(OCR)に使用すると、視覚的根拠のない高尤度テキストを生成でき、言語優先性への依存を示唆している。オープンウェイト VLM を従来の OCR ベースラインと低資源古代ギリシャ校訂版で比較すると、このギャップが明らかになる。
arXiv cs.CL
2026年6月2日
近未来ガイダンスを通じたオンポリシー蒸留における推論軌跡の橋渡しオンポリシー蒸留(OPD)は、教師の監督下で自身のポリシーからサンプリングされた軌跡について学生モデルを訓練することで大規模言語モデルの推論を改善します。OPDは軌跡上で動作しますが、その学習シグナルはトークンレベルのままです。高損失トークンを通じて逸脱を特定します。
arXiv cs.CL
2026年6月2日
弱い批評家が強い学習者を作る: スケーラブルな監督のためのオンポリシー批評蒸留大規模言語モデルがより強力になるにつれて、弱い教師は複雑な出力に対して信頼できるラベル、選好、または最終判断を提供できず、弱から強への汎化とスケーラブルな監督の両方を制限する可能性があります。より扱いやすい弱い教師を使用する形式を研究します。
arXiv cs.AI
2026年6月16日
CoRA:信頼性の高い思考連鎖推論のための信頼度と根拠の整合性思考連鎖(CoT)推論はLLMのパフォーマンスを向上させることができますが、CoTの根拠がもっともらしくても不完全または十分に裏付けられていない場合、高い回答信頼度は誤解を招く可能性があります。本研究では、モデルがコミットした回答に対する信頼度が、生成された根拠によって正当化されるかどうか、すなわち信頼度と根拠の整合性について調査します。回答の正しさ、コミットされた回答の確率、およびルーブリック(評価基準)に基づく根拠のサポートを共同で評価するGRPOベースの強化学習フレームワークを導入しました。このルーブリックは、正解を明かさずに、根拠のグラウンディング(根拠付け)、一貫性、タスクへの適合性、および選択された回答との関連性を評価します。MedQA、MathQA、OpenBookQAの3つのオープンウェイトLLMを用いた実験では、本手法は、チューニングされていないチェックポイント、SFT、および正しさのみを重視するGRPOと比較して、信頼度と根拠の整合性エラーを最大26.51%削減し、競争力のある精度を維持しつつ、しばしばキャリブレーション(校正)を改善しました。
arXiv cs.CL
2026年6月16日
Nemotron 3 Ultra:エージェント推論のためのオープンで効率的なMixture-of-ExpertsハイブリッドMamba-Transformerモデル5500億の総パラメータと550億のアクティブパラメータを持つMixture-of-ExpertsハイブリッドMamba-Attention言語モデル「Nemotron 3 Ultra」を紹介します。Nemotron 3 Ultraは20兆トークンのテキストで事前学習され、その後コンテキスト長を100万トークンに拡張し、教師ありファインチューニング(SFT)、強化学習(RL)、マルチティーチャー・オンポリシー蒸留(MOPD)を用いて事後学習されました。Nemotron 3 Ultraは、LatentMoE、マルチトークン予測(MTP)、NVFP4事前学習、マルチ環境RLVR、MOPD、推論バジェット制御といった複数の主要技術を採用した、これまでにない最も高性能なモデルです。Nemotron 3 Ultraは、最先端の公開LLMと比較して最大約6倍高い推論スループットを達成しながら、同等の精度を実現しています。最先端の精度、高い推論スループット、100万トークンのコンテキスト長により、Nemotron 3 Ultraは長期間実行される自律エージェントタスクに最適です。
arXiv cs.CL
2026年6月17日
近接政策最適化のゾーン:勾配ではなくプロンプト内の教師知識蒸留は教師の能力を小さな生徒モデルに転送しますが、生徒モデルが小さい場合に脆く、汎化性能を損なう可能性があります。 強化学習では、教師の応答をポリシー勾配に直接注入すると、オンポリシーの仮定が破られ、ドリフトを引き起こす可能性があります。 本研究では、プロンプト内に教師を保持する「近接政策最適化のゾーン(ZPPO)」を導入し、特に難しい質問に対して二つの再構成されたプロンプトを構築します。
arXiv cs.CL
2026年6月21日
水面を歩くうさぎの姿に…⇨まるで「もののけ姫のシシ神様」「神秘的です」と反響(ハフポスト日本版)まるで神さまが舞い降りたよう…。水面を歩くうさぎの神秘的な姿がXで話題になっています。 投稿したのは、うさぎ写真家 utaさん(@utajima)。 「綺麗にリフレクションした水面を歩くうさぎさん
Yahoo!ニュース IT
2026年6月26日
DanceOPD: オンポリシー生成フィールド蒸留画像生成技術の分野で、多様な能力を一つのモデルで実現することを目指した新たな研究「DanceOPD」が発表されました。この技術は、生成したい画像の特性に応じて、最適な生成プロセスを自動で選択する仕組みを持っています。 具体的には、DanceOPDは生成したいサンプルごとに、その特徴を分析し、適切な「能力フィールド」へと誘導します。そして、そのフィールド内でノイズの少ない状態を特定してクエリすることで、目的に合った画像を生成します。このプロセスにより、これまで個別のモデルでしか実現できなかったような、専門的な能力を合成して学習することが可能になります。この研究は、画像生成における汎用性と効率性を飛躍的に向上させる可能性を秘めています。 arXiv cs.LG
arXiv cs.LG
2026年6月30日
SEAD:エントロピー誘導型教師あり学習による、能力を考慮したオンポリシー蒸留オンポリシー蒸留(OPD)は、オフライン蒸留や強化学習(RL)にはない特性、すなわち教師の監督品質が生徒の能力に依存するという特性を持っています。不整合なロールアウトはノイズの多い勾配を生み、既に習得したトークンは冗長なものになります。これは3つのスケール(トークン、トレーニングフェーズ、プロンプト)で無駄を生じさせますが、既存の方法は均一に監督します。本稿では、SEADを提案します。これは、3つのスケールにおけるこの能力依存型の劣化の統一的なプローブとしてエントロピーを使用します。(1)教師と生徒の共同エントロピーは、トークンを、調整されたダイバージェンスまたはゼロ勾配を受け取るゾーンに分割します(約50%がスキップされます)。(2)コサインスケジュールは、能力の成長に伴い、フォワードKLからリバースKLへと減衰します。(3)能力ゲート付きカリキュラムは、簡単なものから難しいものへとプロンプトを導入します。これらのコンポーネントは共生的かつ必要不可欠です。トークン選択には整合性の取れたロールアウト(カリキュラム)が必要であり、減衰には単調な改善(これもカリキュラム)が必要です。
arXiv cs.CL
2026年6月30日
臨床トレーニングのためのフランス語OSCE対話データセットと制御可能な仮想患者システム医学生の臨床スキルとコミュニケーションスキルは、医師と患者のやり取りを短時間でシミュレーションする客観構造化臨床試験(OSCE)を通じて一般的に評価されます。しかし、訓練は人間の標準化された患者の利用可能性が低いという制約を受けることが多く、リアルな仮想患者(VP)の開発が動機付けられています。このギャップを埋めるため、240件の学生と患者のトレーニングインタラクションを含むフランス語OSCE対話データセットを導入します。これに基づき、合成OSCE対話を生成するための制御可能なLLMベースのパイプラインを構築します。このパイプラインは、リトリーバルベースのグラウンディングやリフレクションループなどのモジュラーコンポーネントを統合し、患者の忠実性、一貫性、現実性を確保します。さらに、LLM-as-a-Judgeアプローチを使用して、患者シミュレーションの質、学生のパフォーマンス、言語の質を評価する多層評価フレームワークを提案します。実験の結果、制御モジュールは一般的に患者の忠実性と学生の評価の一貫性を向上させることが示唆されています。
arXiv cs.CL
2026年7月1日
反復プロンプト最適化のための対照的リフレクションLLMエージェントは情報検索の中心となりつつあります。検索クエリの発行、回答の統合、そしてIR評価の判断基準としての役割を担っています。これらのエージェントを制御するプロンプトの改善は最適化問題ですが、実際のIR設定では、盲目的な探索というよりはデバッグに近いものとなります。エンジニアは、どの動作が失敗したのか、近くのどのような動作がまだ機能しているのか、それらをどう区別するのか、そしてプロンプトの編集が保持された品質を向上させ、退行を導入しないかどうかを知る必要があります。本稿では、エージェント型IRワークフローのための反復プロンプト最適化フレームワークであるContrastive Reflection(対照的リフレクション)を提案します。このフレームワークは、タスク中心の品質定義から始まります。QAエージェントは検索または推論のトレースを露出し、評価エージェントは次元レベルのスコアと根拠を露呈します。
arXiv cs.AI
2026年7月3日
手続き的記憶蒸留:自己改善型言語モデルのためのオンラインリフレクション検証可能な報酬を用いた強化学習(RLVR)や、最近の自己蒸留のバリアント(SDPOなど)は、各ロールアウトを検証機で評価し、エピソードレベルの信号からポリシーを更新する。しかし、ロールアウトに含まれるより豊かな手続き的情報は、ほとんど保持または再利用されない。エピソードやエポックをまたいで、モデルは変化するポリシーの下で関連する問題に繰り返し遭遇し、エピソードローカルな更新では捉えきれないクロスエピソード信号を生成する。どの戦略が一貫して検証を通過するか、どの失敗モードが持続するか、どのパターンが再発するかなどである。我々は、これらのクロスエピソード信号を再利用可能な手続き的記憶に変換し、トレーニング中にそれをポリシーの重みに蒸留するProcedural Memory Distillation(PMD)を提案する。この記憶はトレーニングの足場として機能し、ポリシー自体に吸収され、推論時には記憶のないモデルが得られる。
arXiv cs.AI
2026年7月3日
Google 検索グラウンディングを検証してみた 〜画像検索・Maps 対応と課金の注意点〜こんにちは! KDDIアイレットの取り組みとして6月22日〜7月3日の期間で開催中の「Google Cloud Next '26 / Google I/O やってみた系ブログリレー」、最終日の投稿です。 今回は「Google検索によるグラウンディング」を対象に、実際に検証し...
Qiita 人気記事
2026年7月7日
学生の振る舞いを教師が正規化:英語証拠付きクロスリンガルRAGのための教師正則化強化学習クロスリンガル検索拡張生成(RAG)は、多くの場合、英語証拠レジームで展開されます。このレジームでは、ユーザーは多様な言語でクエリを発行しますが、検索されたパッセージは英語のままです。この設定では、強力なベースモデルがあっても生成が失敗する可能性があります。英語の証拠は言語ドリフト(英語またはコードスイッチング出力)を誘発し、モデルは非英語の回答を生成する際に証拠を信頼性なく使用します。これらの失敗は、2つのポストトレーニングの課題に起因すると考えられます。(i) エラーはプレフィックス依存であり、固定軌道監督はプレフィックスの不一致に苦しむ。(ii) シーケンスレベル(部分的に離散的/ジャッジベース)の報酬は、ノイズの多いクレジット割り当てと高分散の更新をもたらします。本研究では、報酬最適化と学生が訪問したプレフィックスでのオンポリシー蒸留を組み合わせた教師正則化RLレシピ、TR-RAGを提案します。
arXiv cs.CL
2026年7月13日
ARCANA:ARC-AGI-2推論のための反射型マルチエージェントプログラム合成フレームワークARCANAは、厳格なテスト時間とハードウェアの制約下でARC AGI 2タスクを解決するための協調型マルチエージェントフレームワークです。ARCANAは、各タスクを知覚、仮説生成、記号実行、反射的洗練の反復に分解します。知覚的グラウンディングエージェントは生データグリッドからオブジェクト中心のシーングラフを構築し、潜在プログラムポリシーは多様なDSLプログラムを提案し、記号実行エージェントはデモンストレーションで候補を検証し、反射エージェントは次のターンに向けた失敗駆動型フィードバックを合成します。これらのエージェントは、共有の微分可能ブラックボードを介して通信し、学習されたメタコントローラーによってスケジュールされます。この設計は、構造化されたプログラム検索と適応型マルチターン修正を組み合わせ、挑戦的な抽象変換タスクにおける推論効率とソリューションの品質を向上させます。
arXiv cs.AI
2026年7月15日
ミラー・ホライズン:バウンド・リフレクションの尺度としての実現可能なパス・エントロピーミラー理論は、知能システムは、それが何を表現しているかだけでなく、繰り返しのリフレクションの下で維持できる一貫した継続性によっても研究されるべきであると提唱しています。我々は、検証された継続能力の有限予算尺度である「Viable Path Entropy(VPE)」を通じて、この主張を運用可能にします。ミラー状態、ロールアウト・プロトコル、検証者、モード・マップが与えられると、VPEはバウンドされた能力を2つの部分に分解します:実現可能な継続に到達する確率と、成功したロールアウトの中で到達した検証された継続モードの多様性です。本論文は、この尺度の背後にある完全な理論的構造を回復します:局所的な決定制約の解除としての直観、不変量選択圧としてのテイスト、決定制約の解除のテイスト誘導解決としてのリフレクション、そして将来のリフレクションを安定させる学習された構造としてのジオメトリです。その後、GSM8Kにおける言語モデル推論実験で理論を具体化します。
arXiv cs.LG
2026年7月22日
SAAG:構造化エージェント評価とグラウンディングエージェント呼び出しの厳密一致評価は、質的に異なる失敗モードを不明瞭にします。モデルは正しい関数を選択するかもしれませんが、引数値がハルシネーション(幻覚)を起こしたり、スキーマを満たしながらも不適切な理由でエージェントを選択したりする可能性があります。既存のベンチマークでは、これらの違いを単一の二項スコアに集約してしまうため、実務家はエージェント呼び出しがどこで失敗するかを診断できません。本稿では、エージェント呼び出し評価を、レジストリ適合性、構造的完全性、引数グラウンディングの3つの連続したステージに分解するカスケード診断フレームワークSAAGを提案します。各ステージは解釈可能なステージ固有の診断を生成します。これらの診断は、反復的な自己修正も可能にします。予測失敗時には、ステージ固有の信号が、正解値に漏洩することなく、ターゲットを絞った修正をガイドします。本稿では、5、10、15エージェントのレジストリサイズでGlaiveの関数呼び出しデータセットから派生した制御されたベンチマークで、3つのローカルサブ4Bパラメータモデルを用いてこのフレームワークを評価します。
arXiv cs.AI
2026年7月28日
多ターン長期間計画の物理学:事前学習から事後学習まで、単一・複数教師のオンポリシーエージェント蒸留長期にわたる複雑な計画立案は、AIエージェントの能力向上に不可欠な要素ですが、その実現に向けた研究はまだ十分に進んでいません。この課題に対し、東京大学の研究者らは、AIエージェントの計画能力を体系的に評価・向上させるための新しいフレームワークを提案しました。 このフレームワークでは、AIエージェントの計画能力を「事前学習」「事後学習(GRPO/OPD)」「蒸留」の3段階に分けて分析します。まず、事前学習段階で基本的な計画能力を獲得させ、次にGRPOやOPDといった手法を用いて、より高度な計画能力を形成します。さらに、教師あり・なしの蒸留技術を適用することで、これらの能力を統合し、長期・多ターン計画におけるエージェントの性能を最大限に引き出すことを目指します。この研究は、AIエージェントがより複雑な意思決定を自律的に行えるようになるための重要な一歩となることが期待されます。 引用元: arXiv cs.LG
arXiv cs.LG
2026年7月28日
オンポリシー拡散蒸留における分類子フリーガイダンスの再考オンポリシー拡散蒸留(OPD)は、生成モデルの学習手法の一つであり、学習中のモデル(学生)が生成したデータ軌跡を利用して、より高性能なモデル(教師)から知識を転移させる技術です。この手法は、学生モデルが生成した軌跡に沿って教師モデルに問い合わせを行うことで、効率的な適応を目指します。 しかし、近年の拡散モデルで一般的に用いられている「分類子フリーガイダンス(CFG)」という技術との組み合わせにおいて、OPDの挙動は十分に解明されていませんでした。CFGは、生成されるデータの質を向上させるための重要な技術ですが、OPDとの相互作用については不明な点が残されていました。 従来のOPD手法では、CFGが生成する予測結果に対して、学生モデルと教師モデルの「ガイド付き速度」を直接比較することで、知識の転移を図っていました。これは、CFGによって調整された予測を、OPDの枠組みに自然に組み込む試みでした。 ところが、このアプローチには課題も指摘されています。具体的には、CFGは「正のデータ」と「負のデータ」の両方を考慮して予測を行うため、それぞれの予測における誤差が相殺されてしまう可能性があるという点です。このため、ブランチレベルでの正確な指導が難しく、OPDの効果を最大限に引き出せない可能性が示唆されています。 引用元: arXiv cs.LG
arXiv cs.LG
2026年7月29日
バトンを渡す: 軌跡中継型オンポリシー蒸留AIモデルの学習効率を高める新たな手法が提案されました。従来のオンポリシー蒸留(OPD)では、学習済みの教師モデルから生徒モデルへ知識を伝達する際、生徒モデルが途中で誤った学習経路に進んでしまう「プレフィックス失敗」という課題がありました。 この問題に対し、研究者たちは「リレーオンポリシー蒸留(Relay-OPD)」という手法を考案しました。これは、教師モデルと生徒モデルの役割を「リレー」のように切り替える考え方です。具体的には、教師モデルが担当する区間を設けることで、生徒モデルが初期段階で誤った方向に学習が進むのを防ぎます。これにより、計算資源の無駄遣いを抑制しつつ、より効率的な学習が可能になると期待されます。この新しい蒸留手法は、AIモデル開発のさらなる進歩に貢献する可能性があります。 (arXiv cs.AI)
arXiv cs.AI
2026年8月12日
テスト時自己進化型GUI視覚的グラウンディング、リフレクション誘導型オンポリシー自己蒸留によるGUI操作を行うAIエージェントの性能向上が期待されています。既存のAIモデルは、一度展開されるとパラメータが固定されるため、未知のGUIインターフェースにうまく適応できないという課題がありました。 この度、この課題を解決する新たなフレームワークが提案されました。このフレームワークは、AIエージェントが展開後も人間からの指示なしで自律的に学習し、性能を向上させることを可能にします。具体的には、「探索」「評価」「反省」「内部化」という4つのステップからなる閉ループ構造を採用。大規模言語モデル(MLLM)をベースにした「リフレクター」がAIエージェントの生成結果を評価し、その評価結果から得られた「反省知識」をAIエージェントにフィードバックすることで、継続的な改善を実現します。これにより、AIエージェントは様々なGUI環境への適応能力を高めることができます。 (引用元: arXiv cs.CL)
arXiv cs.CL