TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月7日
「正解」が確定的でない場合のエージェント動作の検証GitHub Copilotクラウドエージェント向けの「信頼レイヤー」を構築する方法について、脆弱なスクリプトやブラックボックス判定を使用せず、優位性分析を用いた手法を紹介しています。
GitHub Blog (AI)
2026年5月29日
幻覚削減のための格子上のチェーンベース適応再構成大規模言語モデルにおけるテスト時の幻覚削減のための確率的フレームワークであるCAROL(Chain-based Adaptive Reconfiguration Over Lattices)を導入します。トークンレベルの不確実性に依存するのではなく、CAROLは生成された結果間の一貫性に基づいて意味的不確実性測度を定義します。
arXiv cs.CL
2026年5月29日
信頼度ショートカット:マスク拡散モデルの推論失敗モードarXiv:2605.29123v1 公表予定タイプ:新規 概要:マスク拡散言語モデル(MDM)は任意の順序の生成をサポートしており、信頼度ベースのデコーディングが事実上標準的な推論ポリシーとして機能している。これを最適化するため、最近のトレーニングスキームでは、生成時に観察されるマスクパターンと直接整合させることを試みている。
arXiv cs.AI
2026年6月1日
COFT:大規模言語モデルにおけるフェアな思考の連鎖推論のための反事実適合デコーディングarXiv:2605.30641v1 大規模言語モデル(LLM)は、思考の連鎖(CoT)生成中に社会的偏見を明らかにし、増幅する可能性がある。本論文では、デコード時にトークンレベルのフェアネス制御を適用する訓練不要のデコーディング方法であるCOFT(フェアな思考の連鎖)を提案し、分布自由の周辺有効性を保証する。
arXiv cs.CL
2026年6月1日
長期タスク向けエージェント互換コンテキスト管理の学習LLMエージェントはウェブサーチや深い研究など現実世界のアプリケーションにおける長期タスクにますます直面しており、蓄積されたコンテキストは長コンテキスト低下と推論失敗を引き起こすことがある。先行研究ではエージェント側のコンテキスト制御または固定戦略によるコンテキスト管理を通じてこれを緩和している。
arXiv cs.AI
2026年6月2日
ARCA:トークン信号が退化した場合のアダプタ残差クレジット割当言語モデルの強化学習におけるトークンレベルのクレジット割当は、通常、ポリシーが完全に訓練可能であるかのように定式化されていますが、実際のLLM-RLパイプラインはパラメータ効率の良い微調整、特にLoRAに依存することが多いです。本論文はこの分離が構造的な失敗モードを隠していることを主張しています。
arXiv cs.LG
2026年6月2日
近未来ガイダンスを通じたオンポリシー蒸留における推論軌跡の橋渡しオンポリシー蒸留(OPD)は、教師の監督下で自身のポリシーからサンプリングされた軌跡について学生モデルを訓練することで大規模言語モデルの推論を改善します。OPDは軌跡上で動作しますが、その学習シグナルはトークンレベルのままです。高損失トークンを通じて逸脱を特定します。
arXiv cs.CL
2026年6月8日
言語モデルの失敗:確定的かつ持続的な推論失敗のトークンレベル特性言語モデルの推論失敗は、推論トレース内で識別可能な特性を残す異なるプロセスを通じて発生する。本研究はトークンレベルの不確実性シグナルを使用してこれらの失敗を特性化し、経験的に区別可能な2つのプロセスから生じることを発見した。第1は確定的失敗で、モデルがトレース初期の不正な推論経路に固着する。中心的な診断特性は確定点であり、その先で追加のトークンを考慮すると失敗検出がむしろ悪化する。第2は持続的不確実性で、不確実性はトレース全体を通じて蓄積され、失敗と成功の完了を区別するには完全なトレースが必要となる。これらの特性は23のモデル-データセット構成で再現され、フレームワークの反証可能な予測は23例中20例で保持され、両方の失敗モードにおいて偶然を大きく上回る。最後に、自己一貫性への直接的な含意を示す失敗モードフレームワークを実証し、不確実性シグナルが補完するケースと選択的にスキップできるケースを特定する。これらの結果は、LLM推論失敗がいつ検出可能になるかを理解し、それに応じて検出戦略を適応させるための基礎を提供する。
arXiv cs.CL
2026年6月8日
CrowdMath: クラウドソーシングされた数学研究討論のデータセット大規模言語モデルは数学的推論において大きな進展を遂げていますが、既存のベンチマークは最終答案、段階的な解法、または完全な証明といった確定的な問題を評価するのが一般的です。本研究は、参加者が部分的な議論を提案し、先行する段階の不備を特定し、不完全な推論を修正し、段階的な貢献を徐々に統合していくという、協調的なオープン問題解決のプロセスをとらえた新しいデータセット「CrowdMath」を紹介します。これはMIT PRIMES--Art of Problem Solving (AoPS) CrowdMathプログラム(2016-2025)から164個の専門家による注釈付きの進捗チェーンで構成されており、その討論は査読済み論文に至っています。各チェーンはオープン問題の陳述から完成した証明まで、複数の参加者によるフォーラム討論の過程を追跡しています。投稿は部分的進捗、証明の完成、誤った推論、誤りの特定を含む、進化する解答プロセスにおける機能的役割によってラベル付けされています。
arXiv cs.AI
2026年6月8日
Rマドリード、174億円でフェルナンデス強奪計画が発覚 降格ウェストハムから21歳の有望ポルトガル代表MFを引き抜く(スポーツ報知)ペレス会長再選が確実視され、モウリーニョ監督の復帰も確定的なRマドリードがウェストハム所属のポルトガル代表MFマテウス・フェルナンデス(21)の獲得を目指すことが明らかになった。 英大衆紙「ザ・
Yahoo!ニュース スポーツ
2026年6月11日
大規模言語モデルのための互換性認識型動的ファインチューニングarXiv:2606.11206v1 新規投稿 概要:教師ありファインチューニング(SFT)は、大規模言語モデル(LLM)の調整における主要なパラダイムですが、最適化の不安定性と限定的な汎化性能に悩まされています。最近の研究では、この問題を病的な勾配スケーリングに起因するものとし、トークンレベルでそれを修正するために動的ファインチューニング(DFT)を提案しています。しかし、DFTはすべてのデモンストレーションが同等に適切な学習ターゲットであると仮定しますが、大規模な命令データセットの強い異質性により、デモンストレーションとポリシーの不一致がサンプルレベルで高分散の更新を引き起こすため、この仮定は破られます。本稿では、サンプルレベルの最適化分散を制御するDFTの原理的な拡張である、互換性認識型動的ファインチューニング(CADFT)を導入します。CADFTは、モデルの尤度から動的でポリシー依存の互換性信号を導出し、教師あり更新を調整して、互換性のないデモンストレーションからの高分散勾配を抑制します。
arXiv cs.CL
2026年6月18日
CODEBLOCK:適切な粒度でのコード監視学習コードLLMの教師ありファインチューニングでは、通常、すべての応答トークンに均一なクロスエントロピー損失を適用し、すべてのトークンが等しく有用な学習信号を提供するという暗黙の前提があります。最近のトークンレベル選択手法は、高価値トークンのみを監視することで、自然言語SFTにおけるこの前提に異議を唱えています。しかし、トークンレベルのマスキングをコードに直接転送すると、コードは構造的な完全性と定義-使用関係に依存するため、構文的および意味的に一貫したプログラムユニットが壊れる可能性があります。そこで、私たちは独立したトークンではなく、構造的に完全なコード証拠を選択する構造認識型スパース監視フレームワークであるCodeBlockを提案します。CodeBlockは、まず高品質な命令-応答ペアを選択し、次にコード応答を構文的に一貫したコーディングアイテムに分割し、コアロジックトークンに対する一般化クロスエントロピーを集計してその有用性を推定し、データフローの到達範囲とブリッジ信号で再ランク付けして、重要なプログラム依存関係を伝播または接続するブロックを優先します。
arXiv cs.LG
2026年6月24日
軌跡模倣を超えて:LLM推論のための戦略主導型ポリシー最適化強力な言語モデルから弱い言語モデルへの推論能力の抽出は、通常、特定の解法の軌跡を模倣することを含み、推論方法ではなく回答方法を効果的に転送します。この軌跡レベルの模倣は、汎用的な問題解決スキルの獲得ではなく、インスタンス固有のステップの記憶を促進し、新しい問題への一般化を制限します。我々は、インスタンスレベルの軌跡模倣を再利用可能な戦略蒸留に置き換えるStrategy-Guided Policy Optimization (SGPO)を提案します。SGPOは、強力なモデルの応答から構造化された戦略説明を抽出し、各問題に対して、自律的および戦略主導型の両方の軌跡を構築し、戦略的ガイダンスの有無によるモデルの挙動を直接比較できるようにします。このフレームワークは、2つの重要な問いに答えます。どのように蒸留するかについては、トークンレベルのフォワードKL目的関数が、戦略条件付けによって誘発される分布シフトを選択的にガイダンスのないポリシーに転送し、近接制約が安定性を確保します。
arXiv cs.AI
2026年6月25日
ノイズのあるASRにおけるグラフベースの音韻誤り訂正自動音声認識(ASR)システムは、全体的な単語誤り率は低いものの、固有表現、否定、感情表現などの意味的に重要なトークンに不均衡に影響を与える残存する語彙的誤りを生成します。これらの誤りは、ランダムなノイズではなく音韻的な類似性から生じる構造的なものであることが多く、単純なトークンレベルの訂正では不十分です。本稿では、音韻グラフモデリングと文脈言語理解を組み合わせた、G-SPINと呼ぶ構造化ASR訂正フレームワークを提案します。まず、グラフニューラルネットワーク(GNN)が、フラグ付けされたトークンに対して音響的に妥当な候補近傍を構築し、訂正検索空間を音韻的代替案に明示的に制限します。次に、マスク言語モデル(MLM)がローカルな文脈スコアリングを提供し、指示チューニングされた大規模言語モデル(LLM)が、このコンパクトな候補セットに対して最終的な文脈認識再ランキングを実行します。構造化された音韻的推論と文脈意味的選択を分離することにより、本手法は制約のない生成を回避しつつ、訂正精度を向上させます。このフレームワークは軽量でモジュール化されており、推論時に完全に動作します。
arXiv cs.CL
2026年6月29日
PairSAE:タンパク質共フォールディングにおけるペア表現からのメカニズム解釈構造生物学のための基盤モデルは、生体分子構造の予測において目覚ましい性能を達成し、タンパク質や低分子の設計に有望視されている。しかし、その出力の根幹をなす内部特徴を理解することは依然として困難である。標準的なスパースオートエンコーダー(SAE)は、トランスフォーマー風のシーケンス埋め込みには効果的だが、ペアフォーマー風のアーキテクチャにはそのまま適用できない。ペア表現に単純に作用させると、特徴量が二次関数的に増加し、シーケンス表現とペア表現にまたがって分散する概念が不明瞭になる。そこで我々はPairSAEを開発した。これは、ペアテンソルをNモードSVDによってトークンごとの相互作用役割に要約し、その後、スパースオートエンコーダーを使用して、シーケンス表現とペア表現の両方をデコードできる共通のトークンレベル特徴セットを学習する。PLINDERタンパク質-リガンド複合体のBoltz-2活性化で評価した結果、PairSAEはUniProtアノテーションと一致し、Boltz-2親和性値を予測する解釈可能な特徴量をもたらした。
arXiv cs.LG
2026年7月3日
TokenScope:大規模言語モデルにおけるコード指向タスクのトークンレベルの解釈可能性と説明可能性大規模言語モデル(LLM)がコード生成中にトークンレベルの決定をどのように行うかを理解することは、研究者と実務者の両方にとって依然として大きな課題です。最近のツールはモデルの内部構造や生成結果に関する洞察を提供していますが、デコード時のシグナル、きめ細やかな不確実性指標、代替生成パスを探索するためのインタラクティブなメカニズムを欠いていることがよくあります。本稿では、生成中にトークンレベルのメトリクス、アテンションパターン、構造情報を提供する、デコーダーベースLLMのためのインタラクティブな解釈可能性および分析ツールであるTokenScopeを紹介します。TokenScopeは、インタラクティブなトークン置換、反事実的ブランチング、抽象構文木によるコード対応集約をサポートします。デコード時のシグナルと構造化されたプログラム分析を統合することにより、TokenScopeはコード生成中のLLMの動作の体系的な調査を可能にします。
arXiv cs.CL
2026年7月20日
Length Value Model: トークンレベルの長さをスケーラブルに事前学習現代の自己回帰モデルにおいて、トークンは計算の基本単位であり、生成長は推論コストと推論性能の両方に直接影響します。その重要性にもかかわらず、既存のアプローチは、主に粗粒度のシーケンスレベルで動作し、きめ細かな長さモデリングに欠けていました。本稿では、各デコードステップで残りの生成長をモデル化するトークンレベルのフレームワークであるLength Value Model(LenVM)を紹介します。
Apple Machine Learning Research