TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
ソフトからハードなLLMプロンプトへの翻訳学習ソフトプロンプトチューニングはLLMを特定のタスクに適応させるためのパラメータ効率的な方法ですが、解釈可能性の欠如に悩んでいます。ソフトプロンプトの解釈に関する最近の研究に基づいて、専用のソフトプロンプトから自然言語翻訳モデルへのトレーニング方法を探索します。
arXiv cs.CL
2026年5月29日
BEAMS: AI モデリング・シミュレーション評価ベンチマーク実世界の意思決定を支援するAIツールは、推奨事項を知らせ解釈可能にするシミュレーションモデルを構築できる必要があります。モデリング実務の側面を自動化できるツールは、人間の専門知識を補完する必要があり、置き換えるべきではありません。BEAMS Initiativeは、開発を指導することを目的としています。
arXiv cs.AI
2026年6月1日
交通予測のためのグラフ条件付きグラフニューラルネットワーク専門家混合モデルarXiv:2605.30486v1 センサーグラフ上の時空間予測は通常、すべてのノードに均一に適用される単一のバックボーン構造で対処されるが、グラフ領域は異なるダイナミクスを示す可能性がある。道路セグメントは機能的分類、構造、交通行動が異なることから、ノード単位の専門家の活用が推奨される。
arXiv cs.LG
2026年6月1日
機械的解釈可能性によるディック経路上のゼータ写像アルゴリズムの発見arXiv:2605.30482v1 機械学習は数学的発見にますます利用されているが、数学では出力は予測そのものではなく、独立して検証可能な明示的な構築であることが求められる。本研究では組合せ論における古典的な全単射であるディック経路上のゼータ写像を通じてこの設定を研究する。
arXiv cs.LG
2026年6月1日
部分グラフ説明はグラフニューラルネットワークを盗むために兵器化されることができるか?arXiv:2605.30470v1 Graph Machine Learning as a Service(GMLaaS)プラットフォームは、規制上の透明性要件を満たすために説明可能性インターフェースを実装することが増えています。しかし、この透明性はモデル抽出攻撃の悪用可能な脆弱性を生み出します。本論は、特にサブグラフ説明を対象とした初のモデル抽出攻撃を提示しています。
arXiv cs.LG
2026年6月1日
拡散モデルを用いた知識グラフ推論のためのグラフ的ルール生成論理ルールは知識グラフ(KG)推論の基盤であり、その解釈可能性と関係パターンのモデル化能力で重視されている。しかし既存のルール抽出手法は主に単純な連鎖的ルールに焦点を当てており、より豊かな関係情報のエンコーディングを見落としている。
arXiv cs.AI
2026年6月1日
深いニューラルネットワークなしのLLM:新しいアーキテクチャ、利点とケーススタディ本論文は、LLMの文脈における深いニューラルネットワークの代替案を検証することを目的としている。最近、中国の研究者たちがRBFネットワークというモデルに大きな関心を示しており、標準的なDNNの代替として、より高い解釈可能性と精度の向上が期待されている。
arXiv cs.LG
2026年6月4日
STRIDE: 部分集合摂動からの疎復旧を用いた訓練データ帰属大規模言語モデル(LLM)の予測がどの訓練データに由来するのかを特定する「訓練データ帰属」の研究が進展している。従来の手法は膨大なパラメータを追跡する必要があり、計算コストが大きな課題だった。 この課題に対応する新しい手法「STRIDE」が提案された。STRIDEは、モデルの活性化空間(内部計算層)に着目し、軽量な「ステアリングオペレータ」と呼ばれるツールを学習する。このオペレータが訓練データの部分集合を除いた場合のモデル動作の変化を模倣することで、効率的なデータ帰属を可能にする。 従来の全パラメータ追跡と比べ、計算負荷を大幅に削減しながら、訓練データがモデルの出力にもたらす影響を追跡できるという。LLMの解釈可能性向上やバイアス検出などの応用が期待されている。 (arXiv cs.CL)
arXiv cs.CL
2026年6月8日
深い表現学習の原理と実践:記憶の数学的理論本書は、深層学習、特に生成モデルの時代において、大規模な生成モデルの訓練に多大な投資がなされている現状に対して、これらの「ブラックボックス」を理解することを目指している。深層ネットワークの内部メカニズムは不透明であり、解釈可能性、信頼性、制御の困難さにつながっている。本書は表現学習の観点から大規模深層ネットワークのメカニズムを解明することで、このブラックボックスを開こうとする試みである。表現学習は深層学習モデルの経験的力の重要な要因である。本書では、最適化と情報理論を通じてモダンなニューラルネットワークアーキテクチャの設計原理を説明し、アーキテクチャ開発を「錬金術」から大学初級レベルの線形代数と微積分の問題に還元する。また、これらの原理を応用して、効率的で解釈可能かつ制御可能でありながら、ブラックボックスモデルと同等かそれ以上の性能を持つ新しい手法とモデルを得ることについても論じ、深層学習の今後の方向性と表現学習の役割を探求する。
arXiv cs.LG
2026年6月8日
位置論文:「ポスプロで直すな」—AIの科学は訓練ダイナミクスを研究する必要がある本位置論文は、AIに対する科学的理解とは何かを問う。モデルは静的なオブジェクトではなく、データ、目的関数、アーキテクチャ、最適化ダイナミクスによって形成される時間発展するプロセスのスナップショットである。しかし、AI研究の多くはモデルを固定的な産物として扱い、訓練後の振る舞いを分析するのみで、その出現理由を問わない。本論文は、AIの科学は事後的な修正を超えて、モデルの振る舞いを生み出す訓練ダイナミクスを研究する必要があると主張する。そのような科学は、段階的により強い形の理解をサポートすべきである:初期の訓練信号から結果を予測し、軌跡が誤った時に介入し、最終的には望ましい特性をより確実に生み出す訓練手続きを設計すること。スケーリング則は損失の予測を日常化させたが、課題は能力、偏り、ロバスト性、安全性関連の振る舞いにこの成功を拡張することである。本論文は科学の歴史と哲学に基づいた理論の要件を明示し、機械的解釈可能性、公平性、記憶化、単純性バイアスの進展を検討し、具体的な未解決問題を特定する。
arXiv cs.AI
2026年6月10日
勾配ブースティングと分布フリーカバレッジを用いた非アルコール性脂肪性肝疾患のリスク予測arXiv:2606.09860v1 発表タイプ: new 概要: 非アルコール性脂肪性肝疾患(NAFLD)は世界中の成人の約25%に影響を与え、肝臓および心血管系に重大なリスクをもたらします。しかし、集団レベルでのスクリーニングツールは依然として不十分です。我々は、勾配ブースト決定木とコンフォーマル予測を組み合わせたNAFLDリスク予測のための機械学習フレームワークであるMethodを提案します。これにより、個々のリスク推定値に対して、キャリブレーションされた、分布フリーのカバレッジ保証が得られます。Methodは、相互情報量に基づく安定性選択手順を統合し、ブートストラップリサンプリングを通じて、コンパクトで臨床的に解釈可能な特徴サブセットを特定します。これにより、ユーザー指定の信頼水準を証明可能に超える周辺カバレッジを持つ予測セットを構築します。我々は、広州、中国の多施設コホート(主解析n=2,187、外部検証n=412)で、人口統計、代謝バイオマーカー、ライフスタイル要因にわたる78の候補特徴量を使用してMethodを評価しました。
arXiv cs.LG
2026年6月11日
マルチモーダル言語モデルによるソーシャルメディア上のAI生成コンテンツの検出arXiv:2606.11200v1 発表タイプ: new 要旨: 生成AIにより、フォトリアルな画像や動画の作成が可能になり、これらはソーシャルメディアで拡散されることが増えています。しばしば、スパム、偽情報、操作、詐欺に利用されます。既存のAI生成コンテンツ(AIGC)検出方法は、新しい生成モデルへの汎化性能の低さ、単一モダリティへの依存、解釈可能な説明の欠如といった課題に直面しています。本稿では、多様なマルチモーダルソーシャルメディアデータを継続的にキュレーションし、検出と説明のためにコンパクトなビジョン・言語モデルをトレーニングすることで、これらの問題を軽減するパイプラインを提案します。提案モデルは、公開ベンチマークにおいて最先端の検出性能を達成し、複数のプラットフォームにわたる内部ソーシャルメディアデータセットで堅牢な検出および説明能力を示します。
arXiv cs.CL
2026年6月16日
運転軌跡予測におけるインタラクションモデリングのためのグラフニューラルネットワーク層選択の比較研究自動運転システムは、安全かつ効率的な移動計画のために正確な軌跡予測に依存しています。グラフニューラルネットワーク(GNN)は、道路上のエージェント間の時空間的インタラクションをモデリングするための有望なアプローチとなっています。しかし、軌跡予測のためのGNNアーキテクチャの設計は標準化されておらず、どのグラフ層が空間的インタラクションと時間的ダイナミクスを効果的に捉えられるかについてのガイダンスはほとんどありません。本稿では、19種類のグラフ層について、軌跡予測に最も効果的なアーキテクチャを発見するために、それらの空間的および時間的処理能力に焦点を当てた詳細な比較研究を提供します。探索されたハイパーパラメータ設定内で、ARMA、Chebyshev、およびトポロジー認識層が他の層よりも一貫して優れたパフォーマンスを示し、5つの際立った層の組み合わせを強調します。
arXiv cs.LG
2026年6月17日
長距離単写式フリンジ投影プロフィロメトリにおける形状事前情報によるショートカットの診断と修復学習ベースの単写式フリンジ投影プロフィロメトリ(FPP)は、主に近距離で研究されてきました。1mを超える長距離領域は、逆二乗の強度低下によりフリンジ信号対雑音比が低下し、物理的な真値が劣化するという問題があり、未解決のままでした。単写式問題は、1枚の画像からはフリンジ次数情報が欠如しているため不良設定であり、これらのアーキテクチャはメカニズム的に研究されていませんでした。我々は、メカニズム的解釈可能性(MI)と conformal uncertainty quantification(UQ)を収束診断として用いた診断・修復・検証研究を発表します。これらは、1つの物理的故障箇所について合意し、アーキテクチャの修復を促進・検証します。写実的な合成ベンチマーク(15,600枚のフリンジ画像、1.5~2.1mの距離にある50個の物体)において、最良のUNetベースラインは14.54 mmの物体平均絶対誤差(MAE)を達成しました。
arXiv cs.LG
2026年6月17日
スキル制約付きモデル予測制御によるレジリエントな製造サプライチェーンの実現スキル制約のある生産・在庫システムにおいて、明日の有資格者の能力は今日のトレーニング決定に依存する。生産には認定された作業者が必要であり、認定は維持されないと失効し、トレーニングは現在生産に必要なものと同じ希少な作業時間しか消費しない。本研究では、閉ループのスキル制約付きモデル予測制御を検討する。この制御器は、シフトごとに、生産、在庫、バックログ、トレーニングに関する有限ホライゾン混合整数計画問題を解く。そこでは、バイナリ予測認証、厳格な生産資格、およびホライゾン境界での認定能力ギャップに価格設定する解釈可能な終端値が含まれる。計画の修正前に、最初の期間のアクションのみが適用される。
arXiv cs.AI
2026年6月19日
DiffusionGemmaの透明性はどの程度か?人工知能(AI)における大規模言語モデル(LLM)の透明性は、その意思決定プロセスを理解し、不適切な使用や矛盾を減らし、予期せぬ動作を修正するために不可欠であるとされています。この課題に対し、ある研究では、画像生成モデル「DiffusionGemma」の透明性について、変数透明性とアルゴリズム透明性という二つの側面から分析が行われました。 初期の分析では、DiffusionGemmaの変数透明性には課題が見られましたが、研究チームは新たな発見をしました。具体的には、画像からノイズを除去する各ステップ間の情報伝達を、解釈可能な「トークンボトルネック」を通じて可視化できることを示したのです。この方法は、モデルの内部でどのように情報が処理され、最終的な画像が生成されるのかを理解する上で、新たな道を開く可能性を秘めています。 この研究は、AIモデルの「ブラックボックス」問題を解決し、その振る舞いをより深く理解するための重要な一歩となるかもしれません。 引用元: arXiv cs.AI
arXiv cs.AI
2026年6月19日
情報格子学習を確率的グラフィカルモデルの構造学習として捉える情報格子学習(ILL)は、抽象化の階層をエンコードするパーティション格子に信号を交互に投影し、選択されたルールを信号ドメインにリフトバックすることで、信号の解釈可能なルールを学習します。信号が確率質量関数である場合、ILLによって学習された確率的ルールが自然な確率的グラフィカルモデル(PGM)の解釈を許容することを示し、その解釈を詳細に展開します。ILLにおけるパーティションは決定論的な商変数を誘発し、ルールはその商変数の周辺法則です。したがって、ルールセットは解釈可能な抽象化に対する周辺制約のコレクションです。一般的なリフティングは、それらの制約を満たすすべての同時分布の実現可能なファミリーであり、特殊なリフティングは、最大エントロピーに密接に関連するL2均一性原理によってILLで実装された、最大無知再構築を選択します。シャノンエントロピーリフティングの下では、同じ制約が、学習された抽象化によってインデックス付けされた因子を持つ対数線形因子グラフを生成します。しかし、情報格子自体はベイジアンネットワークではありません。
arXiv cs.LG
2026年6月19日
LLMのコンテキスト内学習における偶然的uncertaintyの定量化:予測信頼性の頑健な指標に向けてコンテキスト内学習(ICL)は、LLMが少数のデモンストレーションから新しいタスクに適応することを可能にしますが、その信頼性は依然として懸念事項です。予測はプロンプト設計とコンテキスト理解能力の両方に非常に敏感であり、失敗がデータ特性に起因するのか、モデルの限界に起因するのかが不明瞭になります。不確実性の分解、すなわち偶然的(aleatoric)なものと認識的(epistemic)なものの分離は、この設定において特に重要ですが、標準的な生成タスク用に設計された既存の方法では、ICLのユニークなダイナミクスを捉えきれません。この問題に対処するため、ベイズ的見解とICLのメカニズム的解釈可能性に基づいて構築された、self-function vectorという概念を導入します。これらのベクトルは、内部モデル表現を活用して、コンテキスト内プロンプティング中に学習された潜在概念をモデル化します。これにより、ベイズ的フレームワーク内で偶然的uncertaintyを直接推定することが可能になり、脆弱な入力やデコーディング操作への依存を回避できます。
arXiv cs.CL
2026年6月23日
CIExplainer++:グラフニューラルネットワークのための因果的で解釈可能な説明を生成説明可能な人工知能(Explainable Artificial Intelligence)は、モデルの出力につながる要素を人間が理解できる方法で提示することにより、ブラックボックスモデルへの信頼性を高めることを目指しています。これには、(i)出力に対する真の因果的影響を持つコンポーネントと接続の特定、(ii)そのような構造の解釈可能な表現への変換の両方が含まれます。前者については、グラフニューラルネットワーク(GNN)を説明するための因果推論に基づいた新しい摂動ベースの方法であるCIExplainerを導入します。CIExplainerは、潜在的結果フレームワークを用いて、GNN予測に対する因果的影響が最も大きいサブグラフを特定します。CIExplainerをさまざまなGNNアーキテクチャ(GCN、GraphSAGE、GAT、GIN)とデータセットで評価・比較します。サブグラフの説明と人間の解釈可能性を橋渡しするために、さらに、特徴レベルと関係性の両方の情報を取り込んだ自然言語の説明に因果サブグラフを変換するG2TeXplainerという手法を提案します。
arXiv cs.LG
2026年6月24日
ModTGCN:テキスト分類のためのモジュラリティを考慮したグラフニューラルネットワークグラフベースのテキスト分類モデルは、通常、局所的な近傍集約に依存し、意味的な文書グラフが強力なクラス一致クラスタリングを示すにもかかわらず、グローバルなコミュニティ構造を見落としています。これを無視すると、クラス境界が不明瞭になり、過度の平滑化につながる可能性があります。本稿では、クロスエントロピーとモジュラリティベースの補助目的を共同で最適化し、クラスに一致する文書コミュニティを促進すると同時に、識別表現を維持する、テキスト分類のためのモジュラリティを考慮したグラフニューラルネットワークであるModTGCNを提案します。モジュラリティ項は、トランスフォーマー埋め込み(事前学習済みまたはファインチューニング済み)から派生した文書間類似性グラフで計算されます。スケーラビリティを向上させるために、元の異種TextGCNグラフを文書-単語および単語-単語の個別のコンポーネントに分離し、トレーニング速度を2倍から10倍向上させました。さらに、モジュラリティ最適化のためのグラフ構築戦略、ラベルを意識したエッジ再重み付け、および監視の選択について研究します。
arXiv cs.CL
2026年6月24日
製品の望ましさに関する数値的・分類的隠れた感情分析の効率性と説明可能性のためのLLM利用評価定性的な製品フィードバックはニュアンスのあるユーザー体験を明らかにしますが、その隠れた感情を測定することは困難です。本論文では、大規模言語モデル(LLM)を使用して、このようなデータから製品の望ましさを定量化する、スケーラブルで解釈可能なフレームワークを提案します。ZORQとCARMAの2つのProduct Desirability Toolkit(PDT)データセットを使用し、106の回答者タームグルーピングをゴールドスタンダードの人間によるアノテーションで評価し、明示的なレビュー評価に依存せずに、ゼロショット連続数値感情スコアリングとカテゴリ感情分類を評価します。データセット全体で、LLMは定性的な回答から直接数値感情スコアを生成し、専門家のラベルに非常に近く、ピアソン相関係数は最大0.97、分類精度は最大94%を達成しました。LLMは、複数の形式で提示されたデータを処理しても堅牢性を維持し、一貫して高い信頼性を示しました。対照的に、辞書ベースおよびトランスフォーマーベースラインでは統計的に有意な結果は得られませんでした。
arXiv cs.CL
2026年6月24日
物理制約付きMCMCと化学情報付きガウス過程のシナジーによる反応ネットワーク発見離散的な反応トポロジーと連続的な速度論的パラメータが密接に結合しているため、スパースでノイズの多い化学時系列データから解釈可能な支配方程式を抽出することは依然として困難です。本稿では、スパイクアンドスラブトポロジーサンプリング、ハード保存および熱力学スクリーニング、そしてパラメータキャリブレーションおよび実験設計のための化学情報付きガウス過程(CIGP)残差モデルを組み合わせた、再現可能なグレイボックスワークフローであるPC-MCMC-CIGPを提案します。方法論的な貢献は、単独の新しいMCMCまたはGPファミリではなく、むしろこれらのコンポーネントを明示的な不確実性認識型取得選択を備えた物理制約付きワークフローに統合することです。H2 + Br2ベンチマークでは、制約付きサンプラーは実験において、欺瞞的な現象論的適合から素ラジカル経路を区別します。スチレンのエポキシ化では、CIGP最適化ループは報告されたGP-BOベースラインと比較して最終収率を12.5%向上させます。
arXiv cs.LG
2026年6月25日
完璧な検知、失敗した制御:言語モデルにおける「知ること」と「操ること」の幾何学メカニズム解釈可能性の中心的な目標は制御可能性です。つまり、モデルの活性化において行動がどこで表現されているかがわかれば、それを変更できるはずです。これは、行動を検知する方向とそれを制御する方向が同じか、それに近いという隠れた前提に基づいています。これを幾何学的に検証します。行動を最もよく検知する方向と、それを最もよく引き起こす方向との角度はどれくらいでしょうか? 検知が制御を意味する場合、コサインは1に近くなります。そうでない場合、それは検知と介入のギャップを定量化します。Gemma 2-2B-itでは、出力フォーマット(クリーンなJSON対Markdownフェンシング)は両方の役割を1つの軸に収縮させます。幻覚(ハルシネーション)はそうではありません。モデルは偽のエンティティを完璧な線形分離可能性(レイヤー5からAUC = 1.000)で検知しますが、その方向は拒否を引き起こす方向からcos = 0.12(約83度)の位置にあり、「検知は制御である」が要求するcos = 1からはかけ離れた、小さく再現可能な整合性を示します。
arXiv cs.CL
2026年6月25日
ノイズのあるASRにおけるグラフベースの音韻誤り訂正自動音声認識(ASR)システムは、全体的な単語誤り率は低いものの、固有表現、否定、感情表現などの意味的に重要なトークンに不均衡に影響を与える残存する語彙的誤りを生成します。これらの誤りは、ランダムなノイズではなく音韻的な類似性から生じる構造的なものであることが多く、単純なトークンレベルの訂正では不十分です。本稿では、音韻グラフモデリングと文脈言語理解を組み合わせた、G-SPINと呼ぶ構造化ASR訂正フレームワークを提案します。まず、グラフニューラルネットワーク(GNN)が、フラグ付けされたトークンに対して音響的に妥当な候補近傍を構築し、訂正検索空間を音韻的代替案に明示的に制限します。次に、マスク言語モデル(MLM)がローカルな文脈スコアリングを提供し、指示チューニングされた大規模言語モデル(LLM)が、このコンパクトな候補セットに対して最終的な文脈認識再ランキングを実行します。構造化された音韻的推論と文脈意味的選択を分離することにより、本手法は制約のない生成を回避しつつ、訂正精度を向上させます。このフレームワークは軽量でモジュール化されており、推論時に完全に動作します。
arXiv cs.CL
2026年6月25日
シャープレイ値を超える:非対称シャープレイ値の効率的な計算本研究では、特徴量寄与度推定法を用いた機械学習モデルの解釈可能性の問題に取り組みます。特に、因果グラフを利用してモデルに依存しない説明に因果知識を組み込むことを可能にする、非対称シャープレイ値(ASV)として知られるシャープレイ値の派生形を検討します。SHAPの計算が#P困難な特定の文脈において、ASVの正確な計算が多項式時間で可能であることを示します。このアルゴリズム的結果を拡張するため、根本的な因果グラフのトポロジカル順序における同値類の概念を導入し、ASVの計算時間を短縮するのに役立ちます。特に、因果グラフが根付き有向木である場合に、それ(同値類)を計算する多項式時間アルゴリズムを提示します。最後に、任意の因果DAGにおけるASVを近似するためのアルゴリズムを開発します。これは、トポロジカル順序を一様にランダムにサンプリングする手順に依存します。このサンプリングメカニズムを実装するために、既知のアルゴリズムとより単純な代替手段を活用します。実験結果は、現実的な因果構造における提案手法の実用的な実行可能性を示しています。
arXiv cs.AI
2026年6月29日
MER-R1:Slow-Fast思考のシナジーによるマルチモーダル感情推論明示的な推論は、予測の解釈可能性を高めるものの、必ずしもマルチモーダル感情認識(MER)の精度向上に結びつかないことがわかりました。具体的には、推論ベースのMLLMにおいて、熟慮的な推論後の「遅い思考」よりも、直接的な回答をトリガーする「速い思考」の方がしばしば優れた性能を発揮します。経験的な分析により、「速い思考」はより広範で自信のある予測によりリコールを改善する一方、「遅い思考」は不正確なカテゴリの保守的なフィルタリングを通じて精度を優先することが示されました。これらの洞察に基づき、我々はSlow-Fastの相補性を明示的な最適化に転換する強化学習フレームワークMER-R1を提案します。デュアルオブジェクトの分離により、リコールと精度を2つの最適化信号に分離し、互いにトレードオフされるのではなく、共同で最適化できるようにします。Slow-Fastの信頼度キャリブレーションは、最終的な「遅い思考」の回答を「速い思考」の直感にさらに一致させ、正しい感情を強化しながら不正確な感情を抑制します。
arXiv cs.AI
2026年6月29日
PairSAE:タンパク質共フォールディングにおけるペア表現からのメカニズム解釈構造生物学のための基盤モデルは、生体分子構造の予測において目覚ましい性能を達成し、タンパク質や低分子の設計に有望視されている。しかし、その出力の根幹をなす内部特徴を理解することは依然として困難である。標準的なスパースオートエンコーダー(SAE)は、トランスフォーマー風のシーケンス埋め込みには効果的だが、ペアフォーマー風のアーキテクチャにはそのまま適用できない。ペア表現に単純に作用させると、特徴量が二次関数的に増加し、シーケンス表現とペア表現にまたがって分散する概念が不明瞭になる。そこで我々はPairSAEを開発した。これは、ペアテンソルをNモードSVDによってトークンごとの相互作用役割に要約し、その後、スパースオートエンコーダーを使用して、シーケンス表現とペア表現の両方をデコードできる共通のトークンレベル特徴セットを学習する。PLINDERタンパク質-リガンド複合体のBoltz-2活性化で評価した結果、PairSAEはUniProtアノテーションと一致し、Boltz-2親和性値を予測する解釈可能な特徴量をもたらした。
arXiv cs.LG
2026年6月29日
信頼性と堅牢性の高いLLMプランニングに向けて:シンボリックフィードバック駆動型反復的自己改善フレームワーク大規模言語モデル(LLM)は学術界および産業界から広く注目を集めているが、その展開には堅牢性と信頼性に関する重大なセキュリティ上の懸念が伴う。インテリジェントな行動の中核をなすプランニングは、LLMにとって依然として困難な課題であり、固有の複雑さから長期間にわたる意思決定タスクにおいて、実現不可能または不正確な解を生成することが多い。本稿では、長期間にわたるプランニングにおけるLLMの堅牢性と信頼性を向上させるため、シンボリックフィードバック駆動型反復的自己改善フレームワークを提案する。具体的には、論理シンボルを自然言語記述にマッピングする自然言語プロンプトメカニズムを導入し、LLMがタスクの制約と意味をより良く捉えられるようにする。さらに、エラーを特定し、LLMが解釈可能な修正指示に変換することで自己改善を導くシンボリック検証器を設計する。加えて、目標到達可能性を推測するためのプラン認識器を活用し、望ましい目標へのより効果的なガイダンスを促進する。
arXiv cs.AI
2026年6月30日
ターン平均SAEによる特徴発見と長文脈アトリビューションスパースオートエンコーダー(SAE)は、言語モデルにおける解釈可能な特徴抽出に役立つツールとなっています。しかし、標準的なSAEアーキテクチャは個々のトークン活性化に基づいて動作するため、アクティブな特徴の数はコンテキスト長に比例して増加し、長文のモデルトランスクリプトの研究が困難になります。本稿では、ターン内の平均モデル活性化を再構築するように学習することで、固定数の特徴で単一の人間またはアシスタントのターンを表すターン平均SAEを導入します。ターン平均特徴は、LLMによって評価された場合、トークンごとの特徴よりも単一ターンの高レベル特性をより完全に記述することを発見しました。また、ターン平均SAEが、アトリビューショングラフのようなSAEの一般的な下流用途を大幅に単純化することを示します。広範には、ターン平均SAEは、長コンテキスト長での解釈可能性技術の実用性を高めます。
arXiv cs.CL
2026年7月1日
競合最適化による複数ソースデータセットからの支配的部分微分方程式の共同発見観測データから直接支配方程式を発見することは、解釈可能な科学的機械学習への重要な一歩です。現在のデータ駆動型アプローチは通常、単一のデータセットで動作しますが、観測が制限されている場合には、そのパフォーマンスが本質的に制限されます。実際には、同じ物理システムに対して複数のデータセットが利用可能であることが多く、それらは異なる初期条件または境界設定によってのみ区別されます。ここでは、複数ソースデータセットから共通の部分微分方程式(PDE)を発見するように設計された競合最適化フレームワーク、MCO-PDEを提案します。このフレームワークは、まず各データソースに対して独立したニューラルサロゲートをトレーニングし、次にソフト競合重み付けメカニズムを使用してデータセットの信頼性を動的に評価し、合意されたグローバル係数を集約します。構造探索のための遺伝的アルゴリズムと統合されたこのアプローチは、支配法則の関数形式とパラメータを同時に特定します。7つのケースにわたる各データセットでわずか50個の観測を融合するだけで、標準的な方程式を高精度で復元できることを示します。
arXiv cs.LG