TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
クロスモデルエントロピーによるラベル不要強化学習強化学習を用いた大規模言語モデルの事後学習は報酬信号によってボトルネックとなっている。既存のアプローチは、自動正確性チェック(数学やコード実行など)のある領域に訓練を制限する検証可能な報酬か、人間の選好ラベルのいずれかを必要とする。
arXiv cs.LG
2026年5月29日
ReverseMath: 数学問題生成の拡張可能性と検証可能性を実現する逆向き回答手法数学推論ベンチマークはLLMの評価に不可欠だが、多くは静的で公開評価やトレーニングパイプラインを通じて繰り返し露出しており、真の推論と暗記を区別することが困難である。一方、新しい数学問題の手動構築は...
arXiv cs.CL
2026年5月29日
「落ちずに自力で戻った」女子高生殺害で内田梨瑚被告―旭川地裁北海道の旭川地裁で進行中の女子高生殺害事件の公判で、被告人・内田梨瑚氏が「落ちずに自力で戻った」と供述し、検察側の主張と対立しています。物理的証拠が限定的な事件では、被告人の供述が有罪・無罪の判断を左右する重要な要素となるため、この供述が医学的・物理的に検証可能なのかが焦点となります。冤罪リスクを減らすには、客観的証拠、証人の信用性評価、法医学的知見の三点が重要であり、これらが「合理的疑いを超える立証」に到達するかが問われています。
時事通信
2026年6月1日
構造認識報酬による深い研究のためのプランナー中心強化学習深い研究タスクではLLMが調査対象を計画し、エビデンスを検索し、複数の調査分野にわたって長文の回答を合成する必要がある。既存の訓練パラダイムは短文の検証可能なQAをプロキシとして依存するか、モノリシックな長軌跡を最適化するかのいずれかであり、計画と実行が困難である。
arXiv cs.AI
2026年6月1日
レアイベントの因果経路の形式化と反証構造方程式モデルにおけるレアイベント(外れ値)の根本原因分析の最近の形式化に基づいて、因果経路の正式な定義を提案し、その検証可能な含意について議論します。これらの含意が因果抽象化定義のみに依存する条件を特定しています。
arXiv cs.AI
2026年6月1日
機械的解釈可能性によるディック経路上のゼータ写像アルゴリズムの発見arXiv:2605.30482v1 機械学習は数学的発見にますます利用されているが、数学では出力は予測そのものではなく、独立して検証可能な明示的な構築であることが求められる。本研究では組合せ論における古典的な全単射であるディック経路上のゼータ写像を通じてこの設定を研究する。
arXiv cs.LG
2026年6月1日
Leanの定理証明のためのLLMフィードバック蒸留推論モデルのポストトレーニングは通常、検証可能な報酬からの教師あり微調整と強化学習を組み合わせ、最も一般的にはGRPOで行われている。しかしこのアルゴリズムは報酬の疎さ、限定的な探索、モード崩壊に悩まされている。自己蒸留に関する最近の研究に基づき、改善されたアプローチを提案する。
arXiv cs.AI
2026年6月2日
信頼できる推論による許容的安全性:検証可能な信念空間ニューラル安全フィルタによる確実な対話型ロボティクス人間と直接接する自律ロボットの安全性向上に向け、新たな制御技術が開発されている。ロボット工学の研究では、従来の安全フィルタより柔軟な「信念空間安全フィルタ」(BeliefSF)が注目を集めている。 この技術は、ロボットが実行時に推論を行うことで不確実性を段階的に低減させながら、同時に安全性を確保するという特徴を持つ。従来手法では事前に多くの制約条件を設定する必要があったが、新しいアプローチはより適応的に対応できる利点がある。 一方で実用化に向けた課題も指摘されている。推論過程でのエラー発生やニューラルネットワークの近似精度に基づいて、安全性が数学的に保証されるかどうかという問題が存在する。研究チームはこうした課題に対し、検証可能な信念空間の構築により形式的な安全保証の提供を目指しているという。 医療用ロボットや製造現場など、人間との安全な協働が求められる分野での応用が期待されている。 引用元:arXiv cs.AI
arXiv cs.AI
2026年6月2日
CAST:GRPOのための非特権化クリップ付き非対称セルフティーチングとアドバンテージ反転検証可能な報酬を用いた強化学習(RLVR)、特にグループ相対方針最適化(GRPO)は、大規模言語モデルの推論を改善するために広く使用されています。しかし、結果レベルの報酬は疎な教示のみを提供し、サンプリングされた軌跡がすべて同じ結果を得た場合、グループ相対アドバンテージは消失します。
arXiv cs.AI
2026年6月2日
SDR:放射線科レポート生成のための設定距離報酬arXiv:2606.00440v1 発表タイプ:新規 概要:検証可能な報酬による強化学習は、ビジョン言語モデルの推論を急速に進歩させています。ただし、胸部X線レポート生成の場合、標準的な報酬(正確一致精度およびステップレベルのプロセス)は、レポートが順序付けされていない直交的な検査結果で構成されているため、互換性がありません。
arXiv cs.AI
2026年6月3日
Tom Holland Called Sony Boss to Delay ‘Spider-Man: Brand New Day’ for Christopher Nolan’s ‘The Odyssey’The 30-year-old actor has both films releasing in theaters this summer.
The Hollywood Reporter
2026年6月4日
AIがAIを作る時代の到来か──Anthropicが示す「再帰的自己改善」の実態とリスクAnthropicは、AIが自ら開発を担う「再帰的自己改善」に関する考察を公開した。社内コードの8割以上をClaudeが執筆するなど自動化が進む現状を明かす一方、制御不能に陥るリスクを警告。他社と検証可能な形で開発を減速・一時停止できる国際協調体制の構築と、選択肢を持つべきだと提唱している。
ITmedia AI+
2026年6月10日
データジャーナリストエージェント:データを検証可能なマルチモーダルな物語へ変換データジャーナリストエージェント「Data2Story」は、生のデータから非専門家が信頼できる物語を生成するマルチエージェントフレームワークです。 このシステムは、データの分析、視覚化、記事作成までを一貫して行い、仮想のニュースルームとして機能します。 すべての主張がデータ、コード、外部参照に根拠を持つ検証可能性と、読者のニーズに応じたマルチモーダルな記事生成が特徴です。
arXiv cs.CL
2026年6月11日
ProcessThinker:ロールアウトベースのプロセス報酬によるマルチモーダル大規模言語モデルの推論能力強化arXiv:2606.11209v1 新規発表 要旨:ビジュアル質問応答は、ますます多段階の推論を必要としています。検証可能な報酬(RLVR)とグループ相対ポリシー最適化(GRPO)を用いた近年の強化学習による事後学習は、マルチモーダル推論を改善できますが、ほとんどのアプローチは、結果のみの疎な報酬に依存しています。その結果、不正解が推論の終盤の小さな間違いに起因するのか、それとも最初から役に立たない推論経路に起因するのかを判断するのが困難です。一般的な解決策は、ステップレベルの監督のためにプロセス報酬モデル(PRM)をトレーニングすることですが、これには通常、大規模で高品質な思考連鎖の注釈と追加のトレーニングコストが必要です。本研究では、明示的なPRMをトレーニングすることなく、ステップレベルのプロセス報酬を提供する実用的な事後学習パイプラインであるProcessThinkerを提案します。
arXiv cs.CL
2026年6月14日
マット・デイモン、『ボーン』シリーズ復活に前向き「また1本作る方法を常に模索している」マット・デイモンは、クリストファー・ノーラン監督の待望の『The Odyssey』でリノソラックスを着用するかもしれないが、それは彼が解離性健忘症に苦しむCIAエージェントとしての役柄が必ずしも終わりを迎えたわけではないことを意味しない。
Deadline
2026年6月15日
英国、フランス、ドイツ、イランの関連制裁解除を表明英国、フランス、ドイツ、イタリアの首脳による共同声明で、「イランが核開発計画で明確かつ検証可能な措置を取った場合、関連制裁を解除する用意がある」と述べた。
Bloomberg
2026年6月16日
PhoneHarness:GUI、CLI、ツールアクションを組み合わせた電話エージェントの活用電話エージェントは、単に次の画面アクションを予測するだけでなく、実際のモバイルワークフローを完了することが期待されるようになっています。しかし、現在のモバイルエージェントに関する文献の多くは、エージェントを主にGUIコントローラーとして評価しており、画面を監視し、タップやスワイプを実行し、ターゲットアプリの状態によってスコアリングされます。実際の電話使用タスクはより広範であり、アプリGUI、デバイスサイドコマンド、または構造化ツールの使用時期を判断し、意図した副作用が実際に発生したことを示す証拠を残す必要があります。本稿では、検証可能なモバイルワークフローで電話使用エージェントを研究するための、混合アクションベンチマークおよび実行ハーネスであるPhoneHarnessを紹介します。PhoneHarnessは、GUI、CLI、およびホストサイドツールアクションを介してデバイスサイドのエージェントループを実行し、決定論的なアクションルーティングと、境界のあるGUI委任、監査可能な実行トレースを組み合わせています。
arXiv cs.CL
2026年6月18日
「Odyssey」が14.5億ドルの評価額を獲得、Amazonなどが支援AIの次のフロンティアとなるワールドモデル分野で、「Odyssey」が今回の資金調達ラウンドを経て、注目すべきスタートアップとしての地位を確立しました。
TechCrunch AI
2026年6月25日
汎用推論のための転移学習:マルチドメインRLVR向け自動カリキュラム検証可能な報酬付き強化学習(RLVR)が、単一ドメインのトレーニングから、数学、プログラミング、科学にまたがるマルチドメイン推論スイートへと拡張されました。しかし、推論スキルのドメイン間での転移は不均一であるにもかかわらず、トレーニングカリキュラム(各ドメインがサンプリングされる頻度)は通常固定または手動調整されています。既存の学習可能性ベースのカリキュラムは、ポリシーが現在改善されている場所に適応しますが、選択されたドメインでの勾配ステップが残りのドメインに利益をもたらすかどうかには盲目です。本稿では、BanditスタイルのオンラインカリキュラムであるTransfer-Aware Curriculum(TAC)を提案します。これは、更新がトレーニングスイートの残りに広く利益をもたらすドメインを優先します。TACは、RLトレーニングによって既に生成されているシグナルを再利用します。
arXiv cs.AI
2026年6月26日
COrigami:平坦に折り畳める、認識可能なオリガミを共創するAIパイプライン生成AIは検証可能な解を持つ問題解決で目覚ましい成功を収めていますが、厳密な幾何学的制約と主観的な美的感覚の両方を満たす物理的なアートの生成は依然として課題です。本稿では、計算オリガミの領域におけるこれらの困難に取り組むアプローチを提示します。計算オリガミは、数理的に厳密な環境であり、芸術的デザインを平坦折り畳み可能性の数式内に位置づけます。本稿では、自然言語から折り目パターンを生成することでデザインサイクルを支援する、エンドツーエンドのAI駆動パイプラインであるCOrigamiを紹介します。このパイプラインは、セマンティックな棒人間生成、ベースパッキング計算、平坦折り畳み可能な折り目パターンの解決、平坦に折り畳まれた折り目パターンの整形、そして自律的な美的評価ループによって駆動される強化学習を用いた生成モデルの改良を含みます。本システムは、人間のアーティストがさらに発展させ、整形できる構造的な出発点を生成する、非常に効果的な共同アシスタントとして機能します。
arXiv cs.AI
2026年6月29日
DysLexLens:オンラインフォーラムの分析からディスレクシア学習者の洞察を得るための低リソースLLMフレームワークディスレクシア(読み書き障害)のある学習者は、読書、執筆、整理、学習関連のタスクをサポートするために人工知能(AI)ツールをますます活用しています。しかし、これらのツールとの実際の体験はほとんど調査されていません。本論文では、ディスレクシア学習者がオンラインフォーラムでの議論を通じてAIをどのように体験しているかを分析するために設計された、低リソースLLMフレームワークであるDysLexLensを提案します。DysLexLensは、エンドツーエンドで証拠を追跡可能なアーキテクチャとして設計されており、ノイズの多いソーシャルメディアの投稿を辞書駆動型コーパスに変換し、知識グラフ(KG)ベースの質問推論を提供し、検証可能なクエリ応答を生成し、定量的および人間による評価を通じて応答を評価できるようにします。DysLexLensには4つの主要な特徴があります。
arXiv cs.AI
2026年6月29日
Odyssey:検証可能でローカルな真実保持型基盤モデルの構築「ODYSSEY」と名付けたカテゴリー論的フレームワークを提案します。これは、ファウンドリ(局所的な文脈、局所表現ファミリー、制限写像、結合規則、妨害ポリシー、更新義務、人間向けビューを指定する構成要素)の合成によって、検証可能でローカルな真実保持型基盤モデルを構築するためのものです。ファウンドリは、議論コンポーネントを内包する知識の編成された束です。具体的なファウンドリは、証拠/議論、運用上の決定、制度/金融、市場の定義、科学的挑戦、研究プログラム、アシスタント構築、評価ハーネスといった汎用ファウンドリから構築されます。Universal Foundry Learning (UFL) は、左・右カン拡張の合成としてファウンドリ構築を形式化します。左カン拡張は局所的アーティファクトを候補ファウンドリにロールインし、右カン拡張は昇格に必要な制限、結合、妨害、議論の条件を強制します。
arXiv cs.AI
2026年7月2日
検証可能な報酬によるキャリブレーションされた確率的予測検証可能な報酬を持つ強化学習は、原則として、真の確率によって期待値が最小化され、結果のみから計算されるブライアースコアのような適切なスコアリングルールであるため、キャリブレーションされた確率的予測器を訓練できます。実際には、キャリブレーションは低下し、既存の解決策は、モデルの信頼度が検証可能な正誤を伴う不確実性に対処します。ここでは、予測自体が出力であり、ラベルが1つの確率的結果であるアレアトリー予測を研究し、NFLの試合中の勝率をベッティング市場を参照としてテストベッドとして使用します。実現したプレーごとの結果に報酬を与えることは失敗します。単一の結果はノイズの多いターゲットであり、ポリシー勾配は思考の連鎖を破損するためです。過去の結果から推定された、ラベルのない検証可能な報酬である状態条件付き経験的勝率を導入し、ラベルノイズを削除します。また、直接予測または勾配マスクによって、破損できないように勾配を推論から除外します。
arXiv cs.LG
2026年7月2日
失敗を安全にする:オープンウェブデータ収集のための制約付き検証可能エージェントフレームワークLLMとエージェントは自然言語の要件からウェブスクレイパーを生成できますが、依存関係エラー、セレクタの破損、スキーマの不一致、ページ構造の異質性により、直接生成は依然として信頼性が低いです。我々は、LLMの出力を自由形式のコードから型付けされたJSONコレクタ構成に移行する、制約付き検証可能エージェントフレームワークを提案します。これは、6つのコレクタ分類、テンプレートとユーティリティ関数の制約、静的なAirflow DAG実行、ルールベースの品質チェック、構造化されたフィードバック修正を組み合わせています。138のタスクでの実験は、この分類が記述ベースの要件タイピングをサポートすることを示し、安定したインスタント化には初期記述を超えたソース、フィールド、実行制約の完了が必要であることを確認しました。独立したソース検証済みの80のタスクでは、このフレームワークは実行ステージでのLLMトークンゼロと最短の平均壁時計時間を達成し、1回の試行での品質を中程度に抑える代わりに、繰り返しスケジュールされた収集に適した再利用可能で決定的かつ検証可能な実行パスを実現しています。
arXiv cs.AI
2026年7月3日
次トークン予測を超えて: Atlassianワークフローにおけるツール使用エージェントのためのRLVR証明大規模言語モデルは、特定のAPI内で行動するためではなく、次トークンを予測するように訓練されています。成功が適切なネスト引数を適切な順序で適切なエンドポイントにヒットすることを意味する、ニッチなエンタープライズSaaSワークフローでは、この目的の不一致は、欠落した必須フィールド、幻覚を見たツール、または単一の読み取り後の早期終了といったサイレントな失敗として現れます。我々は、ターゲット環境に直接適用された検証可能報酬付き強化学習(RLVR)が、そのギャップを埋めるかどうかを問います。概念実証として、Jira REST v3およびConfluence v2 APIをスキーマ忠実度でエミュレートする5つの合成環境のスイートを構築します。報酬は、ツール呼び出しトレースから完全に計算され、ライブAPI、学習済みジャッジ、またはループ内の人間のラベルは使用しません。
arXiv cs.AI
2026年7月3日
手続き的記憶蒸留:自己改善型言語モデルのためのオンラインリフレクション検証可能な報酬を用いた強化学習(RLVR)や、最近の自己蒸留のバリアント(SDPOなど)は、各ロールアウトを検証機で評価し、エピソードレベルの信号からポリシーを更新する。しかし、ロールアウトに含まれるより豊かな手続き的情報は、ほとんど保持または再利用されない。エピソードやエポックをまたいで、モデルは変化するポリシーの下で関連する問題に繰り返し遭遇し、エピソードローカルな更新では捉えきれないクロスエピソード信号を生成する。どの戦略が一貫して検証を通過するか、どの失敗モードが持続するか、どのパターンが再発するかなどである。我々は、これらのクロスエピソード信号を再利用可能な手続き的記憶に変換し、トレーニング中にそれをポリシーの重みに蒸留するProcedural Memory Distillation(PMD)を提案する。この記憶はトレーニングの足場として機能し、ポリシー自体に吸収され、推論時には記憶のないモデルが得られる。
arXiv cs.AI
2026年7月7日
データ効率的なコードスイッチングASRのための強化学習音声言語モデルはコードスイッチング音声に対応可能ですが、そのデコーディングはコードスイッチングに最適化されておらず、言語境界で失敗することがよくあります。本研究では、グループ相対方策最適化を組み合わせた、検証可能な報酬を持つ実用的な強化学習手法を提案します。この手法は、エラー率報酬と、誤った表記体系を罰するスクリプト忠実度報酬、および2段階のドラフト・改良手順を組み合わせることで、音声言語モデルをコードスイッチングASRにデータ効率的に適応させます。再現可能なテストベッドとしてQwen2-Audioを10の言語ペアで使用し、TTSコードスイッチング音声のみで学習させた結果、RLVRはデータ量の10%でLoRA教師ありファインチューニング(全データセットで学習)と同等の性能を示し、特に類型学的に離れたペアで最大の効果が得られました。エラー率報酬は翻訳エラーを排除し、スクリプト忠実度報酬は劣化なくスクリプトの混入を個別に削減します。これらの改善は、人間が録音したコードスイッチングコーパスにゼロショットで転移します。
arXiv cs.CL
2026年7月8日
Prompt-to-Paper:バイオインフォマティクス向けエージェント型AIシステム大規模言語モデルの最近の進歩により、エンドツーエンドでの原稿自動生成が可能になったが、既存システムには3つの重大な欠陥がある。(i)生成された主張が検証可能な文献に決定論的に裏付けられていない、(ii)実験結果が実行されるのではなく、しばしば捏造される、(iii)AI生成原稿が実世界での出版に必要な質と厳密性を満たしているかを評価するための標準化された多次元フレームワークが存在しない。我々は、3つの統合されたイノベーションを通じて、この評価ギャップに直接対処するマルチエージェントフレームワーク「Prompt-to-Paper」を発表する。第一に、セクション認識型の関連性スコアリングとスノーボール引用拡張を備えた決定論的な検索拡張生成パイプラインにより、60~100報の検証可能な論文コーパスに各主張を裏付ける。第二に、自律的なコーディングエージェントが実際の計算生物学実験を実行し、合成出力を実際の数値結果に置き換える。第三に、出版された論文からの参照統計の近似値でベンチマークされ、明示的な幻覚ペナルティで拡張された8次元の自動品質スコアラーが、標準化された再現性のある品質評価を提供する。
arXiv cs.AI
2026年7月9日
大規模行動モデル:小売顧客のプロンプタブル・デジタルツイン顧客行動モデリングは、レコメンデーション、マーケティング、意思決定支援の基盤となりますが、既存のアプローチは、決定を説明せずに予測精度を最適化するか、実際の行動データに根拠を持たせずにユーザーをシミュレーションするかのいずれかです。本稿では、大規模な小売取引データから、統合された「人物・環境」フォーミュレーションを通じて、顧客の意思決定を直接学習する大規模行動モデル(LBM)を提案します。顧客の状態は、過去の購入履歴から導き出される行動プロファイルによって表現され、製品コンテキストは、検索拡張生成(Retrieval-Augmented Generation)によって組み込まれます。このモデルは、言語化された行動データに対する継続的な事前学習、意思決定生成のための教師ありファインチューニング、そして証拠に基づくキャリブレーションのための検証可能な報酬を用いた強化学習によって訓練されます。提案されたフレームワークを、購入予測、ハードネガティブ識別、バスケット補完、プロモーション反応、ドメイン間バウチャー交換の各タスクで評価します。
arXiv cs.AI
2026年8月12日
ONESTRUCTION、AWS GenAIICの支援で建設DX向け基盤モデル「Ishigaki-IDS」を構築ONESTRUCTIONは、Amazon Web Services (AWS) の支援を受けて、建設業界向けの基盤モデル「Ishigaki-IDS」を開発しました。このモデルは、建設およびBIM (Building Information Modeling) ワークフローに特化して設計されています。 「Ishigaki-IDS」の構築にあたっては、合成データ生成、3段階にわたる学習パイプライン、そしてAmazon EC2上で検証可能な報酬システムを組み合わせたアプローチが採用されました。この手法により、データが不足しがちな専門分野においても、効果的なドメインモデルの構築が可能になったとされています。ONESTRUCTIONは、この基盤モデルを通じて、建設業界のデジタルトランスフォーメーション (DX) を推進していく方針です。 (AWS Machine Learning Blog)
AWS Machine Learning Blog