TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月28日
RSIは新しいAGI—その定義も同じくらい曖昧複数のAI研究機関が再帰的自己改善(RSI)という技術開発に力を注いでいる。RSIはAIシステムが自らのコードやアルゴリズムを継続的に改良する仕組みだが、その定義や実現方法が業界内で統一されていない課題が浮き彫りになった。 研究機関間で目標設定の基準が異なるため、同じRSIという言葉を使いながらも、実質的に異なるアプローチが進められている状況だ。加えて、実装の難しさも指摘されており、理論的な可能性と実現の間に大きなギャップが存在する。 この状況は、より広い汎用人工知能(AGI)の定義が曖昧であることと類似しており、研究業界全体で共通の理解や基準作りの必要性が高まっている。RSIが今後の重要な技術になり得る一方で、概念整理と現実的な評価指標の構築が急務となっている。 (引用元:TechCrunch)
TechCrunch
2026年5月29日
日本航空機が成田空港に緊急着陸 タイヤ不具合でA滑走路閉鎖日本航空の航空機がタイヤの不具合により成田空港に緊急着陸し、A滑走路が一時閉鎖されました。航空機のタイヤは離着陸時に最も負荷がかかる消耗部品であり、国際基準に基づいて厳格に管理されていますが、飛行中に異常が検知されるケースが散発的に発生しています。今回の事案では、乗務員から管制部門への通報から緊急着陸までの対応プロセスが適切に機能したかが重要な評価指標となります。世界有数のハブ空港である成田での滑走路閉鎖は、日本の空港インフラの集約度の高さと冗長性の限界を示しており、今後の原因究明では個別機体の整備記録のみならず、業界全体のタイヤ交換周期の見直しも検討される見込みです。
NHK
2026年5月29日
フロンティアLLMベースエージェントは自然表現型のオントロジーキュレーションボトルネックを解決できる自由形式の表現型の説明をオントロジー用語にリンクする、いわゆる表現型アノテーションは、比較形態学的データの研究間統合に不可欠です。この労働集約的なプロセスは高度な訓練を受けた人間の専門家に大きく依存してきたため、スケーラビリティが課題となっています。
arXiv cs.AI
2026年5月30日
拡散モデルのグラフ-テキスト生成における復号化軌跡分析:最初に復号化されるトークンの考察マスク付き拡散言語モデルの復号化プロセスを分析した新しい研究が発表された。グラフ-テキスト生成タスクにおいて、同モデルが持つユニークな特性が初めて体系的に調査された。 研究によると、マスク付き拡散言語モデルは従来の自己回帰型大規模言語モデルと異なり、反復的な復号化の過程で特定の優先順序に従うことが明らかになった。具体的には、まず実体(エンティティ)を復号化し、その後に関係詞や機能語を復号化し、最終段階で構造トークンを復号化するという順序である。 同時に研究では、教師あり微調整がこの自然な復号化戦略を阻害する新たな問題モードを特定した。これに対し、推論時に重みなし修正を行う「ラムダスケーリング構造復号化」という手法を提案。この手法を導入することで、BLEUスコア(翻訳品質の評価指標)が9.4ポイント向上することが確認された。 この研究成果は、拡散モデルに基づくテキスト生成技術の精度向上に向けた重要な知見を提供するものとなっている。 (出典:arXiv cs.CL)
2026年6月1日
AISベース海事異常検出における教師なし学習の新規評価指標:MADQI本論文は、自動識別システム(AIS)データセットの異常検出のための新しい体系的フレームワークを導入する。これらの異常には、速度、位置ジャンプ、時間差、旋回角に関連した異常な船舶行動が含まれる。Isolation Forestなどの教師なし学習アルゴリズムが利用されている。
arXiv cs.LG
2026年6月2日
SN-WER:多言語インド言語ASR評価用スクリプト正規化WER音声認識システムの性能評価に関する新たな課題を解決する研究成果が発表された。従来の評価指標であるWER(Word Error Rate)は、同じ言語でも異なる文字体系で表記された同一単語を誤りと判定する問題があった。 新たに提案された「Script-Normalized WER(SN-WER)」は、評価前に参照文と認識結果の文字表記を各言語の標準文字に統一する手法。インド言語を含む5言語で検証した結果、きれいに録音されたデータセットでは最大12%のモデル性能評価ギャップを改善した。 一方、ノイズが多い実環境のデータセットでは改善幅が限定的だったことから、文字体系の違いが評価の誤差要因となるのは限定的であり、実際の音声認識精度そのものが主要な課題であることが判明。本研究は多言語音声認識システムのより正確な性能測定に貢献する成果として評価される。 (arXiv cs.CL)
2026年6月2日
MindZero:アノテーションなしでのオンライン心理推論の学習効果的な実世界での支援には、行動から人間の心理状態を推論する堅牢な心の理論(ToM)を備えたAIエージェントが必要です。最近の進歩にもかかわらず、複数の仮説にわたる堅牢な不確実性更新を伴うオンライン推論や効率的な推論など、いくつかの重要な課題が残っています。
arXiv cs.AI
2026年6月2日
あらゆるロール、ツール、ワークフロー向けのCodexアナリスト、マーケター、デザイナー、投資家など、様々なチームがAIでより多くの作業を完了するのに役立つ新しいCodexプラグイン、サイト、アノテーションを発見できます。
OpenAI
2026年6月3日
OpenAI、Codexのビジネス用途を広げる役割別プラグインを公開、アノテーション対象拡大やSitesのプレビュー提供もOpenAIは2026年6月2日、Codex向けに、職種や役割に合わせて使える6種類の新しい「役割別プラグイン」、成果物をWebサイトやアプリとして共有できる「Sites」のプレビュー提供、選択箇所を指定して修正を依頼できる「アノテーション」の対象拡大を発表した。
gihyo.jp
2026年6月4日
EVA-Bench Data 2.0:3つのドメイン、121のツール、213のシナリオAI評価の標準化を目指すHugging Faceが、ベンチマークデータセット「EVA-Bench Data」の最新版2.0をリリースした。 このデータセットは、AIモデルの性能を多角的に測定するための包括的な評価基盤として設計されている。従来版から大幅に拡充され、3つの異なるドメインをカバーしながら、121種類のツールと213のシナリオに対応している点が特徴だ。 複数分野における実践的なシナリオを用意することで、開発者はより実務的な環境下でモデルの性能を検証できるようになる。様々なツールセットが含まれていることから、汎用性の高い評価が可能になると期待されている。 このような統一された評価指標の提供は、AI開発業界全体の品質向上と信頼性確保に寄与する。研究機関や企業がモデルを比較検討する際の基準となり、より透明性の高い開発環境の構築につながる可能性がある。 引用元:Hugging Face
2026年6月5日
繰り返しゲームにおける適応的対手との後悔最小化繰り返しゲーム理論における新しい評価指標が提案された。arXivの人工知能分野に掲載された論文は、対手が過去の行動履歴に基づいて戦略を適応させるゲーム環境での意思決定評価方法を改善している。 従来の後悔最小化の指標である外部後悔は、対手の適応性を十分に考慮できないという課題を抱えていた。この論文は反事実的推論を組み込んだ「繰り返しポリシー後悔」という新たな概念を導入し、より正確な評価を実現した。 新指標は、複数プレイヤーが全て履歴に応答できる場合に、実際に得られた効用と理想的な事後効用の差を測定する。これにより、適応的な対手との相互作用における戦略の真の効率性を評価できる。 この研究は機械学習や多エージェントシステム、経済学における意思決定分析など、複数の分野での応用が期待されている。適応環境でのアルゴリズム性能評価の精度向上に貢献する成果である。 (引用元:arXiv cs.AI)
2026年6月8日
UnpredictaBench: LLMにおける分布的ランダム性を評価するためのベンチマーク大規模言語モデル(LLM)が真の基礎分布をキャプチャする能力をテストする評価指標UnpredictaBenchが導入されました。LLMが経済シミュレーションなど他の主体の代替として使用される場合が増えていますが、多くのモデルが単一の尤もらしい答えに収束する傾向があり、実際のシステムの予測不可能性を捉えられていません。出力の多様性向上に関する最近の研究は不十分で、シミュレーションには単なるバリエーション豊かな出力ではなく、目標分布に校正されたサンプルが必要です。UnpredictaBenchは、正規統計分布、確率的プログラムによる分布、ランダムプロセスを記述する自然言語シナリオを含む448個の問題を提示し、コルモゴロフ・スミルノフ統計検定を用いてモデルの出力が目標分布にどの程度近いかを定量化するKS@Nという評価指標を導入しています。複数のオープンソースモデルと商用モデルをテストした結果、分布能力に大きなばらつきが見られ、サンプルサイズ100(標準指標KS@100)での得点は0近くから20%以上まで分布し、どのモデルもKS@100で40%を超える成績を達成できていません。
arXiv cs.CL
2026年6月8日
CAF-Gen:議論構造を充実させるためのマルチエージェントシステム自然言語テキストから複雑な推論を形式化することは、計算言語学における中心的な課題である。現在の議論マイニング技術は基本的な主張と前提を識別するが、前提のタイプ、証明基準、議論スキームなどの特徴を組み込むカーネアデス議論枠組み(CAF)といった高度なスキーマが必要とする豊かな構造情報を捉えるのに苦労している。本研究は、浅い議論構造をCAF準拠の議論モデルに充実させるために設計された自動マルチエージェントフレームワークCAF-Genを導入することでこの制限に対処している。反復的なクリエイター・レビュアーパイプラインを採用することで、クリエイターエージェントの出力は批評的エージェントによって検証され、構造的整合性が確保される。このマルチエージェント協働は、単一パス生成モデルに典型的な構造的不安定性を軽減するために重要である。実験結果は、反復的なフィードバックループが結果データの品質を向上させ、元のアノテーションとの強い一致を達成しながら、構造的により豊かなモデルを生成することを示している。
arXiv cs.CL
2026年6月8日
HKJudge:香港判決文の法的言説注釈付きコーパス - 裁判所の判断根拠、推論過程、判決内容の解釈本研究は、香港の判決文に対する言説分析のための初めての専門家注釈付き法的言説コーパス「香港判決文言説データセット(HKJudge)」を紹介する。HKJudgeは香港の5段階の裁判所階級全体にわたる刑事判決を含み、約29万文、650万トークンから構成され、法言語学の専門家により完全に注釈付けされている。2層構造の言説スキーマを設計し、裁判所が認定した事実、推論過程、判決内容を捉える。文レベルでは各文に26の修辞的役割のいずれかが割り当てられ、スパンレベルでは有罪判決要素(罪状、懲役期間、罰金)でさらに注釈付けされている。10人の法言語学注釈者によるアノテーションは高い一致度(κ = 0.8)を達成している。HKJudgeに対して修辞的役割分類と法的要素抽出の2つのタスクを定式化し、4つのBERTベースモデル、2つのオープンソースLLM(ゼロショットおよびファインチューニング設定)、および4つの商用LLMについて初の基準評価を提供している。この研究は、文レベルの言説注釈が香港判決文の構造モデリングに価値があることを実証し、法的判決予測に関する将来の研究のための豊富なデータ基盤を提供する。
arXiv cs.CL
2026年6月16日
ReportQA: QAベースの放射線レポート評価放射線レポートの評価は、自動レポート生成の進歩に不可欠です。自然言語生成メトリクスは臨床的関連性が限定的です。臨床的有効性(CE)メトリクスは重要な医学的所見を評価しますが、主に存在に焦点を当て、限定的なエンティティしかカバーしません。手動アノテーションへの重い依存により、CEメトリクスが臨床エンティティや属性を拡張することは困難です。臨床現場では、放射線レポートは情報伝達の媒体として機能します。臨床医は、画像を直接検査することなく、下流の診断タスクを実行するためにこれらを使用します。この洞察に基づき、放射線レポート生成システムの詳細な定量的分析をサポートする、臨床関連で柔軟な放射線レポート評価フレームワークであるReportQAを提案します。まず、複数の画像モダリティと解剖学的領域をカバーするデータセットを収集します。次に、放射線科医のガイダンスを得て臨床エンティティと属性の知識ツリーを構築し、大規模言語モデル(LLM)を使用して生のレポートから構造化情報を抽出します。
arXiv cs.CL
2026年6月16日
Metric Match:LLM判定の信頼性評価のためのサブセット選択アプローチLLM判定は、オープンエンドなテキスト生成の評価における人件費の削減に利用されます。しかし、これらの判定の信頼性は、人間による評価との一致に大きく依存しますが、その一致自体も費用のかかる人間によるアノテーションに依存します。本研究では、限定的なアノテーションからLLM判定の相関ベースの信頼性指標を推定する方法(Metric Match)を開発しました。Metric Matchは、取得した合成ラベルに関して、サブセットが母集団の信頼性指標と一致するように、人間によるアノテーションのためのサンプルサブセットを選択します。経験的に、Metric Matchは、4つの異なる相関指標と15のデータセット全体でランダムなサブセット選択と比較して0.838の勝率を達成し、平均推定誤差を18.7%減らし、アノテーションの必要性を32.5%削減することを示しました。コストモデルを提供し、専門家のアノテーションにおいてランダム選択と比較して1,041.67ドルの節約になる医療ケーススタディを強調します。
arXiv cs.AI
2026年6月18日
可能性か断定か?臨床テキストにおける診断の不確実性保持を評価するためのベンチマーク大規模言語モデル(LLM)は、要約や修正などの臨床テキストタスクでますます利用されています。ほとんどの研究ではLLM生成テキストの流暢さや一貫性を評価していますが、LLMが診断の不確実性を正しく保持するかどうかは十分に探求されていません。臨床現場では、「可能性のある肺炎」のようなフレーズは、利用可能な証拠の強さを伝え、フォローアップ検査や治療の決定に直接影響を与えます。これらの不確実性表現を変更すると、臨床的意味が完全に変わる可能性があります。本稿では、この問題を2段階で体系的に評価しました。まず、5つのレベルにわたる9,184の不確実性アノテーションが付いた1,200の臨床文書のベンチマークを構築しました。次に、このベンチマークで3つのLLMを評価しました。その結果、(1)LLMは元の不確実性キューを貧弱に保持しており、多くの場合半数未満しか保持しないこと、(2)LLMは隣接するレベル間の微妙な区別で苦労することが示されました。この研究は、標準的な評価指標では捉えられない失敗モードを明らかにし、臨床ワークフローにおけるLLMの安全な展開への示唆を提供します。
arXiv cs.CL
2026年6月19日
大規模手話データセット:リソース、ベンチマーク、アノテーション標準に関する包括的調査手話は、ろう者および難聴者(DHH)コミュニティが使用する表現力豊かな視覚言語です。手話認識、翻訳、生成において substantial な進歩があったにもかかわらず、データセットの断片化、アノテーションの一貫性の欠如、言語的カバレッジの限定性により、進歩は still 制限されています。既存のベンチマークは、real-world のコミュニケーションニーズを反映できていないことが多く、これらの制限に対する体系的な分析は still limited です。本調査では、35 の手話にわたる 120 のリソースをカバーする、手話データセットの包括的な index を提示します。モダリティの不均衡、アノテーションの粒度、署名者のバイアスなどの主要な課題を分析し、将来のデータセット設計に関する考慮事項を概説します。
arXiv cs.CL
2026年6月23日
学習におけるアノテーション飽和度を評価指標に依存させて推定する手法アノテーター間の意見の不一致は、それ自体が情報となりうる。その情報量を得るために必要なアノテーターの数は、評価指標によって異なる。本研究では、ChaosNLIデータセット(項目ごとに100人の独立したアノテーターの判断を提供)からサブサンプリングしたラベル分布を用いて、NLIモデルをファインチューニングし、評価指標に依存したアノテーション飽和度を特定した。
Apple Machine Learning Research
2026年6月24日
製品の望ましさに関する数値的・分類的隠れた感情分析の効率性と説明可能性のためのLLM利用評価定性的な製品フィードバックはニュアンスのあるユーザー体験を明らかにしますが、その隠れた感情を測定することは困難です。本論文では、大規模言語モデル(LLM)を使用して、このようなデータから製品の望ましさを定量化する、スケーラブルで解釈可能なフレームワークを提案します。ZORQとCARMAの2つのProduct Desirability Toolkit(PDT)データセットを使用し、106の回答者タームグルーピングをゴールドスタンダードの人間によるアノテーションで評価し、明示的なレビュー評価に依存せずに、ゼロショット連続数値感情スコアリングとカテゴリ感情分類を評価します。データセット全体で、LLMは定性的な回答から直接数値感情スコアを生成し、専門家のラベルに非常に近く、ピアソン相関係数は最大0.97、分類精度は最大94%を達成しました。LLMは、複数の形式で提示されたデータを処理しても堅牢性を維持し、一貫して高い信頼性を示しました。対照的に、辞書ベースおよびトランスフォーマーベースラインでは統計的に有意な結果は得られませんでした。
arXiv cs.CL
2026年6月24日
LLMの帰属評価指標は転移するか?データセットと構成要素を横断したRetrieval-Augmented Generation評価の監査LLMのRetrieval-Augmented Generationにおける帰属評価のための自動評価指標は、しばしば交換可能に扱われる。本研究では、8つの自動評価指標(lexical、embedding、BERTScoreのベースライン、entailment/groundingで学習したモデル(cleanおよびFEVER NLI、checker MiniCheck))を、3つの評価構成要素(provenance/topicality、生成回答の帰属、fact-check entailment)にわたって監査する。どの指標も、マルチデータセット構成要素の各データセットにおいて、監査された最良の評価指標の95%信頼区間内に留まるか、すなわち転移するかどうかを検証する。人間によるラベル付けが最も多くカバーされている構成要素である生成回答の帰属(AttributionBenchの4つのソースデータセット、n=1,610、独立したHAGRID、n=2,150)では、どの指標も転移しなかった。
arXiv cs.CL
2026年6月24日
QuechuaTok:形態素境界精度を、膠着語におけるトークナイザー評価の必須指標とするNLPパイプラインの基盤となるトークン化において、既存の評価指標(例:生起頻度)は、膠着語の形態論的な正しさを捉えきれていない。本研究では、南米で8〜1000万人が話す低資源膠着語であるケチュア語(quz)を対象に、BPE、Unigram LM、WordPiece、そして形態論を考慮したPRPEトークナイザーの4つの戦略を比較する体系的なベンチマーク「QuechuaTok」を提案する。20万文のコーパスとSQUOIA有限状態形態素解析器(Rios, 2016)を基準として、生起頻度、未知語率(OOV rate)、形態素境界精度(MorphAcc)の3つの指標で評価した。結果として、BPEは16k語彙で1.636という最低の生起頻度を達成するも、MorphAccは6.67%に留まった。一方、PRPEは全システム中最高の83.33%のMorphAccを達成し、生起頻度だけでは膠着語のトークナイザー評価として不十分であることを示した。全てのコードとモデルはkaggle.com/code/macmaky/quechuatokで公開されている。
arXiv cs.CL
2026年6月24日
言語モデルエージェントはメカニズム解釈における回路説明に役立つか?メカニズム解釈は、回路の自動的な特定において大きな進歩を遂げましたが、特定されたコンポーネントが何をするかの説明は、依然として手間がかかり、標準化が困難です。本研究では、回路が特定された後、言語モデル(LM)エージェントがこの説明問題の支援となるかどうかを調査します。163個のコンポーネントレベルのアノテーションを持つ84個の半合成トランスフォーマー回路から構築された、回路説明のためのベンチマークであるAgenticInterpBenchを導入します。観察、仮説生成、因果検証の反復ループを通じて各コンポーネントを分析し、最終的にコンポーネントレベルの説明と回路レベルのタスク説明を生成するエージェント型説明ツールHyVE(Hypothesize, Validate, Explain)を提案します。4つのLMバックボーンにわたるHyVEは、有用なコンポーネントレベルおよびタスクレベルの説明を回復しますが、どのバックボーンも一様に最良ではありませんでした。
arXiv cs.AI
2026年6月26日
敵対的生成ネットワーク(GAN)のためのニューラルアーキテクチャ探索:包括的なレビューと批判的分析ニューラルアーキテクチャ探索(NAS)は、敵対的生成ネットワーク(GAN)の設計最適化において極めて重要な技術として登場し、手動設計に内在する課題に対処しながら効果的なアーキテクチャの探索を自動化します。本稿では、GANに適用されるNAS手法の包括的なレビューを提供し、探索戦略、評価指標、パフォーマンス結果などの基準に基づいて様々なアプローチを分類・比較します。このレビューは、GANのパフォーマンス、安定性、効率性の向上におけるNASの利点を強調するとともに、限界と今後の研究分野を特定します。主な発見には、特定の状況における進化的アルゴリズムと勾配ベースの手法の優位性、Inception Score(IS)やFréchet Inception Distance(FID)などの従来のスコアを超えた堅牢な評価指標の重要性、GANのパフォーマンス評価における多様なデータセットの必要性が含まれます。既存のNAS-GAN技術の構造化された比較を提示することにより、本稿は、より効果的なNAS手法の開発とGAN分野の進歩において研究者を導くことを目指しています。
arXiv cs.LG
2026年6月26日
AIエージェント基盤のためのエージェンティック分析:DAOと企業のAIプロトコルの比較ガバナンスのためのLLM搭載パイプラインAIエージェントプロトコルが普及するにつれて、相互運用性標準を形成するガバナンス構造は経験的に十分に検討されていません。本稿では、大規模なガバナンス・ディスコース分析のためのLLM搭載比較パイプラインを導入します。これには、自動アノテーション、ニューラル・トピック・モデリング、マルチレイヤー・ネットワーク分析を統合し、社会技術的パワー構造を大規模に研究します。本パイプラインは、エージェント相互運用性の2つの対照的な標準、ERC-8004(パーミッションレス、オンチェーン)とGoogle A2A(企業主導)で検証されます。4,323件のガバナンス参加記録を分析し、LLM支援コーディング、トピック・モデリング、マルチレイヤー・ネットワーク分析を組み合わせて、制度設計がテーマの優先順位やコミュニティ構造にどのように影響するかを調査します。ガバナンスの形式が実質的な焦点に影響を与える一方で、両方の体制が参加の不平等やコミュニティの断片化において同程度のレベルを示すことがわかります。
arXiv cs.AI
2026年6月29日
PairSAE:タンパク質共フォールディングにおけるペア表現からのメカニズム解釈構造生物学のための基盤モデルは、生体分子構造の予測において目覚ましい性能を達成し、タンパク質や低分子の設計に有望視されている。しかし、その出力の根幹をなす内部特徴を理解することは依然として困難である。標準的なスパースオートエンコーダー(SAE)は、トランスフォーマー風のシーケンス埋め込みには効果的だが、ペアフォーマー風のアーキテクチャにはそのまま適用できない。ペア表現に単純に作用させると、特徴量が二次関数的に増加し、シーケンス表現とペア表現にまたがって分散する概念が不明瞭になる。そこで我々はPairSAEを開発した。これは、ペアテンソルをNモードSVDによってトークンごとの相互作用役割に要約し、その後、スパースオートエンコーダーを使用して、シーケンス表現とペア表現の両方をデコードできる共通のトークンレベル特徴セットを学習する。PLINDERタンパク質-リガンド複合体のBoltz-2活性化で評価した結果、PairSAEはUniProtアノテーションと一致し、Boltz-2親和性値を予測する解釈可能な特徴量をもたらした。
arXiv cs.LG
2026年6月29日
地中CO2貯留における坑底圧とCO2プルーム予測の境界条件精度安全な地中CO2貯留には、坑底圧(BHP)とCO2プルーム移動の正確な予測が不可欠ですが、実用的なシミュレーションでは、人工境界が圧力拡散とCO2飽和度フットプリントを歪める截断領域が用いられることがよくあります。本研究では、均質および不均質貯留層における全領域参照シミュレーションと比較して、10種類の縮小領域境界処理がBHPとCO2プルーム予測にどのように影響するかを評価します。性能指標として、BHPのRMSE、NRMSE、ピーク圧力偏差、プルームのIntersection over Union(IoU)を使用して、均一な孔隙体積乗数、透過率修飾子、コーナー調整孔隙体積補正、層状補正、段階的修飾子をテストします。結果は、コーナー孔隙体積の保存が截断領域モデリングに最も重要な要件であることを示しています。
arXiv cs.LG
2026年6月30日
RL研究者はシミュレーターを解くことと、デプロイメントの代理としてシミュレーターを使うことを区別する必要がある強化学習(RL)研究の目標の一つは、デプロイメント設定での学習の代理としてベンチマークシミュレーターを使用し、汎用的な逐次的意思決定を理解することです。しかし、実験を行う際、シミュレーターで高いパフォーマンスを達成するという目標が、シミュレーターを解くことに専念するようになる可能性があります。高スコアを達成するために、研究者はシミュレーター外でエージェントがデプロイされた際の学習ではなく、シミュレーターを解くためだけに意図されたソリューションを採用するかもしれません。シミュレーターを解くことも調査に値しますが、それは根本的に異なるRL研究の質問です。本論文では、RL研究者はシミュレーターの2つのユースケース、すなわちシミュレーターを解くことと、デプロイメントでの学習の代理としてシミュレーターを使うことを区別する必要があると主張します。まず、これら2つのユースケースが、エージェントがシミュレーターをどのように使用できるかという制約、適切なアルゴリズム、および適切な評価指標の点でどのように重要に異なるかを議論します。
arXiv cs.LG
2026年7月1日
クリーンテキストを超えて:ノイズのあるテキストでのベンガル語イベント検出におけるエンコーダーとデコーダーのロバスト性の評価イベント検出(ED)システムは通常、クリーンでキュレーションされたテキストで評価されるため、特にベンガル語のような低リソース言語においては、現実世界のノイズに対するロバスト性はほとんど探求されていません。本研究では、汎用的なベンガル語ニュースイベントオントロジーと、クリーンなニューステキスト、実世界の自動音声認識(ASR)トランスクリプト、および正書法的に破損したテキストにまたがる40のイベントサブタイプにわたる9,979のアノテーション付き文からなるベンチマークを導入します。ファインチューニングされたエンコーダー専用モデル(BanglaBERTとXLM-R)と、命令チューニングされたデコーダー専用大規模言語モデル(Llama 3とGemma 3)を体系的に評価します。結果は明確なアーキテクチャのトレードオフを明らかにします。エンコーダーモデルはクリーンなテキストで高いパフォーマンスを達成しますが、ノイズ下では著しく低下します。一方、デコーダー専用LLMは、特にイベントトリガーが破損している場合に、著しくロバストです。
arXiv cs.CL
2026年7月1日
成果報酬モデルによるテキストからSQLへのテスト時検証推論時の大規模言語モデル(LLM)の信頼性向上は、テキストからSQLへの変換のような構造化推論タスクにおける中心的な課題です。Best-of-Nサンプリングや多数決などの一般的なテスト時推論戦略は、実行成功や出力頻度などのヒューリスティックな信号に依存していますが、候補出力間の意味的な識別能力は限られています。本研究では、テキストからSQLへの変換におけるテスト時検証のための学習済み意味スコアリング関数として、成果報酬モデル(ORM)を検討します。ORMは以前からテスト時のスケーリングやアライメントに検討されてきましたが、構造化クエリ生成への応用は十分に探求されていませんでした。自動化された候補生成と実行ベースのラベリングによるタスク固有ORMのトレーニングのためのスケーラブルなフレームワークであるGradeSQLを導入し、手動アノテーションなしでの検証器トレーニングを可能にします。ORMを検証駆動型Best-of-Nパイプラインに統合し、複数のオープンソースLLMファミリーにわたるBIRDおよびSpiderベンチマークでアプローチを評価します。
arXiv cs.CL