TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
表現署名とLLM取引エージェントのリスク・フィードバック整合性金融意思決定環境におけるLLMエージェントの行動整合性と表現ダイナミクスを研究します。リスクレポート、実行シミュレーション、メモリ、再生可能なトラジェクトリを備えた監査可能な取引エージェントテストベッドであるTradeArenaを使用して、理論的根拠、ポジション、その他の要因がどのように変化するかを分析します。
arXiv cs.LG
2026年6月10日
Regimes:LongMemEvalでのアクティブグラフによる監査可能・ホールドアウトゲート付き改善ループの実証arXiv:2606.10241v1 発表タイプ:新規 概要:自律的な改善ループは、通常、エージェントに外部から取り付けられた足場であるため、信頼が難しい。失敗は記録されず、診断は再現できず、昇格または破棄の決定はエージェント自身の履歴ではなく、サイドデータベースに格納される。イベントソーシングされたエージェントランタイムは、その摩擦を取り除き、制御された改善をファーストクラスのワークフローに変えることを示す。エージェントの状態が追記専用イベントログの決定論的な射影である場合、失敗は記録され、実行はログから正確に再現され、候補パッチは型付きパイプラインのシームにスコープされ、ゲートは監査可能であり、すべての昇格または破棄はそれ自体がイベントとなる。これは、失敗した評価を診断し、パイプラインのポイントで修理を提案し、静的チェック、サンドボックス実行、インサンプル評価、およびホールドアウト検証の後でのみ昇格するActiveGraphランタイム上のループであるRegimesで実証される。このループはターゲットに依存しない。
arXiv cs.AI
2026年6月11日
明示的要素から暗黙的意図へ:監査可能な行動推論のための事前定義ライブラリarXiv:2606.11207v1 新規発表。SemantiCleanは、Eコマースセッションデータから構造化されたセマンティック信号を抽出し、共有要素ライブラリを通じて購入意図、顧客セグメンテーション、商品親和性などのプラグ可能な推論ターゲットを駆動するモジュラーフレームワークです。従来の精度のみを最適化するエンドツーエンド予測子とは異なり、SemantiCleanは監査可能性、構造的ガバナンス、sigma=0再現性を優先し、要素レベルの透明性と正当な決定トレイルのためにわずかな予測ゲインを明示的にトレードオフします。Online Shoppers Purchasing Intention (OSPI) データセットに基づき、このフレームワークは24の行動要素を4層アーキテクチャ(機能、インタラクション、システム、コンテキスト)に整理し、3つのアンチインフレーションメカニズム(RedundancyGroup貢献キャップ、TieredPenaltyCalculatorバイアスペナルティ、AdaptiveConstraintModeコールドスタート保護)を通じて信号品質を強制します。
arXiv cs.AI
2026年6月16日
PhoneHarness:GUI、CLI、ツールアクションを組み合わせた電話エージェントの活用電話エージェントは、単に次の画面アクションを予測するだけでなく、実際のモバイルワークフローを完了することが期待されるようになっています。しかし、現在のモバイルエージェントに関する文献の多くは、エージェントを主にGUIコントローラーとして評価しており、画面を監視し、タップやスワイプを実行し、ターゲットアプリの状態によってスコアリングされます。実際の電話使用タスクはより広範であり、アプリGUI、デバイスサイドコマンド、または構造化ツールの使用時期を判断し、意図した副作用が実際に発生したことを示す証拠を残す必要があります。本稿では、検証可能なモバイルワークフローで電話使用エージェントを研究するための、混合アクションベンチマークおよび実行ハーネスであるPhoneHarnessを紹介します。PhoneHarnessは、GUI、CLI、およびホストサイドツールアクションを介してデバイスサイドのエージェントループを実行し、決定論的なアクションルーティングと、境界のあるGUI委任、監査可能な実行トレースを組み合わせています。
arXiv cs.CL
2026年6月19日
DeXposure-Claw:DeFiリスク監視のためのエージェントシステム分散型金融(DeFi)は、監視担当者に急速に変化し、ネットワーク化された信用リスクをさらけ出します。汎用的なLLMエージェントはこの状況には不向きで、弱い証拠を過剰に読み取り、高リスクな介入を推奨する一方、既存の評価方法では、結果として生じる誤報を測定するための規制当局に沿った方法が提供されていません。本稿では、LLMの決定を構造化された証拠にルーティングする、予測に基づくエージェント型監視システム「DeXposure-Claw」を導入します。(1)グラフ時系列基盤モデル「DeXposure-FM」が将来のエクスポージャーネットワークを予測します。(2)次に、決定論的なモニターとストレステストシナリオが、それらの予測をタイプ化されたアラート、帰属シグナル、およびシナリオ証拠に変換します。(3)データヘルスと信頼度ゲートが、「DeXposure-Claw」が根拠とともに監査可能な監視チケットを発行する前にエスカレーションを制限します。さらに、6軸評価ハーネス「DeXposure-Bench」を開発しました。
arXiv cs.AI
2026年6月30日
監査可能ババ抜きこんにちは! 株式会社ブレインパッドの @y-tsukasa です! はじめに ♤ みなさんはババ抜きを知っていますか? ババ抜きはそのルールのわかりやすさから老若男女問わず楽しむことができるトランプを用いたゲームの一種です。 以下のようなルールが一般的だと思います。 ...
Qiita 人気記事
2026年7月8日
FirstResearch:LLM科学発見エージェントのための監査可能な質問生成科学的発見のためのLLMシステムは、アイデア創出、文献合成、実験計画、レポート生成を支援するが、最初に提案されるリサーチクエスチョンは監査が困難な場合がある。なぜなら、科学者が検査すべきメカニズム、反証、仮定を明らかにせずに、もっともらしく聞こえることがあるからだ。本稿では、科学的LLMエージェントのための第一原理リサーチクエスチョン生成フレームワークであるFirstResearchを紹介する。その中核成果物は構造化されたリサーチクエスチョン証明書である。この証明書は、基本的な定義、仮定、メカニズムモデル、緊張または矛盾、反証可能な仮説、最小限の決定的なテスト、および失敗時の更新ルールを記録し、提案された質問が下流の実行前に検査可能になる。10のLLMエージェントリサーチトピックにおいて、FirstResearchはAI co-scientist、Agent Laboratory、AI Scientist-v2に着想を得た制御されたプロンプトレベルのベースラインを、主要なDeepSeek-blind-judgeプロトコル下で上回った。
arXiv cs.AI
2026年7月20日
Causal-Audit: ターゲット認識型因果連鎖構築による明示的で監査可能なグラフベース推論因果関係と介入に基づく質問応答は、大規模言語モデル(LLM)を表面的な相関関係を超えた推論や、根本的な因果メカニズムの理解へと進歩させる上で不可欠です。しかし、既存のLLMベースの手法は、しばしば暗黙的な言語レベルの推論に依存しており、その結果、不透明な因果的仮定、検証不可能な推論パス、そして特にコンテキストフリーな設定における複雑な介入下での脆弱な予測につながります。本稿では、コンテキストフリーな介入ベースの質問応答のための、明示的で監査可能な因果推論フレームワークを提案します。我々の手法は、暗黙的なエンドツーエンド予測ではなく、4つのモジュール化された段階を経た明示的な因果グラフ上の構造化推論として因果推論を定式化します。主要な革新は、ターゲット変数をグラフ拡張中のコア制約として扱うターゲット認識型因果グラフ構築戦略であり、これにより無関係な変数、偽の因果関係、推論ノイズを効果的に抑制します。さらに、単一連鎖推論を超えた堅牢な意思決定を可能にする、複数の因果パスを組み合わせ、補強効果と相殺効果の両方をモデル化するパスレベルの因果証拠集約メカニズムを導入します。
arXiv cs.AI
2026年7月22日
Phionyx:構造化された状態管理と応答前ガバナンスを備えた決定論的AIランタイムアーキテクチャ本稿では、より広範なEchoismインタラクションフレームワークから派生した決定論的AIランタイムアーキテクチャであるPhionyxを紹介します。これは、大規模言語モデル(LLM)の出力を直接的な決定ではなくノイズの多いセンサー測定値として扱う、ガバナンスファーストのアプローチをAIエンジニアリングに導入します。確率的エージェントとは異なり、Phionyxは決定論的な状態遷移方程式によって制御される構造化された状態ベクトルを介して決定論的な状態進化を強制し、監査可能性とガバナンスを必要とするアプリケーションでの再現可能な動作を可能にします。このアーキテクチャは3つのレイヤーを統合しています。(1)標準的な46ブロックパイプラインを介してノイズの多いセンサー測定値を処理する決定論的評価カーネル、(2)応答前の制御とアーキテクチャのプライバシー強制を提供する統合安全レイヤー、(3)影響度加重キャッシュエビクションを実装するセマンティック時間ベースのメモリシステム。
arXiv cs.AI