TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月13日
NVIDIA、Ineffable Intelligenceが強化学習インフラストラクチャの未来構築で協力試行錯誤を通じて学習するAIシステムである強化学習エージェントは、計算を新しい知識に変換することができます。これがNVIDIAとIneffable Intelligenceの新しいエンジニアリングレベルの協業の焦点です。
NVIDIA Blog
2026年5月22日
マスク氏の「Grok」、AI競争で大きく後れ取るイーロン・マスク氏が率いるxAIが開発したAI「Grok」が、業界内での競争力で課題を抱えている。OpenAIの「ChatGPT」やGoogle、Anthropicといった大手企業が提供する高度なAIモデルとの性能格差が拡大しているという。 Grokは2023年の発表当初、ユーモアを備えた独特のAIアシスタントとして注目を集めていた。しかし、その後の開発段階で、言語処理能力や推論性能などの基本的なAI機能において、競合他社との差が生じているようだ。 AI市場は急速に進化しており、複数企業が性能向上に向けた投資を加速させている。Grokが現在のポジションを維持あるいは改善するには、技術開発の加速化が必要とされている。xAIが今後どのような戦略で市場巻き返しを図るかが注視されている。 (引用元:xAI)
xAI
2026年5月29日
Amazon Bedrock AgentCoreのデータセット管理でエージェントとともに成長するテストスイートを構築エージェント評価は、急速に変化するオンラインシグナルと安定したオフラインベースラインを組み合わせることで最も強力になります。エージェントが時間とともに本当に改善されているかどうかを理解するには、固定ベンチマークが必要です。
AWS Machine Learning Blog
2026年5月29日
カタストロフィック・フォーゲッティングの機序的起源:RLがSFTよりも回路をよく保持する理由大規模言語モデル(LLM)のファインチューニングはしばしば以前の能力のカタストロフィック・フォーゲッティングを引き起こす。最近の研究によれば、強化学習(RL)は教師あり学習(SFT)よりも効果的に以前の能力を保持し、ポリシー勾配更新がより近い状態に留まることに起因している。
arXiv cs.LG
2026年5月29日
クロスモデルエントロピーによるラベル不要強化学習強化学習を用いた大規模言語モデルの事後学習は報酬信号によってボトルネックとなっている。既存のアプローチは、自動正確性チェック(数学やコード実行など)のある領域に訓練を制限する検証可能な報酬か、人間の選好ラベルのいずれかを必要とする。
arXiv cs.LG
2026年5月29日
強化学習ベースの産業用ディスパッチングにおけるシミュレーション・ツー・リアル・ギャップの解決(実行セマンティクスを通じて)イベント駆動型スケジューリング・ポリシーは産業環境で導入されており、非同期で部分的に観測されたシステム状態下で決定が行われます。その結果、決定状態は時間的一貫性を欠き、アクション実行可能性が明示的に定義されず、実行の由来に関する問題が生じます。
arXiv cs.AI
2026年5月29日
FedQHD: 閉形式関数空間フェデレーション強化学習フェデレーション強化学習は、生のトラジェクトリを交換することなく、分散エージェントが協力してポリシーまたは価値推定を改善することを可能にします。ただし、FedAvgスタイルのパラメータ平均化は関数空間で一貫性がなく、クライアントが異なるエンコーダを使用したり、同じ非線形ネットワークを使用する場合でも問題が生じます。
arXiv cs.LG
2026年5月29日
微分可能な信念ベースの対戦相手形成人間の協調は、戦略的行動を通じて他者の信念に影響を与える能力に依存している。マルチエージェント強化学習では、対戦相手形成がこの影響を複製しようとしているが、既存の方法は通常、対戦相手のパラメータ、ポリシー、または価値空間内で動作している。
arXiv cs.AI
2026年5月29日
言語優先性の脱却: モダリティ認識ポリシー最適化によるオーディオ推論の後期段階モダリティ崩壊の軽減オーディオと全モダリティ大規模言語モデルは印象的なクロスモーダル推論能力を示すが、これらのモデルに標準的な強化学習後処理アルゴリズムを適用すると、GRPO のような方法がすべてのトークンに均一なポリシー勾配を適用する構造的脆弱性が露呈する。
arXiv cs.CL
2026年5月29日
ビッグ2における不完全情報下の自己対戦強化学習不完全情報の多人数ゲームは、エージェントが隠された情報、スパースな報酬、および非定常の対手の下で行動できるかどうかをテストします。4人プレイの不完全情報カードゲームであるビッグ2でこれらの課題を研究し、制御された比較を可能にする自己対戦RLフレームワークを開発しました。
arXiv cs.LG
2026年5月29日
LLM報酬設計が失敗するとき:スパース構造化RLのための診断駆動型改善セマンティック報酬関数インターフェースを持つスパース構造化強化学習タスクの場合、LLM生成報酬形成は一度限りの生成ではなくデバッグとしてより適切に枠付けされている。MiniGridを中核評価として、MuJoCoを境界ストレステストとして使用するPPO訓練エージェントを研究する。本監査では2つの支配的な知見を発見する。
arXiv cs.LG
2026年5月29日
ペットの捕獲・育成を楽しめる都市型オープンワールドRPG「望月」,開発中のゲームプレイ映像を公開。中国ではオフライン試遊イベントを開催へ星辰工作室は本日(2026年5月29日),開発中の都市型オープンワールドペット捕獲RPG「望月」のゲームプレイ映像を公開した。中国ではオフライン試遊イベントを開催予定だ。
4Gamer.net
2026年5月30日
遺伝子発現マスキングによる効果的な生物学的表現学習遺伝子発現データの自動学習モデルが開発される RNA配列決定データから遺伝子発現パターンを効率的に学習する新しい自己教師あり学習モデル「TxFM」がarXivで報告された。 このモデルはマスク付きオートエンコーディング手法を採用しており、RNA分析に付きものの技術的ノイズや異なる実験条件によるバッチ効果に対応できるのが特徴である。従来の生物学的データ分析では、こうした外部要因の影響を除去するために手作業による前処理が必要だったが、TxFMはモデル内で自動的に対応する。 開発チームは転移学習の性能向上を実証するため、約140万件のRNA配列データを集めた公開学習用データセット「DiverseRNA-1.4M」を整備した。このデータセットを用いた実験では、従来手法と比べて学習効率が向上したという。 今後、このアプローチは遺伝子発現解析の標準的な手法として活用される可能性がある。 (arXiv cs.LG)
arXiv cs.LG
2026年5月30日
Gemini OmniとGemini 3.5の9つのデモ動画Googleは開発者向けカンファレンス「I/O 2026」で発表した最新AI モデル「Gemini Omni」と「Gemini 3.5」の機能を示すデモンストレーション動画9本を公開した。 公開された動画では、両モデルの実際の動作と性能が具体的に紹介されている。Gemini Omniは音声、画像、テキストなど複数の形式のデータを統合的に処理する能力を持つマルチモーダルモデルで、より自然で正確な応答生成が可能とされている。一方、Gemini 3.5は前世代からの性能向上が示されており、様々なタスクにおける処理精度の改善が確認できるという。 これらのデモ動画は、開発者やAI技術に関心を持つユーザーに対して、Googleの最新AI技術の実用的な活用方法を理解する機会を提供している。今後、これらのモデルは様々なアプリケーション開発に活用されることが期待される。 (Google AI Blog)
Google AI Blog
2026年5月30日
分散最適化における誤差フィードバックアルゴリズムの厳密な理論分散学習システムにおける通信効率化に関する新しい理論研究が発表された。機械学習の分散処理では、複数のコンピュータ間で勾配情報を交換する際の通信コストが大きな課題となっていた。 情報圧縮により通信量を削減する手法は既に活用されているが、圧縮に伴う精度低下の問題が存在していた。誤差フィードバック機構はこの課題に対する有効な解決法として注目されている。 この研究では、標準的な誤差フィードバック法とEF21という2つの主要なアルゴリズムについて、数学的に厳密な収束性の分析を実施した。最適なステップサイズの決定方法と、各アルゴリズムに適したリアプノフ関数の構築により、より正確な理論保証が得られたという。 この成果は、今後の大規模分散学習システムの効率化と性能向上に貢献する可能性がある。 (arXiv cs.LG)
2026年5月30日
【16029円ゲット】Teclast Android 15 タブレット『T50Mini』を期間限定の低価格でお得に購入可能! Amazonセール開催(5/20から6/2まで)Teclastの8インチAndroidタブレット『T50Mini』がAmazonで5月20日から6月2日まで期間限定セール開催され、16029円の割引が適用される。スマートフォンの大型化に伴いタブレット市場はエントリー層向け廉価機が主流となる中、中国系メーカーの参入が進んでいる。プロセッサ性能向上により安価な端末でも動画視聴や電子書籍閲覧に十分と認識される様になり、インターネット販売を活用した低価格戦略が有効とされている。
PR TIMES
2026年6月1日
自動運転のための強化学習における不確実性認識と時間的に規制された専門家アドバイスarXiv:2605.30576v1 発表型:新規 要旨:自動運転の強化学習における探索は本質的に危険である。エージェントは学習のために新しい行動を経験する必要があるが、探索は衝突やオフロード走行につながる可能性がある。我々は、長期的な危険を回避しながら探索を導くために専門家アドバイスを活用する不確実性認識フレームワークを提案する。
arXiv cs.AI
2026年6月1日
構造認識報酬による深い研究のためのプランナー中心強化学習深い研究タスクではLLMが調査対象を計画し、エビデンスを検索し、複数の調査分野にわたって長文の回答を合成する必要がある。既存の訓練パラダイムは短文の検証可能なQAをプロキシとして依存するか、モノリシックな長軌跡を最適化するかのいずれかであり、計画と実行が困難である。
arXiv cs.AI
2026年6月1日
状態拡張とコンセンサスを用いた分離可能ダイナミクスの拡張可能な制約付きマルチエージェント強化学習状態拡張ポリシー学習と双対変数の分散コンセンサスを組み合わせた制約付きマルチエージェント強化学習の分散アプローチを提示する。本手法は、エージェントが分離可能なダイナミクスを持つシステムを対象とし、グローバルリソース制約を満たすために調整する必要がある。
arXiv cs.LG
2026年6月1日
SLAT: 効率的なCoT推論のためのセグメントレベル適応トリミング大規模推論モデルの最近の進歩は強化学習(RL)を通じた思考の連鎖(CoT)機能を大幅に改善している。しかし生成された推論チェーンはしばしば構造的冗長性(いわゆる過度な思考)に悩まされ、改善なく高い計算オーバーヘッドを引き起こしている。
arXiv cs.AI
2026年6月1日
Leanの定理証明のためのLLMフィードバック蒸留推論モデルのポストトレーニングは通常、検証可能な報酬からの教師あり微調整と強化学習を組み合わせ、最も一般的にはGRPOで行われている。しかしこのアルゴリズムは報酬の疎さ、限定的な探索、モード崩壊に悩まされている。自己蒸留に関する最近の研究に基づき、改善されたアプローチを提案する。
arXiv cs.AI
2026年6月2日
ProtoAda: マルチモーダル継続学習における プロトタイプ誘導型適応アダプタ展開と幾何学的統合マルチモーダル大規模言語モデルの継続学習における課題解決の新たなアプローチが報告された。 既存の継続学習手法では、画像とテキストの類似度のみを基準に専門家タスクの割り当てを行っていたため、異なる出力形式を持つタスク間で勾配干渉が発生し、性能低下につながっていた。 新研究「ProtoAda」は、この問題に対してプロトタイプ誘導型の適応的アダプタ拡張と幾何学的統合を組み合わせた手法を提案している。応答形式の違いを明確に考慮することで、タスク間の干渉を軽減し、より効率的な継続学習を実現する。 この技術により、マルチモーダル継続学習タスク(MCIT)全体の性能向上が期待できるという。画像認識とテキスト処理を同時に扱う複合的なAIシステムの精度向上につながる可能性がある。 (arXiv cs.LG)
arXiv cs.LG
2026年6月2日
CAST:GRPOのための非特権化クリップ付き非対称セルフティーチングとアドバンテージ反転検証可能な報酬を用いた強化学習(RLVR)、特にグループ相対方針最適化(GRPO)は、大規模言語モデルの推論を改善するために広く使用されています。しかし、結果レベルの報酬は疎な教示のみを提供し、サンプリングされた軌跡がすべて同じ結果を得た場合、グループ相対アドバンテージは消失します。
arXiv cs.AI
2026年6月2日
CSRP: 効率を考慮した報酬による強化学習を通じた中国語テキスト修正のための思考の連鎖推論LLMベースの中国語文法誤り修正(CGEC)システムは2つの重大な課題に直面しています。汎用モデルは微妙な文法的区別のための特化した言語的先験知識が不足しており、最尤推定による教師あり微調整は最適化に失敗しています。
arXiv cs.CL
2026年6月2日
MindGames Arena 一般化トラック:遅延段階ごと報酬帰属を用いたIn2AIソリューションマルチエージェント戦略的相互作用のための言語モデルエージェントの訓練には、中核的な困難が存在します。任意のアクションの質は、実現しなかった将来のイベント、ゲーム規則に違反する動き、または他のプレイヤーの決定に依存する可能性があります。標準的な強化学習はこれを想定していません。
arXiv cs.AI
2026年6月2日
LLM語彙バイアスの分離:選好段階学習のための キュレーション不要な三角測量メトリクス様々な言語領域は近年著しい変化を遂行しており、これらの変化は大規模言語モデルの出現と自然言語使用との整合性の欠如に主に起因しています。これらの不整合は選好学習段階(強化学習など)の一部に由来すると考えられています。
arXiv cs.CL
2026年6月2日
安全な強化学習のためのロバストシールディングシールディングは、マルコフ決定過程(MDP)における強化学習エージェントの安全性を正式に保証する効果的なアプローチです。しかし、既存のシールディング技術は通常、安全性に関連する遷移ダイナミクスの知識を仮定しており、これは実際には稀に満たされる要件です。
arXiv cs.AI
2026年6月2日
エージェント的Transformerが強化学習を通じた探索学習を証明可能に行う木探索は多くの言語エージェント推論および意思決定タスクの背後にある中心的な抽象化です。エージェントはアクションを探索し、失敗を記憶し、有望な代替案に向かってバックトラックする必要があります。しかし、Transformerベースのポリシーがこのような探索能力をどのように習得するかについて、理論的理解が不足しています。
arXiv cs.LG
2026年6月2日
SDR:放射線科レポート生成のための設定距離報酬arXiv:2606.00440v1 発表タイプ:新規 概要:検証可能な報酬による強化学習は、ビジョン言語モデルの推論を急速に進歩させています。ただし、胸部X線レポート生成の場合、標準的な報酬(正確一致精度およびステップレベルのプロセス)は、レポートが順序付けされていない直交的な検査結果で構成されているため、互換性がありません。
arXiv cs.AI
2026年6月2日
デモンストレーションから報酬へ:VLM報酬モデルのためのテスト時プロンプト最適化強化学習は正確な報酬関数に依存しており、ロボティクスなどの実世界アプリケーションではしばしば手作業で作成されるか利用できません。最近の研究では、事前学習済みビジョン言語モデル(VLM)の零ショット推論能力を報酬モデルとして活用することが検討されていますが、慎重な調整なしに実施することは困難です。
arXiv cs.LG