TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2025年12月8日
Kubernetesスケジューラのベンチマークテスト本記事は、PFNのインターンシップを経て現在はアルバイトとして勤務されている上田蒼一朗さんによる寄稿です。 はじめに Preferred Networks(以下PFN)ではKubernetesを用いた機械学習基盤の開発・ […] 投稿 Kubernetesスケジューラのベンチマークテスト は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年2月20日
日本語の自然さを測る評価手法の検証Preferred Networksでは大規模言語モデル (LLM) PLaMoの開発を継続して行っています。 LLMを開発するにあたってその能力を評価するベンチマークは非常に重要です。英語においては様々なベンチマークが […] 投稿 日本語の自然さを測る評価手法の検証 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年2月25日
コード生成ベンチマークのためのサンドボックス環境の開発はじめに Preferred Networksでは、大規模言語モデル「PLaMo」の開発を行っています。 PLaMoは開発サイクルにて様々なベンチマークによりその能力を評価していますが、今回はコード生成ベンチマークにてモ […] 投稿 コード生成ベンチマークのためのサンドボックス環境の開発 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年3月29日
AI時代のためにマウスポインターを再構想するGoogle DeepMindはマウスポインターをコンテキスト認識型のAIパートナーに進化させています。従来のプロンプト入力の面倒さを超え、Chromeおよびそれ以外でもAIとの直感的なコラボレーションを実現します。
Google DeepMind
2026年5月7日
テキスト条件付きJEPAによるセマンティック豊かなビジュアル表現の学習画像ベースの Joint-Embedding Predictive Architecture(I-JEPA)は、マスク付き特徴予測を通じた視覚的自己教師あり学習への有望なアプローチを提供している。しかし、固有の視覚的不確実性を伴っている。
Apple Machine Learning Research
2026年5月15日
DatabricksがGPT-5.5をエンタープライズエージェントワークフローに導入DatabricksがOfficeQA Proベンチマークで最先端の成績を達成したGPT-5.5をエンタープライズエージェントワークフローに活用しています。
OpenAI
2026年5月18日
Gemini Omniの紹介Googleは新たなAIモデル「Gemini Omni」を発表した。このモデルの特徴は、テキストや画像、音声といった複数の形式のデータを同時に処理できる点にある。 従来のAIモデルが特定の形式に限定されていたのに対し、Gemini Omniはユーザーが異なるメディア形式を組み合わせて入力することが可能となった。例えば、画像を示しながら音声で質問するといった、より自然な方法での操作が実現する。 この統合的な設計により、AIアシスタントの利便性が向上する見込みだ。複数の入出力形式に対応することで、様々なユースケースにおける応用が期待される。 Googleはこのモデルを通じて、より直感的で使いやすいAI体験の提供を目指しているという。 (引用元:Google DeepMind)
2026年5月18日
pretrained model向けのベンチマークの構築Preferred Networks では、大規模言語モデル PLaMo の開発を継続して行っています。 LLM を開発するうえで、モデルの能力を適切に測定するベンチマークは重要です。英語ではさまざまなベンチマークが日々 […] 投稿 pretrained model向けのベンチマークの構築 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年5月19日
EpiCache: リソース制約のある環境での長期会話向けのエピソード的KVキャッシュ管理最新の大規模言語モデル(LLM)は、コンテキスト長を数百万トークンまで拡張し、長い会話履歴に基づいた一貫性のあるパーソナライズされた応答を実現しています。しかし、キー・バリュー(KV)キャッシュが...
Apple Machine Learning Research
2026年5月21日
Stability AI、最大6分の音楽生成「Stable Audio 3.0」発表、商用利用も可能生成AI企業のStability AIは、最大6分間の音楽を自動生成できるAIモデル「Stable Audio 3.0」を発表した。 従来の音楽生成AIは生成時間が限定されていたが、同モデルはより長尺のコンテンツ制作に対応した。テキストプロンプトから指定した長さの楽曲を生成でき、ジャンルやテンポなど細かい指定も可能とされている。 注目される点は商用利用への対応である。生成した音楽を広告やストリーミング配信などビジネス用途で活用できるため、映像制作会社や音楽プロデューサーなど専門家の業務効率化が期待される。 一方で、生成AIによる音楽制作については著作権や音楽制作者への影響を懸念する声も業界から上がっている。同社がこれらの課題にどう対応するかが、今後の普及の鍵となりそうだ。 (引用元:Stability AI)
Stability AI
2026年5月27日
Strands Agents、NVIDIA NIM、Amazon Bedrock AgentCoreを使用した高性能生成AIシステムの構築このポストでは、統合アーキテクチャを使用して、並列推論、コンテキスト永続性、追跡可能な実行パスを実証するマルチエージェントキャンペーンレビュー システムの構築方法を学ぶことができます。
AWS Machine Learning Blog
2026年5月27日
NVIDIA Vera CPUが競合製品に対して「強力なパンチを繰り出している」エージェンシャルAIへのシフトは、AIファクトリーの新しいCPU要件を生み出します:高速コア、膨大なメモリ帯域幅、およびすべてのコアがアクティブな場合でも高いパフォーマンスを維持する能力です。初期ベンチマークでは...
NVIDIA Blog
2026年5月28日
YouTubeプレミアムにポッドキャストファン向け新機能YouTubeはプレミアム会員向けに、ポッドキャスト視聴をより快適にする新機能を導入した。同サービスのポッドキャストセクションは月間10億人を超えるアクティブユーザーに利用されており、需要の高まりに応える形での機能強化となる。 新たに追加された機能により、プレミアム会員はポッドキャスト視聴時により充実した体験が得られるようになる。これにより、ユーザーはより効率的にコンテンツを探索・再生できるほか、自分好みのポッドキャストをより簡単に管理できるようになるという。 YouTubeは動画プラットフォームとして認識されることが多いが、近年ポッドキャストコンテンツの重要性を高めており、テキスト検索機能の改善やポッドキャスト専用セクションの展開など、段階的に関連機能を拡充している。今回の新機能追加は、その戦略の一環として位置づけられる。 プレミアム会員の利便性向上が、サービスの加入継続につながるか注目される。 (参考:YouTube Blog)
YouTube Blog
2026年5月29日
Amazon Bedrock AgentCoreのデータセット管理でエージェントとともに成長するテストスイートを構築エージェント評価は、急速に変化するオンラインシグナルと安定したオフラインベースラインを組み合わせることで最も強力になります。エージェントが時間とともに本当に改善されているかどうかを理解するには、固定ベンチマークが必要です。
AWS Machine Learning Blog
2026年5月29日
LCO: LLMベースの制約最適化によるより安全なエージェントLLM実世界タスク対応大規模言語モデル(LLM)は自律エージェントとしてますます機能していますが、環境との継続的なインタラクションはコンテキスト内報酬ハッキング(ICRH)につながる可能性があり、これはLLMがプロキシ目標を最大化するために行動を反復的に最適化し、意図しない有害な副作用を生み出す現象です。
arXiv cs.CL
2026年5月29日
プロンプトベースのテキスト音声変換モデルにおける細粒度および文内話し方スタイル制御の実現プロンプトベースのテキスト音声変換(TTS)モデルは自然言語駆動の話し方スタイル制御を実現しますが、多くの場合きめ細かい制御が限定的で、発話全体に単一のグローバルスタイルを適用しています。これは発話全体にわたる継続的なスタイル属性補間を必要とする実用的なユースケースを制限しています。
arXiv cs.CL
2026年5月29日
検出可能効果の事前登録:4ビット量子化ベンチマーク用ペアリングMDEバジェット、パイロット監査付きこれはペアリングなしパイロット監査を伴う計画方法に関する注記である。古典的なペアリング二項サンプルサイズ計算(Miettinen, 1968)を量子化ベンチマークに適応させ、ペアリングされた最小検出可能効果(MDE)の保守的な下限を提供している。
arXiv cs.LG
2026年5月29日
FormInv: 数学推論ベンチマークにおけるセマンティック不変性の測定プロトコルMathCheck(ICLR 2025)のパラフレーズ品質監査により、129グループ中4つのセマンティック的に不正確なパラフレーズ(3.1%)が検出されました。これらを削除するとGPT-4oはランク2からランク4に低下し、Claude HaikuとDeepSeek V3がそれを上回ります。これらのランク変動は単一モデル評価では見えません。
arXiv cs.LG
2026年5月29日
BEAMS: AI モデリング・シミュレーション評価ベンチマーク実世界の意思決定を支援するAIツールは、推奨事項を知らせ解釈可能にするシミュレーションモデルを構築できる必要があります。モデリング実務の側面を自動化できるツールは、人間の専門知識を補完する必要があり、置き換えるべきではありません。BEAMS Initiativeは、開発を指導することを目的としています。
arXiv cs.AI
2026年5月29日
Simorgh at SemEval-2026 task 7: 多言語質問応答におけるリソース限定的な文化的推論用の地域認識型ハイブリッド検索大規模言語モデル(LLM)は一般領域内の一般的な推論タスクに対して優れた能力と性能を示していますが、デジタルテキストデータが限定的な言語における文化的に根拠付けられた知識に関しては課題に直面する可能性があります。本論文では、言語固有の文化的知識への対応について調査しています。
arXiv cs.CL
2026年5月29日
ReverseMath: 数学問題生成の拡張可能性と検証可能性を実現する逆向き回答手法数学推論ベンチマークはLLMの評価に不可欠だが、多くは静的で公開評価やトレーニングパイプラインを通じて繰り返し露出しており、真の推論と暗記を区別することが困難である。一方、新しい数学問題の手動構築は...
arXiv cs.CL
2026年5月29日
読解か推測か?古代ギリシャ版のOCRにおけるビジョン言語モデルの視覚的グラウンディング失敗視覚言語モデル(VLM)を光学文字認識(OCR)に使用すると、視覚的根拠のない高尤度テキストを生成でき、言語優先性への依存を示唆している。オープンウェイト VLM を従来の OCR ベースラインと低資源古代ギリシャ校訂版で比較すると、このギャップが明らかになる。
arXiv cs.CL
2026年5月29日
多言語LLMタスク実行における言語役割の分離多言語LLMは、指示、ソースコンテンツ、および必要な応答言語が一致しない場合にますます使用されています。既存のベンチマークは多言語命令追従評価を拡張していますが、完全にクロスされた設計内でこれら3つの役割を分離することはめったにありません。MTM-Benchを導入します。
arXiv cs.CL
2026年5月29日
BenchTrace:LLMエージェントの反省能力と制御された進化をテストするベンチマークarXiv:2605.29225v1 文書の発表。自己進化型エージェントは過去の失敗を反省することで時間とともに改善されますが、既存の評価には2つの制限があります。タスクスコアのみを測定して反省の質は不明であり、エージェント自身のエピソード実行に依存して特定の失敗パターンに対応するメカニズムがありません。本論文では新しいアプローチを提示しています。
arXiv cs.AI
2026年5月29日
潜在メモリ管理としてのコンテキスト蒸留コンテキスト蒸留は文脈情報をモデルパラメータに圧縮するが、既存の方法は複数の蒸留された潜在メモリをオラクル以外の設定でどのように保存、検索、安全に活性化するかについて無視することが多い。本研究ではコンテキスト蒸留を潜在メモリ管理問題として定式化する。
arXiv cs.LG
2026年5月29日
ARから拡散へ:厳密に因果的で柔軟な地平線を持つ大規模言語モデルの効率的な適応拡散モデルは効率的な並列テキスト生成を約束していますが、双方向アテンションに依存しており、事前学習済みの自動回帰(AR)モデルとの構造的な不一致を生じています。この非互換性はロバストなAR事前知識の再利用を排除し、スクラッチからの禁止的な事前学習が必要になります。
arXiv cs.CL
2026年5月29日
PAST2HARM: マルチモーダルAIのジェイルブレイク用シンプル適応型過去形攻撃マルチモーダルAIシステムへのジェイルブレイク攻撃は未だ十分に研究されていません。テキストの不安全な生成よりも深刻な結果をもたらす可能性のある不安全な画像生成が存在する一方で、現在の防御策は比較的成熟していません。本研究ではPAST2HARMという、拒否トレーニングをバイパスする効果的な適応型ジェイルブレイクフレームワークを紹介します。
arXiv cs.CL
2026年5月29日
GTA:スケーラブルなWebエージェント用ロングホライズンタスク生成arXiv:2605.29218v1 文書の発表。言語モデルをブラウジングおよびツール使用機能と組み合わせたWebエージェントは、オープンなWebアシスタントとしての可能性を示していますが、スケーラブルなプロセスレベルの監督の不足により進展が制限されています。既存のベンチマークは主に手動で構築されており、粗い開始ゴール注釈のみを提供しています。
arXiv cs.AI
2026年5月29日
チェーンが保たれる、答えが折れる:敵対的圧力下での推論モデルの軌跡と答えの乖離推論モデルはシングルターンベンチマークで評価されているが、ユーザーが正解に異議を唱えるマルチターン対話環境に配備されている。継続的な敵対的圧力下では、これまで文書化されていない障害モードが見つかった:思考の連鎖は最初のターンから最後まで事実上正確であるが、回答は変わる。
arXiv cs.AI
2026年5月30日
GS Plus 第4弾「GS Plus 日本株式(TOPIXアルファ)」新登場!ゴールドマン・サックスが新たな日本株投資商品「GS Plus 日本株式(TOPIXアルファ)」を発表した。この商品は、TOPIXの構成銘柄から割安性や成長性などの指標で優良企業を厳選し、指数を上回るリターンを目指すもの。日本株が長期停滞する中、機関投資家のニーズが従来のベンチマーク運用からアルファ追求型へシフトしており、データ科学や機械学習を活用した新しい運用戦略が業界で広がっている。
PR TIMES