TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2025年12月8日
Kubernetesスケジューラのベンチマークテスト本記事は、PFNのインターンシップを経て現在はアルバイトとして勤務されている上田蒼一朗さんによる寄稿です。 はじめに Preferred Networks(以下PFN)ではKubernetesを用いた機械学習基盤の開発・ […] 投稿 Kubernetesスケジューラのベンチマークテスト は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年1月27日
創薬DMTAサイクルの高速化! Active Learning駆動型Relative Binding FEP(RBFEP)による”実践的”リード化合物最適化の新戦略タンパク質に低分子化合物が結合する強度 (Affinity )を高精度に予測する手法として、Free Energy Perturbation (FEP)があります。Preferred Networksは、このFEPに基づ […] 投稿 創薬DMTAサイクルの高速化!
Preferred Networks
2026年2月20日
日本語の自然さを測る評価手法の検証Preferred Networksでは大規模言語モデル (LLM) PLaMoの開発を継続して行っています。 LLMを開発するにあたってその能力を評価するベンチマークは非常に重要です。英語においては様々なベンチマークが […] 投稿 日本語の自然さを測る評価手法の検証 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年2月25日
コード生成ベンチマークのためのサンドボックス環境の開発はじめに Preferred Networksでは、大規模言語モデル「PLaMo」の開発を行っています。 PLaMoは開発サイクルにて様々なベンチマークによりその能力を評価していますが、今回はコード生成ベンチマークにてモ […] 投稿 コード生成ベンチマークのためのサンドボックス環境の開発 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年3月23日
Optunaベースの内製フレームワーク × Work Suite: ユーザフィードバック駆動型プロンプト最適化を用いた新機能についてはじめに Preferred Networksの加藤です。AIプロダクト・ソリューションチーム所属で、AutoMLチームも兼務しています。PFNでは Preferred AI という生成AIを活用したプロダクト群を開発し […] 投稿 Optunaベースの内製フレームワーク × Work Suite: ユーザフィードバック駆動型プロンプト最適化を用いた新機能について は Preferr…
Preferred Networks
2026年5月7日
実践的な学習画像圧縮において重要な要素学習コーデックが従来のハードコードされた標準的なコーデックに対して解き放つ主要な差別化要因の1つは、人間の視覚系に直接最適化される能力である。
Apple Machine Learning Research
2026年5月9日
スパーサー、高速、軽量なトランスフォーマー言語モデルトランスフォーマー言語モデルの実用化に向けた新たな技術開発が加速している。Sakana AIの研究によれば、モデルの構造を最適化することで、計算負荷を大幅に削減しながら性能を維持することが可能になりつつあるという。 具体的には、ニューラルネットワークの一部の接続を不要な部分として削減する「スパース化」と、モデル全体を軽量化する技術を組み合わせることが有効であると指摘されている。これらの手法により、処理速度が向上し、必要な計算リソースが削減されるメリットがある。 言語モデルの大規模化が進む一方で、実装には膨大な計算力が必要という課題があった。今回の技術は、より少ないリソースで高い精度を保つ可能性を示唆しており、スマートフォンなどの環境でも効率的に利用できるモデルの開発につながると期待されている。 今後、こうした効率化技術がAI活用の幅広い展開を促進する重要な基盤になると考えられる。 (引用元:Sakana AI)
2026年5月15日
DatabricksがGPT-5.5をエンタープライズエージェントワークフローに導入DatabricksがOfficeQA Proベンチマークで最先端の成績を達成したGPT-5.5をエンタープライズエージェントワークフローに活用しています。
OpenAI
2026年5月18日
pretrained model向けのベンチマークの構築Preferred Networks では、大規模言語モデル PLaMo の開発を継続して行っています。 LLM を開発するうえで、モデルの能力を適切に測定するベンチマークは重要です。英語ではさまざまなベンチマークが日々 […] 投稿 pretrained model向けのベンチマークの構築 は Preferred Networks Tech Blog に最初に表示されました。
Preferred Networks
2026年5月27日
NVIDIA Vera CPUが競合製品に対して「強力なパンチを繰り出している」エージェンシャルAIへのシフトは、AIファクトリーの新しいCPU要件を生み出します:高速コア、膨大なメモリ帯域幅、およびすべてのコアがアクティブな場合でも高いパフォーマンスを維持する能力です。初期ベンチマークでは...
NVIDIA Blog
2026年5月29日
Amazon Bedrock AgentCoreのデータセット管理でエージェントとともに成長するテストスイートを構築エージェント評価は、急速に変化するオンラインシグナルと安定したオフラインベースラインを組み合わせることで最も強力になります。エージェントが時間とともに本当に改善されているかどうかを理解するには、固定ベンチマークが必要です。
AWS Machine Learning Blog
2026年5月29日
インターネットが機械向けに再構築されている人工知能技術の急速な進展に伴い、インターネットのインフラストラクチャが根本的な変化を迎えている。AWSやCloudflareといった大手クラウド企業が、従来の人間ユーザーを中心とした設計から、機械が生成するトラフィック中心のシステムへの移行を進めている。 背景にあるのは、AIエージェントが研究開発の段階を脱し、実際の本番環境での運用が本格化していることだ。こうした状況下で、企業側は既存のクラウドインフラが新たな需要に対応できるよう、アーキテクチャの再構築を急いでいる。 この転換は、データ通信量の急増やAPI利用パターンの変化、リアルタイム処理能力の向上などを見据えた対応となる。クラウド企業各社は、機械同士の通信効率化やセキュリティ強化、コスト最適化を目指した技術開発に注力している。インターネットの構造自体が、人間中心から機械中心への時代へ移行しつつある。 (TechCrunch)
TechCrunch
2026年5月29日
GPUの推論処理を独自のキャッシュ技術で最適化、Tensormeshが2,000万ドルを追加調達推論最適化プラットフォームを提供する Tensormesh は27日、シードラウンドの延長として2,000万ドルを追加調達したと発表した。今回の調達には AMD Ventures、CoreWeave、NVentures( […]
THE BRIDGE
2026年5月29日
エンタープライズAI検索企業Gleanの年間売上が3倍に成長し、3億ドル突破エンタープライズAI検索を手がけるスタートアップのGleanが、年間売上を3倍に拡大させ3億ドルを超えたことが明らかになった。 同社は企業内の膨大なデータを効率的に検索・活用するAIソリューションを提供しており、顧客企業がAI導入時のコスト削減を実現できる点が購買の決め手となっているという。業界全体でAI予算の最適化が課題となる中、こうした実用的なアプローチが市場で評価されている。 一方、MicrosoftやGoogleといった大手テック企業も同様のカテゴリに続々参入を始めており、競争環境は激化している。Gleanは先行者として強固なポジションを築きつつあるが、今後の市場動向が注視されている。 (引用元:TechCrunch)
TechCrunch
2026年5月29日
PRO-CUA: コンピュータ使用エージェント向けプロセス報酬最適化コンピュータ使用エージェント(CUA)は複雑なデジタルワークフローの自動化に強い可能性を示していますが、その訓練はコストの高いライブ環境での相互作用と限定的な高品質の教示に制限されています。既存のフィルタリング動作クローニングパイプラインは、模倣ボトルネックに悩まされています。
arXiv cs.AI
2026年5月29日
検出可能効果の事前登録:4ビット量子化ベンチマーク用ペアリングMDEバジェット、パイロット監査付きこれはペアリングなしパイロット監査を伴う計画方法に関する注記である。古典的なペアリング二項サンプルサイズ計算(Miettinen, 1968)を量子化ベンチマークに適応させ、ペアリングされた最小検出可能効果(MDE)の保守的な下限を提供している。
arXiv cs.LG
2026年5月29日
LoRe: ステップごとのインタラクション予算を備えた適応的インタラクション評価ルーティング組み合わせ最適化のための拡散ベースのニューラルソルバーは、密なエッジ/因子インタラクションを繰り返し再評価し、ウォールクロック時間での推論を高くし、スケール時にメモリボトルネックになることが多いです。多体物理学の計算方法論にインスパイアされ、訓練不要な推論効率を実現するLoReを導入しました。
arXiv cs.LG
2026年5月29日
信頼度ショートカット:マスク拡散モデルの推論失敗モードarXiv:2605.29123v1 公表予定タイプ:新規 概要:マスク拡散言語モデル(MDM)は任意の順序の生成をサポートしており、信頼度ベースのデコーディングが事実上標準的な推論ポリシーとして機能している。これを最適化するため、最近のトレーニングスキームでは、生成時に観察されるマスクパターンと直接整合させることを試みている。
arXiv cs.AI
2026年5月29日
エージェント的ツール計画による分子リード最適化医薬品開発は多段階の長く資源集約的なプロセスです。これらの段階の中で、リード最適化は早期のヒット化合物を有効な医薬品候補に変換する重要な役割を果たしています。このステージでは、微妙な構造改善を通じてADMET関連特性を改善することが必要です。
arXiv cs.LG
2026年5月29日
認知圏論トランスフォーマー:言語モデリングのための圏論的帰納的バイアス認知圏論トランスフォーマー(CCT)は3億600万パラメータのアーキテクチャで、事前学習されたGPT-2 Smallバックボーンを圏論から導出された認知的に根拠のあるコンポーネント、および認知科学からのいくつかのインスピレーションで拡張しています。マッチドステップ・プロトコル下(215,000最適化ステップ)で...
arXiv cs.AI
2026年5月29日
ラベル空間の再構成によるマルチモーダル学習のバランシングマルチモーダル学習は、より速く収束するモーダルが最適化を支配する一方で、他のモーダルが訓練不足に陥るモーダルインバランスの問題に悩まされることがあります。既存のアプローチは、通常、弱いモーダルを強化するか、最適化勾配を調整することでこの問題を軽減しますが、そのような戦略には制限があります。
arXiv cs.LG
2026年5月29日
BenchTrace:LLMエージェントの反省能力と制御された進化をテストするベンチマークarXiv:2605.29225v1 文書の発表。自己進化型エージェントは過去の失敗を反省することで時間とともに改善されますが、既存の評価には2つの制限があります。タスクスコアのみを測定して反省の質は不明であり、エージェント自身のエピソード実行に依存して特定の失敗パターンに対応するメカニズムがありません。本論文では新しいアプローチを提示しています。
arXiv cs.AI
2026年5月29日
言語優先性の脱却: モダリティ認識ポリシー最適化によるオーディオ推論の後期段階モダリティ崩壊の軽減オーディオと全モダリティ大規模言語モデルは印象的なクロスモーダル推論能力を示すが、これらのモデルに標準的な強化学習後処理アルゴリズムを適用すると、GRPO のような方法がすべてのトークンに均一なポリシー勾配を適用する構造的脆弱性が露呈する。
arXiv cs.CL
2026年5月29日
LCO: LLMベースの制約最適化によるより安全なエージェントLLM実世界タスク対応大規模言語モデル(LLM)は自律エージェントとしてますます機能していますが、環境との継続的なインタラクションはコンテキスト内報酬ハッキング(ICRH)につながる可能性があり、これはLLMがプロキシ目標を最大化するために行動を反復的に最適化し、意図しない有害な副作用を生み出す現象です。
arXiv cs.CL
2026年5月29日
FormInv: 数学推論ベンチマークにおけるセマンティック不変性の測定プロトコルMathCheck(ICLR 2025)のパラフレーズ品質監査により、129グループ中4つのセマンティック的に不正確なパラフレーズ(3.1%)が検出されました。これらを削除するとGPT-4oはランク2からランク4に低下し、Claude HaikuとDeepSeek V3がそれを上回ります。これらのランク変動は単一モデル評価では見えません。
arXiv cs.LG
2026年5月29日
多言語LLMタスク実行における言語役割の分離多言語LLMは、指示、ソースコンテンツ、および必要な応答言語が一致しない場合にますます使用されています。既存のベンチマークは多言語命令追従評価を拡張していますが、完全にクロスされた設計内でこれら3つの役割を分離することはめったにありません。MTM-Benchを導入します。
arXiv cs.CL
2026年5月29日
GTA:スケーラブルなWebエージェント用ロングホライズンタスク生成arXiv:2605.29218v1 文書の発表。言語モデルをブラウジングおよびツール使用機能と組み合わせたWebエージェントは、オープンなWebアシスタントとしての可能性を示していますが、スケーラブルなプロセスレベルの監督の不足により進展が制限されています。既存のベンチマークは主に手動で構築されており、粗い開始ゴール注釈のみを提供しています。
arXiv cs.AI
2026年5月29日
ReverseMath: 数学問題生成の拡張可能性と検証可能性を実現する逆向き回答手法数学推論ベンチマークはLLMの評価に不可欠だが、多くは静的で公開評価やトレーニングパイプラインを通じて繰り返し露出しており、真の推論と暗記を区別することが困難である。一方、新しい数学問題の手動構築は...
arXiv cs.CL
2026年5月29日
BEAMS: AI モデリング・シミュレーション評価ベンチマーク実世界の意思決定を支援するAIツールは、推奨事項を知らせ解釈可能にするシミュレーションモデルを構築できる必要があります。モデリング実務の側面を自動化できるツールは、人間の専門知識を補完する必要があり、置き換えるべきではありません。BEAMS Initiativeは、開発を指導することを目的としています。
arXiv cs.AI
2026年5月29日
チェーンが保たれる、答えが折れる:敵対的圧力下での推論モデルの軌跡と答えの乖離推論モデルはシングルターンベンチマークで評価されているが、ユーザーが正解に異議を唱えるマルチターン対話環境に配備されている。継続的な敵対的圧力下では、これまで文書化されていない障害モードが見つかった:思考の連鎖は最初のターンから最後まで事実上正確であるが、回答は変わる。
arXiv cs.AI