TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年3月27日
Gemini 3.1 Flashライブ:オーディオAIをより自然で信頼性の高いものにする最新の音声モデルは精度の向上とレイテンシーの低下により、音声インタラクションをより流暢で自然で正確なものにします。
Google DeepMind
2026年5月5日
Gemini APIのウェブフックで長時間実行ジョブの摩擦とレイテンシーを削減イベント駆動型ウェブフックはプッシュベースの通知システムであり、...
Google AI Blog
2026年5月29日
Claude Opus 4.8がAWSで利用可能にこの投稿では、Opus 4.8の改善点と、Amazon Bedrockでのエージェントシステムと本番推論ワークロードへのモデル統合に関するAIエンジニア向けの実践的なガイダンスについて説明します。
AWS Machine Learning Blog
2026年6月1日
NVIDIAがRTX PCsとDGX SparkでローカルAIエージェント機能を強化NVIDIAがローカルAIエージェント機能を強化する新展開を発表した。RTX PCsとDGX Sparkプラットフォームで、エッジデバイス上での実行を想定したAIエージェント機能を拡張する取り組みだ。 OpenClawやHermesといったオープンソースプロジェクトが急速に採用されており、開発者コミュニティから高い関心を集めている。これらのエージェントはクラウドに依存せず、ローカル環境でアプリケーション操作やコンテンツ生成、プロセス自動化、複数ステップのタスク管理を実行可能な点が特徴だ。 ローカル実行により、データプライバシーの向上やレイテンシの削減、インターネット接続への依存軽減といった利点が期待される。NVIDIAのプラットフォームを通じた提供により、より多くの開発者が高度なAI機能を自身のハードウェア環境で活用しやすくなる見通しだ。 (引用元:NVIDIA Blog)
NVIDIA Blog
2026年6月2日
BudgetDraft:スパースKV推測デコーディング用の受け入れ認識マルチビュー訓練推測デコーディングは、ドラフタが複数のトークンを提案し、検証者が並列で検証することによって、自己回帰デコーディングを高速化します。リソース制約のあるデプロイメントでは、ドラフタはスパースKVキャッシュを使用して、固定KV予算下でのピークGPUメモリとエンドツーエンドレイテンシを制限し、検証者が検証します。
arXiv cs.LG
2026年6月3日
Perplexity AI、Computex 2026でハイブリッド型ローカル・クラウド推論システムを発表AI検索エンジンのPerplexity AIは、Computex 2026でハイブリッド型推論システムを発表した。このシステムは機械学習ワークロードを自動的に判別し、プライバシーが必要な処理はユーザーのデバイス上で実行し、より複雑なタスクはクラウドベースの高度なモデルに割り当てる。 IntelのCEOと行った共同デモンストレーションでは、Intel Core Ultra Series 3プロセッサで動作するローカルモデルが機密データの処理を担当。この方式により、ユーザーのプライベート情報を保護しながら、クラウドリソースの効率的活用を実現できるという。 ハイブリッド型アーキテクチャは、オンデバイス処理とクラウド処理のバランスを取ることで、プライバシーと性能の両立を目指すものとなっている。 (引用元:VentureBeat AI)
VentureBeat AI
2026年6月4日
DLAMI と DLC で SOCI インデックスを使用してコンテナコールドスタート時間を削減するこの記事では、公開されているディープラーニング AMI とコンテナで SOCI を使用する方法、ツールが提供する様々な SOCI モードを使用するタイミング、および現在のワークロードで迅速かつ効率的にこのツールを使用する方法について説明します。
AWS Machine Learning Blog
2026年6月4日
DLAMI・DLCでSOCI indexを使用したコンテナコールドスタート時間の短縮# コンテナの起動時間短縮を実現するSOCI技術 AWSはDeep Learning AMIおよびコンテナ環境でSOCI(Seekable OCI)を活用する最適化手法を紹介した。この技術により、コンテナのコールドスタート時間を大幅に削減できる。 SOCIは、コンテナイメージを効率的に読み込むための仕組みで、必要なレイヤーのみを優先的にロードする。これにより、従来の手法よりも迅速にコンテナを起動できる。AWSは異なるワークロード特性に対応した複数のSOCIモードを提案しており、ユースケースに応じた使い分けが可能だ。 機械学習やビッグデータ処理など、頻繁なコンテナ起動が必要なアプリケーションにおいて、特に効果的とされている。実装方法についても詳細に説明されており、既存のシステムへの統合が容易に進められる見通しも示唆されている。 クラウドワークロードの効率化が急速に進む中、この技術は大規模環境での運用コスト削減に貢献すると期待される。 (参考:AWS Machine Learning Blog)
AWS Machine Learning Blog
2026年6月5日
NVIDIA Nemotron 3 Ultra、Amazon SageMaker JumpStartで利用可能にNVIDIAの推論モデル「Nemotron 3 Ultra」がAmazon SageMaker JumpStartで提供開始となった。このモデルは、エージェンティックAI関連のワークロードに最適化されており、推論処理の大幅な性能向上を実現している。 導入により、推論速度は従来比で5倍の高速化が期待でき、同時に運用コストは約30%の削減が可能となる。これにより、企業はAI活用の効率性と経済性の両面で利益を得られる見通しだ。 SageMaker JumpStartはAWSのマネージド機械学習プラットフォームで、事前構築されたモデルやアルゴリズムを容易に利用できる。今回の統合により、ユーザーはNemotron 3 Ultraをより簡単にデプロイし、実運用環境での利用が可能になる。 エージェンティックAIは自律的に意思決定を行うAIシステムとして注目を集めており、本モデルの提供開始は、こうした先進的なAI技術へのアクセスを民主化する動きといえる。企業規模を問わず、高性能な推論環境の構築が現実的になるだろう。 (AWS Machine Learning Blog)
AWS Machine Learning Blog
2026年6月5日
NVIDIA Nemotron 3 UltraがAmazon SageMaker JumpStartで利用可能にNVIDIA Nemotron 3 UltraをAmazon SageMaker JumpStartにデプロイできるようになった。このフロンティア推論モデルにより、エージェンティックAIワークロードで5倍高速な推論と30%低いコストが実現される。
AWS Machine Learning Blog
2026年6月8日
加速フーリエSAT(AFSAT):GPUベースの対称疑似ブール充足可能性ソルバーの完全実現連続局所探索(CLS)に基づく疑似ブール充足可能性問題向けのGPU加速ソルバーであるAccelerated Fourier SAT(AFSAT)を提案する。AFSATは概念実証的なアプローチであるFastFourierSATを完全に実装されたソルバーへと発展させ、単一の問題インスタンス内で任意の異種対称制約タイプおよび長さの混合に対応する。JAXコンパイラを使用し、AFSATは純粋関数合成、自動ベクトル化、自動微分、ジャストインタイム(JIT)コンパイルを活用して、候補割り当てのバッチ全体で大規模並列CLSを実行する。概念実証と比較して、数値安定性、実行時性能、メモリ効率の大幅な改善を実証する。メモリレイテンシおよび浮動小数点表現から生じる様々な制限を特定・対処し、自動並列化とコンパクト表現を活用することで実現している。浮動小数点の本質的な表現および安定性の制限は、カスタマイズされた離散フーリエ変換実装により部分的に対処される。JAXアレイシャーディングを通じて複数のアクセラレータにスケーリングする際に、ほぼ線形のスループットを達成する。
arXiv cs.AI
2026年6月10日
[ITmedia PC USER] エルザ、AIワークロード向け3U GPUアクセラレーテッドサーバ「H3 Falcon 6048」の取り扱いを開始エルザジャパンは、H3製となる3U GPUアクセラレーテッドサーバ「H3 Falcon 6048」の取り扱い開始を発表した。
ITmedia 全カテゴリ
2026年6月10日
エルザ、AIワークロード向け3U GPUアクセラレーテッドサーバ「H3 Falcon 6048」の取り扱いを開始(ITmedia PC USER)エルザジャパンは6月10日、H3製となる3U GPUアクセラレーテッドサーバ「H3 Falcon 6048」の取り扱い開始を発表した。価格については要問合せとなっている。 3Uラックマウント筐体
Yahoo!ニュース IT
2026年6月11日
安全データシートからの情報抽出における大規模言語モデルのベンチマーク安全データシート(SDS)からの構造化情報の正確な抽出は、文書形式の多様性や従来のルールベース手法の限界から、産業安全分野では依然として課題となっています。本研究では、自動SDSデータ抽出のための最新の大規模言語モデル(LLM)をベンチマークし、テキストベースおよびマルチモーダル処理パイプラインを比較します。Gemini 1.5 Pro、GPT-4o、Claude 3.7 Sonnet、Llama 3.1-70Bの4つのモデルを、ゼロショット、フューショット、連鎖思考(Chain-of-Thought)の3つのプロンプト戦略で体系的に評価しました。評価フレームワークでは、50,000以上の抽出データフィールドにわたる精度、レイテンシ、コストを評価しました。結果として、テキストベースの抽出は、すべての指標においてマルチモーダル処理を常に上回ることが示されました。Chain-of-Thoughtプロンプトと組み合わせたGemini 1.5 Proが最高の精度(84%)を達成し、GPT-4o(81%)とClaude 3.7 Sonnet(79%)を上回りました。
arXiv cs.CL
2026年6月13日
NVIDIA Blackwellが初のAgentic AIインフラベンチマークでリードAgentic AIと呼ばれる、自律的に目標を設定し実行するAIシステムの性能を評価するための新しいベンチマーク「AgentPerf」が発表されました。この初のAgentic AI特化ベンチマークにおいて、NVIDIAのBlackwell Ultra NVL72プラットフォームが、テストされたすべてのワークロードで最も高い性能を示したことが明らかになりました。 NVIDIAによると、Blackwell Ultra NVL72プラットフォームは、同社の従来のシステムと比較して、1メガワットの電力あたりで最大20倍多くのエージェントを処理できる能力を持つとされています。AgentPerfのような専門的なベンチマークの登場は、高度な自律性を持つAIシステムの開発と最適化が加速している現状を反映しています。この結果は、NVIDIAがAgentic AI分野におけるインフラストラクチャ提供において主導的な役割を果たしていることを示唆しています。 引用元: NVIDIA Blog
NVIDIA Blog
2026年6月16日
ローカルLLMをいつ使うべきか?TL;DR 「ローカルLLM=コストが安い」はほとんどの場合で誤りです。2026年時点での損益分岐点はかなり高く、GPUを遊ばせると単価はAPIより高くつきます。 それでもローカルLLMが勝つ領域はあります。ガバナンス・タスク特化での精度・レイテンシ の3軸です。
Zenn
2026年6月17日
Amazon SageMaker AIにおけるコンテナキャッシュ機能の導入による、より高速なモデルスケーリング本日、Amazon SageMaker AI推論におけるコンテナイメージキャッシュ機能を発表できることを嬉しく思います。これは、より高速なスケーリング最適化の旅における次なる大きな進歩です。これにより、スケールアウトイベント中の生成AIモデルのエンドツーエンドレイテンシが最大2倍高速化されます。
AWS Machine Learning Blog
2026年6月18日
テスコ、Broadcomの「 abusive conduct(不当な行為)」を受けVMwareから4万件のサーバーワークロードを移行へTescoは、BroadcomがVMwareの価格を約175パーセント引き上げた、と英国の裁判資料で主張した。
Ars Technica AI
2026年6月19日
SageMakerの詳細メトリクスとCloudWatchのInsightsダッシュボードで生成AI推論を監視・デバッグするAmazon SageMakerは、機械学習モデルのリアルタイム推論をホスティングするサービスであり、特に生成AIワークロードにおける推論の監視とデバッグを効率化するための詳細な機能を提供しています。 SageMakerでは、シングルモデルエンドポイント(SME)と推論コンポーネント(IC)エンドポイントの両方で、詳細な可観測性メトリクスが利用可能です。これらのメトリクスは、生成AI推論のパフォーマンスを深く理解し、問題発生時に迅速なデバッグを可能にするために設計されています。 これらの詳細なメトリクスをAmazon CloudWatch Insightsダッシュボードと組み合わせることで、ユーザーは生成AI推論の状況を一元的に監視し、異常を検知した際には詳細なログやイベントに基づいて原因を特定できるようになります。これにより、推論のレイテンシ、スループット、エラー率などの重要な指標をリアルタイムで追跡し、モデルの動作を最適化するための貴重な洞察を得ることが可能です。この機能は、生成AIの運用において安定性と効率性を高める上で重要な役割を果たすと期待されます。 引用元: AWS Machine Learning Blog
AWS Machine Learning Blog
2026年6月19日
“何でもGPU”時代の終焉 AMDとトヨタシステムズが指摘する「AIワークロードへの理解」AMDが国内のインフラ関係者が集う「Interop Tokyo」の場でAI戦略を語るのも、今年で3年連続になる。今年の基調講演では、本社コーポレートVPのデレク・ディッカー氏が登壇。AIインフラのコスト増に対して、「自社のワークロードを理解することが重要」だと訴えた。
ASCII.jp
2026年6月19日
LLMエージェントにおける明確化要求のための不確実性分解最近の論文では、対話型大規模言語モデル(LLM)エージェントには、古典的な偶然的/認識的(aleatoric/epistemic)不確実性フレームワークが不十分であり、プロアクティブな明確化要求や共有メンタルモデル構築といった新たなエージェント機能を引き出すための、仕様不備を認識し、分解可能で、伝達可能な不確実性表現が必要だと主張しています。実用的なデプロイメントの制約(ブラックボックスAPI、対話レイテンシ予算、ラベル付き軌跡の欠如)は、ログ確率ベース、マルチサンプリング、トレーニングベースの方法を排除し、デプロイメント時にこれらのシグナルを提示するための最も実行可能な手法としてプロンプトベースの推定を残します。我々は、タスク仕様が曖昧な場合にエージェントが明確化を求めることを可能にする、アクションの信頼度と要求の不確実性(u)を分離する、シンプルなプロンプトベースの分解でこの要求に応えます。
arXiv cs.AI
2026年6月22日
AI向けx86拡張命令「ACE」、106ページの詳細仕様が公開(PC Watch)IntelやAMDが設立し、x86アーキテクチャエコシステム拡大を担うThe x86 Ecosystem Advisory Groupは6月15日(米国時間)、マシンラーニングワークロードに特化した
Yahoo!ニュース IT
2026年6月22日
AI向けx86拡張命令「ACE」、106ページの詳細仕様が公開IntelやAMDが設立し、x86アーキテクチャエコシステム拡大を担うThe x86 Ecosystem Advisory Groupは6月15日(米国時間)、マシンラーニングワークロードに特化したx86拡張命令「AI Compute Extensions(ACE)」の仕様を正式に発表した。
PC Watch
2026年6月25日
Dustin:投機的デコーディングによる効率的な長文脈生成のためのドラフト拡張スパース検証投機的デコーディングは、マルチバッチ長文脈大規模言語モデル(LLM)の推論スループットを向上させますが、その効率は、キー・バリュー(KV)キャッシュのロードがレイテンシを支配する検証ボトルネックによってしばしば制限されます。既存の圧縮方法はこの状況では機能しません。静的除外は顕著性のシフトによる精度低下を引き起こし、動的選択は検証パス中に許容できない計算オーバーヘッドを導入します。私たちは、長文脈の投機的デコーディングのために設計されたスパース検証フレームワークであるDustinを提案します。Dustinは、ドラフトモデルからのルックアヘッド信号とターゲットモデルからの履歴アテンションを統合し、マルチステップ検証ウィンドウ全体で高忠実度で重要なトークンを特定します。再計算レイテンシを削減するために、このアプローチはさらに、アテンションヘッドの最小サブセットに重要度スコアリングを制限するスパース推定スキームを採用しています。
arXiv cs.CL
2026年6月27日
Spring Boot で Claude API 呼び出しを OpenTelemetry で計測するこの記事について 対象読者:Spring Boot から Claude API を呼んでいて、そのレイテンシ・トークン・コスト・失敗を可視化したい人/LLM 呼び出しに OpenTelemetry を入れる最小の型を知りたい人 得られること:Spring Boot 3 標準の Micrometer…
Zenn
2026年6月30日
Oracle GDAI で実現するグローバル分散 AI データベースを整理してみてみた最近、グローバル分散データベースや分散SQLの話題をよく見かけるようになりました。 データレジデンシ、高可用性、低レイテンシ、マルチリージョン、マルチクラウド、AI活用など、キーワードだけ見てもかなり強そうな世界です。 そんな中で、Oracle にも Globally Di...
Qiita 人気記事
2026年7月1日
NVIDIAの推論ソフトウェアスタックが最低トークンコストを実現組織がAIのパイロットプロジェクトから本番稼働のAIファクトリーへと移行するにつれて、インフラの意思決定はピーク時のチップ仕様からトークンあたりのコストへとシフトしています。これは、1ドルあたり、1ワットあたり、そして要求されるレイテンシ目標内で、どれだけの有用なトークンを提供できるかということです。
NVIDIA Blog
2026年7月1日
Amazon Bedrockモデルへのマルチアカウントアクセスをマネージド権限で簡素化本投稿では、Amazon Bedrockのマネージド権限を使用して、中心となるアカウントから一度サブスクライブし、組織全体にモデルアクセスを配布する方法を紹介します。このアプローチにより、ワークロードアカウントでのAWS Marketplaceの権限が不要になります。
AWS Machine Learning Blog
2026年7月1日
最先端モデルの安全な顧客への提供AWSは、20年以上前の創業以来、すべてのサービスでセキュリティに深く投資してきました。これは、AWSをあらゆるワークロードを実行する上で最も安全な場所にするという目標を支援するためです。Amazon BedrockのようなAIサービスも、この基盤と、同じ重点に築かれています。
AWS Machine Learning Blog
2026年7月6日
ASRエラー訂正の再検討:特化型モデルによるアプローチ自動音声認識(ASR)において言語モデルは中心的な役割を担っていますが、ほとんどの手法はASRのエラーパターンを認識しないテキスト専用モデルに依存しています。近年、大規模言語モデル(LLM)がASR訂正に応用されていますが、レイテンシとハルシネーション(偽情報生成)の懸念が伴います。
Apple Machine Learning Research