TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月30日
Gemini OmniとGemini 3.5の9つのデモ動画Googleは開発者向けカンファレンス「I/O 2026」で発表した最新AI モデル「Gemini Omni」と「Gemini 3.5」の機能を示すデモンストレーション動画9本を公開した。 公開された動画では、両モデルの実際の動作と性能が具体的に紹介されている。Gemini Omniは音声、画像、テキストなど複数の形式のデータを統合的に処理する能力を持つマルチモーダルモデルで、より自然で正確な応答生成が可能とされている。一方、Gemini 3.5は前世代からの性能向上が示されており、様々なタスクにおける処理精度の改善が確認できるという。 これらのデモ動画は、開発者やAI技術に関心を持つユーザーに対して、Googleの最新AI技術の実用的な活用方法を理解する機会を提供している。今後、これらのモデルは様々なアプリケーション開発に活用されることが期待される。 (Google AI Blog)
Google AI Blog
2026年6月1日
BilliardPhys-Bench: マルチモーダルLLMの物理推論と視覚ダイナミクスのベンチマーク現在のマルチモーダルモデルは静止画像認識は得意ですが、直感的な物理推論はまだ弱点です。単一の画像からオブジェクトがどのように移動し相互作用するかを予測することは、これらのシステムにとって依然として困難です。物理推論用のベンチマークBilliardPhys-Benchを提示します。
arXiv cs.AI
2026年6月4日
「Gemma 4 12B」登場 メモリ16GBのノートPCでも動作するマルチモーダルモデル米Googleがオープンなマルチモーダルモデル「Gemma 4 12B」を発表した。エンコーダー不要の統合アーキテクチャを採用し、メモリ16GBのノートPCで動作可能。上位モデルに迫る性能を発揮するという。
ITmedia AI+
2026年6月4日
「Gemma 4 12B」登場 メモリ16GBのノートPCでも動作するマルチモーダルモデル(ITmedia NEWS)米Googleは6月3日(現地時間)、マルチモーダルのオープンウェイトモデル「Gemma 4 12B」を発表した。メモリ16GBのノートPCでも動作可能で、ベンチマークはより大型の「Gemma 4
Yahoo!ニュース IT
2026年6月9日
Gemma 4 12B: 統合されたエンコーダーフリーのマルチモーダルモデルが登場Gemma 4 12Bは、AIモデルの新しい世代であり、テキスト、画像、動画、音声など、さまざまな種類のデータを理解し、処理するように設計されています。
Google DeepMind
2026年6月9日
Gemma 4 12Bの紹介:統一されたエンコーダフリーのマルチモーダルモデルGoogleは、エンコーダフリーのマルチモーダルモデル「Gemma 4 12B」を発表しました。このモデルは、画像や音声といった多様なデータ形式を、単一かつ統一されたアプローチで効率的に処理する能力を持つ点が特徴です。 従来のマルチモーダルAIモデルでは、異なる種類のデータを処理するためにそれぞれ専用のエンコーダを必要とすることが一般的でした。しかし、Gemma 4 12Bはエンコーダを必要としない設計を採用しており、これによりモデルの複雑さを軽減し、より柔軟なデータ統合を実現すると期待されています。 Google DeepMindの研究チームは、この革新的なモデルが、より高度なAIアプリケーションの開発に大きく貢献する可能性を強調しています。特に、複雑なマルチモーダル情報を理解し、処理する必要がある分野での応用が期待されます。 引用元: Google DeepMind
Google DeepMind
2026年6月30日
AIは科学を描けるか? テキストから画像生成・マルチモーダルモデルによる科学図生成評価ベンチマークテキストから画像生成モデルやマルチモーダル生成モデルは、メカニズム図、実験デザイン概略図、概念フレームワーク、グラフィカルアブストラクトといった科学図の生成にますます利用されています。しかし、既存の画像生成ベンチマーク(GenEval、T2I-CompBench、DPG-Benchなど)は自然画像を評価し、構成性、オブジェクト数、フォトリアリズムなどを測定します。生成された科学図が利用可能であるために重要な、正確で判読可能なテキストラベル、エンティティとその関係の忠実な描写、一貫した図構造、分野固有の描画規則への準拠を測定するものは存在しません。本研究では、SciDraw-Benchを提案します。これは、8種類の図と10分野にわたる32の構造化された科学図生成タスクからなるベンチマークであり、各タスクは自然言語プロンプトと、要求されるラベル、関係、コンポーネント、規則、およびネガティブ制約の機械チェック可能な仕様をペアにします。
arXiv cs.LG
2026年6月30日
ターン平均SAEによる特徴発見と長文脈アトリビューションスパースオートエンコーダー(SAE)は、言語モデルにおける解釈可能な特徴抽出に役立つツールとなっています。しかし、標準的なSAEアーキテクチャは個々のトークン活性化に基づいて動作するため、アクティブな特徴の数はコンテキスト長に比例して増加し、長文のモデルトランスクリプトの研究が困難になります。本稿では、ターン内の平均モデル活性化を再構築するように学習することで、固定数の特徴で単一の人間またはアシスタントのターンを表すターン平均SAEを導入します。ターン平均特徴は、LLMによって評価された場合、トークンごとの特徴よりも単一ターンの高レベル特性をより完全に記述することを発見しました。また、ターン平均SAEが、アトリビューショングラフのようなSAEの一般的な下流用途を大幅に単純化することを示します。広範には、ターン平均SAEは、長コンテキスト長での解釈可能性技術の実用性を高めます。
arXiv cs.CL
2026年7月9日
音声感情分析:生成された多言語トランスクリプトの知識蒸留とクロスモーダル統合による実現音声からポジティブかネガティブかの感情を自動認識することは、声の抑揚の分析と発話された言葉の解釈の両方を必要とする困難なタスクです。最近のソリューションは、このタスクを解決するために音声基盤モデルに依存していますが、そのようなモデルがすべての側面を考慮できるかどうかは依然として不明です。この目的のため、我々はクロスモーダル・トランスフォーマーを介して音声とテキスト情報を統合するマルチモーダル・ソリューションを提案します。ここでは、自動音声認識(ASR)ツールを介してテキストトランスクリプトが自動生成されます。さらに、機械翻訳ツールを介してトランスクリプトを複数の言語に自動翻訳することで、複数のテキストモダリティを作成します。音声と多言語テキストの特徴は、モダリティを一つずつ統合するクロスモーダル・トランスフォーマーブロックからなるカスケードアーキテクチャを介して結合されます。さらに、ティーチャーと呼ばれるマルチモーダルモデルから、スチューデントと呼ばれるユニモーダル(音声のみ)モデルへ知識を蒸留します。
arXiv cs.CL
2026年8月4日
UMbed: 疎密融合型マルチモーダル埋め込みモデル新たなマルチモーダル埋め込みモデル「UMbed」が発表されました。これは、テキストの疎な特徴(単語レベル)と、画像や音声といった異なるモダリティにまたがる密な意味表現の両方を効果的に捉えることを目指したモデルです。 従来のマルチモーダルモデルでは、疎な特徴と密な特徴を別々に扱うか、あるいは一方を犠牲にする必要がありました。UMbedは、単一のモデルアーキテクチャ内でこれらの両方の特性を融合させることで、この課題を克服します。 大規模なデータセットで学習されたUMbedは、その性能を様々な規模で検証・公開されており、今後のマルチモーダルAI研究開発の基盤となることが期待されます。 arXiv cs.AI
arXiv cs.AI
2026年8月11日
マルチモーダルモデルの差分検出による特徴発見と制御マルチモーダル大規模言語モデル(MLLM)は、テキストだけでなく画像などの複数の情報を統合して理解する能力で注目されています。しかし、その高度な理解を支える内部の仕組みや、特定の振る舞いを意図的に引き出す制御方法については、まだ解明されていない部分が多くありました。 この課題に対し、この度「MMDiff」と名付けられた新しいフレームワークが提案されました。MMDiffは、マルチモーダルSAE(Sparse Autoencoder)と呼ばれる学習手法を用いることで、MLLMが持つ多様な特徴を、より人間が理解・操作しやすい「特徴レベル」のインターフェースへと変換します。 これにより、研究者や開発者は、MLLMがどのような特徴に基づいて情報を処理し、応答を生成しているのかを具体的に特定できるようになります。さらに、これらの特徴を操作することで、モデルの振る舞いをより細かく制御することが可能になると期待されています。この技術は、MLLMの透明性向上や、より目的に沿った応用展開に貢献するものと考えられます。 引用元: arXiv cs.AI
arXiv cs.AI