TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年6月4日
「Gemma 4 12B」登場 メモリ16GBのノートPCでも動作するマルチモーダルモデル米Googleがオープンなマルチモーダルモデル「Gemma 4 12B」を発表した。エンコーダー不要の統合アーキテクチャを採用し、メモリ16GBのノートPCで動作可能。上位モデルに迫る性能を発揮するという。
ITmedia AI+
2026年6月4日
Google、「Gemma 4 12B」を発表 ~16GBメモリのノートPCでもオンデバイス動作、上位モデルに迫る性能/エンコーダーフリーの新アーキテクチャー採用で実現米Google DeepMindは6月3日(現地時間)、「Gemma 4 12B」を発表した。オープンモデル「Gemma 4」ファミリーの新顔で、他のモデルにはない特徴をもつ。
窓の杜
2026年6月9日
Gemma 4 12B: 統合されたエンコーダーフリーのマルチモーダルモデルが登場Gemma 4 12Bは、AIモデルの新しい世代であり、テキスト、画像、動画、音声など、さまざまな種類のデータを理解し、処理するように設計されています。
Google DeepMind
2026年6月10日
時系列を言語として捉える:汎用時系列基盤モデルのためのユニバーサル・トークナイザーarXiv:2606.09861v1 新規発表 要旨:次トークン予測(NTP)はLLMの事前学習を統一してきたが、その応用は無限で連続的な時系列(TS)には未解決のままでした。このギャップを埋めるため、TSを離散トークンに変換するユニバーサル・トークナイザーUniTokと、これらのトークン上でNTPにより事前学習された基盤モデルUniTok-FMを提案します。UniTok-FMは、ゼロショットおよびプロンプト強化型予測、さらに訓練不要のインコンテキスト推論による少数ショット生成・分類をサポートする汎用基盤モデルであり、これは先行研究では達成されていませんでした。技術的には、UniTokはスケール安定化のためのプレフィックス正規化、エンコード・デコードのための段階的解像度因果アーキテクチャ、および学習のための構造保存型再構築損失を組み込んだベクトル量子化オートエンコーダーです。UniTok-FMは、TS固有の修正なしに市販のLLMアーキテクチャを採用しています。
arXiv cs.LG
2026年6月10日
大規模言語モデルにおけるアライメントアルゴリズムのメカニズム解析arXiv:2606.09850v1 公開タイプ: new 概要: 事後学習のアライメントアルゴリズムは、言語モデルの内部計算をどのように再構築するかを不明瞭にしたまま、ブラックボックスとして評価されることが大半です。本研究では、6つの選好最適化手法(PPO, DPO, SimPO, ORPO, GRPO, KTO)を3つのオープンウェイトモデルファミリーで横断的に比較し、体系的なメカニズム解析を行います。層ごとの線形プロービング、スパースオートエンコーダー、クロスコーダーを統合することで、選好表現を局在化させ、潜在空間におけるアライメント誘発性の幾何学的変換を定量化します。選好信号は一貫して早期~中期または中期~後期の層に集中するものの、異なる目的関数が表現上のシフトを質的に区別することを発見しました。KTOとGRPOは、建設的な特徴共有とスパースで高顕著性な募集を通じて線形分離性を向上させます。対照的に、DPOとORPOは、非建設的な幾何学的回転と特徴減衰を通じて分離性を低下させる一方、PPOとSimPOはベースラインの幾何学的構造をほぼ維持します。
arXiv cs.LG
2026年6月11日
PoQ-Judge: 分散型LLM推論におけるコスト意識型Proof-of-Qualityのためのマルチアーキテクチャ評価フレームワークarXiv:2606.11196v1 新規発表 要旨:分散型LLM推論ネットワークには、Proof-of-Quality (PoQ) のための軽量で参照不要な品質評価が必要です。我々は、正解データ参照なしでクエリと出力のペアをスコアリングする専用のジャッジモデルをトレーニングするフレームワーク、PoQ-Judgeを提案します。品質とコストのトレードオフを考慮した3つのアーキテクチャ(TextCNNジャッジ、MiniLMクロスエンコーダー、DeBERTaジャッジ)を研究します。UltraFeedbackとGPTラベル付きドメイン内データを用いた2段階トレーニングにより、最良のモデルは、保持されたテストセットで正解プロキシとのPearson相関0.747を達成し、以前の研究の参照ベース評価者を上回ります。複合スコアリングにおける参照フリーコンポーネントとして、参照回答の必要性をなくしながら、最良の単一参照ベース評価者と同等の0.645のPearson相関を達成します。
arXiv cs.CL
2026年6月11日
LatticeBridge:忠実な構造化シーケンス合成のためのレアケース逐次推論arXiv:2606.11203v1 新規発表 構造化シーケンス生成では、しばしば1つの出力で複数の入力由来の制約を満たすことがモデルに求められます。標準的なデコーディング手法では、流暢な継続に高い確率を割り当てる一方で、必要なアンカーをすべて同時に実現する継続には低い確率を割り当てる可能性があります。これをレアケース逐次推論問題として研究します。LatticeBridgeは、コンパクトなプレフィックス言語モデル、インスタンスコンパイルされたサーフェスオートマトン、そしてリサンプリング、マルチレベル分割、インスタンス提供フレーズから導出されるソースサポート提案項を備えたツイスト逐次モンテカルロ(SMC)デコーダーを組み合わせます。制約表現は各入力インスタンスからコンパイルされ、手動でキュレーションされた語彙クラスに依存しません。
arXiv cs.CL
2026年6月16日
コンテクスト圧縮は一つではない:読みやすい記号的再表現 vs. 同一予算での首尾一貫した要約我々は、小規模言語モデルを用いたマルチホップQAにおけるコンテクスト圧縮を研究する。我々は、検索されたパッセージを構造化されたエンティティ・リレーション文に書き換え、より低いトークンコストで推論証拠を保持する、読みやすい記号形式であるTelegraph Englishを提案する。MuSiQue、TwoWiki、HotpotQAでの制御実験において、Telegraph Englishは、3つの同一予算の圧縮ベースライン(文字レベル削除、切り捨て、ランダムサブサンプリング)を全てのデータセットで上回り、13〜20 F1パーセンテージポイントの改善が見られた。また、最も難しいデータセットでは、同じエンコーダーによって生成された首尾一貫した散文要約をも上回った。事前登録された深さ相互作用仮説は有意ではなかった:その利点はデータセット内の推論深度と共に増加しなかった。我々はこれらの結果を、読みやすい記号的再表現が、同一トークン予算において、自然言語や首尾一貫した要約よりも高密度にエンティティ内容を保持している証拠と解釈する。
arXiv cs.CL
2026年6月17日
SpeechDx: クリニカル音声AIのためのマルチタスクベンチマーク音声は、神経系、運動系、呼吸器系、声帯系を同時に活用することで、健康状態をユニークに把握できる情報源となります。現在のクリニカル音声AIの手法は、主に個別の疾患に特化した研究によって進歩してきましたが、結果の比較や一般化の評価を困難にしてきました。そこで、12のデータセットと27のタスクを多様な健康状態にまたがって網羅する、大規模なクリニカル音声AIベンチマークであるSpeechDxを導入します。共通の臨床メカニズムを横断した評価を可能にするため、SpeechDxはタスクを音声生成の段階(概念化、言語化、発声)で構造化します。このベンチマークは、ラベル付きデータが限られているタスクを含め、複数のデータセットにわたる同じ健康状態を評価することで一般化能力をテストし、臨床的に意味のあるパターンとデータセットの人工的な特徴を区別します。すべてのタスクにおいて、またゼロショットのクロスコンディション転移下で、12の最先端オーディオエンコーダーを体系的に評価します。
arXiv cs.AI
2026年6月18日
匿名化するか、維持するか?教育対話の個人情報識別解除のための完全ローカルAIカスケード教育対話は研究にとって貴重だが機密性の高いリソースです。本物の学習を捉えるトランスクリプトは、しばしばカリキュラムの内容に個人識別情報(PII)が絡み合っており、「リーマン」が実在の学生を指すのか、数学的概念を指すのかを捉えています。既存のアプローチは、ガバナンスと精度のトレードオフを強います。商用の大規模言語モデル(LLM)は、この曖昧さを処理できますが、学生データを第三者に送信する必要があります。一方、ローカルの固有表現認識(NER)システムは、ガバナンスを維持しますが、カリキュラム用語を過剰に匿名化します。本研究では、匿名化をオープンエンドのエンティティ認識から制約付きプライバシートリアージに再構築する、完全ローカルのカスケードフレームワークを提案します。リコール優先のユニオンプロポーザーは、2つの軽量エンコーダーと決定論的ルールを組み合わせて候補スパンを過剰生成します。その後、コンテキストを意識したレビューアが、周囲の対話と話者の役割を使用して、各候補に対して「匿名化/維持」の二項決定を行います。
arXiv cs.CL
2026年6月23日
MindAlign:限定データ下でのマルチモーダル埋め込みアライメントによるfMRI信号からの内的音声のデコード内的な言語出力の欠如、学習データの制限、被験者間の大きなばらつきにより、非侵襲的な脳信号からの内的音声のデコードは依然として根本的な課題です。既存の脳信号からテキストへのアプローチは、タスク固有のデコーダーのファインチューニングに依存することが多く、スケーラビリティを制限し、新しい被験者への適応を複雑にします。本研究では、基盤となる言語モデルを変更することなく、fMRI信号からのオープンエンドなテキスト生成を可能にする、分離された2段階の脳信号から言語へのフレームワークであるMindAlignを提案します。第1段階では、fMRI活動を共有マルチモーダル意味空間にマッピングし、内的生成された文章の潜在的な意味スケッチを抽出する、被験者固有のニューラル意味アライメントを学習します。第2段階では、このスケッチを視覚的コンテキストと統合し、冷凍されたマルチモーダル言語モデルにプロンプトを与えることで自由形式の生成を行います。静かな画像記述中に収集されたfMRIデータを用いた実験により、提案手法が一貫してfMRIのみおよびランダムベースラインを上回ることが実証されました。
arXiv cs.CL
2026年6月23日
ユーザー適応を同調させるニューラルインターフェースにおける識別可能性について本稿では、同調適応型人間機械システムの識別可能性について分析する。閉ループエンコーダー推定値はユーザー適応を一意に識別するのではなく、むしろ共同システムの特性を反映することを示す。行動適応の解釈への影響を考察し、識別可能性の条件を提案する。
arXiv cs.AI
2026年6月25日
チェスプレイヤーのスタイルをレーティングから分離する埋め込み手法本研究では、個々のチェスプレイヤーのスタイルを表現学習することを目的としています。プレイヤーごとの埋め込みは、そのプレイヤーの棋譜から学習され、内積によってスタイルの類似性を測定しながら、プレイの強さ(Eloレーティング)とはほぼ分離されるように設計されています。主要な設計は残差形式であり、レーティング条件付きのベースとなる指し手モデル(Maia-3のポリシー対数尤度とStockfish由来の特徴量を組み合わせ、Maia-2が提案した候補手に対してスコアリング)が、指定された強さの典型的なプレイヤーがどのような手を指すかを捉えます。そのモデルの凍結コピーが、学習された指し手エンコーダーとプレイヤーごとのベクトルzを固定し、zはレーティングから標準的なプレイからの逸脱のみを説明します。ベースモデルは、レーティングスペクトル全体で27-37%の相対NLL(負対数尤度)改善をMaia-3ポリシーと比較して達成し、特に高レーティング(2800以上)で最大の改善が見られます。Stockfishの追加効果はEloとともに単調に増加します。
arXiv cs.AI
2026年6月26日
HierBias:マルチタスクタイプ分類による文脈条件付き階層的メディアバイアス検出メディアバイアス検出は、公正でバランスの取れた情報伝達を保証するための重要なタスクですが、既存の文レベルのアプローチは各文を独立して分類し、人間の注釈者が自然に活用する文間コンテキスト信号を無視しています。本研究では、バイアス予測において文書コンテキストを形式的にモデル化する階層的コンテキスト条件付きメディアバイアス検出器であるHierBiasを提案します。コンテキスト条件付きバイアス確率を導入し、文間の相互情報量がゼロでない場合、文書コンテキストを活用することで文レベル分類のベイズ誤差が厳密に減少することを理論的に証明します。さらに、マルチタスク一般化バウンドにより、二項バイアス検出と詳細なバイアスのタイプ分類を共同でトレーニングすることが、小規模な注釈付きコーパスでのサンプル効率を向上させることが確立されます。アーキテクチャ的には、HierBiasは文レベルのRoBERTaエンコーダーと、文間トランスフォーマーアグリゲーター、および二項検出と4クラスのタイプ分類のためのデュアル出力ヘッドを組み合わせています。
arXiv cs.CL
2026年6月29日
因果関係の抽出:金融QAにおける多言語ファインチューニングの活用 @FinCausal 2026本論文は、金融ナラティブからの因果関係抽出を目的としたFinCausal 2026共有タスクにおける、チームHSA_CORALの提出内容について説明する。このタスクは、英語とスペイン語の抽出型質問応答を通じて行われた。本研究では、3つのモデリングファミリーを比較検討する。(i) 多言語BERTを用いたエンコーダーオンリーのトークンラベリング、(ii) 多言語BARTを用いたエンコーダーデコーダー生成、(iii) プロンプト洗練、少数のデモンストレーション、教師ありファインチューニングを使用したデコーダーオンリーLLM(Llama 3.1およびGPTバリアント)。いずれの設定においても、プロンプティングと少数の例は競争力のあるパフォーマンスをもたらしたが、教師ありファインチューニングが最も大きな進歩をもたらした。
arXiv cs.CL
2026年6月29日
PairSAE:タンパク質共フォールディングにおけるペア表現からのメカニズム解釈構造生物学のための基盤モデルは、生体分子構造の予測において目覚ましい性能を達成し、タンパク質や低分子の設計に有望視されている。しかし、その出力の根幹をなす内部特徴を理解することは依然として困難である。標準的なスパースオートエンコーダー(SAE)は、トランスフォーマー風のシーケンス埋め込みには効果的だが、ペアフォーマー風のアーキテクチャにはそのまま適用できない。ペア表現に単純に作用させると、特徴量が二次関数的に増加し、シーケンス表現とペア表現にまたがって分散する概念が不明瞭になる。そこで我々はPairSAEを開発した。これは、ペアテンソルをNモードSVDによってトークンごとの相互作用役割に要約し、その後、スパースオートエンコーダーを使用して、シーケンス表現とペア表現の両方をデコードできる共通のトークンレベル特徴セットを学習する。PLINDERタンパク質-リガンド複合体のBoltz-2活性化で評価した結果、PairSAEはUniProtアノテーションと一致し、Boltz-2親和性値を予測する解釈可能な特徴量をもたらした。
arXiv cs.LG
2026年6月30日
ターン平均SAEによる特徴発見と長文脈アトリビューションスパースオートエンコーダー(SAE)は、言語モデルにおける解釈可能な特徴抽出に役立つツールとなっています。しかし、標準的なSAEアーキテクチャは個々のトークン活性化に基づいて動作するため、アクティブな特徴の数はコンテキスト長に比例して増加し、長文のモデルトランスクリプトの研究が困難になります。本稿では、ターン内の平均モデル活性化を再構築するように学習することで、固定数の特徴で単一の人間またはアシスタントのターンを表すターン平均SAEを導入します。ターン平均特徴は、LLMによって評価された場合、トークンごとの特徴よりも単一ターンの高レベル特性をより完全に記述することを発見しました。また、ターン平均SAEが、アトリビューショングラフのようなSAEの一般的な下流用途を大幅に単純化することを示します。広範には、ターン平均SAEは、長コンテキスト長での解釈可能性技術の実用性を高めます。
arXiv cs.CL
2026年6月30日
scKDGM: KAN誘導型動的グラフマスキング学習による単一細胞RNAシーケンス・クラスタリング単一細胞RNAシーケンス(scRNA-seq)のクラスタリングは細胞タイプの同定に不可欠ですが、高次元性、スパース性、ドロップアウト、技術的ノイズが堅牢な発現表現と細胞グラフ構築を妨げます。既存のマスクトランスフォーマーは主に特徴再構築のための発現回復を使用しますが、グラフクラスタリング手法は通常、固定されたKNNグラフに依存し、回復された発現をグラフ最適化にフィードバックしません。本研究では、scRNA-seqクラスタリングのためのKAN誘導型動的グラフマスキング学習フレームワークであるscKDGMを提案します。scKDGMは、細胞アイデンティティを摂動させるグラフ認識型分布保持型遺伝子マスキング(GDP-Mask)、マスクビュー表現を学習するためのKANベースのTAKGCNエンコーダー、動的グラフを構築するためのマスク誘導型発現回復、および回復シグナルをトポロジー更新に転送するためのクロスビュー対照学習を使用します。ZINB損失は過分散とゼロインフレーションをモデル化します。
arXiv cs.LG
2026年6月30日
機器レベルのエネルギー異常検知とLLM駆動型推奨のためのエージェンティックAIパイプラインオフィスビルにおける機器レベルのエネルギー監視は、専門知識のない施設管理者にとって利用が困難なノイズの多いアラートを生成します。本論文では、ディープ時系列予測、変分異常検知、LLMベースの推論を組み合わせ、優先順位付けされた実行可能なメンテナンス推奨事項を生成するエンドツーエンドのエージェンティックパイプラインを提案します。このシステムは、ハイブリッド単一スペクトル分析(SSA)とLong Short-Term Memory(LSTM)予測モデルを使用して7つのオフィス機器を追跡し、注意機構を備えた機器ごとのLSTM変分オートエンコーダー(VAE)を適用して異常な毎日の消費エピソードをフラグ付けします。3段階のLangChainパイプラインは、常に3つのコアRAGソース(モデル信頼性、時間別ベースライン、専門知識)を取得するコンテキストエージェントから始まり、イベント特性に基づいて最大3つの追加ソース(予測コンテキスト、異常履歴、グローバルベースライン)を条件付きで追加し、8回の推論ステップに制限されます。
arXiv cs.LG
2026年7月1日
クリーンテキストを超えて:ノイズのあるテキストでのベンガル語イベント検出におけるエンコーダーとデコーダーのロバスト性の評価イベント検出(ED)システムは通常、クリーンでキュレーションされたテキストで評価されるため、特にベンガル語のような低リソース言語においては、現実世界のノイズに対するロバスト性はほとんど探求されていません。本研究では、汎用的なベンガル語ニュースイベントオントロジーと、クリーンなニューステキスト、実世界の自動音声認識(ASR)トランスクリプト、および正書法的に破損したテキストにまたがる40のイベントサブタイプにわたる9,979のアノテーション付き文からなるベンチマークを導入します。ファインチューニングされたエンコーダー専用モデル(BanglaBERTとXLM-R)と、命令チューニングされたデコーダー専用大規模言語モデル(Llama 3とGemma 3)を体系的に評価します。結果は明確なアーキテクチャのトレードオフを明らかにします。エンコーダーモデルはクリーンなテキストで高いパフォーマンスを達成しますが、ノイズ下では著しく低下します。一方、デコーダー専用LLMは、特にイベントトリガーが破損している場合に、著しくロバストです。
arXiv cs.CL
2026年7月3日
TokenScope:大規模言語モデルにおけるコード指向タスクのトークンレベルの解釈可能性と説明可能性大規模言語モデル(LLM)がコード生成中にトークンレベルの決定をどのように行うかを理解することは、研究者と実務者の両方にとって依然として大きな課題です。最近のツールはモデルの内部構造や生成結果に関する洞察を提供していますが、デコード時のシグナル、きめ細やかな不確実性指標、代替生成パスを探索するためのインタラクティブなメカニズムを欠いていることがよくあります。本稿では、生成中にトークンレベルのメトリクス、アテンションパターン、構造情報を提供する、デコーダーベースLLMのためのインタラクティブな解釈可能性および分析ツールであるTokenScopeを紹介します。TokenScopeは、インタラクティブなトークン置換、反事実的ブランチング、抽象構文木によるコード対応集約をサポートします。デコード時のシグナルと構造化されたプログラム分析を統合することにより、TokenScopeはコード生成中のLLMの動作の体系的な調査を可能にします。
arXiv cs.CL
2026年7月3日
効率的な小規模言語モデルのためのWiolaアーキテクチャ我々は、GPT、LLaMA、Mistral、Falconを含む既存のどのモデルファミリーとも構造的な lineage を共有しない、ゼロから構築された完全にオリジナルの小規模言語モデル(SLM)アーキテクチャであるWiolaを発表します。Wiolaは5つの独立して新規なコンポーネントを導入します:(i)絶対的、相対的、階層的な位置信号を組み合わせた3次元ヘリカル多様体にトークン位置を埋め込むスパイラルロータリー位置エンコーディング(SRPE)、(ii)各デコーダー層に、層間の一貫性のために先行する2つの層の圧縮要約へのソフトクロスアテンションアクセスを提供するゲート付きクロスレイヤーアテンション(GCLA)、(iii)情報損失なしにアテンションの複雑さを低減するために、ネットワーク中層で意味的に冗長な隣接トークンを動的にマージするアダプティブトークンマージング(ATM)、(iv)学習された次元ごとのゲートによって融合された2つの並列ストリームで従来のMLPを置き換えるデュアルストリームフィードフォワード(DSFF)、および(v)…
arXiv cs.AI
2026年7月4日
EPRA U-Net: DWI MRIにおける正確な梗塞セグメンテーションのための効率的なピラミッド残差アテンションフレームワーク拡散強調MRI(DWI)画像から急性虚血性梗塞を正確に特定することは、脳卒中治療における正確な病変評価と効果的な意思決定に不可欠です。この課題に対し、最新の研究では、梗塞領域を効率的かつ高精度に識別する新たな手法「EPRA U-Net」が提案されました。 EPRA U-Netは、DWI画像解析に特化した統合アーキテクチャです。特徴抽出の段階では、計算資源の消費を抑えつつ、多層的な画像の特徴を効率的に捉えるEfficientNetを基盤としたエンコーダーを採用しています。これにより、限られたパラメータ数で高い性能を発揮することが期待されます。この技術は、脳血管イベントの迅速かつ正確な診断に貢献する可能性があります。 (arXiv cs.AI)
arXiv cs.AI
2026年7月6日
長尺音声エンコーディングにおけるセグメントアテンションデコーディング我々は、アテンションベースのエンコーダー・デコーダー(AED)モデルと長尺音声エンコーディングの根本的な不一致に取り組みます。セグメント化された発話で学習したAEDモデルは、セグメント境界を超えた限られた音響コンテキストを利用して絶対フレーム位置をエンコードすることを学習しますが、これらの手がかりが失われる長尺セグメントのデコーディングでは一般化できません。
Apple Machine Learning Research
2026年7月7日
LensVLM: テキストの圧縮された視覚表現のための選択的コンテキスト拡張Vision Language Models (VLMs) は、テキストをレンダリングされた画像として処理し、テキストを長いトークンシーケンスにトークン化する必要性を回避するというエキサイティングな可能性を提供します。VLMの画像エンコーダーは固定サイズの画像を固定数の視覚トークンにマッピングするため、レンダリング解像度の変更はきめ細かな圧縮ノブを提供します。
Apple Machine Learning Research
2026年7月7日
Gemma 4 技術レポートGemmaモデルファミリーに、オープンウェイトでネイティブにマルチモーダルな新世代言語モデル「Gemma 4」を紹介します。計算効率と推論能力の向上を目指して設計されたGemma 4モデルスイートは、23億から310億パラメータまで、密結合型およびMixture-of-Experts(MoE)アーキテクチャを備えています。全モデルサイズでビジョンおよびオーディオエンコーダーを改良したのに加え、生のオーディオや画像パッチを取り込む120億パラメータモデル向けに、エンコーダーフリーの統合アーキテクチャを提案します。さらに、Gemmaモデルが応答前に推論トレースを生成できるようにする「シンキングモード」を統合しました。重要な設計選択により、推論速度、メモリ、計算効率、および長文コンテキスト能力を向上させています。Gemma 4は、STEM、マルチモーダル、長文コンテキストのベンチマーク全体で性能が飛躍的に向上し、人間による評価タスクでは、より大規模な最先端のオープンモデルに匹敵します。
arXiv cs.CL
2026年7月7日
LuxSQA:TTS拡張型音声質問応答システムでルクセンブルク語での質問を可能に音声質問応答(SQA)は、依然としてリソースの豊富な言語や慎重に録音された音声に重点が置かれており、リソースの少ない環境での音声LLM手法の普及を制限しています。本論文では、テキスト読み上げ(TTS)が、大規模な人間による録音QAコーパスを必要とせずに、ルクセンブルク語SQAのためのタスク固有のトレーニングデータを提供できるかどうかを調査します。既存のテキストベースQAリソースから始め、質問をルクセンブルク語に翻訳し、複数のTTSシステムで音声質問を合成し、それらをテキスト回答とペアにします。学習されたプロジェクターとLoRAアダプターを介して、フリーズされたWhisperエンコーダーをフリーズされた多言語LLMバックエンドに接続する、パラメーター効率の良いSLAMスタイルのアーキテクチャをトレーニングします。MMS-TTS、Qwen3-TTS、およびOmniVoiceのバリアントを比較します。これには、約48,000の質問からなる単一ソースコーパスと、約230,000の質問からなる4TTSマルチソースミックスが含まれます。
arXiv cs.CL
2026年7月7日
QuantFlow: 時系列予測のためのフェデレーテッド・マンバベース・ポスト・トランスフォーマー基盤モデル時系列予測は、金融、エネルギー、交通、公衆衛生、産業モニタリングにおける意思決定を支援します。最近の基盤モデルは予測タスク間の転送を改善しますが、多くは中央集権化されたデータとトランスフォーマーの注意機構に依存しており、長くて高次元でプライバシーが保護された信号への使用を制限します。本稿では、逆順シーケンス埋め込み、双方向マンバ状態空間デコーダー、分位数回帰、フェデレーテッド学習を組み合わせた確率的予測フレームワーク、QuantFlowを発表します。各変数は完全な観測ウィンドウにわたって埋め込まれ、順方向と逆方向で処理され、5つの条件付き分位数が投影されます。TSMixupは、シーケンス構造を維持しながら、ディリクレ重み付け補間によって時間的多様性を拡大します。実験は、仮想通貨、交通、電力、Electricity Transformer Temperature、インフルエンザ、気象データに及びます。
arXiv cs.LG
2026年7月8日
言語モデルのパープレキシティとASR単語誤り率の関係性の再検証:最新のEnd-to-End音声認識システムにおいて言語モデル(LM)のパープレキシティ(PPL)は、従来、自動音声認識(ASR)の単語誤り率(WER)の代理指標として使用されてきました。過去の研究では、ログ・ログ空間でほぼ線形な関係が報告されていました。しかし、最新のEnd-to-End ASRシステムは、内部に言語モデリング能力を備え、外部言語モデルなしで評価されることが多く、またニューラルLMや大規模言語モデル(LLM)と組み合わせることが可能であるため、この仮説に疑問を投げかけています。本稿では、最新のASRシステムにおけるPPLとWERの関係性を再検証します。外部LMが現在のEnd-to-End ASRシステムを依然として改善するかどうか、PPL-WER関係はログ・ログ空間で線形性を維持するかどうか、エンコーダーのコンテキスト長がこの関係にどのように影響するか、そしてLLMのパープレキシティが標準的なニューラルLMで観測される傾向にどのように適合するかを調査します。
arXiv cs.CL
2026年7月8日
NAVER LABS、IWSLT 2026指示追従タスクに向けたシステム再実装IWSLT 2026共有タスク(制約条件、短い音声トラック)のため、NAVER LABSのIWSLT 2025指示追従パイプラインを再実装しました。必須コンポーネントであるSeamlessM4T-v2-largeを音声エンコーダー、Qwen3-4B-InstructをLLMバックボーンとして採用しています。プロジェクターアライメント、テキストのみのLoRA事前学習、マルチモーダルマージという3段階アプローチは、元の設計から踏襲しています。さらに、提供されたコーパスから10種類の音声中心タスクタイプ(各1万件)にわたる10万件の合成指示追従例を構築し、ステージ3のファインチューニングに適したものとしました。主要モデルは、MCIFベンチマークにおいてEN-ZH音声翻訳でCOMET 0.781、英語SQAでBERTScore-F1 0.346を達成しました。
arXiv cs.CL