TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
認知圏論トランスフォーマー:言語モデリングのための圏論的帰納的バイアス認知圏論トランスフォーマー(CCT)は3億600万パラメータのアーキテクチャで、事前学習されたGPT-2 Smallバックボーンを圏論から導出された認知的に根拠のあるコンポーネント、および認知科学からのいくつかのインスピレーションで拡張しています。マッチドステップ・プロトコル下(215,000最適化ステップ)で...
arXiv cs.AI
2026年5月29日
TRACES:軌跡状態モデリングによるマルチターンLLMエージェント向けプロアクティブセーフティ監査LLMエージェントはマルチターンツール使用と環境相互作用を通じてますます動作していますが、安全リスクは最終結果に表面化する前の中間ステップから生じることが多いです。したがって、リアクティブ監査は不十分です。事後診断はリスクを指摘する機会を逃すことが頻繁にあります。
arXiv cs.CL
2026年5月29日
言語優先性の脱却: モダリティ認識ポリシー最適化によるオーディオ推論の後期段階モダリティ崩壊の軽減オーディオと全モダリティ大規模言語モデルは印象的なクロスモーダル推論能力を示すが、これらのモデルに標準的な強化学習後処理アルゴリズムを適用すると、GRPO のような方法がすべてのトークンに均一なポリシー勾配を適用する構造的脆弱性が露呈する。
arXiv cs.CL
2026年5月29日
反応トーンを通じたコミュニティ態度のモデリング:オンラインコミュニティの言語的行動とLLMアラインメント評価のための人間-AI協働フレームワーク大規模言語モデル(LLM)は計算社会分析のプロキシとしてますます利用されていますが、人間のコミュニティの「厚い記述」を忠実に表現する能力は依然として重大な課題です。現在の評価では、社会的アイデンティティを静的なラベルに縮小することが多いです。
arXiv cs.CL
2026年5月29日
ノルネ貯留層システムの逐次物理制約ニューラルオペレータ順方向モデリングフーリエニューラルオペレータ(FNO)と物理情報付きの変種(PINO)に特に重点を置いて、ニューラルオペレータを使用した3相ブラックオイル貯留層ダイナミクスの逐次サロゲートモデリング用の包括的な数学および計算フレームワークを開発する。アプリケーションの焦点はノルネシステムである。
arXiv cs.LG
2026年5月29日
BEAMS: AI モデリング・シミュレーション評価ベンチマーク実世界の意思決定を支援するAIツールは、推奨事項を知らせ解釈可能にするシミュレーションモデルを構築できる必要があります。モデリング実務の側面を自動化できるツールは、人間の専門知識を補完する必要があり、置き換えるべきではありません。BEAMS Initiativeは、開発を指導することを目的としています。
arXiv cs.AI
2026年6月1日
パディング付きトランスフォーマー表現力の再検討:どのアーキテクチャの選択が重要でどれが重要でないのかarXiv:2605.30523v1発表タイプ:新規 概要:最近の研究では、トランスフォーマーがブール回路との接続を通じて計算できること・できないことを説明しているが、既存の結果は正確な特性化を欠き、モデリング選択に対して敏感である。パディング付きトランスフォーマー――入力に「...」などのフィラー記号が追加される――は有用なツールとして出現している。
arXiv cs.LG
2026年6月1日
教師あり学習は生物学的に妥当な学習規則全体で初期視覚皮質アラインメントを急速に低下させるarXiv:2605.30556v1 発表タイプ:新規 要旨:ランダムで未訓練のニューラルネットワークは、初期視覚皮質への表現類似性において、訓練されたネットワークと一貫して同等以上の性能を示す。この驚くべき知見は、学習が脳アラインメントを改善するという仮定に異議を唱えている。我々は表現類似性分析(RSA)アラインメントを追跡することで調査する。
arXiv cs.LG
2026年6月1日
CobSeg: 対話トピックセグメンテーションのための一貫性境界モデリング対話トピックセグメンテーションは異なる境界手がかり(発話エッジ付近の語彙遷移および発話全体の意味的不連続性)を識別する必要がある多くのヒト-AI協調アプリケーションで重要である。既存の発話モデルはしばしばこれらのローカル語彙信号を希薄化させる。
arXiv cs.CL
2026年6月2日
マルチモーダルLLM評価器の知覚判断バイアス緩和:知覚摂動と報酬モデリング視覚と言語の矛盾を見分ける課題に対応 マルチモーダル大規模言語モデル(LLM)が自動評価システムとして機能する際、画像とテキストが相反する状況で問題が生じることが明らかになった。研究によると、これらのモデルはもっともらしく聞こえるテキスト応答を、実際の画像内容より優先する傾向があるという。 研究チームは、制御された画像変化を加えることでこの「知覚判断バイアス」を詳細に分析。実際の画像内容とは異なる反事実的な応答を組み込んだ新しい評価データセットを構築した。 対策として、報酬モデリングとバッチランキング目的を統合した統一的なフレームワークを開発。このアプローチにより、視覚情報とテキスト情報の両者を適切に重視し、より正確で一貫性のある評価を実現できるようになった。 成果は、マルチモーダルAIが複雑な判断を求められる場面で、より信頼できる決定を下すための基盤となる可能性を示している。 (arXiv)
arXiv cs.AI
2026年6月2日
lmfaoooo at SemEval-2026 Task 1: ユーモアは観客である。制約付きユーモア生成のための選好モデリングユーモア生成は、流暢で新しいジョークを生成することの難しさだけでなく、「面白い」というのが観客に依存し、教師ラベルがノイズを含んでいるという点で困難です。選好は観客、文脈、文化によって異なり、アノテータ間の一致度も低くなります。本論文では、SemEvalのシステムについて説明します。
arXiv cs.CL
2026年6月6日
中央アフリカのエボラ感染拡大は2014年の過去最大流行と同規模に達する可能性、米保健当局が警告米CDCのモデリングでは、エボラ感染が「危険な軌道」を辿る可能性があることが示されているが、専門家はアウトブレイクは予測が非常に難しいと警告している。米保健当局による新たな分析によると、中央アフリカのエボラ流行は、1万1,000人以上の死亡者を出した西アフリカの2014~2016年の流行と同規模に拡大する可能性がある。
The Guardian World
2026年6月8日
Lean4Agent: エージェントワークフロー及び軌跡の形式的モデリングと検証大規模言語モデル(LLM)に信頼性の高い多段階ワークフロー実行能力を備えさせることはAIの中心的課題となっている。LLMのエージェント機能の最近の進歩にもかかわらず、ほとんどのエージェントシステムはワークフロー実行軌跡の仕様化、検証、デバッグのための形式的手法を欠いている。この課題は数学における長年の問題を反映しており、自然言語の曖昧性が形式言語開発の動機となっている。この範例に触発されて、我々は依存型形式言語Lean4を用いてエージェント動作をモデリング・検証する最初のフレームワークLean4Agentを提案する。Lean4Agentはエージェントワークフローの意味的一貫性を形式的にモデリング・検証し、実行時失敗の局所化を可能にする拡張可能なLean4ライブラリFormalAgentLibを立ち上げる。FormalAgentLibに基づいて、さらにLeanEvolveを開発し、ワークフローを改善してその能力を強化する。
arXiv cs.AI
2026年6月8日
HKJudge:香港判決文の法的言説注釈付きコーパス - 裁判所の判断根拠、推論過程、判決内容の解釈本研究は、香港の判決文に対する言説分析のための初めての専門家注釈付き法的言説コーパス「香港判決文言説データセット(HKJudge)」を紹介する。HKJudgeは香港の5段階の裁判所階級全体にわたる刑事判決を含み、約29万文、650万トークンから構成され、法言語学の専門家により完全に注釈付けされている。2層構造の言説スキーマを設計し、裁判所が認定した事実、推論過程、判決内容を捉える。文レベルでは各文に26の修辞的役割のいずれかが割り当てられ、スパンレベルでは有罪判決要素(罪状、懲役期間、罰金)でさらに注釈付けされている。10人の法言語学注釈者によるアノテーションは高い一致度(κ = 0.8)を達成している。HKJudgeに対して修辞的役割分類と法的要素抽出の2つのタスクを定式化し、4つのBERTベースモデル、2つのオープンソースLLM(ゼロショットおよびファインチューニング設定)、および4つの商用LLMについて初の基準評価を提供している。この研究は、文レベルの言説注釈が香港判決文の構造モデリングに価値があることを実証し、法的判決予測に関する将来の研究のための豊富なデータ基盤を提供する。
arXiv cs.CL
2026年6月9日
スパースな縦断的データに基づくアルツハイマー病のトランジションベースのデジタルツインモデリングアルツハイマー病(AD)の進行は異質性が高く、散発的で不規則な縦断的データで観察されるため、予測と個別監視が困難です。 既存の機械学習アプローチはAD予測を改善しましたが、静的な分類やコホートレベルのリスク推定に重点を置き、個別のモデリングや不確実性を考慮した推論には限界がありました。 これらの課題に対処するため、多モーダル縦断的データを用いたAD予測とシナリオベース分析のための個別化されたデジタルツインフレームワークを提案します。
arXiv cs.LG
2026年6月9日
Express言語モデリング言語モデルの効率化を目指し、新たなツール「Express」が導入されました。このExpressは、これまで非因果的アテンションの近似に用いられていた手法を、因果的アテンションの近似へと転換させる機能を持ちます。 具体的には、既存の「Thinformer」という近似手法と組み合わせることで、因果的アテンションの近似精度を向上させることが期待されています。これにより、言語モデリングにおいて課題となっていた四つのリソースボトルネックの克服に貢献すると考えられます。これらのボトルネックには、長いコンテキストの事前処理やKVキャッシュの圧縮などが含まれており、Expressの活用によって、より効率的な言語モデルの開発が進む可能性があります。 arXiv cs.LG
arXiv cs.LG
2026年6月10日
マルチモーダル学習におけるアラインメントと予測の使い分け:フェーズ図マルチモーダル学習における二つの主要な手法、クロスモーダルアラインメント(CA)とクロスモーダル予測(CP)の特性が、統一的な線形フレームワークを用いて分析されました。この研究は、それぞれの学習パラダイムが成功または失敗する条件を明確にしています。 分析の結果、CAは各モダリティのデータを白色化する特徴を持ちますが、ノイズが強く相関している条件下では失敗しやすいことが判明しました。一方、CPはクロス予測可能な情報を符号化することに長けていますが、その回復性能はソースモダリティの品質に大きく依存することが示されました。 この研究は、マルチモーダル学習が単一モダリティ学習と比較して性能が劣る原因を診断するための重要な知見を提供します。特に、複数の異なるデータ形式を扱う科学分野の研究者や実務家にとって、どの手法をどのような状況で適用すべきかについて具体的な指針を与えるものとして注目されます。これにより、マルチモーダルデータからの効果的な学習設計が可能になると期待されます。 引用元: arXiv cs.LG
arXiv cs.LG
2026年6月10日
SynIB:マルチモーダル学習におけるシナジーを最大化するための情報ボトルネックarXiv:2606.09853v1 新規発表 要旨:マルチモーダル学習の中心的な目的は、シナジー(複数のモダリティの共同利用からのみ生じ、単一のモダリティからは利用できない、タスク関連情報)を捉えることです。ほとんどのアプローチは、より大きく複雑なフュージョンモデルを通じたアーキテクチャレベルで動作しますが、我々は補完的な軸として、トレーニング目的自体を形成することを提案します。標準的なトレーニングは、しばしば単峰性または冗長な情報を強調し、クロスモーダル推論を必要とする例では不十分です。我々は情報理論を通じてマルチモーダルシナジーを形式化し、シナジーを直接ターゲットとするスケーラブルな目的であるシナジスティック情報ボトルネック(SynIB)を導入します。シナジー学習を優先するために、SynIBはモデルがすべてのモダリティから正確に予測することを動機付け、同時にいずれかのモダリティからの情報が抑制された場合に自信を罰します。
arXiv cs.LG
2026年6月11日
介入するかしないか:確率的モデルブレンディングによる推論時アラインメントの誘導arXiv:2606.11201v1 新規発表 概要:LLMの広範な展開により、新たにトレーニングされたモデルがユーザーの指示に安全かつ効果的に応答するように、モデルアラインメントが必要となっています。様々な手法の中でも、推論時アラインメントは、出力生成中のみ介入(つまり、ガイダンスを提供する)するため、より安価であることが多いです。既存の提案では、信頼性を適切に評価せずに、特定の調整済みモデルから抽出されたガイダンスを適用しています。しかし、私たちの体系的な評価では、ガイダンスの効果はモデルによって劇的に異なることが明らかになりました。効果のないガイダンスは、さらなる混乱、ひいてはさらなる介入につながるため、結果として生じる過剰な介入は、通常、パフォーマンスの低下を示します。介入をより効果的かつ効率的にするため、私たちはBlendInを導入します。これは、二項決定から、両モデルの知識を統合したハイブリッド分布の作成へと移行する推論時アラインメントフレームワークです。
arXiv cs.LG
2026年6月11日
ProHiFlo:階層的フローマッチングと関数的ガイダンスによる新規タンパク質生成de novoタンパク質生成は、治療薬設計、酵素工学、合成生物学において革新的な可能性を秘めています。拡散ベースおよびフローマッチングアプローチは進歩を遂げていますが、通常は単一解像度で動作し、機能的制約を組み込むメカニズムを欠いています。本稿では、3つの革新的な階層的フローマッチングフレームワークであるProHiFloを提案します。(1) 骨格構造をモデリングしてから全原子座標へと洗練させる粗視的から微視的への生成により、精度を維持しながら計算コストを削減します。(2) 事前学習済み予測器を活用した機能的ガイダンスにより、再学習なしで望ましい特性へと生成を誘導します。(3) 効率的なマルチスケール処理のための適応型SE(3)-同変アーキテクチャ。非条件付き生成、モチーフ足場構築、機能設計における実験は、4回のサンプリングステップを削減しながら、最先端のパフォーマンスを示しました。酵素活性部位の足場構築では、ProHiFloはRFDiffusionの41.2%に対し、58.9%の成功率を達成しました。
arXiv cs.LG
2026年6月16日
融合は万能ではない:イベント発生までの時間モデリングのためのクロスモーダル表現アラインメントマルチモーダル臨床データからの正確なイベント発生までの時間(TTE)予測は、モダリティの不均衡と分布シフトにより依然として課題となっています。本研究では、CT画像と縦断的EHRデータ間のクロスモーダル表現アラインメントのための、タスクや施設を超えて汎用化できるように設計された、ファウンデーションモデル主導のフレームワークを提案します。CTとEHRのモダリティは、ドメイン固有のファウンデーションモデルを用いて個別にエンコードされ、4つの原則的な融合戦略(late fusion, contrastive alignment, cross-attention, co-attention)を通じて共有潜在空間でアラインメントされます。肺塞栓症(PE)の死亡率と心血管疾患(CVD)の転帰という、臨床的に異なる2つのTTEタスクを、大規模な複数施設コホート(PE: N=3,099学習; 1,098内部; 435外部; CVD: N=2,951学習; 837内部; 682外部)で評価しました。
arXiv cs.AI
2026年6月16日
生理信号からのマルチモーダル感情認識のための深層時間モデリングとアンサンブル融合生理的ストレスと感情認識は、健康モニタリングと感情コンピューティングにおいて重要です。本研究では、手首と胸のセンサー信号を用いたマルチモーダル感情認識のためのWESADデータセットにおける、Long Short-Term Memory (LSTM)、Temporal Convolutional Networks (TCN)、Transformerなどの深層学習モデルの包括的な評価を提示します。手首のみ、胸のみの入力でモデルをトレーニングすることにより、各モダリティの個別の貢献度を評価するためにアブレーションスタディを実施します。さらに、マルチモーダル入力でトレーニングされた3つのアーキテクチャすべての予測を組み合わせる、レイトフュージョンアンサンブル戦略を実装します。また、各モデルに入力する前に手首と胸の信号を連結することにより、センサーレベルでの早期融合も採用します。結果は、Transformerモデルがマルチモーダル設定で一貫して最も高い精度を達成する一方、TCNモデルが手首のみの構成で最良のパフォーマンスを発揮することを示しています。
arXiv cs.CL
2026年6月16日
GRASP:メモリ効率的なマルチソース学習のための勾配アラインメント逐次パラメータ転送マルチソース転送学習は、根本的なスケーラビリティのボトルネックに直面しています。既存のアプローチでは、パラメータ融合中にすべてのK個のソースモデルを同時にメモリにロードする必要があり、O(K)のメモリを必要とするか、推論時にすべてのモデルをデプロイする必要があり、本番環境へのデプロイを不可能にしています。我々は、GRASP(Gradient-Aligned Sequential Parameter Transfer)を提案します。これは、3つの主要なイノベーションにより、O(1)のメモリ消費を維持しながら、優れた知識統合を実現します。(1)ソースを一度に1つずつ進化するターゲットモデルにマージする逐次処理。(2)最適化方向がターゲットドメインと一致するパラメータのみを選択的に転送し、ネガティブ転送を回避するパラメータごとの勾配アラインメント。(3)次のソースを統合する前に、転送された知識を適応させる反復ファインチューニング。
arXiv cs.LG
2026年6月16日
運転軌跡予測におけるインタラクションモデリングのためのグラフニューラルネットワーク層選択の比較研究自動運転システムは、安全かつ効率的な移動計画のために正確な軌跡予測に依存しています。グラフニューラルネットワーク(GNN)は、道路上のエージェント間の時空間的インタラクションをモデリングするための有望なアプローチとなっています。しかし、軌跡予測のためのGNNアーキテクチャの設計は標準化されておらず、どのグラフ層が空間的インタラクションと時間的ダイナミクスを効果的に捉えられるかについてのガイダンスはほとんどありません。本稿では、19種類のグラフ層について、軌跡予測に最も効果的なアーキテクチャを発見するために、それらの空間的および時間的処理能力に焦点を当てた詳細な比較研究を提供します。探索されたハイパーパラメータ設定内で、ARMA、Chebyshev、およびトポロジー認識層が他の層よりも一貫して優れたパフォーマンスを示し、5つの際立った層の組み合わせを強調します。
arXiv cs.LG
2026年6月17日
MODE:MoEマルチモーダルLLMのための、モダリティ分解によるエキスパートレベル混合精度量子化エキスパート混合(MoE)マルチモーダル大規模言語モデル(MoE-MLLM)は目覚ましい性能を発揮しますが、GPUメモリコストが法外に高いため、圧縮が不可欠です。PTQ手法の中でも、エキスパートレベル混合精度量子化はMoE-LLMに有効であることが証明されていますが、エキスパート重要度推定における2つの見過ごされたバイアスのために、MoE-MLLMでは著しい性能低下が見られます。(1)クロスモーダルレベルでは、ビジョントークンの数値的な優位性により、エキスパート選択頻度がビジョントークンに支配され、テキストモダリティに重要なエキスパートが隠蔽されます。(2)イントラビジョンレベルでは、冗長なビジョントークンの割合が大きいことが頻度統計をさらに歪め、情報量の多い視覚コンテンツに重要なエキスパートを不明瞭にします。これらのギャップを埋めるため、我々はMoE-MLLM向けのモダリティ分解エキスパートレベル混合精度量子化フレームワークであるMODEを提案します。
arXiv cs.LG
2026年6月18日
モントリオール強制アライナーと2026年の音声認識アライメントの現状モントリオール強制アライナー(MFA)は2016年にリリースされ、以来、研究および産業分野で最も広く使用されている強制アライメントツールとなっています。それから10年間で、MFAは、より大規模なオープンソースデータセット、統一されたIPA辞書、モデル適応、クロス言語フォネティック再マッピング、およびサポートユーティリティを使用した、より多くの言語と方言へのカバレッジ拡大を含む、大幅な開発を経てきました。本論文は、バージョン1.0以降のMFA 3.0の開発を記録し、古典的およびニューラル強制アライナーをベンチマークとして、英語、日本語、韓国語におけるMFAのパフォーマンスを評価します。MFA 3.0は、平均境界誤差15ミリ秒未満で、4つのベンチマークデータセットすべてにおいて最先端またはそれに近いパフォーマンスを達成しています。適応とクロス言語再マッピングは、MFAのトレーニング分布外の言語に効果的であり、発音確率モデリングと音韻規則は特定の条件下で改善をもたらします。
arXiv cs.CL
2026年6月19日
拡散言語モデル:実験的分析大規模言語モデル(LLM)は、自己回帰的生成によって言語モデリングに革命をもたらし、幅広いタスクで高いパフォーマンスを実現しました。最近、拡散言語モデル(DLM)は、次トークン予測ではなく反復的なノイズ除去を通じてテキストを生成する代替パラダイムとして登場し、シーケンス全体の並列的な洗練を可能にしました。多数の拡散ベースのアーキテクチャが提案されていますが、評価プロトコル、データセット、推論予算、生成ハイパーパラメータの違いにより、それらの能力を比較し、提供されるトレードオフを理解することが困難になっています。本研究では、最新のDLMの体系的な実験的分析を提示します。具体的には、推論、コーディング、翻訳、知識、構造化問題解決を網羅する8つのベンチマークで8つの最先端DLMを評価し、生成品質と計算効率の両方を明確に考慮します。下流タスクの評価を超えて、ノイズ除去ステップ、コンテキスト長、ブロックサイズ、並列アンマスキング戦略を含む、推論時間における主要因子の影響を分析し、大規模な実験を、同一条件下でトレーニングされた小規模モデルの制御された比較によって補完します。
arXiv cs.AI
2026年6月19日
REVEAL++:アルツハイマー病リスクの視覚言語網膜モデリングのための微分可能な表現型グルーピング網膜は、認知機能低下リスクに関連する微細な構造パターンを捉え、神経変性疾患への非侵襲的な窓を提供します。REVEALのような視覚言語アラインメントフレームワークは、網膜眼底画像と構造化された臨床リスク記述をペアにすることで、アルツハイマー病(AD)の早期予測を改善することが示されています。これらのアプローチにおける重要な設計上の選択は、表現型グルーピングの使用であり、リスクプロファイルが類似した個人が、対照学習中にマルチポジティブペアとして扱われます。しかし、既存の方法では、表現型の類似性を離散的な構成概念として具体化し、硬いグループ割り当てに依存しており、これは厳格な監視を課し、グループ形成を表現学習から切り離します。本研究では、対照学習における表現型構造の連続的な定式化を提案します。サンプルを固定クラスターに割り当てるのではなく、網膜画像とリスクプロファイルの両方におけるモダリティ内埋め込み類似性から導出される微分可能な重み付け関数として、被験者間の類似性をモデル化します。
arXiv cs.AI
2026年6月22日
NVIDIA Vera CPU、ロスアラモス国立研究所でエージェント型AI科学を推進ロスアラモス国立研究所は、科学研究の加速を目指し、HPEとNVIDIAが共同開発する次世代スーパーコンピュータ「Mission, Vision and Veritas」にNVIDIAの新型CPU「Vera」を採用すると発表しました。このスーパーコンピュータは、HPE Cray Supercomputing GX5000アーキテクチャとNVIDIA Vera Rubinプラットフォームを統合したもので、最新のCPU技術とAI処理能力を組み合わせることで、これまで困難だった複雑な科学的課題の解決を支援します。 特に、研究所ではVera CPUの性能を活かし、科学分野におけるエージェント型AIの活用を推進する方針です。エージェント型AIは、自律的に学習・判断し、複雑なタスクを実行する能力を持つことから、新たな科学的発見のペースを大幅に向上させることが期待されています。これにより、材料科学、気候変動モデリング、核融合研究といった多岐にわたる分野でのブレークスルーが加速される見込みです。 (NVIDIA Blog)
NVIDIA Blog
2026年6月22日
エクサスケール科学の姿を示すJUPITER、ISCで展示欧州初のスーパーコンピュータ「JUPITER」が、その先進的な性能と科学研究への貢献を国際的な舞台で披露します。ドイツのJülich研究センターに設置されたこのエクサスケール級システムは、NVIDIA Grace Hopper SuperchipsとInfiniBandネットワークを基盤として稼働。現在、4つの主要プロジェクトを通じて、エクサスケールコンピューティングがもたらす計り知れない可能性を実証しています。 これらのプロジェクトの成果は、スーパーコンピューティング分野における世界有数のカンファレンスであるISC(International Supercomputing Conference)で公開される予定です。JUPITERは、気候変動モデリング、新素材開発、創薬、そして宇宙科学など、多岐にわたる分野でのブレークスルーを加速させることを目指しています。エクサスケール時代の到来を告げるJUPITERの展示は、科学技術の新たな地平を切り拓く期待を集めています。(NVIDIA Blog)
NVIDIA Blog