TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月29日
ARから拡散へ:厳密に因果的で柔軟な地平線を持つ大規模言語モデルの効率的な適応拡散モデルは効率的な並列テキスト生成を約束していますが、双方向アテンションに依存しており、事前学習済みの自動回帰(AR)モデルとの構造的な不一致を生じています。この非互換性はロバストなAR事前知識の再利用を排除し、スクラッチからの禁止的な事前学習が必要になります。
arXiv cs.CL
2026年5月30日
センサーに音声を与える:セマンティック時系列埋め込みのためのマルチモーダルJEPAセンサーデータの解析に新たな手法が登場した。学習論文プラットフォームのarXivで公開された研究によると、Transformerアーキテクチャを活用した「CHARM」というモデルが開発され、多変量時系列データの処理において高い性能を示している。 このモデルの特徴は、センサーなどから得られる複雑なデータに対して、テキスト情報を組み合わせるマルチモーダル学習を採用している点である。具体的には、各センサーチャネルに対して自然言語による説明を付与することで、データの意味をより深く理解できる仕組みになっている。 実験結果では、異常検知・データ分類・将来値予測といった複数のタスクで優れた成果を上げたという。特筆すべきは、ノイズの多い実環境のセンサーデータに対しても堅牢性を保ち、同時にモデルの判断根拠が解釈しやすいという利点を兼ね備えている点である。さらに簡潔な学習手法でも強い性能を発揮でき、実用性が高いことが示唆されている。 この技術は、製造業や医療分野などセンサーデータが重要な産業への応用が期待される。
arXiv cs.LG
2026年6月2日
エージェント的Transformerが強化学習を通じた探索学習を証明可能に行う木探索は多くの言語エージェント推論および意思決定タスクの背後にある中心的な抽象化です。エージェントはアクションを探索し、失敗を記憶し、有望な代替案に向かってバックトラックする必要があります。しかし、Transformerベースのポリシーがこのような探索能力をどのように習得するかについて、理論的理解が不足しています。
arXiv cs.LG
2026年6月2日
デモンストレーションから報酬へ:VLM報酬モデルのためのテスト時プロンプト最適化強化学習は正確な報酬関数に依存しており、ロボティクスなどの実世界アプリケーションではしばしば手作業で作成されるか利用できません。最近の研究では、事前学習済みビジョン言語モデル(VLM)の零ショット推論能力を報酬モデルとして活用することが検討されていますが、慎重な調整なしに実施することは困難です。
arXiv cs.LG
2026年6月4日
Vision Transformerを用いた細粒度車両分類のためのオープンソース二段階コンピュータビジョンパイプライン自転車事故の重症度を予測する新たな取り組みが進められている。道路動画から車両を自動識別し分類するオープンソースシステムが開発されたもので、最新のコンピュータビジョン技術を活用している。 このシステムはRT-DETRとVision Transformerという2つの技術を組み合わせた二段階パイプラインで構成。乗用車やSUV、ピックアップトラックなど6種類の車両を自動的に識別できる。従来手法との大きな違いは、分類の信頼度が低い場合に未知の車両として扱う仕組みを備えている点だ。このアプローチにより、不確実な判定から生じる誤分類を防止し、より高い精度の予測が可能になる。 同研究は機械学習分野で注目を集める論文プラットフォームarXivに掲載されており、オープンソースとして公開されることで、他の研究機関での活用も期待されている。自転車利用者の安全向上に向け、AI技術の応用が広がっている。 (引用元:arXiv cs.LG)
2026年6月4日
Cerebras CEO、スケールでのAI推論提供について語るAI推論インフラの経済性に焦点 Cerebras Systemsのアンドリュー・フェルドマンCEOは、ブルームバーグ・テック2026でAI推論サービスの大規模提供における経済的課題について言及した。同社は、AIモデルの推論処理を効率的かつ低コストで配信するための戦略を展開している。 AI推論は、学習済みモデルを用いた予測処理を指しており、実応用では推論の処理効率と採算性が重要となる。フェルドマンCEOの発言から、Cerebrasが現在のAIインフラストラクチャの課題を認識し、スケール段階での推論提供に向けた独自のアプローチを模索していることが伺える。 業界では、AI技術の商用化が進む中、高い計算処理を低コストで実現できるインフラの整備が競争力の源となっている。同社の経営方針は、今後のAI推論市場の発展方向を示す動きとして注視される。 (出典:Bloomberg)
2026年6月5日
TailLoR: パラメータ効率的継続学習における主要成分の保護機械学習モデルの継続学習において、新たなパラメータ効率化手法が提案された。arXiv上で発表された「TailLoR」と呼ばれるこの手法は、複数のタスクを順序立てて学習する際に、モデルの性能を維持しながら計算量を削減するアプローチである。 TailLoRの特徴は、事前学習済みモデルの重要な特性を活用する点にある。既存モデルの基本的な構造を参考基準として固定し、そこからの微調整を行う仕組みで、新しいタスク学習時に以前習得した知識の損失を抑制する。 手法の核となるのはスペクトルペナルティと呼ばれる制御機構で、モデル更新時に重要な成分への悪影響を最小化する。同時に、スペクトル分解における低ランク部分への適応可能性を確保することで、新規タスクの学習効率を損なわないよう設計されている。 この研究は、限られた計算資源で複数タスクに対応する必要があるAI応用分野での実用化が期待される。パラメータ効率性と学習性能のバランスを取る課題に対する一つの解決策として注目されている。
arXiv cs.LG
2026年6月11日
DiffusionGemma: テキスト生成が4倍高速化Gemmaモデルを基盤とした新しいテキスト生成モデル「DiffusionGemma」は、標準的なTransformerベースのモデルよりも4倍速いテキスト生成を実現します。これは、拡散モデルのアーキテクチャをテキスト生成に適用することで達成され、特に長いテキストの生成において顕著なパフォーマンス向上が見られます。
Google DeepMind
2026年6月11日
ProHiFlo:階層的フローマッチングと関数的ガイダンスによる新規タンパク質生成de novoタンパク質生成は、治療薬設計、酵素工学、合成生物学において革新的な可能性を秘めています。拡散ベースおよびフローマッチングアプローチは進歩を遂げていますが、通常は単一解像度で動作し、機能的制約を組み込むメカニズムを欠いています。本稿では、3つの革新的な階層的フローマッチングフレームワークであるProHiFloを提案します。(1) 骨格構造をモデリングしてから全原子座標へと洗練させる粗視的から微視的への生成により、精度を維持しながら計算コストを削減します。(2) 事前学習済み予測器を活用した機能的ガイダンスにより、再学習なしで望ましい特性へと生成を誘導します。(3) 効率的なマルチスケール処理のための適応型SE(3)-同変アーキテクチャ。非条件付き生成、モチーフ足場構築、機能設計における実験は、4回のサンプリングステップを削減しながら、最先端のパフォーマンスを示しました。酵素活性部位の足場構築では、ProHiFloはRFDiffusionの41.2%に対し、58.9%の成功率を達成しました。
arXiv cs.LG
2026年6月16日
生理信号からのマルチモーダル感情認識のための深層時間モデリングとアンサンブル融合生理的ストレスと感情認識は、健康モニタリングと感情コンピューティングにおいて重要です。本研究では、手首と胸のセンサー信号を用いたマルチモーダル感情認識のためのWESADデータセットにおける、Long Short-Term Memory (LSTM)、Temporal Convolutional Networks (TCN)、Transformerなどの深層学習モデルの包括的な評価を提示します。手首のみ、胸のみの入力でモデルをトレーニングすることにより、各モダリティの個別の貢献度を評価するためにアブレーションスタディを実施します。さらに、マルチモーダル入力でトレーニングされた3つのアーキテクチャすべての予測を組み合わせる、レイトフュージョンアンサンブル戦略を実装します。また、各モデルに入力する前に手首と胸の信号を連結することにより、センサーレベルでの早期融合も採用します。結果は、Transformerモデルがマルチモーダル設定で一貫して最も高い精度を達成する一方、TCNモデルが手首のみの構成で最良のパフォーマンスを発揮することを示しています。
arXiv cs.CL
2026年6月16日
機械学習を用いた生体信号による試験結果予測本研究では、試験中に収集された生理学的データを用いて試験結果を予測するために、機械学習モデルの応用を調査します。皮膚電気活動、心拍数、皮膚温などの生理学的ストレス指標を分析し、学業成績との関連性を明らかにしました。ロジスティック回帰、ランダムフォレスト、サポートベクターマシンなどの標準的なモデルから、Transformer、LSTM(Long Short-Term Memory)、GRU(Gated Recurrent Unit)モデルなどのより高度なアーキテクチャまで、さまざまな機械学習アプローチが採用されました。この多様性は、データ内の複雑な相互作用を効果的に捉えることを目的としています。Transformerの数値データ処理への適応性を評価し、この新しい文脈におけるパフォーマンスを評価することに重点が置かれました。モデルの有効性を比較するために、精度、適合率、再現率、F1スコアなどの標準的なパフォーマンスメトリックが使用されました。
arXiv cs.LG
2026年6月16日
Nemotron 3 Ultra:エージェント推論のためのオープンで効率的なMixture-of-ExpertsハイブリッドMamba-Transformerモデル5500億の総パラメータと550億のアクティブパラメータを持つMixture-of-ExpertsハイブリッドMamba-Attention言語モデル「Nemotron 3 Ultra」を紹介します。Nemotron 3 Ultraは20兆トークンのテキストで事前学習され、その後コンテキスト長を100万トークンに拡張し、教師ありファインチューニング(SFT)、強化学習(RL)、マルチティーチャー・オンポリシー蒸留(MOPD)を用いて事後学習されました。Nemotron 3 Ultraは、LatentMoE、マルチトークン予測(MTP)、NVFP4事前学習、マルチ環境RLVR、MOPD、推論バジェット制御といった複数の主要技術を採用した、これまでにない最も高性能なモデルです。Nemotron 3 Ultraは、最先端の公開LLMと比較して最大約6倍高い推論スループットを達成しながら、同等の精度を実現しています。最先端の精度、高い推論スループット、100万トークンのコンテキスト長により、Nemotron 3 Ultraは長期間実行される自律エージェントタスクに最適です。
arXiv cs.CL
2026年6月16日
AIエングラム:人工知能における記憶痕跡の探求記憶形成は知能の根幹をなすが、ディープニューラルネットワークが生物学的記憶単位に類似した識別可能な記憶痕跡を保持するかどうかは未解決の問題である。本研究では、特異性、再活性化、十分性、必要性という神経科学的基準を制約付き逆問題として形式化することにより、そのような「AIエングラム」を識別するための幾何学的フレームワークを導入する。グローバルに絡み合ったパラメータから個々の記憶痕跡を分離する閉形式推定器を導出し、この生物学的に導出された解がパラメータ多様体上の自然勾配更新に対応することを示す。AIエングラムは、学習済み知識の外科的操作を可能にする。反復最適化なしに、線形算術演算によって任意のサブセットの記憶を合成または消去できる。単純なMLPからLLMに至るまでの実験は、AIエングラムの因果的妥当性と実質的なスケーラビリティを実証する。これらの結果は、生物学的記憶の理論と人工表現学習の間の橋渡しをし、ディープネットワークが分散ストレージ内で機能的特異性を同時にどのようにサポートするかについての幾何学的洞察を提供する。
arXiv cs.AI
2026年6月17日
薬物警戒における因果推論におけるモデル選択の重要性:InferBERTフレームワーク内での分類モデルの比較分析因果関係のある有害薬物事象(ADE)を偽相関から区別することは、薬物警戒における中心的な課題です。InferBERTフレームワークは、TransformerモデルとDo-calculusを統合していますが、その成功は基盤となる分類モデルに依存します。本研究では、InferBERTにおけるモデル選択の影響を評価し、単純なモデルで十分か、ドメイン固有の事前学習が役立つか、LLMへのスケーリングが因果検出を改善するか、事後キャリブレーションの効果を検証します。分析対象は、Analgesics-induced Acute Liver Failure (AILF) と Tramadol-related Mortalities (TRAM) の2つのベンチマークです。XGBoost(ベースライン)、ALBERT(元のInferBERT)、BioBERT(生物医学Transformer)、Med-LLaMA(医療LLM)の4つのモデルを、20回の繰り返しで5分割交差検証を用いて評価しました。
arXiv cs.LG
2026年6月17日
デジタルツインシミュレーションによる治療応答最適化臨床意思決定支援AIシステム臨床意思決定支援AIシステム(CDSAS)は、厳格な安全制約を遵守しながら、刻々と変化する患者の状態にリアルタイムで適応する必要があります。本研究では、治療効果(TE)推定、治療経過シミュレーションのための患者デジタルツイン(DT)、逐次意思決定のための強化学習(RL)を統合したオンライン適応フレームワークを提案します。AIシステムは、まず過去の医療記録で訓練され、継続的な学習ループで運用されます。安全性を確保するため、ルールベースのモジュールがバイタルサインを監視し、禁忌の治療をブロックします。内部モデルの不一致が強いケースは、臨床医のレビューのためにフラグが立てられ、実験では事前学習済みアウトカムモデルを介してシミュレートされます。本フレームワークは、合成臨床シミュレータとCancer Genome Atlas(TCGA)からの実際の卵巣がんデータセットの両方を使用して検証されます。シミュレーションおよび臨床設定の両方において、提案手法は標準的な計算ベースラインと比較して、治療法の推奨において優れた有効性と安定性を示しました。
arXiv cs.AI
2026年6月18日
人工ニューラルネットワークにおける衝撃波理論と対称性削減確率的勾配降下法の関連性微分幾何学、リー群論、流体力学に基づき、衝撃波理論と確率的勾配降下法の対称性商化学習ダイナミクスとの間の数学的に明確な関連性を開発しました。具体的には、パラメータ対称性を商化し、局所エントロピー粗視化を適用すると、有効ダイナミクスは商多様体上の粘性ハミルトン--ヤコビ方程式を満たします。さらに、生パラメータダイナミクスが商化空間上の勾配場によって要約できると仮定すると、粗視化された損失関数の勾配はバーガース型方程式に従い、衝撃形成を厳密に確立できます。この理論を多層パーセプトロン、畳み込みニューラルネットワーク、Transformer、平均場ネットワークに適用し、それらがハミルトン--ヤコビまたはバーガース型方程式に従うことを示しました。このフレームワークは、深層学習の実用的な診断も提供すると推測しています。Transformerのようなアーキテクチャでは、生パラメータノルムは対称性冗長性によってしばしば歪められ、誤解を招く可能性がありますが、対称性補正された商観測量は、トレーニングフェーズ遷移の監視、予測、制御のための原理的な基盤を提供します。
arXiv cs.LG
2026年6月19日
OpenAI、IPOに向け大物人材を獲得OpenAIは、IPOを前に、Transformerの共同発明者であるGoogle DeepMindのノーム・シェーザー氏と、トランプ政権のAI政策担当者であったディーン・ボール氏を同じ週に迎え入れ、組織を強化している。
TechCrunch
2026年6月24日
ModTGCN:テキスト分類のためのモジュラリティを考慮したグラフニューラルネットワークグラフベースのテキスト分類モデルは、通常、局所的な近傍集約に依存し、意味的な文書グラフが強力なクラス一致クラスタリングを示すにもかかわらず、グローバルなコミュニティ構造を見落としています。これを無視すると、クラス境界が不明瞭になり、過度の平滑化につながる可能性があります。本稿では、クロスエントロピーとモジュラリティベースの補助目的を共同で最適化し、クラスに一致する文書コミュニティを促進すると同時に、識別表現を維持する、テキスト分類のためのモジュラリティを考慮したグラフニューラルネットワークであるModTGCNを提案します。モジュラリティ項は、トランスフォーマー埋め込み(事前学習済みまたはファインチューニング済み)から派生した文書間類似性グラフで計算されます。スケーラビリティを向上させるために、元の異種TextGCNグラフを文書-単語および単語-単語の個別のコンポーネントに分離し、トレーニング速度を2倍から10倍向上させました。さらに、モジュラリティ最適化のためのグラフ構築戦略、ラベルを意識したエッジ再重み付け、および監視の選択について研究します。
arXiv cs.CL
2026年6月24日
3D分子表面の指紋を解読し、正確なエピトープ予測を実現分子表面は、抗体-抗原認識を決定する幾何学的・物理化学的パターンをエンコードしており、エピトープ予測の中心となる。しかし、既存の手法は配列やバックボーン構造に依存しており、不連続な表面駆動型エピトープを捉えるのが難しい。本研究では、分子表面表現を直接扱う表面中心の学習フレームワークであるSurfBindを提案する。SurfBindは、パッチレベルの表面モデリング、バインダー認識型クロスアテンション、階層的な粗視的-微視的予測パラダイムを備えたTransformerベースのアーキテクチャを通じて、幾何学的・物理化学的手がかりを統合する。SAbDabやDB5.5などの困難なエピトープ同定ベンチマークでの実験により、SurfBindは最先端の性能を達成し、未知の抗体や構造状態に対しても強い汎化能力を示すことが証明された。これは、タンパク質-タンパク質相互作用の重要なメカニズムを理解するために、相互作用認識型の表面モデリングがいかに価値があるかを強調するものである。
arXiv cs.LG
2026年6月24日
ニューロシンボリック・ドライブ:運転VLAのためのルール根拠に基づく忠実な推論連鎖思考(CoT)推論を組み込んだ運転VLAモデルは、事前学習済みのVLM表現を活用し、中間的な決定を自然言語で提示するため魅力的ですが、現在の根拠は、計画された動作と因果的に関連付けられるステップバイステップの決定セマンティクスを欠いていることがよくあります。本稿では、古典的なルールベースプランナーから直接抽出されたルール根拠に基づく推論トレースで運転VLAを監視するニューロシンボリック運転フレームワーク「Neuro-Symbolic Drive」を提案します。我々の重要な発見は、ルールベースプランナーがすでに実行可能な推論エンジンとして機能するシンボリックAIシステムであるということです。それらはアクティブな安全制約について推論し、候補となる操作を探索し、最終的な軌道を選択します。我々は、シミュレーションでこれらのプランナーを計測し、実行された軌道と各ルール評価ステップでの内部決定トレースの両方をキャプチャします。各トレースは構造化されたルール根拠に基づく推論にシリアライズされ、軌道とペアになってQwen3.5-4Bを運転VLAとしてファインチューニングします。
arXiv cs.AI
2026年6月24日
「Transformerの最大475倍」 富士通、GPUを効率的に使うLLMアーキテクチャ「PHOTON」開発富士通が、大規模言語モデル(LLM)を少ないGPUで動かせる新アーキテクチャ「PHOTON」(フォトン)を開発した。GPU当たりの処理性能(スループット)が、現在のLLMで主流のアーキテクチャ「Transformer」の最大475倍に達するという。
ITmedia AI+
2026年6月24日
「Transformerの最大475倍」 富士通、GPUを効率的に使うLLMアーキテクチャ「PHOTON」開発(ITmedia NEWS)富士通は6月24日、大規模言語モデル(LLM)を少ないGPUで動かせる新アーキテクチャ「PHOTON」(フォトン)を開発したと発表した。GPU当たりの処理性能(スループット)が、現在のLLMで主流の
Yahoo!ニュース IT
2026年6月25日
NVIDIA NeMo AutoModelによるTransformerのファインチューニング高速化Transformerモデルのファインチューニングを高速化するNVIDIA NeMo AutoModelについて。
Hugging Face
2026年6月25日
富士通がAI効率を475倍にするTransformer代替アーキテクチャ「PHOTON」を開発2026年6月24日、富士通が大規模言語モデル(LLM)の大幅なコスト削減を実現するアーキテクチャ「Parallel Hierarchical Operation for TOp-down Networks(PHOTON)」を発表しました。
はてなブックマーク IT
2026年6月25日
プロジェクト・オートワールド:ニューラル関係推論の自動ベンチマークに向けて関係構造に関する推論は、ニューラルモデルにとって依然として大きな課題であり、特に学習した知識を訓練時よりも難しい問題インスタンスに体系的に適用しなければならない場合に顕著です。この一般化能力の評価の難しさから、進歩は妨げられています。なぜなら、事前には、何がインスタンスを難しくしているのかはほとんど明らかではないからです。本研究では、大規模言語モデル(LLM)を使用してベンチマーク生成を自動化し、エンドツーエンドでますます挑戦的なインスタンスを生成することを学習することによって、この問題にどのように対処できるかを調査します。具体的には、Datalogルールによってパラメータ化されたワールドと、推論評価者としてのEdge Transformerが与えられた場合、LLM主導の進化的探索(FunSearchに基づく)と自律的なエージェント探索を使用して、困難な問題インスタンスを生成するサンプリング関数を発見します。また、このデータを使用してEdge Transformerを改善できることも示しており、さらなるデータ摂動に対してうまく一般化します。
arXiv cs.AI
2026年6月25日
学習済み表現において保存則はいつ成り立つのか?潜在世界モデルのための認定ホライズン物理世界モデルに関する表現学習の疑問、すなわち、モデルが潜在表現を学習した後、保存則はいつ認定可能であり続けるのか、という問いを立てます。認定ホライズンとは、測定可能なモデルの欠陥から、あらかじめ、物理的invariantのレベルセットに証明可能に留まるロールアウトのステップ数を上限するものです。重要な設計選択は、何が認定されるかです。これは、学習済みの潜在ハミルトニアンや学習済みスカラー証人(モデルはいずれかを保存しながら真のエネルギーでドリフトする可能性がある)ではなく、潜在状態をデコードし既知のinvariantを評価することによって得られるデコードされた物理的invariantです。このオブジェクトを中心に、シェルホライズン証明を導出します。その予算は、表現、読み出し、潜在ダイナミクスの欠陥に分解され、ソフト学習済み証人を介してデコードされたinvariantの認定ホライズンを生成するモノトーンアライメントブリッジを介して、保存系における状態、学習済みリフト、ピクセル観測でテストします。
arXiv cs.LG
2026年6月28日
富士通、Transformerと比べ475倍効率な新LLMアーキテクチャ「PHOTON」を発表(ビジネス+IT)富士通は24日、大規模言語モデル(LLM)の推論にかかる計算効率を向上させる新アーキテクチャ「PHOTON」を発表した。理化学研究所などとの共同開発によるもので、従来のTransformerアーキテ
Yahoo!ニュース IT
2026年6月29日
発達的アプローチがニューラル言語モデルの統計的学習を解明:Transformerは最も抽象的な統計パターンから一般化する本研究では、発達的アプローチを用いて、ニューラル言語モデル(NLM)の統計的学習と精神的表現を調査する。一連のGenerative Transformerモデルを合成文法で学習させる。モデルの状態は、学習の過程で複数の段階で保存される。学習パスにおけるこれらのモデルの内部表現の変化を分析した結果、NLMは学習の初期段階で最も抽象的なグローバル統計知識を獲得し、その後、比較的局所的な統計的依存関係を獲得することがわかった。この学習パスには、最初から多くの過剰一般化が含まれており、これらの過剰一般化は学習の後期段階で徐々に制約される。この観察に基づき、NLMの統計的学習と言語認知を説明する新しいフレームワークを提案する。
arXiv cs.CL
2026年6月29日
地上反復言語計画:パラメータ化された世界モデルがLLMエージェントの幻覚伝播をいかに低減するか言語エージェントの世界モデルには、2つの有用な形式があります。エージェントベースの世界モデルはLLM APIを呼び出し、言語で柔軟に推論しますが、そのエラーは通常の回帰損失でスコアリングするのが難しい幻覚状態変化として現れます。パラメータ化された世界モデルは、学習済みの遷移予測器であり、そのエラーはNodeMSE、デルタ精度、妥当性精度などの量で測定しやすいですが、通常はスタンドアロンプランナーとしては弱いです。これらの2つのファミリーを4つのグラフ構造計画ベンチマークで比較し、エージェントベースの場合の運用上の幻覚メトリクスを導入します。この比較により、少数のパラメータ化されたバックボーンのみをトレーニングし、APIベースのエージェント推論と組み合わせる extbf{地上反復言語計画}(GILP)が動機付けられます。バックボーンは有効なアクション、予測された状態デルタ、リスク、値を提供し、LLMはアクションと想像されたデルタをドラフトし、一貫性ゲートは両者が disagreement した場合に修正を求めます。
arXiv cs.AI
2026年6月29日
Prism Transformer: 階層的アテンション処理のためのプログレッシブヘッドスケジューリング従来のマルチヘッドアテンションでは、隠れ次元をすべてのヘッドに各層で等しく分割し、モデルの深さ全体で同一の表現部分空間次元(dh = dmodel/h)を強制していました。本研究では、この均一な割り当てを根本的な構造的ボトルネックとして特定しました。次元空間が制限されているため、初期層のヘッドは複雑で高次元の文脈パターンを忠実に捉えることができません。これを解決するため、静的で均一なヘッド構成をプログレッシブヘッドスケジューリングに置き換える新しいアーキテクチャパラダイムであるPrism Transformerを導入します。層を重ねるごとにヘッド数を単調に増加させることで、Prism Transformerは自然に局所から大域への表現階層を確立します。初期層は、より少なく例外的に幅の広いヘッドを活用して複雑な局所的構成パターンを捉える一方、深い層は多くの狭いヘッドを展開してこれらのパターンを専門的な言語的特徴に分解します。
arXiv cs.LG