TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月9日
スパーサー、高速、軽量なトランスフォーマー言語モデルトランスフォーマー言語モデルの実用化に向けた新たな技術開発が加速している。Sakana AIの研究によれば、モデルの構造を最適化することで、計算負荷を大幅に削減しながら性能を維持することが可能になりつつあるという。 具体的には、ニューラルネットワークの一部の接続を不要な部分として削減する「スパース化」と、モデル全体を軽量化する技術を組み合わせることが有効であると指摘されている。これらの手法により、処理速度が向上し、必要な計算リソースが削減されるメリットがある。 言語モデルの大規模化が進む一方で、実装には膨大な計算力が必要という課題があった。今回の技術は、より少ないリソースで高い精度を保つ可能性を示唆しており、スマートフォンなどの環境でも効率的に利用できるモデルの開発につながると期待されている。 今後、こうした効率化技術がAI活用の幅広い展開を促進する重要な基盤になると考えられる。 (引用元:Sakana AI)
2026年5月29日
安定性-表現性ギャップの橋渡け: 低資源音声言語モデルの合成データスケーリングと優先度調整音声言語モデル(SLM)は明示的な音素グラフ変換パイプラインをバイパスすることで音声合成の有望なパラダイムとして出現しています。ただし、低資源言語での有効性は転記済み音声の不足によって根本的に制限されています。実践では、合成データが重要になっています。
arXiv cs.CL
2026年5月29日
認知圏論トランスフォーマー:言語モデリングのための圏論的帰納的バイアス認知圏論トランスフォーマー(CCT)は3億600万パラメータのアーキテクチャで、事前学習されたGPT-2 Smallバックボーンを圏論から導出された認知的に根拠のあるコンポーネント、および認知科学からのいくつかのインスピレーションで拡張しています。マッチドステップ・プロトコル下(215,000最適化ステップ)で...
arXiv cs.AI
2026年5月29日
すべてを支配するマスク:編集後の隠れた事実とそれらを見つける方法ROMEやMEMITなどのナレッジ編集手法は、MLPの重みを変更することでトランスフォーマーモデル内の事実的関連付けを更新します。主に出力行動によって評価されていますが、内部メカニズムは未だに十分に検討されていません。本研究では、編集がどの事実が対象であるかに関係なく共通のメカニズムに依存しているかどうかを調査します。
arXiv cs.LG
2026年5月29日
初音ミク公式YouTubeチャンネル「39ch」の新作オリジナルMV『Cocho Cocho / 鬱P feat. 初音ミク』公開!初音ミク公式YouTubeチャンネル「39ch」が、プロデューサー鬱Pとのコラボレーション新曲『Cocho Cocho』のMVを公開しました。デジタルアイドル初音ミクは登場から18年を経て、技術デモから独立した創作エコシステムへと進化しており、今回のMV公開は音声合成技術が人間のミュージシャンと対等なコラボレーターとなったことを示しています。ボーカロイドの台頭により、従来の音楽産業における歌手と作曲家の非対称な権力構造が揺らぎ、複数のクリエイターが「声」を重層的に利用することで創作者の個性がより強調される新たな構造が生まれています。この動きは日本の文化的資産の国際展開戦略として位置付けられ、グローバル市場でのAIアーティスト認知向上と音楽制作の民主化をもたらす可能性があります。
PR TIMES
2026年6月1日
HADT: 自律型地球観測衛星クラスター向けの異種マルチエージェント差分トランスフォーマー本論文は、光学およびSAR衛星を含む地球観測ミッションを実施する異種衛星クラスターにおける自律的なリソース管理の問題に対処し、自動運用モードでは衛星に知的能力を備える。
arXiv cs.AI
2026年6月1日
パディング付きトランスフォーマー表現力の再検討:どのアーキテクチャの選択が重要でどれが重要でないのかarXiv:2605.30523v1発表タイプ:新規 概要:最近の研究では、トランスフォーマーがブール回路との接続を通じて計算できること・できないことを説明しているが、既存の結果は正確な特性化を欠き、モデリング選択に対して敏感である。パディング付きトランスフォーマー――入力に「...」などのフィラー記号が追加される――は有用なツールとして出現している。
arXiv cs.LG
2026年6月2日
オンラインコミュニティにおけるうつ病の認知言語指標:DistilBERTと holographic Reduced Representationによる分析本論文では、認知的に根拠のある言語的特徴とトランスフォーマーベースの埋め込みを組み合わせることで、オンラインテキストにおけるうつ病の自動検出が改善されるかどうかを調査しています。ベックの認知抑うつ理論を使用して、認知的歪みを測定可能な特徴として抽出します。
arXiv cs.CL
2026年6月2日
ユニバーサル・クォンタム・トランスフォーマーarXiv:2606.00045v1発表タイプ:新規 抄録:古典的な連続空間ニューラルネットワークは、モジュロ演算や非可換代数などの厳密な数学的対称性にロックインするのに本質的に苦労している。これらの離散的な論理規則を近似するために、しばしば膨大なパラメータスケーリングに頼り、その後でも確率的不安定性をもたらす。
arXiv cs.AI
2026年6月2日
DAStatFormer: DASベースのパターン認識のための統計特徴統合を備えたハイブリッド多分岐トランスフォーマー分散音響センシング(DAS)は光ファイバーを通じた大規模監視を実現しますが、その高次元性と複雑な時空間パターンがイベント分類を困難にします。既存の深層学習アプローチ(CNN、リカレントモデル、トランスフォーマー変種)は長期的なパターンの捕捉に失敗しています。
arXiv cs.LG
2026年6月5日
「トランスフォーマーニューレジェンズ」で「ギガストーム」が11月下旬発売!(HOBBY Watch)タカラトミーは、「トランスフォーマーニューレジェンズ」シリーズからアクションフィギュア「NL-04 ギガストーム」を11月下旬に発売する。価格は41,800円。6月5日より予約受付が開始される。
Yahoo!ニュース エンタメ
2026年6月5日
「トランスフォーマー ミッシングリンク」で「ラチェット」が登場!12月下旬発売(HOBBY Watch)タカラトミーは、「トランスフォーマー」シリーズより、可動フィギュア「ミッシングリンク C-15 ラチェット」を12月下旬に発売する。価格は16,500円。 仮想復刻版「ミッシングリンク」シリーズ
Yahoo!ニュース エンタメ
2026年6月8日
寝不足になるほど面白い ローカルAIと音声合成をつないだら、キャラが普通にしゃべり始めた (1/5)日本語に特化して開発されているTTSモデル(Text-to-Speech、テキストから音声)の「Irodori-TTS v3」が話題になっています。最近、様々なTTSが登場しているのですが、アナウンサー的な話し方のTTSが多いなか、このモデルは、より幅広い感情表現ができ、演技までできるうえに、生成速…
はてなブックマーク IT
2026年6月19日
ITNet: 畳み込み、アテンション、再帰を包含する学習可能な積分変換畳み込みネットワーク、再帰ネットワーク、トランスフォーマーは、それぞれ異なる帰納的バイアス(局所性、逐次メモリ、コンテンツ依存のペアワイズ相互作用)をエンコードしており、その誕生以来、数学的に区別されてきた。本研究では、この断片化は、信号の処理方法における根本的な多様性を反映するのではなく、単一の基盤となる数学的オブジェクト、すなわち学習可能な積分変換の不完全な見方であることを示す。我々は、位置と特徴の両方に依存する学習可能なカーネルを中心に構築された統一アーキテクチャ、Integral Transform Network (ITNet) を紹介する。このカーネルは、ペアワイズ相互作用をモデル化する小さなニューラルネットワーク、具体的にはMLPとして実装されており、モデルがデータからその動作を適応させることを可能にする。畳み込み、自己アテンション(マルチヘッドを含む)、自己回帰再帰(LSTM、GRU、S4、Mambaを含む)が適切なパラメータ化の下で特殊なケースとして現れること、そしてITNetが連続演算子の普遍的近似器であることを示す。
arXiv cs.AI
2026年6月23日
大規模なアクティベーションはアーキテクチャ的に堅牢:制御されたスクラッチ/コミットメント残留ストリームテスト訓練されたトランスフォーマーは、中央値よりもはるかに大きな値を持つ少数の隠れ次元で、シーケンス開始トークンに集中する大規模なアクティベーションを確実に発達させます。これらの外れ値が、残留ストリームの過負荷になった読み書きの役割の除去可能なアーティファクトなのか、それとも機能的な必要性なのかは活発に議論されています。アーキテクチャ的介入により、アーティファクト仮説を直接テストします。 Ledger Residuals というアーキテクチャは、残留ストリームを、中間計算が自由に上書きできる変更可能なスクラッチストリーム(Deliberation)と、モデルが読み出す表現を保持する保護されたデコード専用アキュムレータ(Commitment)に分割します。大規模なアクティベーションが、1つのストリームがスクラッチパッドと回答の両方になることを強制される場合にのみ存在するのであれば、専用の回答チャネルがあればそれらを削除できるはずです。しかし、そうではありませんでした。
arXiv cs.LG
2026年6月23日
感情分析から実践的な洞察へ:先進航空モビリティのデータ駆動型パブリックセンチメント分析先進航空モビリティ(AAM)は、新興の低高度航空輸送システムであり、その成功には技術的進歩だけでなく、一般市民の受容も不可欠です。この受容は、政府の支援、規制、騒音基準、そして飛行意欲を左右し、ひいてはAAMの商業的実現可能性全体に影響を与えます。そのため、AAMに対する一般市民の感情を理解することは、社会的な障壁を特定し、導入戦略を形成するために不可欠です。本研究では、RedditとQuoraから収集された306,009件の人間によるテキストをAIベースのモデルを用いて分析し、AAMに関する公共の議論を調査します。複数のセンチメント分析モデルが存在するため、信頼性の高いAAMセンチメント予測と公衆意見分析には、最も正確なモデルを特定することが重要です。そこで、レキシコンベース、機械学習、ディープラーニング、トランスフォーマーベースのアプローチ spanning 7つのモデルをAAM固有のセンチメント分類で評価しました。ModernBERTが最高の分類性能を達成し、データセット全体にラベル付けするために使用されました。
arXiv cs.CL
2026年6月23日
EmoInstruct-TTS:デュアルパス命令誘導型感情音声合成命令ベースの制御可能な音声合成により、ユーザーは自然言語で感情を指定できます。しかし、既存のアプローチはしばしば粗い感情ラベルに依存し、詳細な強度モデル化を欠いています。本研究では、感情音声合成のためのデュアルパス命令誘導型フレームワークであるEmoInstruct-TTSを提案します。詳細なカテゴリや強度レベルを含む48の感情状態をカバーする教師あり意味音響感情埋め込みであるEmotion2embedを導入します。自由形式の指示から埋め込みを推論するために、音響的に裏付けられた感情表現を生成するInstruction-Conditioned Emotion Flow Model(ICE-Flow)を設計します。推論された埋め込みは、意味計画を維持しながら明示的な感情制御を提供するLLMベースの合成パイプラインに統合されます。実験により、強力なベースラインと比較して感情制御性と音声自然性が向上することが示されています。
arXiv cs.CL
2026年6月23日
NeuroShield:EEG認証のためのデバイス非依存型基盤モデルEEG認証における中心的な課題は、モデルが通常、学習された取得設定に縛られていることです。特に、ヘッドセットハードウェア、チャネルレイアウト、信号時間のばらつきは、既存のモデルが対応できない異種混合の記録を作成し、新しいヘッドセットやデータセットごとに個別のモデル開発問題として扱われる原因となります。この断片化は、マルチデータセット学習を制限し、知識移転を妨げ、モデルの再利用性を低下させます。この制限に対処するため、我々は、デュアルステージトランスフォーマーアーキテクチャを介して、可変チャネルおよび可変長のEEG記録から識別性の高い埋め込みを学習する、EEG認証のための再利用可能な基盤モデルNeuroShieldを提案します。NeuroShieldは、15,762人の被験者と28,116セッションで構成される3つの公開EEGデータセットで事前学習され、2つの未知の下流データセットで転移学習を評価しました。評価によると、ファインチューニング後、NeuroShieldは最先端技術と比較して等価エラー率を0.44〜8.06パーセントポイント削減します。
arXiv cs.LG
2026年6月24日
言語モデルエージェントはメカニズム解釈における回路説明に役立つか?メカニズム解釈は、回路の自動的な特定において大きな進歩を遂げましたが、特定されたコンポーネントが何をするかの説明は、依然として手間がかかり、標準化が困難です。本研究では、回路が特定された後、言語モデル(LM)エージェントがこの説明問題の支援となるかどうかを調査します。163個のコンポーネントレベルのアノテーションを持つ84個の半合成トランスフォーマー回路から構築された、回路説明のためのベンチマークであるAgenticInterpBenchを導入します。観察、仮説生成、因果検証の反復ループを通じて各コンポーネントを分析し、最終的にコンポーネントレベルの説明と回路レベルのタスク説明を生成するエージェント型説明ツールHyVE(Hypothesize, Validate, Explain)を提案します。4つのLMバックボーンにわたるHyVEは、有用なコンポーネントレベルおよびタスクレベルの説明を回復しますが、どのバックボーンも一様に最良ではありませんでした。
arXiv cs.AI
2026年6月24日
製品の望ましさに関する数値的・分類的隠れた感情分析の効率性と説明可能性のためのLLM利用評価定性的な製品フィードバックはニュアンスのあるユーザー体験を明らかにしますが、その隠れた感情を測定することは困難です。本論文では、大規模言語モデル(LLM)を使用して、このようなデータから製品の望ましさを定量化する、スケーラブルで解釈可能なフレームワークを提案します。ZORQとCARMAの2つのProduct Desirability Toolkit(PDT)データセットを使用し、106の回答者タームグルーピングをゴールドスタンダードの人間によるアノテーションで評価し、明示的なレビュー評価に依存せずに、ゼロショット連続数値感情スコアリングとカテゴリ感情分類を評価します。データセット全体で、LLMは定性的な回答から直接数値感情スコアを生成し、専門家のラベルに非常に近く、ピアソン相関係数は最大0.97、分類精度は最大94%を達成しました。LLMは、複数の形式で提示されたデータを処理しても堅牢性を維持し、一貫して高い信頼性を示しました。対照的に、辞書ベースおよびトランスフォーマーベースラインでは統計的に有意な結果は得られませんでした。
arXiv cs.CL
2026年6月24日
ModTGCN:テキスト分類のためのモジュラリティを考慮したグラフニューラルネットワークグラフベースのテキスト分類モデルは、通常、局所的な近傍集約に依存し、意味的な文書グラフが強力なクラス一致クラスタリングを示すにもかかわらず、グローバルなコミュニティ構造を見落としています。これを無視すると、クラス境界が不明瞭になり、過度の平滑化につながる可能性があります。本稿では、クロスエントロピーとモジュラリティベースの補助目的を共同で最適化し、クラスに一致する文書コミュニティを促進すると同時に、識別表現を維持する、テキスト分類のためのモジュラリティを考慮したグラフニューラルネットワークであるModTGCNを提案します。モジュラリティ項は、トランスフォーマー埋め込み(事前学習済みまたはファインチューニング済み)から派生した文書間類似性グラフで計算されます。スケーラビリティを向上させるために、元の異種TextGCNグラフを文書-単語および単語-単語の個別のコンポーネントに分離し、トレーニング速度を2倍から10倍向上させました。さらに、モジュラリティ最適化のためのグラフ構築戦略、ラベルを意識したエッジ再重み付け、および監視の選択について研究します。
arXiv cs.CL
2026年6月25日
密な教師信号だけでは不十分:ループ型言語モデルにおける読み出しの盲点ループ型言語モデルは、隠れ状態をランタイム状態に変換します。各状態は予測のためにデコードされ、将来の計算にフィードバックされます。これにより、基本的な教師信号の問題が生じます。クロスエントロピーは実際にどの状態変数を制御するのでしょうか?我々は、密なループごとのクロスエントロピーが、リカレント遷移でアクティブな全ての変数を制御するのではなく、読み出しによって公開される変数を制御することを示します。隠れ状態のスケールは、具体的な失敗モードをもたらします。RMSNormやLayerNormのようなスケール不変の読み出しは、直接的なクロスエントロピー損失からラジアルスケールを隠蔽しますが、プリノーム残差リカレンスは同じスケールを保持および更新し続けます。したがって、ループごとの損失は、リカレントスケールを制御せずに早期終了を可能にします。44Mおよび129Mのループ型トランスフォーマーで、ループ間正規化なしの場合、RMSNorm読み出しによるループごとのクロスエントロピーは、依然として最終的な隠れ状態のノルムを数千または数万に押し上げます。
arXiv cs.LG
2026年6月25日
エージェント型AIへのガイド:基礎からシステムまで「エージェント型AIへのガイド」は、自律型AIシステム構築のための包括的な実践者向けリファレンスです。本書は、最初の原則から本番展開までのフルスタックを網羅しており、優れたエージェント型システムを構築するには、パイプラインの単一のレイヤーだけでなく、すべてのレイヤーを理解する必要があるという中心的なテーゼを中心に構成されています。まず、LLM基盤(トランスフォーマーアーキテクチャ、GPUシステム、トレーニングとファインチューニング(SFT、LoRA、MoE)、モデル圧縮、推論最適化)を、主要な焦点ではなく、不可欠な基盤として扱います。次に、アライメントと推論レイヤー(RLHF、PPO、DPOとそのバリアント、GRPO、報酬モデリング、チェーン・オブ・ソートやテストタイムスケーリングを含む大規模推論モデルのためのRL)を開発します。後半は、エージェント型AIそのものに充てられています。
arXiv cs.AI
2026年6月26日
位相情報を用いたニューラルネットワークによる光学・合成開口レーダー画像での洪水検知世界中で頻繁に発生する洪水の迅速かつ正確な検知は、緊急対応と人的・経済的損失のタイムリーな軽減に不可欠です。衛星データの利用拡大と人工知能の進歩は環境ハザードの監視を強化していますが、光学衛星画像は雲によって隠されるため、多くの洪水イベントは検知が困難なままです。RambourらはSEN12-FLOODデータセットを導入し、ResNet-50畳み込みニューラルネットワークバックボーンを使用して画像ごとの特徴を抽出し、それらをゲート付き再帰ユニットネットワークに供給することで、単一画像ベースラインと比較して時間的情報が精度を大幅に向上させることを示しました。最近では、Chamatidisらも、ビジョントランスフォーマーが一般的な畳み込みアーキテクチャで高い性能を達成できることを示しました。しかし、これらのモデルは通常、不透明なブラックボックスとして機能するため、特にリモートセンシングのような安全性が重要視される分野では、その決定境界、学習された特徴、および内部の推論を解釈することが困難です。
arXiv cs.LG
2026年6月26日
HierBias:マルチタスクタイプ分類による文脈条件付き階層的メディアバイアス検出メディアバイアス検出は、公正でバランスの取れた情報伝達を保証するための重要なタスクですが、既存の文レベルのアプローチは各文を独立して分類し、人間の注釈者が自然に活用する文間コンテキスト信号を無視しています。本研究では、バイアス予測において文書コンテキストを形式的にモデル化する階層的コンテキスト条件付きメディアバイアス検出器であるHierBiasを提案します。コンテキスト条件付きバイアス確率を導入し、文間の相互情報量がゼロでない場合、文書コンテキストを活用することで文レベル分類のベイズ誤差が厳密に減少することを理論的に証明します。さらに、マルチタスク一般化バウンドにより、二項バイアス検出と詳細なバイアスのタイプ分類を共同でトレーニングすることが、小規模な注釈付きコーパスでのサンプル効率を向上させることが確立されます。アーキテクチャ的には、HierBiasは文レベルのRoBERTaエンコーダーと、文間トランスフォーマーアグリゲーター、および二項検出と4クラスのタイプ分類のためのデュアル出力ヘッドを組み合わせています。
arXiv cs.CL
2026年6月29日
プレゼンテーション自動コーチングの調査:システム、手法、および未解決の課題スピーチのプレゼンテーションに対する自動コーチングは、コンピュータ支援発音トレーニング(CAPT)、プロソディモデリング、音声合成の交差点に位置しますが、これまでこれらの側面において既存のシステムを体系的に調査・比較した研究はありませんでした。本調査では、発音チューター、流暢さ・プロソディコーチ、マルチモーダルトレーナー、会議の質疑応答練習ツールなど、自動プレゼンテーションコーチングシステムをレビューし、分類します。セグメンタル発音、語彙ストレス、超セグメンタルプロソディ、ペース配分、内容の忠実性という5次元のタスク分類を導入し、調査対象システムをそれに明示的にマッピングして、カバー率のギャップを明らかにします。さらに、これらのシステムが採用するコア技術手法、すなわち、発音、プロソディ、流暢さの評価のためのTTSベースの模範生成および診断手法をレビューします。主要な未解決の課題には、注釈付きプレゼンテーションコーパスの不足、多様な第一言語の背景を持つ学習者に対するアクセントに公平なフィードバックの実現、リアルタイムリハーサルに向けた低遅延診断の提供が含まれます。
arXiv cs.CL
2026年6月29日
PairSAE:タンパク質共フォールディングにおけるペア表現からのメカニズム解釈構造生物学のための基盤モデルは、生体分子構造の予測において目覚ましい性能を達成し、タンパク質や低分子の設計に有望視されている。しかし、その出力の根幹をなす内部特徴を理解することは依然として困難である。標準的なスパースオートエンコーダー(SAE)は、トランスフォーマー風のシーケンス埋め込みには効果的だが、ペアフォーマー風のアーキテクチャにはそのまま適用できない。ペア表現に単純に作用させると、特徴量が二次関数的に増加し、シーケンス表現とペア表現にまたがって分散する概念が不明瞭になる。そこで我々はPairSAEを開発した。これは、ペアテンソルをNモードSVDによってトークンごとの相互作用役割に要約し、その後、スパースオートエンコーダーを使用して、シーケンス表現とペア表現の両方をデコードできる共通のトークンレベル特徴セットを学習する。PLINDERタンパク質-リガンド複合体のBoltz-2活性化で評価した結果、PairSAEはUniProtアノテーションと一致し、Boltz-2親和性値を予測する解釈可能な特徴量をもたらした。
arXiv cs.LG
2026年6月29日
コンテキスト対応トランスフォーマーD層のトランスフォーマーブロックから構築された新しいリカレントニューラルネットワークアーキテクチャであるコンテキスト対応トランスフォーマーを紹介します。このアーキテクチャは、各トークンがブロックに入る前に事前コンテキスト化します。左から右への生成中、補正ネットワークは、過去のコンテキストのキャッシュされた要約である前の位置のブロック出力を現在のトークン埋め込みと組み合わせるため、トークンは生の埋め込みではなく、すでにコンテキスト化された状態でブロックに入ります。逐次推論では、補正チェーンにより、アーキテクチャはリカレントニューラルネットワークになります。トレーニングのために、補正プロセスをシーケンス全体でK回展開し、各ステップですべての位置を並列処理します。事前トレーニング済みのトランスフォーマーは、ゼロ初期化された補正FFNを追加してファインチューニングすることで、コンテキスト対応モデルに変換することもできます。幅、深さ、ブロックサイズ、および2つのデータセット全体で評価を行い、すべての比較は標準トランスフォーマー、バリアント、およびアブレーションに対して行われます。
arXiv cs.CL
2026年6月30日
scKDGM: KAN誘導型動的グラフマスキング学習による単一細胞RNAシーケンス・クラスタリング単一細胞RNAシーケンス(scRNA-seq)のクラスタリングは細胞タイプの同定に不可欠ですが、高次元性、スパース性、ドロップアウト、技術的ノイズが堅牢な発現表現と細胞グラフ構築を妨げます。既存のマスクトランスフォーマーは主に特徴再構築のための発現回復を使用しますが、グラフクラスタリング手法は通常、固定されたKNNグラフに依存し、回復された発現をグラフ最適化にフィードバックしません。本研究では、scRNA-seqクラスタリングのためのKAN誘導型動的グラフマスキング学習フレームワークであるscKDGMを提案します。scKDGMは、細胞アイデンティティを摂動させるグラフ認識型分布保持型遺伝子マスキング(GDP-Mask)、マスクビュー表現を学習するためのKANベースのTAKGCNエンコーダー、動的グラフを構築するためのマスク誘導型発現回復、および回復シグナルをトポロジー更新に転送するためのクロスビュー対照学習を使用します。ZINB損失は過分散とゼロインフレーションをモデル化します。
arXiv cs.LG
2026年7月2日
MemoryLLM:Transformer向けのプラグイン可能な解釈可能フィードフォワードメモリ人工知能における最近の技術的進歩の中核をなすトランスフォーマーコンポーネントがLLMでどのように動作するかを理解することは重要です。本研究では、フィードフォワードモジュール(FFN)の解釈可能性に関連する課題を再検討し、FFNをセルフアテンションから切り離すことを目的としたMemoryLLMを提案します。
Apple Machine Learning Research