
画像: Pexels
SafeGene: 転送可能な安全性アライメントのための再利用可能なアダプター
ニュース概要
オープンウェイトLLMは、カスタマイズされたアシスタントへのファインチューニングが増加していますが、下流のファインチューニングにより安全性アライメントが弱まり、訓練データが意図的に有害でない場合でも、モデルが悪質なプロンプトに対して脆弱になる可能性があります。ターゲットモデルが新しいタスクデータやユーザーインタラクションで繰り返し更新されるため、反復的な安全性回復の問題が生じます。本論文では、各アーキテクチャ互換モデルファミリー内での横断的再利用のために設計された再利用可能な安全性アダプターモジュール「SafeGene」を提案します。安全性回復をモデル固有の修復ステップとして扱う代わりに、SafeGeneは安全性能力をタスク固有の更新から分離された独立した再利用可能なアダプター表現として扱います。この表現は、アラインされた-劣化したモデルの差分から取得され、データに対応したレイヤー選択を通じてタスク転送可能な安全性ベクトルに精密化され、各下流タスク適応モデルで少数ショットレイヤー単位の係数再キャリブレーションを通じて表現されます。
ニュースタイムライン
2026年6月10日
KVキャッシュ量子化によるアライメント崩壊:診断と緩和arXiv cs.LG
2026年6月10日
大規模言語モデルにおけるアライメントアルゴリズムのメカニズム解析arXiv cs.LG
2026年6月11日
PermDoRA -- 言語モデルにおけるアダプター干渉の理解:パラメータ空間幾何学の限界arXiv cs.LG
2026年6月18日
モントリオール強制アライナーと2026年の音声認識アライメントの現状arXiv cs.CL
2026年6月19日
クロスリンガル転移における言語的関連性とタスクアライメントの分離arXiv cs.CL
記事AI質問チャット
PREMIUMこの記事についてAIが質問に答えます。背景・要約・影響まで深堀り。
ログインして利用関連記事
こんな記事も読まれています
この記事について疑問がありますか?
事実誤認や不適切な内容について通報できます (要ログイン)。
異議申し立て・通報












