TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年5月8日
RVPO:分散正則化によるリスク敏感性アライメント現在のクリティック不要なRLHF手法は、複数目的報酬を算術平均で集約しており、制約無視に対して脆弱である。一つの目的での大きな成功が数値的に他の目的を相殺する可能性がある。
Apple Machine Learning Research
2026年5月29日
ICG:MLLMベースのプロンプティングと個人化された好みアライメントによるカバー画像生成の改善arXiv:2605.27374v1 マルチモーダル大言語モデル(MLLM)と拡散モデル(DM)の最近の進歩により、AI生成コンテンツの新しい可能性が開かれた。しかし、パーソナライズされたカバー画像生成は、デジタルプラットフォームでのユーザーエンゲージメント向上における重要な役割にもかかわらず、ほとんど未開拓である。
arXiv cs.CL
2026年5月29日
ログアライメント比による訓練時の汎化診断パラメータ化理論で導入されたパラメータ活性化アライメント測度であるログアライメント比(LAR)を研究します。これを行列の正規化された2乗特異値のウェイトスペクトル p と正規化された2乗射影値のアクティベーションスペクトル q との重複として再構成します。
arXiv cs.LG
2026年5月29日
表現アライメントは線形構造に基づいているプラトン表現仮説(PRH)を信号、バイアス、ノイズの3分岐統計フレームワークを通じて調査します。信号に関しては、プラトンアライメントは、表現に線形でエンコードされるオブジェクトと属性間の普遍的関係から生じることを提案します。
arXiv cs.LG
2026年6月1日
バランス型安全性アライメントのための設定可能なリワードモデルarXiv:2605.30487v1。大規模言語モデル(LLM)を異種かつ急速に進化する安全性要件に整合させることは重大な課題。既存の命令チューニング型LLMとスタンドアローン安全性分類器は新しい安全性設定への一般化に失敗することが多く、外部的に設定可能なリワードモデル(RM)の必要性が生じている。
arXiv cs.CL
2026年6月1日
LLMが一貫して間違える方法を学ぶとき:合成的欺瞞の線形表現に関する複数モデル研究モデルが正確な内部表現を保持しながら意図的に虚偽の出力を生成する欺瞞的アライメントは、AI安全性における中心的な課題として残っている。戦略的欺瞞は長期的な主要な懸念であるが、合成的不誠実さ(不正解への直接的な最適化を通じて誘発される)について研究している。
arXiv cs.LG
2026年6月1日
COMPASS: 安全な検索エージェントのための認知的MCTS誘導プロセスアライメントLLM搭載の検索エージェントは多段階推論とツール使用を可能にしますが、これらの機能により検索誘発安全性低下をもたらします。有害な意図が一見無害な部分質問に分解され、安全でない結果につながる可能性があります。既存のアライメント手法は疎な安全性パターンの捕捉に苦労しています。
arXiv cs.AI
2026年6月1日
生成型AIにおける多元的アライメント評価フレームワークarXiv:2605.31021v1 現在の生成型AIのアライメント手法は、人間の判断の多様性を集計された統計的基準に縮約する単一的なベンチマーク枠組みに依存しており、文化的、人口統計学的、文脈的な評価のばらつきが見落とされている。本論文では、これらの違いを考慮したペルソナベースの評価フレームワークを提案する。
arXiv cs.AI
2026年6月1日
大規模言語モデルにおけるアライメント特性の測定、特定、および除去arXivで発表された論文:調整された言語モデルはしばしば認識可能なAI的スタイルを示すが、その訓練後処理と内部表現との関連性は十分に理解されていない。この研究では、訓練後処理がAI的文体規則性を導入または増幅するかどうか、また これらの規則性が局在化した表現を持つかどうかを調査している。
arXiv cs.LG
2026年6月8日
SafeGene: 転送可能な安全性アライメントのための再利用可能なアダプターオープンウェイトLLMは、カスタマイズされたアシスタントへのファインチューニングが増加していますが、下流のファインチューニングにより安全性アライメントが弱まり、訓練データが意図的に有害でない場合でも、モデルが悪質なプロンプトに対して脆弱になる可能性があります。ターゲットモデルが新しいタスクデータやユーザーインタラクションで繰り返し更新されるため、反復的な安全性回復の問題が生じます。本論文では、各アーキテクチャ互換モデルファミリー内での横断的再利用のために設計された再利用可能な安全性アダプターモジュール「SafeGene」を提案します。安全性回復をモデル固有の修復ステップとして扱う代わりに、SafeGeneは安全性能力をタスク固有の更新から分離された独立した再利用可能なアダプター表現として扱います。この表現は、アラインされた-劣化したモデルの差分から取得され、データに対応したレイヤー選択を通じてタスク転送可能な安全性ベクトルに精密化され、各下流タスク適応モデルで少数ショットレイヤー単位の係数再キャリブレーションを通じて表現されます。
arXiv cs.AI
2026年6月10日
自己蒸留におけるフィードバックアライメントの役割自己蒸留は、モデルが追加コンテキストなしで性能向上を維持できるよう学習させる手法です。 本研究では、自己蒸留におけるコンテキスト設計を、凍結された評価者からのフィードバックを用いて探求しました。 ステップごとにアラインされた批評が最も大きな改善をもたらし、他の手法を大幅に上回る結果を示しました。
arXiv cs.LG
2026年6月10日
KVキャッシュ量子化によるアライメント崩壊:診断と緩和arXiv:2606.09864v1 新規発表 論文要旨:キーバリュ(KV)キャッシュ量子化は、大規模言語モデル(LLM)の推論メモリを削減するために広く利用されていますが、既存の評価は、安全性への影響を評価することなく、パープレキシティと精度のみを測定することに焦点を当てています。本研究では、KVキャッシュ量子化下でのアライメント(整合性)の維持を探求します。11の命令チューニング済みモデル(3.8B-72B)と5つのベンチマーク(1,894プロンプト)にわたる調査で、低ビット量子化が安全なアライメントを静かに破壊しうることを発見しました。具体的には、Mistral-7Bはパープレキシティ1.03倍のわずかな増加で拒否率が15.2%失われ、普遍的な安全なビット幅は存在せず、標準的な指標では見えない鋭いモデル固有の位相遷移が見られました。根本原因は幾何学的なものであることを特定しました。安全機能は、パープレキシティの全体表現空間平均よりも10^2〜10^3倍量子化ノイズに弱い低次元アクティベーションサブスペースを占めています。
arXiv cs.LG
2026年6月10日
大規模言語モデルにおけるアライメントアルゴリズムのメカニズム解析arXiv:2606.09850v1 公開タイプ: new 概要: 事後学習のアライメントアルゴリズムは、言語モデルの内部計算をどのように再構築するかを不明瞭にしたまま、ブラックボックスとして評価されることが大半です。本研究では、6つの選好最適化手法(PPO, DPO, SimPO, ORPO, GRPO, KTO)を3つのオープンウェイトモデルファミリーで横断的に比較し、体系的なメカニズム解析を行います。層ごとの線形プロービング、スパースオートエンコーダー、クロスコーダーを統合することで、選好表現を局在化させ、潜在空間におけるアライメント誘発性の幾何学的変換を定量化します。選好信号は一貫して早期~中期または中期~後期の層に集中するものの、異なる目的関数が表現上のシフトを質的に区別することを発見しました。KTOとGRPOは、建設的な特徴共有とスパースで高顕著性な募集を通じて線形分離性を向上させます。対照的に、DPOとORPOは、非建設的な幾何学的回転と特徴減衰を通じて分離性を低下させる一方、PPOとSimPOはベースラインの幾何学的構造をほぼ維持します。
arXiv cs.LG
2026年6月18日
モントリオール強制アライナーと2026年の音声認識アライメントの現状モントリオール強制アライナー(MFA)は2016年にリリースされ、以来、研究および産業分野で最も広く使用されている強制アライメントツールとなっています。それから10年間で、MFAは、より大規模なオープンソースデータセット、統一されたIPA辞書、モデル適応、クロス言語フォネティック再マッピング、およびサポートユーティリティを使用した、より多くの言語と方言へのカバレッジ拡大を含む、大幅な開発を経てきました。本論文は、バージョン1.0以降のMFA 3.0の開発を記録し、古典的およびニューラル強制アライナーをベンチマークとして、英語、日本語、韓国語におけるMFAのパフォーマンスを評価します。MFA 3.0は、平均境界誤差15ミリ秒未満で、4つのベンチマークデータセットすべてにおいて最先端またはそれに近いパフォーマンスを達成しています。適応とクロス言語再マッピングは、MFAのトレーニング分布外の言語に効果的であり、発音確率モデリングと音韻規則は特定の条件下で改善をもたらします。
arXiv cs.CL
2026年6月19日
マウスと目の動きでユーザーの好みを密かに読み取る:暗黙的フィードバックを用いたLLMアライメント大規模言語モデル(LLM)の性能を向上させるアライメント技術において、ユーザーの暗黙的な行動に着目した新たな研究が発表されました。これまでのアライメント手法は、ユーザーが直接評価を下すといった明示的なフィードバックに依存しており、そのデータ収集には多大なコストがかかるという課題がありました。 今回開発された「IFLLM」と呼ばれる新しいデータセットは、ユーザーのマウスの動きや視線の軌跡といった、無意識のうちに行われる行動パターンを収集し、これをLLMのアライメントに利用することを目的としています。研究チームは、この暗黙的フィードバックを基盤とした報酬モデルを構築。その結果、テキスト情報のみを利用した場合に55%だったモデルの精度が64%に向上しました。さらに、LLMの応答品質の相対的な改善度合いは約3倍に達したと報告されています。 この成果は、LLMのユーザー適合性を高める新たな可能性を示唆しており、より効率的かつ自然な形でユーザーの好みや意図を学習する手法として注目されます。将来的には、ユーザーが意識することなく、よりパーソナライズされたLLM体験が実現するかもしれません。 引用元: arXiv cs.CL
arXiv cs.CL
2026年6月19日
クロスリンガル転移における言語的関連性とタスクアライメントの分離我々は、7つの大規模言語モデル(4B~671Bパラメータ)をアラビア語でファインチューニングし、セム諸語および非セム諸語でのゼロショット読解能力を評価することで、クロスリンガル転移を研究する。密なアーキテクチャとMixture-of-Expertsアーキテクチャ全体において、セム諸語特有の転移の証拠は見つからなかった。ベースラインが弱いモデルは全ての言語で劇的に改善する一方、ベースラインが強いモデルは言語ファミリーに関わらずわずかな改善しか示さなかった。連鎖思考のアブレーションはこの発見を補強する。ファインチューニングから最も恩恵を受けるモデルが、推論時の推論からも同様に恩恵を受けることは、両方のメカニズムがクロスリンガル知識転移ではなく、タスクフォーマットのアライメントに対処していることを示唆している。
arXiv cs.CL
2026年6月19日
LLMはハードウェア設計におけるRTLコーディングでどのように失敗し、汎化するのか?ハードウェア設計の並列論理時間(parallel temporal logic)に逐次プログラミングの事前知識を変換することは、大規模言語モデル(LLM)にとって依然として重要なボトルネックです。この問題を調査するため、認知理論に触発された、問題解決可能性に基づいた新しいエラー分類法を導入します。この分類法は、失敗を構文エラー、意味論的エラー、解ける機能的エラー、解けない機能的エラーのタイプに分類します。評価によると、VerilogEvalベンチマークには厳格な経験的上限があり、最先端のモデルでも初期合格率90.8%でプラトーに達しています。これらのプラトーは解けない機能的エラーによって定義されており、テスト時間計算スケールでは対処できない永続的な知識のギャップを露呈しています。さらに、顕著な表面収束ギャップを明らかにします。最適化は構文エラーを容易に解消しますが、同時に、より深い機能的失敗を悪化させます。我々の発見は、アライメント技術が単にモデルにコンパイルを教えるだけであることを示しています。
arXiv cs.CL
2026年6月19日
創発的アライメント大規模言語モデル(LLM)は、自身の出力が人間の倫理観と乖離している場合にそれを識別できるのか?そして自己修正は可能か?我々はLLMに、自身の推論と出力をレビューする「良心ステップ」を付与し、訓練損失に直接選好最適化(DPO)を用いたアライメントコンポーネントを拡張して、非倫理的な出力からモデルを逸脱させる。この結果、訓練、ファインチューニング、敵対的プロンプティング、ゼロショット学習など、幅広いアプリケーションでモデルをアライメントさせるオンライン技術が実現する。これは、より弱い、あるいはより強いジャッジを必要とせず、代わりに自身の凍結されたコピーに依存する。以前の研究である「創発的乖離」シナリオでは、モデルをハッキングコードにファインチューニングすることで、様々な創発的な非倫理的行動が示された。それに対し、我々は「創発的アライメント」を達成する方法を実証的に示す。単一のハイレベルな内省的な質問が、同じコードハッキングシナリオ下で、訓練を倫理的なモデルへと導く。
arXiv cs.AI
2026年6月23日
MindAlign:限定データ下でのマルチモーダル埋め込みアライメントによるfMRI信号からの内的音声のデコード内的な言語出力の欠如、学習データの制限、被験者間の大きなばらつきにより、非侵襲的な脳信号からの内的音声のデコードは依然として根本的な課題です。既存の脳信号からテキストへのアプローチは、タスク固有のデコーダーのファインチューニングに依存することが多く、スケーラビリティを制限し、新しい被験者への適応を複雑にします。本研究では、基盤となる言語モデルを変更することなく、fMRI信号からのオープンエンドなテキスト生成を可能にする、分離された2段階の脳信号から言語へのフレームワークであるMindAlignを提案します。第1段階では、fMRI活動を共有マルチモーダル意味空間にマッピングし、内的生成された文章の潜在的な意味スケッチを抽出する、被験者固有のニューラル意味アライメントを学習します。第2段階では、このスケッチを視覚的コンテキストと統合し、冷凍されたマルチモーダル言語モデルにプロンプトを与えることで自由形式の生成を行います。静かな画像記述中に収集されたfMRIデータを用いた実験により、提案手法が一貫してfMRIのみおよびランダムベースラインを上回ることが実証されました。
arXiv cs.CL
2026年6月23日
言語的誘導の調査:大規模言語モデルアーキテクチャにおける形容詞効果の分析大規模言語モデル(LLM)の信頼性の高い制御を実現するには、LLMが言語的手がかりをどのように解釈するかを正確かつスケーラブルに理解する必要があります。本研究では、モデルのパフォーマンスに対する個々の形容詞の誘導効果を定量化するためにシャプレー値を用いた厳密なフレームワークを導入し、逸話的なヒューリスティックを超えた原則的な貢献分析を行います。この手法をMMLUベンチマークにおいて多様なモデル(o3、gpt-4o-mini、phi-3、llama-3-70b、deepseek-r1を含む)の100個の形容詞に適用し、AIアライメントに関するいくつかの重要な発見を明らかにします。第一に、形容詞の小さなサブセットが不均衡に強力な「レバー」として機能しますが、その効果は普遍的ではないことがわかります。モデル間分析は「ファミリー効果」を明らかにします。共有された系統を持つモデルは相関する感度プロファイルを示しますが、アーキテクチャ的に異なるモデルはほとんど相関しない方法で反応し、万能なプロンプト戦略の概念に挑戦します。
arXiv cs.CL
2026年6月24日
RAGシステムにおける先行優位性の定量化Retrieval-Augmented Generation (RAG)は、大規模言語モデルを外部知識に接地させますが、現在の評価は離散的なヒューリスティックに依存しており、これは真の文脈情報抽出とパラメータメモリからの想起を区別できない「認識論的盲目」に苦しんでいます。この問題に対処するため、我々はNormalized Context Utilization (NCU)メトリックを導入します。これは、ゼロショット、オラクル、敵対的条件下での連続的なトークン対数確率を活用し、文脈情報ゲインを厳密に定量化します。1.5Bから72Bパラメータのアーキテクチャと、ある商用APIを評価した結果、厳密な事実抽出(Chain-of-Thought推論なし)においては、従来のスケール則は極端な収穫逓減を示し、非常に効率的なSmall Language Models (SLMs)が、高キャパシティなアーキテクチャと同等かそれ以上の性能を発揮することが明らかになりました。さらに、「先行優位性」がモデルのスケールや商用アライメントと相関することを示しました。
arXiv cs.CL
2026年6月24日
自己認識ファインチューニングは、創発的アライメント不一致の防止と反転が可能創発的アライメント不一致(EM)は、アライメント不一致のペルソナベクトルと悪意あるキャラクター特性の活性化に関連しており、EMは有害コンテンツの直接学習ではなく、モデルのアライメントされたキャラクターの破壊を通じて機能することを示唆しています。この関連性に着想を得て、既存のトレーニング中防御とは異なる、キャラクターを標的とした介入として、自己生成テキスト認識(SGTR)ファインチューニングを研究します。GPT-4.1、Qwen2.5-32B-Instruct、Seed-OSS-36B-Instructの3つのモデルと複数のEMデータセットで2段階のファインチューニング実験を実施し、SGTRファインチューニングと、良性ファインチューニングのベースライン(正しいドメイン固有データ、一般知識、単語数)を比較し、SGTRファインチューニングが反転と防止の両方の設定で効果的な防御策であることを発見しました。すべての介入が同等のEM反転を生み出すが、EMが低下させた能力を回復した場合にのみ、これは当てはまることがわかりました。
arXiv cs.CL
2026年6月25日
エージェント型AIへのガイド:基礎からシステムまで「エージェント型AIへのガイド」は、自律型AIシステム構築のための包括的な実践者向けリファレンスです。本書は、最初の原則から本番展開までのフルスタックを網羅しており、優れたエージェント型システムを構築するには、パイプラインの単一のレイヤーだけでなく、すべてのレイヤーを理解する必要があるという中心的なテーゼを中心に構成されています。まず、LLM基盤(トランスフォーマーアーキテクチャ、GPUシステム、トレーニングとファインチューニング(SFT、LoRA、MoE)、モデル圧縮、推論最適化)を、主要な焦点ではなく、不可欠な基盤として扱います。次に、アライメントと推論レイヤー(RLHF、PPO、DPOとそのバリアント、GRPO、報酬モデリング、チェーン・オブ・ソートやテストタイムスケーリングを含む大規模推論モデルのためのRL)を開発します。後半は、エージェント型AIそのものに充てられています。
arXiv cs.AI
2026年6月25日
LLMベースの科学論文査読:手法、ベンチマーク、信頼性の課題科学論文の投稿数の急増は、従来の査読システムを拡張性の限界に追いやり、インテリジェントな自動評価アシスタントとして大規模言語モデル(LLM)の活用が模索されています。最近の研究では、LLMが流暢な批評を生成し、査読者のスコアを近似できることが示されていますが、意思決定支援システムとしての信頼性、堅牢性、セキュリティは十分に理解されていません。このサーベイでは、LLMベースの科学論文査読について、批評生成とスコア予測という2つの中心的な評価機能に焦点を当て、システムレベルでの分析を提供します。プロンプトベース、教師あり学習、検索拡張、アライメント最適化アプローチを含むモデリング手法の構造化された分類法を提示し、既存のベンチマークを横断する経験的知見を統合します。現在の評価慣行を制限するデータセットの制約、評価の不備、ドメイン集中バイアスを分析します。パフォーマンス指標を超えて、プロンプトインジェクション、データポイズニング、検索の脆弱性、報酬ハッキングなどの新たな堅牢性リスクを特定し、自動レビューパイプラインを戦略的な操作に対して露呈させます。
arXiv cs.CL
2026年6月25日
学習済み表現において保存則はいつ成り立つのか?潜在世界モデルのための認定ホライズン物理世界モデルに関する表現学習の疑問、すなわち、モデルが潜在表現を学習した後、保存則はいつ認定可能であり続けるのか、という問いを立てます。認定ホライズンとは、測定可能なモデルの欠陥から、あらかじめ、物理的invariantのレベルセットに証明可能に留まるロールアウトのステップ数を上限するものです。重要な設計選択は、何が認定されるかです。これは、学習済みの潜在ハミルトニアンや学習済みスカラー証人(モデルはいずれかを保存しながら真のエネルギーでドリフトする可能性がある)ではなく、潜在状態をデコードし既知のinvariantを評価することによって得られるデコードされた物理的invariantです。このオブジェクトを中心に、シェルホライズン証明を導出します。その予算は、表現、読み出し、潜在ダイナミクスの欠陥に分解され、ソフト学習済み証人を介してデコードされたinvariantの認定ホライズンを生成するモノトーンアライメントブリッジを介して、保存系における状態、学習済みリフト、ピクセル観測でテストします。
arXiv cs.LG
2026年6月29日
「機械アンラーニング」という言葉はLLM分野で過剰に使われている大規模言語モデル(LLM)は、規制上の削除義務、著作権・ライセンス紛争、安全・製品ポリシー上の要件などから、学習データの削除、知識や挙動の「忘却」を求められることが増えています。本稿では、LLM研究において「機械アンラーニング」という言葉が過剰に使用されており、データセットで定義された削除、すなわち、指定された忘却セットの学習影響を正確に除去し、その結果得られるモデルがそのデータなしで再学習した場合とほぼ区別がつかなくなるような場合にのみ予約されるべきだと主張します。現在「アンラーニング」とラベル付けされている多くのタスク(有害な要求への拒否、エンティティ/知識の削除、標的型抑制など)は、異なり、しばしばポリシーに依存した目標を追求しており、したがって異なる用語やベースライン(アライメント、抑制、編集、難読化など)が必要であると論じます。
arXiv cs.CL
2026年6月30日
手話モデルの音韻知覚手話は、ハンドシェイプ、位置、動きなどのサブ・レキシカル(単語未満)な音韻パラメーターを組み合わせることで意味が生じる構成的なシステムです。手話認識(SLR)のためのディープラーニングモデルは、翻訳ベンチマークで性能が向上していますが、これらのモデルが抽象的な音韻的特徴を区別しているのか、それとも単に低レベルの統計的相関に依存しているのかは不明なままです。本研究では、最小ペアを用いて音韻感度を調査し、人間の行動データとの表現アライメントを評価することにより、アメリカ手話(ASL)で訓練されたSLRモデルの音韻知覚を評価します。結果として、SLRモデルは音韻知覚を創発的に示しますが、アーキテクチャに明確なトレードオフがあることが明らかになりました。ポーズベースのモデルはハンドシェイプの対比に敏感である一方、ピクセルベースのモデルは位置の変化をよりよく捉えます。さらに、ポーズベースのモデルは、人間の知覚的類似性判断(r~0.49)と相関する潜在的表現を学習します。
arXiv cs.CL
2026年7月1日
成果報酬モデルによるテキストからSQLへのテスト時検証推論時の大規模言語モデル(LLM)の信頼性向上は、テキストからSQLへの変換のような構造化推論タスクにおける中心的な課題です。Best-of-Nサンプリングや多数決などの一般的なテスト時推論戦略は、実行成功や出力頻度などのヒューリスティックな信号に依存していますが、候補出力間の意味的な識別能力は限られています。本研究では、テキストからSQLへの変換におけるテスト時検証のための学習済み意味スコアリング関数として、成果報酬モデル(ORM)を検討します。ORMは以前からテスト時のスケーリングやアライメントに検討されてきましたが、構造化クエリ生成への応用は十分に探求されていませんでした。自動化された候補生成と実行ベースのラベリングによるタスク固有ORMのトレーニングのためのスケーラブルなフレームワークであるGradeSQLを導入し、手動アノテーションなしでの検証器トレーニングを可能にします。ORMを検証駆動型Best-of-Nパイプラインに統合し、複数のオープンソースLLMファミリーにわたるBIRDおよびSpiderベンチマークでアプローチを評価します。
arXiv cs.CL
2026年7月3日
近似から創発へ:深層学習理論の探求深層学習は、単一の数学的説明を超えて発展しました。『近似から創発へ』は、現代の深層学習理論の統一的かつ証明指向の解説を展開し、近似、最適化、汎化といった古典的基礎から、過剰パラメータ化、頑健性、生成モデリング、トランスフォーマー、コンテキスト内学習、スケーリング則、解釈可能性、アライメント、創発といった現代的メカニズムへの道筋をたどります。本書は、個々の結果を羅列するのではなく、広範な文献を首尾一貫した研究物語に再編成します。各理論は、それが制御する対象、妥当性の前提、そして未解明の現象を通して検討されます。研究者、大学院生、数学的訓練を受けた実務家向けに書かれたこのモノグラフは、今日の深層学習理論の厳密な地図を提供します。それは強力でありながら不完全で、スケール、データ、アーキテクチャ、トレーニングから学習されたメカニズムがどのように生じるかという問いにますます中心化されています。
arXiv cs.LG
2026年7月7日
Oyster-II:大規模言語モデルにおける建設的安全アライメントのための強化学習大規模言語モデル(LLM)は多様なアプリケーションで目覚ましい能力を発揮していますが、その安全性、有用性、信頼性を同時に確保することは依然として永続的な課題です。従来の拒否中心のアライメント戦略は有害なコンテンツ生成を抑制しますが、正当なユーザーのニーズを満たすことができず、機密性の高いクエリの根本的な意図を安全かつ建設的に満たすことができる情報を提供するのをしばしば怠ります。Oyster-Iが先駆けた建設的安全パラダイムに基づき、一律の拒否から思慮深く応答中心の安全アライメントへと移行するOyster-Iの教師ありファインチューニング(SFT)ベースのスキームには、分布外シナリオへの安全性の不十分な一般化と、安全指向の推論パターンが良性クエリに過剰に適用され、有用性とユーザーエクスペリエンスを低下させる「安全性の思考連鎖(CoT)の過剰一般化」という現象という2つの重要な制限を特定しました。これらの制限に対処するため、Zero-RLパラダイムと多段階強化学習戦略を採用した強化学習(RL)ベースの建設的安全アライメントフレームワークであるOyster-IIを提案します。
arXiv cs.AI