TOPIC TIMELINE
タイムライン検索
特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。
2026年6月1日
Leanの定理証明のためのLLMフィードバック蒸留推論モデルのポストトレーニングは通常、検証可能な報酬からの教師あり微調整と強化学習を組み合わせ、最も一般的にはGRPOで行われている。しかしこのアルゴリズムは報酬の疎さ、限定的な探索、モード崩壊に悩まされている。自己蒸留に関する最近の研究に基づき、改善されたアプローチを提案する。
arXiv cs.AI
2026年6月10日
自己蒸留におけるフィードバックアライメントの役割自己蒸留は、モデルが追加コンテキストなしで性能向上を維持できるよう学習させる手法です。 本研究では、自己蒸留におけるコンテキスト設計を、凍結された評価者からのフィードバックを用いて探求しました。 ステップごとにアラインされた批評が最も大きな改善をもたらし、他の手法を大幅に上回る結果を示しました。
arXiv cs.LG
2026年7月3日
DemoPSD: 不一致を調整した方策自己蒸留大規模言語モデル(LLM)の推論能力向上に有効とされる自己蒸留技術において、教師モデルによる詳細すぎる指導が過学習や情報漏洩を引き起こすという課題が指摘されています。この問題を解決するため、新たなフレームワーク「DemoPSD」が提案されました。 DemoPSDは、教師モデルの出力をそのまま利用するのではなく、教師と生徒モデルの指導を重み付けして組み合わせる「逆KL重心ターゲット」という手法を採用しています。これにより、教師モデルの過度な影響を抑制し、過学習や情報漏洩のリスクを低減させることが期待されます。このアプローチは、LLMがより正確かつ安全に推論能力を向上させるための新しい道筋を示すものです。 arXiv cs.LG
arXiv cs.LG
2026年7月3日
手続き的記憶蒸留:自己改善型言語モデルのためのオンラインリフレクション検証可能な報酬を用いた強化学習(RLVR)や、最近の自己蒸留のバリアント(SDPOなど)は、各ロールアウトを検証機で評価し、エピソードレベルの信号からポリシーを更新する。しかし、ロールアウトに含まれるより豊かな手続き的情報は、ほとんど保持または再利用されない。エピソードやエポックをまたいで、モデルは変化するポリシーの下で関連する問題に繰り返し遭遇し、エピソードローカルな更新では捉えきれないクロスエピソード信号を生成する。どの戦略が一貫して検証を通過するか、どの失敗モードが持続するか、どのパターンが再発するかなどである。我々は、これらのクロスエピソード信号を再利用可能な手続き的記憶に変換し、トレーニング中にそれをポリシーの重みに蒸留するProcedural Memory Distillation(PMD)を提案する。この記憶はトレーニングの足場として機能し、ポリシー自体に吸収され、推論時には記憶のないモデルが得られる。
arXiv cs.AI
2026年7月14日
検証器こそがカリキュラム:クロスファミリーゲーム生成のための実行ゲート付き自己蒸留学習済みジャッジに対してコードジェネレーターをポストトレーニングすると、成果物を改善せずにスコアを上昇させるプロキシ特徴を最適化できます。私たちはその逆の信号を研究します。それは、決定論的で、ジャッジフリーで、操作不可能なフィルターです。具体的には、生成されたプロジェクトがヘッドレスエンジン(厳格起動)でクリーンに起動するかどうかです。このゲートの下で、リジェクションサンプリング自己蒸留は、ファミリー外の一般化を増幅させます。GameCraft-Bench(自然言語の指示から完全なGodotプロジェクトへのマッピング)において、厳格起動下で蒸留された14Bモデル(Qwen3-14B+LoRA)は、4つの未知のゲームファミリーにおけるクリーンな生成率を候補あたり8.8%から42.2%に、K個中ベストのカバレッジを18/25から25/25(ゴールド天井)に、それぞれ3ラウンドで向上させました。各ラウンドで有意な増加が見られました(p=0.0019、p<1e-4、p<1e-4)。この増加は単にデータを追加したことによるものではありません。
arXiv cs.AI
2026年7月22日
Amazon Nova向け自己蒸留推論による教師ありファインチューニングの探求本記事は、SFTカスタマイズで推論トレースがないデータセットのために、思考トークンを生成するアイデアを探求するものです。まず、推論抑制問題について考察し、次に自己蒸留推論(SDR)を導入、3つのベンチマークで検証した結果と実用的な推奨事項を提供します。
AWS Machine Learning Blog