ai2026/6/1 13:00:00

画像: Pexels
Leanの定理証明のためのLLMフィードバック蒸留
ニュース概要
推論モデルのポストトレーニングは通常、検証可能な報酬からの教師あり微調整と強化学習を組み合わせ、最も一般的にはGRPOで行われている。しかしこのアルゴリズムは報酬の疎さ、限定的な探索、モード崩壊に悩まされている。自己蒸留に関する最近の研究に基づき、改善されたアプローチを提案する。
ニュースタイムライン
2026年3月23日
Optunaベースの内製フレームワーク × Work Suite: ユーザフィードバック駆動型プロンプト最適化を用いた新機能についてPreferred Networks
2026年5月29日
表現署名とLLM取引エージェントのリスク・フィードバック整合性arXiv cs.LG
2026年6月2日
反復的実験フィードバックによるグラファイトベース負極のAIガイド設計と最適化arXiv cs.LG
2026年6月8日
Lean4Agent: エージェントワークフロー及び軌跡の形式的モデリングと検証arXiv cs.AI
2026年6月11日
不完全な二値フィードバックを持つレストレスバンディット:PCLインデックス可能性の解析と計算arXiv cs.LG
2026年6月16日
記事AI質問チャット
PREMIUMこの記事についてAIが質問に答えます。背景・要約・影響まで深堀り。
ログインして利用関連記事
こんな記事も読まれています
この記事について疑問がありますか?
事実誤認や不適切な内容について通報できます (要ログイン)。
異議申し立て・通報











