DPO(直接選好最適化)はモデルのアライメント手法です。トレーニングデータは単一の標準回答ではなく、同じプロンプトの下での2つの応答、つまりどちらが好みによりマッチし、どちらが比較的劣るかというものです。DPOは、報酬モデルを別々に訓練し、強化学習最適化のためにPPOを使うことなく、モデル生成の好み応答の相対確率を直接高めます。
選好データはどのようなものですか?
最も基本的なサンプルには、プロンプト、勝利回答、欠落回答が含まれます。アノテーションは、有用性、事実性、スタイル、安全性の境界を比較します。トレーニング中、モデルは同じ文脈内で両者の間に確率ギャップを作り出し、モデルの制約を参照して元のモデルから大きく逸脱しないように好みに合わせて調整します。
これが、DPOが従来のRLHFプロセスよりも単純と考えられる理由でもあります。報酬モデリングと戦略最適化を二進的な目的に変換し、オンラインサンプリング、報酬モデルサービス、複雑な強化学習ループを排除します。DPOはトレーニング後段階にとどまり、事前学習で得られた基礎知識に代わるものではありません。
DPO、SFT、RLHFはそれぞれ何を学んでいるのでしょうか?
| 方法 | 主要データ | 中核的役割 | 一般的な制限事項 |
|---|---|---|---|
| SFT | ヒントと理想的な答え | 模倣ターゲットの実証 | 二つの選択肢の中から微妙な好みを表現するのは難しいです |
| DPO | 優先順位と非好好は正しいです | 直接学習が比較的好まれます | データの品質とカバレッジの比較に大きく依存します |
| クラシックRLHF | サンプルの好みデータ、報酬モデル、戦略 | 報酬シグナルで戦略を継続的に最適化する | このプロセスは複雑で、トレーニングの安定性やコストの管理も難しいです |
これら3つは単純な置換関係ではありません。一般的なアプローチとしては、まずSFTで利用可能な挙動を確立し、その後DPOや他の好み最適化手法を用いてトーン、リジェクション境界、応答品質をキャリブレーションします。
「トレーニングが簡単」だからといって必ずしもより良い結果が出るわけではありません
もし勝利した回答が単に長く、アノテーターに迎合しやすいだけなら、モデルは真の品質ではなく表面的なスタイルを学ぶかもしれません。好みが似すぎれば、訓練信号は弱くなります。カバレッジが不十分な場合、モデルはいくつかのタスクでしか改善できないことがあります。
DPOは、目標をペアワイズ比較で表現しつつ、RLHFのエンジニアリングの複雑さを軽減しようとするシナリオに最適です。チームは依然として独立した評価セットを保持し、異なるグループの事実、安全性、長さバイアス、好みを検証すべきです。「どちらを好むか」一つだけでは普遍的に正しいとは言えません。