DPO / READING NOTES

奖励模型没有消失,
它被折叠进了策略概率比。

DPO 的关键不是“偏好数据做普通监督学习”,而是利用 KL 约束最优策略的闭式解,把不可辨识的奖励等价类改写成可直接训练的策略。

01 / MENTAL MODEL

一眼记住

RLHF 的目标reward − β·KL
最优策略闭式解π* ∝ πref exp(r/β)
反解隐式奖励r̂ = β log(πθ/πref)
代回偏好模型logistic 分类
02 / MECHANISM

梯度为什么不是朴素“拉胜者、踩败者”

DPO 确实提高偏好响应、降低非偏好响应的 log-probability;但更新强度还乘上一个动态权重。当前策略若把败者的隐式奖励排得越高,权重越大;已经正确排序的样本会自动降权。这个权重解释了为什么不带权重的 Unlikelihood 容易退化为重复 token。

03 / EVIDENCE

论文最有力的三条证据

  1. 奖励—KL 前沿:DPO 在受控情感任务中严格支配 PPO;即使 PPO 使用真实奖励,前沿仍更差。
  2. 真实摘要偏好:TL;DR 上 DPO 最佳胜率约 61%,PPO 约 57%,且 DPO 对采样温度更稳健。
  3. 成本对照:对话任务中 DPO 与 Best of 128 相当或更优,却不需要推理时为每个请求生成 128 个候选。
04 / MISREADINGS

三个常见误解

“DPO 没有奖励模型”
没有独立训练的显式奖励网络,但策略概率比定义了隐式奖励。
“DPO 就是 SFT 偏好答案”
损失同时使用胜者、败者、策略和参考模型,且包含动态样本权重。
“DPO 完全等价于任何 RLHF 实践”
理论等价针对特定 KL 约束目标与 Bradley–Terry/Plackett–Luce 偏好假设;数据覆盖、模型容量和优化误差仍会造成差异。
05 / EDITORIAL ASSESSMENT

编辑判断

DPO 的经典性来自一次非常干净的变量替换:它没有发明新的偏好数据,也没有证明 RLHF 不需要奖励假设,而是把“奖励模型 + RL”中最难训练的一段,转成成熟的分类优化问题。论文实验在 6B 及以下模型、2023 年评估条件下完成;GPT-4 judge 的提示敏感性和部分附录样例中的误判,也提醒我们不要把论文里的胜率当成无条件的人类偏好真值。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭