DPO / READING NOTES
奖励模型没有消失,
它被折叠进了策略概率比。
DPO 的关键不是“偏好数据做普通监督学习”,而是利用 KL 约束最优策略的闭式解,把不可辨识的奖励等价类改写成可直接训练的策略。
一眼记住
RLHF 的目标reward − β·KL
→最优策略闭式解π* ∝ πref exp(r/β)
→反解隐式奖励r̂ = β log(πθ/πref)
→代回偏好模型logistic 分类
梯度为什么不是朴素“拉胜者、踩败者”
DPO 确实提高偏好响应、降低非偏好响应的 log-probability;但更新强度还乘上一个动态权重。当前策略若把败者的隐式奖励排得越高,权重越大;已经正确排序的样本会自动降权。这个权重解释了为什么不带权重的 Unlikelihood 容易退化为重复 token。
论文最有力的三条证据
- 奖励—KL 前沿:DPO 在受控情感任务中严格支配 PPO;即使 PPO 使用真实奖励,前沿仍更差。
- 真实摘要偏好:TL;DR 上 DPO 最佳胜率约 61%,PPO 约 57%,且 DPO 对采样温度更稳健。
- 成本对照:对话任务中 DPO 与 Best of 128 相当或更优,却不需要推理时为每个请求生成 128 个候选。
三个常见误解
- “DPO 没有奖励模型”
- 没有独立训练的显式奖励网络,但策略概率比定义了隐式奖励。
- “DPO 就是 SFT 偏好答案”
- 损失同时使用胜者、败者、策略和参考模型,且包含动态样本权重。
- “DPO 完全等价于任何 RLHF 实践”
- 理论等价针对特定 KL 约束目标与 Bradley–Terry/Plackett–Luce 偏好假设;数据覆盖、模型容量和优化误差仍会造成差异。
编辑判断
DPO 的经典性来自一次非常干净的变量替换:它没有发明新的偏好数据,也没有证明 RLHF 不需要奖励假设,而是把“奖励模型 + RL”中最难训练的一段,转成成熟的分类优化问题。论文实验在 6B 及以下模型、2023 年评估条件下完成;GPT-4 judge 的提示敏感性和部分附录样例中的误判,也提醒我们不要把论文里的胜率当成无条件的人类偏好真值。