奖励模型与 Bradley–Terry 偏好模型
奖励模型把 prompt-response 映射为标量;Bradley–Terry 模型用两个标量之差表示成对偏好概率,并以 pairwise logistic loss 训练。
对同一 prompt ,标注者选择更好的回答 (chosen)和较差的回答 (rejected)。共享参数的奖励模型分别输出:
典型实现是在语言模型最后一个 hidden state 上接 scalar head。它评估完整 response 的偏好分数,不生成文本。
Bradley–Terry 概率
Section titled “Bradley–Terry 概率”
令 ,则:
因此奖励差可以解释为 chosen 胜过 rejected 的 log odds。 同时加任意常数不会改变概率,说明绝对零点不可识别。
同一 prompt 有 个严格排序回答时,最多得到:
个成对比较。InstructGPT 配方把同一 prompt 的 pairs 成组处理:一次得到 个 reward 后复用所有差值,并避免把同一 response 在一个 epoch 内作为完全独立样本重复多次。tie 可能被丢弃,实际 pair 数可少于上式。
RewardTrainer 数据形态
Section titled “RewardTrainer 数据形态”课程第 23 讲展示的典型字段是:
input_ids_chosen attention_mask_choseninput_ids_rejected attention_mask_rejected两条输入经过同一个模型,loss 只依赖分数差。padding、截断和 EOS 处理必须在 chosen/rejected 两侧保持可比较。
Reward Model 与 Value Head 不同
Section titled “Reward Model 与 Value Head 不同”- Reward Model:由人类偏好数据训练,通常在 response 结束后给外部标量 score。
- Value Head:在 PPO 中估计当前 policy 的 expected return,常按 token 输出 value,用于 advantage/GAE。
二者都输出“数”,但训练目标和 RLHF 接口不同,不能混用。
课程中的公式校正
Section titled “课程中的公式校正”第 30 讲 notebook 某 cell 同时出现 -F.logsigmoid(0) 与 -np.log10(0.5)。pairwise loss 使用自然对数,正确对照是:
而不是十进制对数的 。
- 成对准确率高不等于跨 prompt 的 reward 绝对可比。
- 单标量 utility 难以表达循环偏好、标注者异质性和多维价值冲突。
- PPO 无约束最大化 RM 可能产生 reward hacking,因此通常需要 reference model/KL 等约束。
- DPO 使用同类偏好模型作为推导起点,但不显式训练并部署独立 RM。