跳转到内容

输入关键词开始搜索

    奖励模型与 Bradley–Terry 偏好模型

    概念更新 2026-08-02置信度 high#概念#基础#长青#大模型#对齐

    奖励模型把 prompt-response 映射为标量;Bradley–Terry 模型用两个标量之差表示成对偏好概率,并以 pairwise logistic loss 训练。

    对同一 prompt xx,标注者选择更好的回答 ycy_c(chosen)和较差的回答 yry_r(rejected)。共享参数的奖励模型分别输出:

    rc=rθ(x,yc),rr=rθ(x,yr).r_c=r_\theta(x,y_c),\qquad r_r=r_\theta(x,y_r).

    典型实现是在语言模型最后一个 hidden state 上接 scalar head。它评估完整 response 的偏好分数,不生成文本。

    P(ycyrx)=ercerc+err=σ(rcrr).P(y_c\succ y_r\mid x) =\frac{e^{r_c}}{e^{r_c}+e^{r_r}} =\sigma(r_c-r_r).

    δ=rcrr\delta=r_c-r_r,则:

    δ=logp1p,(δ)=logσ(δ),ddδ=σ(δ)1.\delta=\log\frac{p}{1-p},\qquad \ell(\delta)=-\log\sigma(\delta),\qquad \frac{d\ell}{d\delta}=\sigma(\delta)-1.

    因此奖励差可以解释为 chosen 胜过 rejected 的 log odds。rc,rrr_c,r_r 同时加任意常数不会改变概率,说明绝对零点不可识别。

    同一 prompt 有 KK 个严格排序回答时,最多得到:

    (K2)=K(K1)2\binom K2=\frac{K(K-1)}2

    个成对比较。InstructGPT 配方把同一 prompt 的 pairs 成组处理:一次得到 KK 个 reward 后复用所有差值,并避免把同一 response 在一个 epoch 内作为完全独立样本重复多次。tie 可能被丢弃,实际 pair 数可少于上式。

    课程第 23 讲展示的典型字段是:

    input_ids_chosen attention_mask_chosen
    input_ids_rejected attention_mask_rejected

    两条输入经过同一个模型,loss 只依赖分数差。padding、截断和 EOS 处理必须在 chosen/rejected 两侧保持可比较。

    • Reward Model:由人类偏好数据训练,通常在 response 结束后给外部标量 score。
    • Value Head:在 PPO 中估计当前 policy 的 expected return,常按 token 输出 value,用于 advantage/GAE。

    二者都输出“数”,但训练目标和 RLHF 接口不同,不能混用。

    第 30 讲 notebook 某 cell 同时出现 -F.logsigmoid(0)-np.log10(0.5)。pairwise loss 使用自然对数,正确对照是:

    ln(0.5)=ln20.6931,-\ln(0.5)=\ln2\approx0.6931,

    而不是十进制对数的 0.30100.3010

    • 成对准确率高不等于跨 prompt 的 reward 绝对可比。
    • 单标量 utility 难以表达循环偏好、标注者异质性和多维价值冲突。
    • PPO 无约束最大化 RM 可能产生 reward hacking,因此通常需要 reference model/KL 等约束。
    • DPO 使用同类偏好模型作为推导起点,但不显式训练并部署独立 RM。