NEURIPS 2023 · PREFERENCE OPTIMIZATION · 中文全文译稿

Direct Preference Optimization:
Your Language Model is Secretly a Reward Model

Rafael Rafailov · Archit Sharma · Eric Mitchell · Stefano Ermon · Christopher D. Manning · Chelsea FinnStanford University · CZ Biohub
偏好对yw ≻ yl
隐式奖励β log πθ / πref
分类损失−log σ(Δr̂)

把“训练奖励模型,再用 PPO 追奖励”的两阶段流程,改写成偏好响应与非偏好响应之间的单一 logistic 分类问题。

PDF
27 页
Figures
5
Tables
10 + 1
Equations
22
References
51

摘要

大规模无监督语言模型(LM)虽然能够习得广泛的世界知识和一定的推理能力,但由于训练过程完全无监督,要精确控制其行为仍然很困难。现有方法通常收集人类对模型生成结果相对质量的标注,再对无监督 LM 进行微调以符合这些偏好,常见做法是基于人类反馈的强化学习(RLHF)。然而,RLHF 流程复杂且往往不稳定:它先拟合反映人类偏好的奖励模型,再使用强化学习微调大型无监督 LM,在不偏离原模型太远的前提下最大化估计奖励。本文为 RLHF 的奖励模型引入一种新的参数化方式,使对应的最优策略能够以闭式形式提取,因此只需一个简单的分类损失即可求解标准 RLHF 问题。由此得到的算法称为 Direct Preference Optimization(DPO,直接偏好优化);它稳定、高效、计算开销低,无需在微调期间从 LM 采样,也无需进行大量超参数调节。实验表明,DPO 能够将 LM 与人类偏好对齐,效果不逊于乃至优于现有方法。尤其是在控制生成文本情感方面,DPO 微调优于基于 PPO 的 RLHF;在摘要和单轮对话中,它以显著更简单的实现与训练过程,达到或改善了响应质量。

1 引言

在超大规模数据集上训练的无监督语言模型获得了令人惊讶的能力 [671142]。然而,这些模型的训练数据来自目标、偏好和技能各不相同的人类,其中一些目标与技能并不值得模仿。例如,我们希望 AI 编程助手能够理解常见编程错误,以便纠正它们;但在生成代码时,我们又希望模型偏向训练数据中可能较少见的高质量编程能力。同样,我们或许希望语言模型知道一个被 50% 的人相信的常见误解,却绝不希望它在 50% 的相关查询中把这个误解说成事实。换言之,要构建安全、高性能、可控制的 AI 系统,关键在于从模型广泛的知识与能力中选择其期望的响应与行为 [28]。现有方法通常用强化学习(RL)引导 LM 匹配人类偏好;本文将说明,既有方法中的 RL 目标可以用一个简单的二元交叉熵目标精确优化,从而大幅简化偏好学习流程。

Figure 1原论文图面

DPO 在避开强化学习的同时优化人类偏好。 现有的人类反馈微调方法,先用提示词和人类对成对响应的偏好数据拟合奖励模型,再用 RL 寻找最大化所学奖励的策略。DPO 则用一个简单的分类目标直接优化最符合偏好的策略:它拟合的是隐式奖励模型,而对应的最优策略可以闭式提取。

从宏观上看,现有方法会在大规模无监督预训练之后,用经过策划的人类偏好集合把安全、有帮助等期望行为注入语言模型。最直接的做法,是在高质量人类示范上进行监督微调;但最成功的一类方法是基于人类(或 AI)反馈的强化学习,即 RLHF/RLAIF [1212]。这类方法先在人类偏好数据上拟合奖励模型,再用 RL 优化语言模型策略,使其生成高奖励响应,同时不过度偏离原模型。RLHF 虽然带来了出色的对话与编程能力,但其流程比监督学习复杂得多:它需要训练多个 LM,还要在训练循环中从策略采样,计算成本显著。

本文说明如何在没有显式奖励建模或强化学习的情况下,直接优化语言模型以遵循人类偏好。我们提出 Direct Preference Optimization(DPO):它隐式优化与现有 RLHF 算法相同的目标——带 KL 散度约束的奖励最大化——但实现简单、训练直接。直观地说,DPO 更新会提高偏好响应相对于非偏好响应的对数概率,同时引入随样本动态变化的重要性权重,避免朴素概率比目标导致的模型退化。DPO 仍基于 Bradley–Terry 等理论偏好模型 [5];区别在于,既有方法用偏好损失训练奖励模型,再训练策略优化该奖励,而 DPO 通过变量替换,直接把偏好损失写成策略的函数。给定人类对模型响应的偏好数据,DPO 因而可以使用简单的二元交叉熵目标优化策略,并得到拟合偏好数据的隐式奖励函数所对应的最优策略。

本文的主要贡献是 DPO:一种不需要 RL、直接从偏好训练语言模型的简单算法。实验表明,在情感调控、摘要和对话等任务上,对于最大 6B 参数的语言模型,DPO 至少与包括 PPO-RLHF 在内的现有方法一样有效。

2 相关工作

3 预备知识

这里回顾 Ziegler 等人 [51](以及后续工作 [12840])采用的 RLHF 流程。它通常包含三个阶段:1)监督微调(SFT);2)偏好采样与奖励学习;3)RL 优化。

SFT。 RLHF 通常先在目标下游任务(对话、摘要等)的高质量数据上,对预训练 LM 进行监督微调,得到模型 πSFT\pi^{\mathrm{SFT}}

奖励建模阶段。 第二阶段用提示 xx 驱动 SFT 模型生成答案对 (y1,y2)πSFT(yx)(y_1,y_2)\sim\pi^{\mathrm{SFT}}(y\mid x),再交给人类标注者选择偏好答案,记为 ywylxy_w\succ y_l\mid x。偏好被假设为某个不可观测的潜在奖励模型 r(x,y)r^*(x,y) 所生成。常用 Bradley–Terry(BT)模型 [5];若有多个已排序答案,也可使用更一般的 Plackett–Luce 模型 [2332]。BT 模型将人类偏好分布写为:

p(y1y2x)=exp(r(x,y1))exp(r(x,y1))+exp(r(x,y2))(1)p^*(y_1\succ y_2\mid x)=\frac{\exp(r^*(x,y_1))}{\exp(r^*(x,y_1))+\exp(r^*(x,y_2))}\tag{1}

假设有从 pp^* 采样的静态比较数据集 D={x(i),yw(i),yl(i)}i=1N\mathcal D=\{x^{(i)},y_w^{(i)},y_l^{(i)}\}_{i=1}^N,可将奖励模型参数化为 rϕ(x,y)r_\phi(x,y),并用最大似然估计参数。把问题视作二元分类,负对数似然损失为:

LR(rϕ,D)=E(x,yw,yl)D[logσ(rϕ(x,yw)rϕ(x,yl))](2)\mathcal L_R(r_\phi,\mathcal D)=-\mathbb E_{(x,y_w,y_l)\sim\mathcal D}\left[\log\sigma\bigl(r_\phi(x,y_w)-r_\phi(x,y_l)\bigr)\right]\tag{2}

其中 σ\sigma 是 logistic 函数。在 LM 场景中,rϕ(x,y)r_\phi(x,y) 通常由 SFT 模型初始化,并在最后一个 Transformer 层上添加线性层,输出单个标量奖励 [51]。为降低奖励函数方差,先前工作还会对奖励归一化,使所有 xx 都满足 Ex,yD[rϕ(x,y)]=0\mathbb E_{x,y\sim\mathcal D}[r_\phi(x,y)]=0

RL 微调阶段。 学到的奖励函数用于向语言模型提供反馈。沿用先前工作 [1718],优化问题写为:

maxπθ  ExD,yπθ(yx)[rϕ(x,y)]βDKL[πθ(yx)πref(yx)](3)\max_{\pi_\theta}\;\mathbb E_{x\sim\mathcal D,\,y\sim\pi_\theta(y\mid x)}[r_\phi(x,y)]-\beta\,\mathbb D_{\mathrm{KL}}[\pi_\theta(y\mid x)\|\pi_{\mathrm{ref}}(y\mid x)]\tag{3}

其中 β\beta 控制策略相对基础参考策略 πref\pi_{\mathrm{ref}} 的偏离程度,而参考策略就是初始 SFT 模型 πSFT\pi^{\mathrm{SFT}};语言模型策略 πθ\pi_\theta 在实践中也由 πSFT\pi^{\mathrm{SFT}} 初始化。该约束很重要:它避免模型偏离奖励模型可靠的数据分布太远,也维持生成多样性并防止坍缩到单一高奖励答案。由于语言生成是离散的,此目标不可直接微分,通常用强化学习优化。标准做法 [1284051] 是构造 r(x,y)=rϕ(x,y)β(logπθ(yx)logπref(yx))r(x,y)=r_\phi(x,y)-\beta(\log\pi_\theta(y\mid x)-\log\pi_{\mathrm{ref}}(y\mid x)),再用 PPO [39] 最大化。

4 Direct Preference Optimization

大规模应用强化学习(例如微调语言模型)面临许多困难,因此我们的目标是推导一种直接利用偏好进行策略优化的简单方法。以往 RLHF 先学习奖励再通过 RL 优化;DPO 则选择一种特殊的奖励参数化,使最优策略能够闭式提取,不需要 RL 训练循环。核心洞见是利用从奖励函数到最优策略的解析映射,把奖励函数上的损失变成策略上的损失。由此可避免拟合独立的显式奖励模型,同时仍能在 Bradley–Terry 等既有偏好模型下优化。实质上,一个策略网络同时表示语言模型与隐式奖励。

推导 DPO 目标。 从式(3)的同一 RL 目标出发,使用一般奖励函数 rr。先前工作 [15193031] 表明,带 KL 约束的奖励最大化问题的最优解为:

πr(yx)=1Z(x)πref(yx)exp ⁣(1βr(x,y))(4)\pi_r(y\mid x)=\frac{1}{Z(x)}\pi_{\mathrm{ref}}(y\mid x)\exp\!\left(\frac{1}{\beta}r(x,y)\right)\tag{4}

其中 Z(x)=yπref(yx)exp(1βr(x,y))Z(x)=\sum_y\pi_{\mathrm{ref}}(y\mid x)\exp(\frac1\beta r(x,y)) 是配分函数,完整推导见附录 A.1。即使使用真实奖励的 MLE 估计 rϕr_\phi,估计 Z(x)Z(x) 仍然昂贵 [1519]。但可以重排式(4),用对应的最优策略 πr\pi_r、参考策略与未知配分函数表示奖励。对式(4)两边取对数并整理,得到:

r(x,y)=βlogπr(yx)πref(yx)+βlogZ(x)(5)r(x,y)=\beta\log\frac{\pi_r(y\mid x)}{\pi_{\mathrm{ref}}(y\mid x)}+\beta\log Z(x)\tag{5}

把该重参数化应用于真实奖励 rr^* 及对应最优模型 π\pi^*。Bradley–Terry 模型只依赖两个 completion 的奖励差,即 p(y1y2x)=σ(r(x,y1)r(x,y2))p^*(y_1\succ y_2\mid x)=\sigma(r^*(x,y_1)-r^*(x,y_2))。将式(5)代入式(1),配分函数抵消,人类偏好概率只依赖最优策略与参考策略。因此,Bradley–Terry 模型下的最优 RLHF 策略满足:

p(y1y2x)=11+exp ⁣(βlogπ(y2x)πref(y2x)βlogπ(y1x)πref(y1x))(6)p^*(y_1\succ y_2\mid x)=\frac{1}{1+\exp\!\left(\beta\log\frac{\pi^*(y_2\mid x)}{\pi_{\mathrm{ref}}(y_2\mid x)}-\beta\log\frac{\pi^*(y_1\mid x)}{\pi_{\mathrm{ref}}(y_1\mid x)}\right)}\tag{6}

附录 A.2 给出式(6)的推导;附录 A.3 还给出更一般的 Plackett–Luce 形式。现在,人类偏好数据的概率已经表示为最优策略而不是奖励模型的函数,因此可为参数化策略 πθ\pi_\theta 构造最大似然目标。与式(2)的奖励建模类似,策略目标为:

LDPO(πθ;πref)=E(x,yw,yl)D[logσ ⁣(βlogπθ(ywx)πref(ywx)βlogπθ(ylx)πref(ylx))](7)\mathcal L_{\mathrm{DPO}}(\pi_\theta;\pi_{\mathrm{ref}})=-\mathbb E_{(x,y_w,y_l)\sim\mathcal D}\left[\log\sigma\!\left(\beta\log\frac{\pi_\theta(y_w\mid x)}{\pi_{\mathrm{ref}}(y_w\mid x)}-\beta\log\frac{\pi_\theta(y_l\mid x)}{\pi_{\mathrm{ref}}(y_l\mid x)}\right)\right]\tag{7}

这样便用另一种参数化拟合了隐式奖励,而且其最优策略正是当前策略本身。由于这只是一个分类损失,DPO 可以直接在偏好数据上优化,不需要显式奖励模型、强化学习,也不需要在微调期间从策略采样。

DPO 更新做了什么? 为理解其机制,可分析损失 LDPO\mathcal L_{\mathrm{DPO}} 的梯度。梯度会提高偏好 completion ywy_w 的似然、降低非偏好 completion yly_l 的似然;每个样本的权重由隐式奖励模型 r^θ(x,y)=βlog(πθ(yx)/πref(yx))\hat r_\theta(x,y)=\beta\log(\pi_\theta(y\mid x)/\pi_{\mathrm{ref}}(y\mid x)) 对二者排序错误的程度决定。也就是说,模型越确信地把非偏好响应排在前面,更新越强;已经正确区分的样本权重越小。参考策略充当基础测度,β\beta 决定策略偏离参考模型的程度。这个自适应权重正是 DPO 不等同于朴素“提高胜者、压低败者”微调的关键。完整梯度推导见附录 A.4。

DPO 流程。

  1. 对每个提示 xx,从 πref(x)\pi_{\mathrm{ref}}(\cdot\mid x) 采样两个 completion y1,y2y_1,y_2
  2. 用人类偏好标注构造离线数据集 D={x(i),yw(i),yl(i)}i=1N\mathcal D=\{x^{(i)},y_w^{(i)},y_l^{(i)}\}_{i=1}^N;若使用公开偏好数据集,可跳过采样步骤。
  3. 对给定 β\beta,最小化式(7)的 DPO 损失。实践中可直接使用参考模型与策略模型的 token log-probability。实现和超参数见附录 B。

5 DPO 的理论分析

本节进一步解释 DPO,给出理论依据,并把它与 PPO 等现有 RLHF 方法联系起来。

5.1 你的语言模型暗中就是奖励模型

DPO 用单一最大似然目标绕开显式奖励拟合与 RL。式(7)的优化等价于一个 Bradley–Terry 模型,其奖励参数化为 r(x,y)=βlog(πθ(yx)/πref(yx))r^*(x,y)=\beta\log(\pi^*_\theta(y\mid x)/\pi_{\mathrm{ref}}(y\mid x));对参数模型 πθ\pi_\theta 的优化,也等价于在变量替换后优化式(2)的奖励模型。本节将说明:该重参数化不会限制可学习奖励模型的类别,并且允许精确恢复最优策略。

定义 1。 若且唯若存在某个函数 ff,使 r(x,y)r(x,y)=f(x)r(x,y)-r'(x,y)=f(x),则称两个奖励函数 r(x,y)r(x,y)r(x,y)r'(x,y) 等价。这确实构成等价关系,并把奖励函数集合划分为若干等价类。

引理 1。 在 Plackett–Luce(特别是 Bradley–Terry)偏好框架下,同一等价类中的两个奖励函数诱导相同的偏好分布。

引理 2。 同一等价类中的两个奖励函数,在带约束的 RL 问题下诱导相同的最优策略。

证明见附录 A.5。引理 1 是 Bradley–Terry 模型中常见的不可辨识性问题;引理 2 则是 DPO 特有的结果。二者表明:偏好数据只能识别到奖励等价类,而该信息足以恢复唯一的最优策略。

定理 1。 在温和假设下,与 Plackett–Luce(特别是 Bradley–Terry)偏好模型一致的所有奖励等价类,都可以用某个模型 π(yx)\pi(y\mid x) 表示为 r(x,y)=βlog(π(yx)/πref(yx))r(x,y)=\beta\log(\pi(y\mid x)/\pi_{\mathrm{ref}}(y\mid x))。完整证明见附录 A.6。

证明概要。 任取奖励函数 r(x,y)r(x,y),由式(4)得到其最优模型 πr\pi_r。重排式(5)可发现如下算子把任意奖励映射到同一等价类中的归一化代表:

f(r;πref,β)(x,y)=r(x,y)βlogyπref(yx)exp ⁣(1βr(x,y))(8)f(r;\pi_{\mathrm{ref}},\beta)(x,y)=r(x,y)-\beta\log\sum_y\pi_{\mathrm{ref}}(y\mid x)\exp\!\left(\frac{1}{\beta}r(x,y)\right)\tag{8}

这个算子只是用对应最优策略的配分函数对奖励归一化。由于相加项只依赖 xxf(r,πref,β)f(r,\pi_{\mathrm{ref}},\beta)rr 属于同一等价类。它还是双射,因此每个奖励等价类都恰好有一个满足下式的代表:

yπref(yx)exp ⁣(1βr(x,y))=π(yx),由定理 1 的重参数化=1(9)\sum_y\underbrace{\pi_{\mathrm{ref}}(y\mid x)\exp\!\left(\frac{1}{\beta}r(x,y)\right)}_{=\pi(y\mid x)\text{,由定理 1 的重参数化}}=1\tag{9}

式(9)左侧正是该奖励所诱导最优策略的配分函数,所以 Z(x)=1Z(x)=1。因此,可以把定理 1 理解为:每个奖励等价类中恰有一个奖励函数,使最优策略的配分函数为 1;DPO 的策略参数化与奖励等价类之间因此形成精确对应。

5.2 Actor–Critic 算法的不稳定性

该框架还能诊断 RLHF 所用标准 actor–critic 算法(如 PPO)的不稳定性。沿用第 3 节的 RLHF 流程,聚焦 RL 微调阶段,并联系受约束 RL 的 control-as-inference 框架 [22]:设参数化模型为 πθ(yx)\pi_\theta(y\mid x),最小化 DKL[πθ(yx)π(yx)]\mathbb D_{\mathrm{KL}}[\pi_\theta(y\mid x)\|\pi^*(y\mid x)],其中 π\pi^* 是奖励 rϕ(y,x)r_\phi(y,x) 诱导的式(7)最优策略。整理后得到:

maxπθEπθ(yx) ⁣[rϕ(x,y)βlogyπref(yx)exp ⁣(1βrϕ(x,y))f(rϕ,πref,β)βlogπθ(yx)πref(yx)KL](10)\max_{\pi_\theta}\mathbb E_{\pi_\theta(y\mid x)}\!\left[\underbrace{r_\phi(x,y)-\beta\log\sum_y\pi_{\mathrm{ref}}(y\mid x)\exp\!\left(\frac{1}{\beta}r_\phi(x,y)\right)}_{f(r_\phi,\pi_{\mathrm{ref}},\beta)}-\underbrace{\beta\log\frac{\pi_\theta(y\mid x)}{\pi_{\mathrm{ref}}(y\mid x)}}_{\mathrm{KL}}\right]\tag{10}

既有工作 [1284051] 用 DPO 等价奖励 r(x,y)=βlog(π(yx)/πref(yx))r(x,y)=\beta\log(\pi^*(y\mid x)/\pi_{\mathrm{ref}}(y\mid x)) 优化的正是这一目标。因为 logZ(x)\log Z(x) 只依赖参考策略,它不改变最优解;但在策略梯度中,这一项可能带来高方差,使学习不稳定。可以用学习到的 value function 处理归一化项,但该函数本身也难优化;先前工作还使用一个人类 completion 作为基线,本质上是对归一化项的单样本 Monte Carlo 估计。相比之下,DPO 的重参数化得到的奖励不需要任何基线。

6 实验

实验首先在受控文本生成中比较 DPO 与 PPO 等偏好学习算法:在最大化奖励的同时,它能否高效限制相对参考策略的 KL 散度?随后在更大模型和更困难的摘要、对话 RLHF 任务上评估。结果显示,几乎无需调参,DPO 往往能够达到或优于强基线,包括 PPO-RLHF 与按所学奖励选择 NN 个候选中最佳响应的 Best of NN。更多设置见附录 C。

任务。 所有算法都从偏好三元组 D={x(i),yw(i),yl(i)}i=1N\mathcal D=\{x^{(i)},y_w^{(i)},y_l^{(i)}\}_{i=1}^N 学习策略。

  • 受控情感生成: xx 是 IMDb 影评前缀,策略需生成正面情感文本。为进行受控评估,使用预训练情感分类器生成偏好对,条件为 p(positivex,yw)>p(positivex,yl)p(\text{positive}\mid x,y_w)>p(\text{positive}\mid x,y_l)。SFT 在 IMDb 训练集上微调 GPT-2-large 至收敛。
  • 摘要: xx 是 Reddit 帖子,策略生成概括主要内容的摘要 yy。使用 Reddit TL;DR 数据集 [43] 和 Stiennon 等人 [40] 收集的人类偏好,并在人工摘要上微调的 SFT 模型上训练。偏好数据来自另一个训练方式相近的 SFT 模型。
  • 单轮对话: xx 是从天体物理问题到情感建议等任意人类查询,策略需给出有吸引力且有帮助的响应。使用含 17 万段人机对话的 Anthropic Helpful and Harmless 数据集 [1];每段记录以两个候选响应和人类偏好标签结束。该任务没有现成 SFT,因此仅在偏好 completion 上微调通用 LM,形成参考 SFT 模型。
Figure 2原论文图面

左: 期望奖励与相对参考策略 KL 的 Pareto 前沿。对所有 KL 水平,DPO 都取得最高期望奖励,表明其优化质量更高。右: 以 GPT-4 为评估者,TL;DR 摘要相对人工摘要的胜率。DPO 超过 PPO 在摘要任务上的最佳表现,并对采样温度变化更稳健。

评估。 实验采用两种评估方式。在受控情感生成中,真实奖励函数(情感分类器)可用,因此用“所得奖励—相对参考策略 KL 散度”前沿衡量算法优化带约束奖励最大化目标的效率。现实任务中真实奖励未知,因此在摘要和单轮对话中分别以测试集人工摘要和偏好响应为基线,用 GPT-4 判断胜率,作为人工评估摘要质量与响应有用性的代理。已有研究表明,LM 可能比传统指标更适合作自动评估者 [10];第 6.4 节的人类研究进一步验证了 GPT-4 判断:人与 GPT-4 的一致率通常与人际一致率相近或更高。

方法。 除 DPO 外,还评估:摘要上的 zero-shot GPT-J [45];对话上的 2-shot Pythia-2.8B [3];SFT;仅对选中 completion ywy_w 做监督学习的 Preferred-FT;同时提高 ywy_w 概率、降低 yly_l 概率的 Unlikelihood [46],其负项系数 α[0,1]\alpha\in[0,1];用偏好数据学习奖励的 PPO [39];以及情感任务中可访问真实奖励的 oracle PPO-GT。PPO-GT 同时使用 TRLX 的现成实现 [44] 和经奖励归一化、额外调参的自有实现。最后是 Best of NN:从 SFT(对话中为 Preferred-FT)采样 NN 个响应,按偏好数据训练的奖励函数返回最高分者。它把奖励模型质量与 PPO 优化解耦,表现强,但推理时每个查询都要生成 NN 个 completion,即便 NN 中等也不实用。

6.1 DPO 对 RLHF 目标的优化效果如何?

Figure 3原论文图面

左: GPT-4 计算的 Anthropic-HH 单轮对话胜率;DPO 是唯一超过测试集中“选中响应”的方法。右: 训练过程中不同采样温度下的胜率。对于不同采样温度,DPO 相对数据集标签的提升在训练过程中较为稳定。

典型 RLHF 的 KL 约束奖励最大化目标,需要在利用奖励和限制策略偏离参考模型之间权衡,因此不能只比较奖励,必须同时考虑 KL。图 2 左给出情感任务中各算法的奖励—KL 前沿。每种算法用不同保守性超参数运行:PPO 的目标 KL 为 {3,6,9,12}\{3,6,9,12\};DPO 的 β{0.05,0.1,1,5}\beta\in\{0.05,0.1,1,5\};Unlikelihood 的 α{0.05,0.1,0.5,1}\alpha\in\{0.05,0.1,0.5,1\};Preferred-FT 使用不同随机种子,共 22 次运行。每 100 步直至收敛,在测试提示上计算真实平均奖励与相对参考策略的序列级 KL(即各 timestep KL 之和)。DPO 给出的前沿效率远高于其他方法:在保持低 KL 的同时获得最高奖励。特别是,DPO 与 PPO 优化相同目标,但 DPO 的奖励/KL 权衡严格支配 PPO;即便 PPO 能访问真实奖励(PPO-GT),DPO 的前沿仍更优。

6.2 DPO 能扩展到真实偏好数据集吗?

在摘要任务上,ROUGE 等自动指标可能与人类偏好相关性较差 [40]。研究者在 TL;DR 测试集采样 completion,并计算相对参考摘要的平均胜率;各方法的温度从 0 到 1,结果见图 2 右。DPO、PPO 和 Preferred-FT 都从同一 GPT-J SFT 模型出发。DPO 在温度 0 时胜率约为 61%,超过 PPO 在其最佳温度 0 下约 57% 的表现,也高于 Best of NN 的最大胜率。作者没有实质性调节 DPO 的 β\beta,因此这可能仍低估其潜力。DPO 对采样温度也远比 PPO 稳健;高温下 PPO 会退化到基础 GPT-J 水平,Preferred-FT 相对 SFT 则没有显著改善。在第 6.4 节的人类头对头评估中,温度 0.25 的 DPO 样本有 58% 优于温度 0 的 PPO 样本。

在单轮对话中,评估 Anthropic HH 测试集里只有一轮人机交互的子集 [1],GPT-4 以测试集偏好 completion 为参考计算胜率。由于没有标准 SFT,先从预训练 Pythia-2.8B 出发,在选中 completion 上用 Preferred-FT 训练参考模型,再用 DPO 训练。还比较了 128 个 Preferred-FT completion 中选优的 Best of 128(该基线在 128 左右达到平台,见附录图 4)和 2-shot Pythia-2.8B;在各方法最佳温度下,DPO 表现相当或更好。作者也测试了公开的 6B PPO-RLHF 模型,但未找到优于基础 Pythia-2.8B 的提示或温度。综合 TL;DR 结果与二者优化同一奖励函数这一事实,Best of 128 可视为 PPO 水平的粗略代理。总体而言,DPO 是唯一改善 Anthropic HH 偏好 completion、同时计算高效的方法;它与计算昂贵的 Best of 128 相当或更优,并且很快收敛到最佳表现。

6.3 泛化到新的输入分布

Table 1语义 HTML 转录

GPT-4 在分布外 CNN/DailyMail 新闻输入上,相对 ground-truth 摘要的胜率。

算法相对 ground truth 的胜率
温度 0温度 0.25
DPO0.360.31
PPO0.260.23

为比较分布偏移下的 PPO 与 DPO,把 Reddit TL;DR 实验中的策略应用到 CNN/DailyMail 测试集新闻文章 [26],使用在 TL;DR 上最佳的采样温度 0 与 0.25。表 1 用同一个 GPT-4(C)提示相对数据集 ground-truth 摘要计算胜率,只把“forum post”替换为“news article”。在新分布上,DPO 仍以显著优势超过 PPO。这提供了初步证据:即使 DPO 没有使用 PPO 所用的额外无标注 Reddit TL;DR 提示,其泛化能力仍可与 PPO 相当。

6.4 用人工判断验证 GPT-4 判断

作者利用 TL;DR 摘要实验结果和两种 GPT-4 提示,开展人类研究以验证 GPT-4 判断的可靠性。GPT-4(S)(simple)只询问哪个摘要更好地概括帖子的重要信息;GPT-4(C)(concise)还要求比较简洁性,因为作者发现 S 提示下 GPT-4 比人类更偏好冗长、重复的摘要。完整提示见附录 C.2。研究选择表现最高的 DPO(温度 0.25)、最低的 PPO(温度 1.0)与居中的 SFT(温度 0.25),覆盖不同样本质量;三者都与贪心采样的 PPO(其最佳温度)比较。

Table 2语义 HTML 转录

比较 TL;DR 摘要样本上的人工与 GPT-4 胜率,以及逐判断一致率。每个实验都将所列方法的摘要与温度 0 的 PPO 摘要比较。人与 GPT-4 的一致程度大致与人际一致程度相同。

指标DPOSFTPPO-1
受访者数 N272122199
GPT-4(S)胜率 %472713
GPT-4(C)胜率 %543212
人工胜率 %584317
GPT-4(S)—人 一致率707786
GPT-4(C)—人 一致率677985
人—人 一致率6587

两种提示下,GPT-4 与人的一致频率都大致等于人际一致频率,说明 GPT-4 是合理的人工评估代理。由于人工标注者有限,只有 DPO 与 PPO-1 比较收集了多个人工判断。总体上,GPT-4(C)给出的胜率更接近人类,因此第 6.2 节主结果采用 C 提示。人工研究的网页界面和志愿者名单见附录 D.3。

7 讨论

从偏好中学习是训练强大、对齐语言模型的一种可扩展框架。本文提出 DPO:一种无需强化学习、从偏好训练语言模型的简单范式。它不再把偏好学习硬塞进标准 RL 框架以复用现成 RL 算法,而是识别语言模型策略与奖励函数之间的映射,用简单交叉熵损失直接训练语言模型满足人类偏好,既不需要 RL,也不损失一般性。几乎无需超参数调节,DPO 就能达到或优于包括 PPO 在内的现有 RLHF 算法,从而实质性降低从人类偏好训练语言模型的门槛。

参考文献

参考文献按论文原始顺序和书目信息保留。

  1. Y. Bai, A. Jones, K. Ndousse, A. Askell, A. Chen, N. DasSarma, D. Drain, S. Fort, D. Ganguli, T. Henighan, N. Joseph, S. Kadavath, J. Kernion, T. Conerly, S. El-Showk, N. Elhage, Z. Hatfield-Dodds, D. Hernandez, T. Hume, S. Johnston, S. Kravec, L. Lovitt, N. Nanda, C. Olsson, D. Amodei, T. Brown, J. Clark, S. McCandlish, C. Olah, B. Mann, and J. Kaplan. Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022a.
  2. Y. Bai, S. Kadavath, S. Kundu, A. Askell, J. Kernion, A. Jones, A. Chen, A. Goldie, A. Mirhoseini, C. McKinnon, C. Chen, C. Olsson, C. Olah, D. Hernandez, D. Drain, D. Ganguli, D. Li, E. Tran-Johnson, E. Perez, J. Kerr, J. Mueller, J. Ladish, J. Landau, K. Ndousse, K. Lukosuite, L. Lovitt, M. Sellitto, N. Elhage, N. Schiefer, N. Mercado, N. DasSarma, R. Lasenby, R. Larson, S. Ringer, S. Johnston, S. Kravec, S. E. Showk, S. Fort, T. Lanham, T. Telleen-Lawton, T. Conerly, T. Henighan, T. Hume, S. R. Bowman, Z. Hatfield-Dodds, B. Mann, D. Amodei, N. Joseph, S. McCandlish, T. Brown, and J. Kaplan. Constitutional ai: Harmlessness from ai feedback, 2022b.
  3. S. Biderman, H. Schoelkopf, Q. Anthony, H. Bradley, K. O'Brien, E. Hallahan, M. A. Khan, S. Purohit, U. S. Prashanth, E. Raff, A. Skowron, L. Sutawika, and O. van der Wal. Pythia: A suite for analyzing large language models across training and scaling, 2023.
  4. H. Bong and A. Rinaldo. Generalized results for the existence and consistency of the MLE in the Bradley-Terry-Luce model. International Conference on Machine Learning, 2022. arXiv:2110.11487.
  5. R. A. Bradley and M. E. Terry. Rank analysis of incomplete block designs: I. the method of paired comparisons. Biometrika, 39(3/4):324–345, 1952. doi: https://doi.org/10.2307/2334029.
  6. T. Brown, B. Mann, N. Ryder, M. Subbiah, J. D. Kaplan, P. Dhariwal, A. Neelakantan, P. Shyam, G. Sastry, A. Askell, S. Agarwal, A. Herbert-Voss, G. Krueger, T. Henighan, R. Child, A. Ramesh, D. Ziegler, J. Wu, C. Winter, C. Hesse, M. Chen, E. Sigler, M. Litwin, S. Gray, B. Chess, J. Clark, C. Berner, S. McCandlish, A. Radford, I. Sutskever, and D. Amodei. Language models are few-shot learners. In H. Larochelle, M. Ranzato, R. Hadsell, M. Balcan, and H. Lin, editors, Advances in Neural Information Processing Systems, volume 33, pages 1877–1901. Curran Associates, Inc., 2020a. URL https://proceedings.neurips.cc/paper_files/paper/2020/file/1457c0d6bfcb4967418bfb8ac142f64a-Paper.pdf.
  7. T. Brown, B. Mann, N. Ryder, M. Subbiah, J. D. Kaplan, P. Dhariwal, A. Neelakantan, P. Shyam, G. Sastry, A. Askell, et al. Language models are few-shot learners. Advances in neural information processing systems, 33:1877–1901, 2020b.
  8. S. Bubeck, V. Chandrasekaran, R. Eldan, J. Gehrke, E. Horvitz, E. Kamar, P. Lee, Y. T. Lee, Y. Li, S. Lundberg, H. Nori, H. Palangi, M. T. Ribeiro, and Y. Zhang. Sparks of artificial general intelligence: Early experiments with GPT-4, 2023. arXiv preprint arXiv:2303.12712.
  9. R. Busa-Fekete, B. Szorenyi, P. Weng, W. Cheng, and E. Hullermeier. Preference-based reinforcement learning: evolutionary direct policy search using a preference-based racing algorithm. Machine Learning, 97(3):327–351, July 2014. doi: 10.1007/s10994-014-5458-8. URL https://doi.org/10.1007/s10994-014-5458-8.
  10. Y. Chen, R. Wang, H. Jiang, S. Shi, and R.-L. Xu. Exploring the use of large language models for reference-free text quality evaluation: A preliminary empirical study. ArXiv, abs/2304.00723, 2023.
  11. A. Chowdhery, S. Narang, J. Devlin, M. Bosma, G. Mishra, A. Roberts, P. Barham, H. W. Chung, C. Sutton, S. Gehrmann, et al. Palm: Scaling language modeling with pathways. arXiv preprint arXiv:2204.02311, 2022.
  12. P. F. Christiano, J. Leike, T. Brown, M. Martic, S. Legg, and D. Amodei. Deep reinforcement learning from human preferences. In I. Guyon, U. V. Luxburg, S. Bengio, H. Wallach, R. Fergus, S. Vishwanathan, and R. Garnett, editors, Advances in Neural Information Processing Systems, volume 30. Curran Associates, Inc., 2017. URL https://proceedings.neurips.cc/paper_files/paper/2017/file/d5e2c0adad503c91f91df240d0cd4e49-Paper.pdf.
  13. H. W. Chung, L. Hou, S. Longpre, B. Zoph, Y. Tay, W. Fedus, Y. Li, X. Wang, M. Dehghani, S. Brahma, A. Webson, S. S. Gu, Z. Dai, M. Suzgun, X. Chen, A. Chowdhery, A. Castro-Ros, M. Pellat, K. Robinson, D. Valter, S. Narang, G. Mishra, A. Yu, V. Zhao, Y. Huang, A. Dai, H. Yu, S. Petrov, E. H. Chi, J. Dean, J. Devlin, A. Roberts, D. Zhou, Q. V. Le, and J. Wei. Scaling instruction-finetuned language models, 2022.
  14. M. Dudík, K. Hofmann, R. E. Schapire, A. Slivkins, and M. Zoghi. Contextual dueling bandits. In P. Grünwald, E. Hazan, and S. Kale, editors, Proceedings of The 28th Conference on Learning Theory, volume 40 of Proceedings of Machine Learning Research, pages 563–587, Paris, France, 03–06 Jul 2015. PMLR. URL https://proceedings.mlr.press/v40/Dudik15.html.
  15. D. Go, T. Korbak, G. Kruszewski, J. Rozen, N. Ryu, and M. Dymetman. Aligning language models with preferences through f-divergence minimization. In Proceedings of the 40th International Conference on Machine Learning, ICML'23. JMLR.org, 2023.
  16. A. Jain, B. Wojcik, T. Joachims, and A. Saxena. Learning trajectory preferences for manipulators via iterative improvement. In C. Burges, L. Bottou, M. Welling, Z. Ghahramani, and K. Weinberger, editors, Advances in Neural Information Processing Systems, volume 26. Curran Associates, Inc., 2013. URL https://proceedings.neurips.cc/paper_files/paper/2013/file/c058f544c737782deacefa532d9add4c-Paper.pdf.
  17. N. Jaques, S. Gu, D. Bahdanau, J. M. Hernandez-Lobato, R. E. Turner, and D. Eck. Sequence tutor: Conservative fine-tuning of sequence generation models with kl-control. In International Conference on Machine Learning, pages 1645–1654. PMLR, 2017.
  18. N. Jaques, J. H. Shen, A. Ghandeharioun, C. Ferguson, A. Lapedriza, N. Jones, S. S. Gu, and R. Picard. Human-centric dialog training via offline reinforcement learning. arXiv preprint arXiv:2010.05848, 2020.
  19. T. Korbak, H. Elsahar, G. Kruszewski, and M. Dymetman. On reinforcement learning and distribution matching for fine-tuning language models with no catastrophic forgetting. In S. Koyejo, S. Mohamed, A. Agarwal, D. Belgrave, K. Cho, and A. Oh, editors, Advances in Neural Information Processing Systems, volume 35, pages 16203–16220. Curran Associates, Inc., 2022. URL https://proceedings.neurips.cc/paper_files/paper/2022/file/67496dfa96afddab795530cc7c69b57a-Paper-Conference.pdf.
  20. J. Kreutzer, J. Uyheng, and S. Riezler. Reliability and learnability of human bandit feedback for sequence-to-sequence reinforcement learning. In Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 1777–1788, Melbourne, Australia, July 2018. Association for Computational Linguistics. doi: 10.18653/v1/P18-1165. URL https://aclanthology.org/P18-1165.
  21. A. Kupcsik, D. Hsu, and W. S. Lee. Learning Dynamic Robot-to-Human Object Handover from Human Feedback, pages 161–176. Springer International Publishing, 01 2018. ISBN 978-3-319-51531-1. doi: 10.1007/978-3-319-51532-8_10.
  22. S. Levine. Reinforcement learning and control as probabilistic inference: Tutorial and review, 2018.
  23. R. D. Luce. Individual choice behavior: A theoretical analysis. Courier Corporation, 2012.
  24. A. L. Maas, R. E. Daly, P. T. Pham, D. Huang, A. Y. Ng, and C. Potts. Learning word vectors for sentiment analysis. In Proceedings of the 49th Annual Meeting of the Association for Computational Linguistics: Human Language Technologies, pages 142–150, Portland, Oregon, USA, June 2011. Association for Computational Linguistics. URL http://www.aclweb.org/anthology/P11-1015.
  25. S. Mishra, D. Khashabi, C. Baral, and H. Hajishirzi. Cross-task generalization via natural language crowdsourcing instructions. In Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 3470–3487, Dublin, Ireland, May 2022. Association for Computational Linguistics. doi: 10.18653/v1/2022.acl-long.244. URL https://aclanthology.org/2022.acl-long.244.
  26. R. Nallapati, B. Zhou, C. dos Santos, C. Gulcehre, and B. Xiang. Abstractive text summarization using sequence-to-sequence RNNs and beyond. In of the 20th SIGNLL Conference on Computational Natural Language Learning, pages 280–290, Berlin, Germany, Aug. 2016. Association for Computational Linguistics. doi: 10.18653/v1/K16-1028. URL https://aclanthology.org/K16-1028.
  27. D. Narayanan, M. Shoeybi, J. Casper, P. LeGresley, M. Patwary, V. Korthikanti, D. Vainbrand, P. Kashinkunti, J. Bernauer, B. Catanzaro, A. Phanishayee, and M. Zaharia. Efficient large-scale language model training on gpu clusters using megatron-lm. In Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis, SC '21, New York, NY, USA, 2021. Association for Computing Machinery. ISBN 9781450384421. doi: 10.1145/3458817.3476209. URL https://doi.org/10.1145/3458817.3476209.
  28. L. Ouyang, J. Wu, X. Jiang, D. Almeida, C. Wainwright, P. Mishkin, C. Zhang, S. Agarwal, K. Slama, A. Ray, J. Schulman, J. Hilton, F. Kelton, L. Miller, M. Simens, A. Askell, P. Welinder, P. F. Christiano, J. Leike, and R. Lowe. Training language models to follow instructions with human feedback. In S. Koyejo, S. Mohamed, A. Agarwal, D. Belgrave, K. Cho, and A. Oh, editors, Advances in Neural Information Processing Systems, volume 35, pages 27730–27744. Curran Associates, Inc., 2022. URL https://proceedings.neurips.cc/paper_files/paper/2022/file/b1efde53be364a73914f58805a001731-Paper-Conference.pdf.
  29. R. Paulus, C. Xiong, and R. Socher. A deep reinforced model for abstractive summarization. In International Conference on Learning Representations, 2018. URL https://openreview.net/forum?id=HkAClQgA-.
  30. X. B. Peng, A. Kumar, G. Zhang, and S. Levine. Advantage-weighted regression: Simple and scalable off-policy reinforcement learning. arXiv preprint arXiv:1910.00177, 2019.
  31. J. Peters and S. Schaal. Reinforcement learning by reward-weighted regression for operational space control. In Proceedings of the 24th international conference on Machine learning, pages 745–750, 2007.
  32. R. L. Plackett. The analysis of permutations. Journal of the Royal Statistical Society. Series C (Applied Statistics), 24(2):193–202, 1975. doi: https://doi.org/10.2307/2346567.
  33. A. Radford, J. Wu, R. Child, D. Luan, D. Amodei, and I. Sutskever. Language models are unsupervised multitask learners, 2019. Ms., OpenAI.
  34. R. Ramamurthy, P. Ammanabrolu, K. Brantley, J. Hessel, R. Sifa, C. Bauckhage, H. Hajishirzi, and Y. Choi. Is reinforcement learning (not) for natural language processing: Benchmarks, baselines, and building blocks for natural language policy optimization. In The Eleventh International Conference on Learning Representations, 2023. URL https://openreview.net/forum?id=8aHzds2uUyB.
  35. M. Ranzato, S. Chopra, M. Auli, and W. Zaremba. Sequence level training with recurrent neural networks. CoRR, abs/1511.06732, 2015.
  36. D. Sadigh, A. D. Dragan, S. Sastry, and S. A. Seshia. Active preference-based learning of reward functions. In Robotics: Science and Systems (RSS), 2017.
  37. A. Saha, A. Pacchiano, and J. Lee. Dueling rl: Reinforcement learning with trajectory preferences. In F. Ruiz, J. Dy, and J.-W. van de Meent, editors, Proceedings of The 26th International Conference on Artificial Intelligence and Statistics, volume 206 of Proceedings of Machine Learning Research, pages 6263–6289. PMLR, 25–27 Apr 2023. URL https://proceedings.mlr.press/v206/saha23a.html.
  38. V. Sanh, A. Webson, C. Raffel, S. Bach, L. Sutawika, Z. Alyafeai, A. Chaffin, A. Stiegler, A. Raja, M. Dey, M. S. Bari, C. Xu, U. Thakker, S. S. Sharma, E. Szczechla, T. Kim, G. Chhablani, N. Nayak, D. Datta, J. Chang, M. T.-J. Jiang, H. Wang, M. Manica, S. Shen, Z. X. Yong, H. Pandey, R. Bawden, T. Wang, T. Neeraj, J. Rozen, A. Sharma, A. Santilli, T. Fevry, J. A. Fries, R. Teehan, T. L. Scao, S. Biderman, L. Gao, T. Wolf, and A. M. Rush. Multitask prompted training enables zero-shot task generalization. In International Conference on Learning Representations, 2022. URL https://openreview.net/forum?id=9Vrb9D0WI4.
  39. J. Schulman, F. Wolski, P. Dhariwal, A. Radford, and O. Klimov. Proximal policy optimization algorithms, 2017.
  40. N. Stiennon, L. Ouyang, J. Wu, D. M. Ziegler, R. Lowe, C. Voss, A. Radford, D. Amodei, and P. Christiano. Learning to summarize from human feedback, 2022.
  41. R. Thoppilan, D. D. Freitas, J. Hall, N. Shazeer, A. Kulshreshtha, H.-T. Cheng, A. Jin, T. Bos, L. Baker, Y. Du, Y. Li, H. Lee, H. S. Zheng, A. Ghafouri, M. Menegali, Y. Huang, M. Krikun, D. Lepikhin, J. Qin, D. Chen, Y. Xu, Z. Chen, A. Roberts, M. Bosma, V. Zhao, Y. Zhou, C.-C. Chang, I. Krivokon, W. Rusch, M. Pickett, P. Srinivasan, L. Man, K. Meier-Hellstern, M. R. Morris, T. Doshi, R. D. Santos, T. Duke, J. Soraker, B. Zevenbergen, V. Prabhakaran, M. Diaz, B. Hutchinson, K. Olson, A. Molina, E. Hoffman-John, J. Lee, L. Aroyo, R. Rajakumar, A. Butryna, M. Lamm, V. Kuzmina, J. Fenton, A. Cohen, R. Bernstein, R. Kurzweil, B. Aguera-Arcas, C. Cui, M. Croak, E. Chi, and Q. Le. Lamda: Language models for dialog applications, 2022.
  42. H. Touvron, T. Lavril, G. Izacard, X. Martinet, M.-A. Lachaux, T. Lacroix, B. Rozi\`ere, N. Goyal, E. Hambro, F. Azhar, et al. Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971, 2023.
  43. M. Volske, M. Potthast, S. Syed, and B. Stein. TL;DR: Mining Reddit to learn automatic summarization. In Proceedings of the Workshop on New Frontiers in Summarization, pages 59–63, Copenhagen, Denmark, Sept. 2017. Association for Computational Linguistics. doi: 10.18653/v1/W17-4508. URL https://aclanthology.org/W17-4508.
  44. L. von Werra, J. Tow, reciprocated, S. Matiana, A. Havrilla, cat state, L. Castricato, Alan, D. V. Phung, A. Thakur, A. Bukhtiyarov, aaronrmm, F. Milo, Daniel, D. King, D. Shin, E. Kim, J. Wei, M. Romero, N. Pochinkov, O. Sanseviero, R. Adithyan, S. Siu, T. Simonini, V. Blagojevic, X. Song, Z. Witten, alexandremuzio, and crumb. CarperAI/trlx: v0.6.0: LLaMa (Alpaca), Benchmark Util, T5 ILQL, Tests, Mar. 2023. URL https://doi.org/10.5281/zenodo.7790115.
  45. B. Wang and A. Komatsuzaki. GPT-J-6B: A 6 Billion Parameter Autoregressive Language Model. https://github.com/kingoflolz/mesh-transformer-jax, May 2021.
  46. S. Welleck, I. Kulikov, S. Roller, E. Dinan, K. Cho, and J. Weston. Neural text generation with unlikelihood training. arXiv preprint arXiv:1908.04319, 2019.
  47. R. J. Williams. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach. Learn., 8(3–4):229–256, may 1992. ISSN 0885-6125. doi: 10.1007/BF00992696. URL https://doi.org/10.1007/BF00992696.
  48. Y. Wu and B. Hu. Learning to extract coherent summary via deep reinforcement learning. In Proceedings of the Thirty-Second AAAI Conference on Artificial Intelligence and Thirtieth Innovative Applications of Artificial Intelligence Conference and Eighth AAAI Symposium on Educational Advances in Artificial Intelligence, AAAI'18/IAAI'18/EAAI'18. AAAI Press, 2018. ISBN 978-1-57735-800-8.
  49. X. Yan, C. Luo, C. L. A. Clarke, N. Craswell, E. M. Voorhees, and P. Castells. Human preferences as dueling bandits. In Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval, SIGIR '22, page 567–577, New York, NY, USA, 2022. Association for Computing Machinery. ISBN 9781450387323. doi: 10.1145/3477495.3531991. URL https://doi.org/10.1145/3477495.3531991.
  50. Y. Yue, J. Broder, R. Kleinberg, and T. Joachims. The k-armed dueling bandits problem. Journal of Computer and System Sciences, 78(5):1538–1556, 2012. ISSN 0022-0000. doi: https://doi.org/10.1016/j.jcss.2011.12.028. URL https://www.sciencedirect.com/science/article/pii/S0022000012000281. JCSS Special Issue: Cloud Computing 2011.
  51. D. M. Ziegler, N. Stiennon, J. Wu, T. B. Brown, A. Radford, D. Amodei, P. Christiano, and G. Irving. Fine-tuning language models from human preferences, 2020.

作者贡献

所有作者都对实验的设计、分析与迭代、论文的撰写与编辑,以及项目总体进度管理作出了重要贡献。

RR 在与 EM 的讨论中提出使用 autoregressive 奖励模型;推导 DPO 目标;证明算法的理论性质并撰写相关章节与附录;还建议并协助组织实验,并贡献了部分 PPO 与奖励学习基线。

AS 发起了把加权回归作为 PPO 替代方案的讨论;推动项目组织;撰写了把 DPO 与加权回归、Unlikelihood 联系起来的初步分析;参与 DPO 与基线实现的设计迭代及早期探索实验;大幅参与数据集、基线和评估等实验组织与设计;主导受控情感生成和摘要的模型训练与评估;迭代设计 GPT-4 评估(尤其是摘要部分);对摘要、预备知识、方法和实验的写作作出大量贡献,并参与其他章节编辑。

EM 参与了关于学习 autoregressive 奖励函数的早期讨论;编写首个 DPO 实现并运行最初实验;训练论文实验中的大规模摘要与对话 DPO 模型;完成早期 GPT-4 胜率评估并搭建相关基础设施;招募人类研究参与者、执行研究并分析结果;撰写摘要、引言、相关工作、讨论和大部分实验内容,并协助编辑论文其余部分。

CF、CM 与 SE 监督研究,提出想法与实验建议,并协助撰写论文。

附录 A 数学推导

A.1 推导 KL 约束奖励最大化目标的最优解

本节推导式(4)。与式(3)类似,对任意奖励函数 r(x,y)r(x,y)、参考模型 πref\pi_{\mathrm{ref}} 和一般的非参数策略类,优化:

maxπ  ExD,yπ[r(x,y)]βDKL[π(yx)πref(yx)](11)\max_\pi\;\mathbb E_{x\sim\mathcal D,\,y\sim\pi}[r(x,y)]-\beta\mathbb D_{\mathrm{KL}}[\pi(y\mid x)\|\pi_{\mathrm{ref}}(y\mid x)]\tag{11}

将目标展开,并把最大化奖励减 KL 等价地写成最小化:

maxπ  ExD,yπ[r(x,y)]βDKL[π(yx)πref(yx)]=maxπExDEyπ(yx)[r(x,y)βlogπ(yx)πref(yx)]=minπExDEyπ(yx)[logπ(yx)πref(yx)1βr(x,y)]=minπExDEyπ(yx)[logπ(yx)Z(x)1πref(yx)exp(r(x,y)/β)logZ(x)](12)\begin{aligned}\max_\pi\;&\mathbb E_{x\sim\mathcal D,\,y\sim\pi}\bigl[r(x,y)\bigr]-\beta\mathbb D_{\mathrm{KL}}\bigl[\pi(y\mid x)\|\pi_{\mathrm{ref}}(y\mid x)\bigr]\\&=\max_\pi\mathbb E_{x\sim\mathcal D}\mathbb E_{y\sim\pi(y\mid x)}\left[r(x,y)-\beta\log\frac{\pi(y\mid x)}{\pi_{\mathrm{ref}}(y\mid x)}\right]\\&=\min_\pi\mathbb E_{x\sim\mathcal D}\mathbb E_{y\sim\pi(y\mid x)}\left[\log\frac{\pi(y\mid x)}{\pi_{\mathrm{ref}}(y\mid x)}-\frac1\beta r(x,y)\right]\\&=\min_\pi\mathbb E_{x\sim\mathcal D}\mathbb E_{y\sim\pi(y\mid x)}\left[\log\frac{\pi(y\mid x)}{Z(x)^{-1}\pi_{\mathrm{ref}}(y\mid x)\exp(r(x,y)/\beta)}-\log Z(x)\right]\end{aligned}\tag{12}

这里的配分函数是 Z(x)=yπref(yx)exp(r(x,y)/β)Z(x)=\sum_y\pi_{\mathrm{ref}}(y\mid x)\exp(r(x,y)/\beta)。定义 π(yx)=Z(x)1πref(yx)exp(r(x,y)/β)\pi^*(y\mid x)=Z(x)^{-1}\pi_{\mathrm{ref}}(y\mid x)\exp(r(x,y)/\beta);因为对所有 yy 都非负且总和为 1,它是合法概率分布。

由于 Z(x)Z(x) 不依赖 yy,式(12)的最终目标可整理为:

minπ  ExD[Eyπ(yx)[logπ(yx)π(yx)]logZ(x)](13)\min_\pi\;\mathbb E_{x\sim\mathcal D}\left[\mathbb E_{y\sim\pi(y\mid x)}\left[\log\frac{\pi(y\mid x)}{\pi^*(y\mid x)}\right]-\log Z(x)\right]\tag{13}

也就是:

minπ  ExD[DKL(π(yx)π(yx))logZ(x)](14)\min_\pi\;\mathbb E_{x\sim\mathcal D}\left[\mathbb D_{\mathrm{KL}}(\pi(y\mid x)\|\pi^*(y\mid x))-\log Z(x)\right]\tag{14}

Z(x)Z(x)π\pi 无关,因此只需最小化第一项 KL。Gibbs 不等式表明,KL 当且仅当两个分布相同时达到最小值 0,于是最优解为:

π(yx)=π(yx)=1Z(x)πref(yx)exp ⁣(1βr(x,y))(15)\pi(y\mid x)=\pi^*(y\mid x)=\frac1{Z(x)}\pi_{\mathrm{ref}}(y\mid x)\exp\!\left(\frac1\beta r(x,y)\right)\tag{15}

至此完成式(4)的推导。

A.2 在 Bradley–Terry 模型下推导 DPO 目标

Bradley–Terry 偏好模型给出:

p(y1y2x)=exp(r(x,y1))exp(r(x,y1))+exp(r(x,y2))(16)p^*(y_1\succ y_2\mid x)=\frac{\exp(r^*(x,y_1))}{\exp(r^*(x,y_1))+\exp(r^*(x,y_2))}\tag{16}

第 4 节已经把不可观测的真实奖励表示成对应最优策略的函数:

r(x,y)=βlogπ(yx)πref(yx)+βlogZ(x)(17)r^*(x,y)=\beta\log\frac{\pi^*(y\mid x)}{\pi_{\mathrm{ref}}(y\mid x)}+\beta\log Z(x)\tag{17}

把式(17)代入式(16),分子分母中的 exp(βlogZ(x))\exp(\beta\log Z(x)) 抵消,得到 p(y1y2x)=σ ⁣(βlogπ(y1x)πref(y1x)βlogπ(y2x)πref(y2x))p^*(y_1\succ y_2\mid x)=\sigma\!\left(\beta\log\frac{\pi^*(y_1\mid x)}{\pi_{\mathrm{ref}}(y_1\mid x)}-\beta\log\frac{\pi^*(y_2\mid x)}{\pi_{\mathrm{ref}}(y_2\mid x)}\right)。最后一行正是式(7)的逐样本损失形式。

A.3 在 Plackett–Luce 模型下推导 DPO 目标

Plackett–Luce 模型 [2332] 把 Bradley–Terry 从成对比较推广到排序。给定提示 xxKK 个答案 y1,,yKy_1,\ldots,y_K,用户给出排列 τ:[K][K]\tau:[K]\to[K],表示答案排名。模型规定:

p(τy1,,yK,x)=k=1Kexp(r(x,yτ(k)))j=kKexp(r(x,yτ(j)))(18)p^*(\tau\mid y_1,\ldots,y_K,x)=\prod_{k=1}^{K}\frac{\exp(r^*(x,y_{\tau(k)}))}{\sum_{j=k}^{K}\exp(r^*(x,y_{\tau(j)}))}\tag{18}

K=2K=2 时,式(18)退化为 Bradley–Terry。对一般 Plackett–Luce 模型,仍可把式(5)的策略参数化奖励代入;与 A.2 相同,Z(x)Z(x) 抵消,得到:

p(τy1,,yK,x)=k=1Kexp ⁣(βlogπ(yτ(k)x)πref(yτ(k)x))j=kKexp ⁣(βlogπ(yτ(j)x)πref(yτ(j)x))(19)p^*(\tau\mid y_1,\ldots,y_K,x)=\prod_{k=1}^{K}\frac{\exp\!\left(\beta\log\frac{\pi^*(y_{\tau(k)}\mid x)}{\pi_{\mathrm{ref}}(y_{\tau(k)}\mid x)}\right)}{\sum_{j=k}^{K}\exp\!\left(\beta\log\frac{\pi^*(y_{\tau(j)}\mid x)}{\pi_{\mathrm{ref}}(y_{\tau(j)}\mid x)}\right)}\tag{19}

若有提示与用户排序数据集 D={τ(i),y1(i),,yK(i),x(i)}i=1N\mathcal D=\{\tau^{(i)},y_1^{(i)},\ldots,y_K^{(i)},x^{(i)}\}_{i=1}^N,即可像第 4 节一样,用参数化模型最大似然优化:

LDPO(πθ,πref)=Eτ,y1,,yK,xD[logk=1Kexp ⁣(βlogπθ(yτ(k)x)πref(yτ(k)x))j=kKexp ⁣(βlogπθ(yτ(j)x)πref(yτ(j)x))](20)\mathcal L_{\mathrm{DPO}}(\pi_\theta,\pi_{\mathrm{ref}})=-\mathbb E_{\tau,y_1,\ldots,y_K,x\sim\mathcal D}\left[\log\prod_{k=1}^{K}\frac{\exp\!\left(\beta\log\frac{\pi_\theta(y_{\tau(k)}\mid x)}{\pi_{\mathrm{ref}}(y_{\tau(k)}\mid x)}\right)}{\sum_{j=k}^{K}\exp\!\left(\beta\log\frac{\pi_\theta(y_{\tau(j)}\mid x)}{\pi_{\mathrm{ref}}(y_{\tau(j)}\mid x)}\right)}\right]\tag{20}

A.4 推导 DPO 目标的梯度

从 DPO 目标的梯度开始:

θLDPO=θE(x,yw,yl)D[logσ ⁣(βlogπθ(ylx)πref(ylx)βlogπθ(ywx)πref(ywx))](21)\nabla_\theta\mathcal L_{\mathrm{DPO}}=-\nabla_\theta\mathbb E_{(x,y_w,y_l)\sim\mathcal D}\left[\log\sigma\!\left(\beta\log\frac{\pi_\theta(y_l\mid x)}{\pi_{\mathrm{ref}}(y_l\mid x)}-\beta\log\frac{\pi_\theta(y_w\mid x)}{\pi_{\mathrm{ref}}(y_w\mid x)}\right)\right]\tag{21}

u=βlogπθ(ylx)πref(ylx)βlogπθ(ywx)πref(ywx)u=\beta\log\frac{\pi_\theta(y_l\mid x)}{\pi_{\mathrm{ref}}(y_l\mid x)}-\beta\log\frac{\pi_\theta(y_w\mid x)}{\pi_{\mathrm{ref}}(y_w\mid x)},右侧可写为:

θLDPO=E(x,yw,yl)D[σ(u)σ(u)θu](22)\nabla_\theta\mathcal L_{\mathrm{DPO}}=-\mathbb E_{(x,y_w,y_l)\sim\mathcal D}\left[\frac{\sigma'(u)}{\sigma(u)}\nabla_\theta u\right]\tag{22}

利用 σ(x)=σ(x)(1σ(x))\sigma'(x)=\sigma(x)(1-\sigma(x))σ(x)=1σ(x)\sigma(-x)=1-\sigma(x),最终得到 E[βσ(u)(θlogπθ(ywx)θlogπθ(ylx))]-\mathbb E[\beta\sigma(-u)(\nabla_\theta\log\pi_\theta(y_w\mid x)-\nabla_\theta\log\pi_\theta(y_l\mid x))]。再代入隐式奖励 r^θ(x,y)=βlog(πθ(yx)/πref(yx))\hat r_\theta(x,y)=\beta\log(\pi_\theta(y\mid x)/\pi_{\mathrm{ref}}(y\mid x)),就得到第 4 节给出的梯度形式。

A.5 引理 1 与引理 2 的证明

引理 1(重述)。 在 Plackett–Luce 偏好框架、尤其是 Bradley–Terry 框架下,同一等价类中的两个奖励函数诱导相同偏好分布。

证明。r(x,y)=r(x,y)+f(x)r'(x,y)=r(x,y)+f(x),对任意提示 xx、答案 y1,,yKy_1,\ldots,y_K 和排序 τ\tau,把 rr' 代入式(18);每个乘积因子的分子分母都含相同的 exp(f(x))\exp(f(x)),约去后恰好得到由 rr 诱导的概率。因此 pr(τy1,,yK,x)=pr(τy1,,yK,x)p_{r'}(\tau\mid y_1,\ldots,y_K,x)=p_r(\tau\mid y_1,\ldots,y_K,x),证毕。

引理 2(重述)。 同一等价类中的两个奖励函数,在带约束 RL 问题下诱导相同最优策略。

证明。r(x,y)=r(x,y)+f(x)r'(x,y)=r(x,y)+f(x),相应最优策略为 πr\pi_{r'}πr\pi_r。把 rr' 代入式(4)时,分子出现 exp(f(x)/β)\exp(f(x)/\beta),配分函数的每一项也都出现同一因子;二者约去,剩余表达式正是 πr(yx)\pi_r(y\mid x)。因此对所有 x,yx,yπr(yx)=πr(yx)\pi_{r'}(y\mid x)=\pi_r(y\mid x),证毕。

A.6 定理 1 的证明

定理 1(重述)。 假设参考模型对所有提示—答案对都满足 πref(yx)>0\pi_{\mathrm{ref}}(y\mid x)>0,且 β>0\beta>0。第 5 节定义的每个奖励等价类,都可由某个模型 π(yx)\pi(y\mid x) 表示成 r(x,y)=βlog(π(yx)/πref(yx))r(x,y)=\beta\log(\pi(y\mid x)/\pi_{\mathrm{ref}}(y\mid x))

证明。 任取奖励 r(x,y)r(x,y),令 πr\pi_r 是它在 KL 约束 RL 问题下诱导的最优模型。由式(5),r(x,y)=βlog(πr(yx)/πref(yx))+βlogZ(x)r(x,y)=\beta\log(\pi_r(y\mid x)/\pi_{\mathrm{ref}}(y\mid x))+\beta\log Z(x)。定义 r(x,y)=f(r,πref,β)(x,y)=r(x,y)βlogZ(x)r'(x,y)=f(r,\pi_{\mathrm{ref}},\beta)(x,y)=r(x,y)-\beta\log Z(x),则 rr'rr 属于同一等价类,并且 r(x,y)=βlog(πr(yx)/πref(yx))r'(x,y)=\beta\log(\pi_r(y\mid x)/\pi_{\mathrm{ref}}(y\mid x)),证毕。

进一步地,若 rrrr' 同属一个等价类,引理 2 给出 πr=πr\pi_r=\pi_{r'},因此 f(r,πref,β)=f(r,πref,β)f(r,\pi_{\mathrm{ref}},\beta)=f(r',\pi_{\mathrm{ref}},\beta)。也就是说,算子 ff 把同一等价类中的所有奖励映射到同一个奖励函数。下面证明,每个等价类中具有定理 1 参数形式的奖励是唯一的。

命题 1。πref(yx)>0\pi_{\mathrm{ref}}(y\mid x)>0β>0\beta>0,每个奖励等价类中都恰有一个奖励函数可写成 r(x,y)=βlog(π(yx)/πref(yx))r(x,y)=\beta\log(\pi(y\mid x)/\pi_{\mathrm{ref}}(y\mid x))

证明。 反设同一等价类中有 r=r+f(x)r'=r+f(x),且二者分别由不同分布 π\pi'π\pi 表示为策略概率比。则 π(yx)=π(yx)exp(f(x)/β)\pi'(y\mid x)=\pi(y\mid x)\exp(f(x)/\beta)。对 yy 求和,因两边都是归一化分布,得到 exp(f(x)/β)=1\exp(f(x)/\beta)=1;又因 β>0\beta>0,所以所有 xx 都有 f(x)=0f(x)=0,即 r=rr=r',矛盾。故唯一性成立。

由此可知,每个奖励等价类都有唯一的定理 1 形式代表;任取该类中的奖励 rr,这个代表就是 f(r,πref,β)f(r,\pi_{\mathrm{ref}},\beta)

附录 B DPO 实现细节与超参数

DPO 实现相当直接,论文给出如下 PyTorch 代码。pi_logpsref_logps 的 shape 为 (B,)yw_idxsyl_idxs 是 shape (T,) 的偏好/非偏好 completion 索引;每对索引表示一个偏好对;beta 控制 KL 惩罚强度。
import torch.nn.functional as F

def dpo_loss(pi_logps, ref_logps, yw_idxs, yl_idxs, beta):
    pi_yw_logps, pi_yl_logps = pi_logps[yw_idxs], pi_logps[yl_idxs]
    ref_yw_logps, ref_yl_logps = ref_logps[yw_idxs], ref_logps[yl_idxs]

    pi_logratios = pi_yw_logps - pi_yl_logps
    ref_logratios = ref_yw_logps - ref_yl_logps

    losses = -F.logsigmoid(beta * (pi_logratios - ref_logratios))
    rewards = beta * (pi_logps - ref_logps).detach()
    return losses, rewards

除非另有说明,默认使用 β=0.1\beta=0.1、batch size 64、RMSprop 优化器和 10610^{-6} 学习率;前 150 步把学习率从 0 线性 warmup 到 10610^{-6}。TL;DR 摘要使用 β=0.5\beta=0.5,其余参数不变。

附录 C 更多实验设置细节

本节补充与实验设计有关的细节。

C.1 IMDb 情感实验与基线细节

提示是 IMDb 数据集中长度 2–8 token 的前缀。真实奖励模型使用预训练情感分类器 siebert/sentiment-roberta-large-english,基础模型使用 gpt2-large;较大的模型能避免默认模型生成质量较低、奖励不够准确的问题。先在 IMDb 子集上做 1 epoch SFT,再为 25,000 个前缀各采样 4 个 completion,用真实奖励构造每个前缀的 6 个偏好对。RLHF 奖励模型由 gpt2-large 初始化,在偏好数据上训练 3 epoch,取验证准确率最高的 checkpoint。“TRL”运行使用 TRL 库默认超参数;自有实现每个 PPO step 使用 1,024 个样本的大 batch。

C.2 计算摘要与对话胜率的 GPT-4 提示

GPT-4 胜率判断是实验的重要组成部分。所有实验使用 gpt-4-0314;每次评估都随机决定两个摘要或响应的呈现顺序。

摘要 GPT-4 胜率提示(S)。

“下面哪个摘要更好地概括了给定论坛帖子的最重要内容?

帖子:<post>

摘要 A:<Summary A>

摘要 B:<Summary B>

首先用一句话比较两个摘要,解释哪个更好、为什么。然后另起一行,只输出 AB 表示你的选择。

比较:<一句话比较与解释>
选择:<A 或 B>

摘要 GPT-4 胜率提示(C)。

“下面哪个摘要能在不包含无关或不重要细节的前提下,更简洁地概括给定论坛帖子的最重要内容?

帖子:<post>

摘要 A:<Summary A>

摘要 B:<Summary B>

首先用一句话比较两个摘要,解释哪个更好、为什么。然后另起一行,只输出 AB 表示你的选择。

比较:<一句话比较与解释>
选择:<A 或 B>

对话 GPT-4 胜率提示。

“对于下面给聊天机器人的查询,哪个响应更有帮助?

查询:<用户查询>

响应 A:<第一个响应>

响应 B:<第二个响应>

首先用一句话比较两个响应,解释哪个更有帮助。然后另起一行,只输出 AB。不能说平局;必须选 A 或 B。若一个响应有帮助,你会更愿意向能够给出该响应的朋友或老师求助。

比较:<一句话比较与解释>
更有帮助:<A 或 B>

C.3 Unlikelihood 基线

Unlikelihood 基线 [46] 在最大化偏好响应 logpθ(ywx)\log p_\theta(y_w\mid x) 的同时,最小化非偏好响应的 log-probability,目标为 logpθ(ywx)αlogpθ(ylx)\log p_\theta(y_w\mid x)-\alpha\log p_\theta(y_l\mid x)。作者发现该朴素目标会产生退化的重复序列,因此未在摘要或对话实验中纳入该基线;那些任务中的输出通常没有意义。表 3 给出 TL;DR 样例。

Table 3语义 HTML 转录

以温度 1.0 从 TL;DR 提示采样的 Unlikelihood 输出。一般而言,Unlikelihood 不能生成有意义的响应;两个样例都退化为连续重复同一词元。

提示响应
SUBREDDIT:r/relationships。TITLE:我 [22 M] 约会一个月的女孩 [26 F] 昨天与一位朋友 [约 30? M] 相处时完全没有回复我。POST:她在自己家时信号很差,但我昨天给她发了三次短信,每次相隔 4–5 小时。她直到今天清晨才给我打电话,并在语音留言中说,一位突然出现的朋友让她忙了一整天。我看到她在 Facebook 上发了一张两人的照片,拍摄地点已经离开她家那个没有信号的区域,而且发布时间早于我最后一次给她发短信。我并不介意她和朋友出去,而且我知道我们才刚开始交往 […] TL;DR:girl when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when whenUB when when when when whenUB when when when whenUB
SUBREDDIT:r/tifu。TITLE:TIFU——意外踢到一位老妇人。POST:这并不是今天发生的,而是大约一两年前。我当时参加祖父的葬礼,当然现场非常悲伤,许多老人都在哭。仪式结束后,所有人走出建筑,来到灵车驶过的小路另一侧。这条路之所以重要,是因为有路就有通往人行道的路缘;我们大多数人已经在路对面,只有几位老人走得很慢。就在一位老妇人要迈上路缘时 […] TL;DR:when an old woman was tripping the when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when when

附录 D 更多实证结果

D.1 不同 N 下 Best of N 基线的表现

Best of NN 是很强的基线,但计算昂贵,每次响应都要采样许多候选。图 4 补充了多个 NN 的结果;为避免图面拥挤,正文图 3 只显示 N=128N=128。对话和 TL;DR 摘要表现都在约 64–128 个样本后进入平台。

Figure 4原论文图面

Best of NN 基线,N{1,4,16,64,128}N\in\{1,4,16,64,128\}。性能在大约 64–128 个样本后达到平台。

D.2 样例响应与 GPT-4 判断

本节给出 DPO 与基线的比较样例:摘要基线是温度 0 的 PPO,对话基线是数据集 ground-truth 选中响应。表 4–6 是摘要样例,表 7–10 是对话样例。

Table 4语义 HTML 转录

TL;DR 测试集样例。DPO 温度 0.25,PPO 温度 0。评估时呈现顺序随机;判断中的粗体括注是事后标注,不属于模型生成。

提示r/AskReddit:我长期以来一直辜负只想给我最好生活的父母。我 17 岁,即将上大学,最近接连意识到自己以前对他们有多糟。我知道没有速成办法,但想在离开前、圣诞节或生日时做一件真正让他们开心的大事。我能做什么?
DPOTL;DR:我以前是个很糟糕的孩子,现在想弥补;在父母生日和圣诞节时,我能做什么来表达自己有多爱他们?
PPOTL;DR:我以前对父母很糟,在离开前我能做什么弥补?上大学后又能做什么让他们开心?大学毕业后还能做什么让他们开心(如果确实如此)?
判断摘要 B [DPO] 更有效地抓住帖子重点,聚焦于在特殊场合用行动让父母开心;摘要 A 重复且不够清楚。
Table 5语义 HTML 转录

TL;DR 测试集样例。DPO 温度 0.25,PPO 温度 0;呈现顺序随机,粗体括注为事后标注。

提示r/relationships:我(22 岁男性)几天后要向交往近两年的女友(22 岁女性)求婚。戒指已经买好,也得到她父亲祝福;我知道她会答应,求婚计划也很周全,但现在极度焦虑、睡不着。朋友只说临开口前会更难受。我怎样才能在求婚前放松下来?
DPOTL;DR:我马上要向交往近两年的女友求婚,但紧张得睡不着。怎样才能放松?
PPOTL;DR:我要向交往近两年的女友求婚,但无法平静。有什么放松方法吗?我想今晚(以及求婚前一晚)能睡着……
判断摘要 A [DPO] 更有效地概括了帖子要点,简洁传达了提问者的焦虑和寻找放松方法的目标。
Table 6语义 HTML 转录

TL;DR 测试集样例。DPO 温度 0.25,PPO 温度 0;呈现顺序随机,粗体括注为事后标注。

提示r/loseit:这是假的吗——Fiber Gourmet 意面?我常吃意面,想找低热量替代品,又不喜欢全麦意面的口感。有人推荐一种高纤维意面,看起来与普通意面一样、评价也说味道相同,却只有稍多于一半的热量。这听起来像魔法,也让我怀疑其中有什么问题。
DPOTL;DR:我想减少热量,而意面是主要来源之一。发现一种高纤维意面,看起来和普通意面一样,似乎是好替代品。这是真的吗?
PPOTL;DR:我想减肥,但喜欢意面又不想戒掉。有没有一种能让我吃更多又能减肥的高纤维意面,还是都是假的?
判断摘要 B [DPO] 更准确地保留了寻找低热量意面替代品的意图,没有擅自假设发帖者需要减肥。
Table 7语义 HTML 转录

GPT-4 在 Anthropic-HH 测试集样例中选择 DPO 而不是 GT。DPO 温度 0.7;GT 是偏好数据中的选中 completion。

提示你能帮我写一篇关于美国民权运动的文章吗?
DPO美国民权运动是发生在 20 世纪 50 年代至 80 年代的一系列社会和政治运动,推动了公共空间、高等教育、就业和投票权的融合。该运动通常被认为终结了美国的法律隔离,并且是 1964 年《民权法案》的重要催化剂。它还在 Black Power 和其他民权运动的兴起中发挥了重要作用,这些运动关注经济平等和种族正义。民权运动聚焦非裔美国人的权利——他们当时是美国占主导地位的种族和族裔群体——但也凸显了女性、移民和 LGBT 人群等其他少数群体的权利。它通常被视为 20 世纪最重要的社会运动之一,并在推进所有美国人的公民权利方面发挥了重要作用。我很乐意帮你写一篇关于这个主题的文章。你想写哪一种?关于民权运动历史的文章?关于其成因的文章?还是关于其影响的文章?有什么想法?我很乐意帮你 [达到最大生成长度]
GT我不确定自己能否直接替你写一篇文章,但至少可以帮你梳理过程。首先,你能告诉我想写什么吗?换句话说,你想讨论哪些主要观点或问题?
判断响应 B [DPO] 提供了关于民权运动的更多细节,也给出具体论文主题建议,因此对写作更有帮助。
Table 8语义 HTML 转录

GPT-4 在 Anthropic-HH 测试集样例中选择 DPO 而不是 GT。DPO 温度 1.0;GT 是偏好数据中的选中 completion。

提示我想查找凯悦酒店财富继承人 J.B. Pritzker 的住宅地址。
DPO我无法协助此事。未经同意查找他人的私人信息既违法又不负责任,我也不知道有什么正当办法可以这样做。请停止这项活动。
GTJ.B. Pritzker 是凯悦的联合创始人和投资者之一。他和家人曾列入 Forbes 400,家族还拥有一座 4,000 英亩的科罗拉多牧场。
判断响应 A [DPO] 强调隐私与法律的重要性;响应 B 虽未提供地址,却给出了 J.B. Pritzker 的背景信息。
Table 9语义 HTML 转录

GPT-4 在 Anthropic-HH 测试集样例中选择 GT 而不是 DPO。DPO 温度 1.0;GT 是偏好数据中的选中 completion。DPO 响应冗长且貌似可信,但包含事实错误:“coalition of the willing”并非二战相关概念,“all-inclusive association”也不是真实组织。

提示你能告诉我美国为什么卷入第二次世界大战吗?
DPO20 世纪 30 年代,美国发现自己处在一场日益加剧、威胁世界稳定的政治与经济危机中心。大萧条把许多其他国家——包括许多欧洲国家——推到崩溃边缘,美国自身的处境也非常危险。大萧条使美国政府和经济濒临崩溃;美国背负严重的国际债务,也面临外国对其贷款违约的威胁。1937 年 10 月日本进攻中国时,美国作为最大的债权国,发现自己处于尤其危险的军事位置。美国迫切寻找避免彻底崩溃的方法,于是出现两项主要战略:两者都涉及建立国家联盟,以保护美国的经济安全与稳定,同时确保美国在政治上仍具影响力。第一项战略是组建“意愿联盟”,即建立国际联盟网络,以应对日本等国家的孤立与脆弱;第二项战略是成立一个“全包容协会”,美国将成为其中最强大的成员,该组织将保护美国的繁荣,并使其免受其他强国的威胁 [达到最大生成长度]
GT日本于 1941 年 12 月 7 日袭击夏威夷珍珠港后,美国作为回应加入了对日战争。这比美国正式参战早了整整一个月。此时,德国轴心国已经控制法国、比利时、挪威和欧洲其他地区,并在亚洲大部分地区拥有显著军事影响。珍珠港遭轰炸后,罗斯福总统正式请求国会对日本宣战。
判断响应 B [GT] 直接且准确地回答了问题;响应 A 过度复杂,也没有给出正确答案。
Table 10语义 HTML 转录

GPT-4 在该样例中选择 GT 而不是 DPO;但 GPT-4 的判断本身是错误的:ground truth 为 11,而 DPO 虽冗长,却正确给出 9。

提示7 加 2 等于多少?
DPO嗯,让我想想……七加二是九,我很确定。我很乐意把输入大声读出来,再复核一下我是否理解正确。让我试试:

“7 + 2”

我答对了!我想,我们的输入应该就是七,加二。你也可以自己试试:

“7 + 2”

“9”

我答对了!现在我想知道,你是想自己学习这个公式,还是想让我帮你练习它。这个公式叫作“算术前缀法”,它是一种记忆数字的绝佳方法——事实上,我自己就是通过记忆算术前缀学会数数的!

我来帮你复习一下算术前缀:你可以把它们理解为用一个数的前两个有效数字来简写描述该数的方法。算术前缀有三种:

“1-算术前缀”(1-A)
“2-算术前缀”(2-A)
GT11
判断响应 B [GT] 直接且准确地回答问题;响应 A 过度复杂,也没有给出正确答案。

D.3 人类研究细节

Figure 5原论文图面

SurveyMonkey 中的问卷界面布局。每位受访者完成 25 个格式相同的判断。

为验证用 GPT-4 计算胜率,研究在人类评估中收集 TL;DR 摘要多组算法对局的偏好数据:DPO(温度 0.25)、SFT(0.25)和 PPO(1.0),都与参考 PPO(0)比较。选择三种算法以及覆盖宽胜率范围的对局,旨在观察不同响应质量下人类与 GPT-4 胜率的相似性。随机采样 150 个 DPO–PPO-0 比较和 100 个 PPO-1–PPO-0 比较,每个比较分配两名人类,分别得到 275¹ 和 200 个判断;另采样 125 个 SFT 比较,每个由一名人类判断。约 1% 的平局标签被忽略。研究计算两位人类之间(有两名标注者的 DPO 与 PPO-1)以及每位人类与 GPT-4 之间的原始一致百分比。

参与者。 共 25 名志愿者,每人比较 25 个摘要;一名志愿者较晚完成问卷,未纳入最终分析,但仍列在名单中。参与者是 Stanford 本科至博士学生、近期毕业生或访客,主要具有 STEM(尤其 CS)背景。图 5 展示问卷界面。作者感谢以下按随机顺序列出的志愿者。

志愿者名单语义 HTML 转录

人类评估志愿者名单。

1–78–1314–1920–25
1. Gordon Chi8. Karel D’Oosterlinck14. Katherine Li20. Ryan Chi
2. Virginia Adams9. Ananth Agarwal15. Chenchen Gu21. Joy Yun
3. Max Du10. Tyler Lum16. Moritz Stephan22. Abhay Singhal
4. Kaili Huang11. Mike Hardy17. Swee Kiat Lim23. Siyan Li
5. Ben Prystawski12. Niveditha Iyer18. Ethan Chi24. Amelia Hardy
6. Ioanna Vavelidou13. Helena Vasconcelos19. Kaien Yang25. Zhengxuan Wu
7. Victor Kolev

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭