READING NOTES · INSTRUCTGPT

RLHF 从这里成为一条完整工程管线

重点不是 PPO 本身,而是如何把人类意图变成示范、比较数据和可优化的奖励信号。
返回中文全文 →

一句话抓住论文

预训练语言模型学的是互联网文本分布,用户真正需要的是“按意图完成任务”。InstructGPT 用三类人类数据逐步缩小这两个目标之间的差距。

DEMONSTRATIONSFT 学会任务形态
COMPARISONRM 学会人类排序
OPTIMIZATIONPPO 提高偏好奖励

最值得记住的证据

  • 在论文的 API 提示分布上,1.3B InstructGPT 的输出能比 175B GPT‑3 更受标注者偏好,说明对齐收益可以压过百倍参数差。
  • 真实性改善、毒性输出减少,但偏见并没有随之稳定消失;“更对齐”不是所有安全维度同时变好。
  • 把预训练梯度混回 PPO(PPO‑ptx)可以缓解公开 NLP 基准上的能力回退,体现了对齐目标与通用能力之间的张力。

容易误读的地方

奖励模型不等于真实的人类价值

它只拟合特定标注员、特定说明书、特定提示分布下的相对偏好。论文自己也讨论了“到底在对齐谁”:数据收集制度决定了奖励信号表达谁的判断。

RLHF 不是事实性保证

偏好训练可以让答案更像“令人满意的回答”,但不能从机制上保证陈述为真。模型仍会犯简单错误,也可能学会更有说服力地表达错误内容。

批判性判断

这篇论文的经典性来自它把零散的偏好学习技术组织成了可规模化的数据—模型闭环。它证明的是这条工程范式在当时有效,而不是证明 PPO 是唯一或最终的对齐算法;后来 DPO 等方法正是在简化同一管线上继续推进。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭