LLM WIKI · 课程精读

LEARNING UNIT · 01

规模化训练与强化学习

从 Scaling Law、GRPO 与 On-Policy Distillation 理解模型能力如何随计算、数据和后训练策略变化。

已整理章节
3 节
单元来源
3 条视频
总时长
2:12:33
状态
已整理试读
学习位置
1 / 6
01

主题讲解 · 19:18

从经验幂律到计算最优训练

学习目标

  • 能用一句话解释 Scaling Law 预测的对象,而不是把它等同于“模型越大越好”。
  • 能区分参数量、数据量、计算量和训练步数在实验中的不同角色。
  • 能根据数据瓶颈与计算预算判断“继续加参数”何时会失效。
  • 能解释一部分“能力涌现”为何可能来自评价指标,而非模型内部突然发生跳变。
  • 能列出 Scaling Law 不能替代的模型设计与数据设计问题。

前置与衔接

本课不要求推导幂律指数,但需要理解训练损失、测试损失、过拟合和计算预算。

它是“规模化训练与强化学习”单元的起点:先学会读规模规律,后续才能判断后训练方法究竟改变了规律,还是只在相同预算下提高了效率。

核心讲解

1. Scaling Law 是关于可预测性的经验规律

课程先用生成模型能力随计算投入扩展的图示建立直觉:算力增加后,模型可能依次学会反射、风格、组合属性、文字渲染与更复杂的视觉关系。

图 1

模型计算规模增加时能力边界逐层扩展的直观示意。

原视频 · 01:20 ↗

这幅图不是严格的因果证明。它表达的是一个研究动机:如果能力随资源变化存在稳定趋势,我们能否在训练大模型之前,用小模型实验估计更大规模的损失和资源需求?

因此 Scaling Law 的核心价值不是“鼓励堆参数”,而是把昂贵的大规模实验变成可外推的问题。

2. 三条最基本的幂律

课程引用 Kaplan 等人的语言模型实验,将测试损失分别写成计算量 CC、数据量 DD 和非 embedding 参数量 NN 的函数:

L(C)(CcC)αC,L(D)(DcD)αD,L(N)(NcN)αN.L(C) \approx \left(\frac{C_c}{C}\right)^{\alpha_C},\qquad L(D) \approx \left(\frac{D_c}{D}\right)^{\alpha_D},\qquad L(N) \approx \left(\frac{N_c}{N}\right)^{\alpha_N}.
图 2

测试损失分别随计算量、数据量和参数量呈幂律下降。

原视频 · 04:20 ↗

读图时要抓住三点:

  1. 纵轴是损失,不是所有下游任务的最终分数。
  2. 每条曲线都隐含“其余资源足够或取近似最优值”的条件。
  3. 幂指数来自观测区间内的拟合,外推到更大数量级时仍需验证。

在双对数坐标里,幂律会接近直线。这使研究者可以先做多个小规模实验,拟合斜率,再估计目标损失对应的资源规模。

课程还强调,在合理范围内,深宽比等局部架构超参数对这组实验的影响小于 (C,D,N)(C,D,N);这不意味着架构永远不重要,只说明在特定模型族和实验区间内,主要变化可由规模变量解释。

3. 参数和数据必须共同考虑

只看 L(N)L(N) 容易得出“参数越多越好”的片面结论。课程进一步给出参数量与数据量的联合形式:

L(N,D)(NcN)αN+(DcD)αD.L(N,D) \approx \left(\frac{N_c}{N}\right)^{\alpha_N} + \left(\frac{D_c}{D}\right)^{\alpha_D}.

当数据量固定时,模型增大到一定程度后,测试损失不再下降,甚至因过拟合而回升。

图 3

数据不足导致性能瓶颈和过拟合的联合图示。

原视频 · 06:00 ↗

课程用相对额外损失衡量数据不足带来的过拟合:

δL(N,D)=L(N,D)L(N,)1.\delta L(N,D)=\frac{L(N,D)}{L(N,\infty)}-1.

若把允许的过拟合阈值设为 0.020.02,就能反推出给定参数规模所需的最低数据量。这里真正可迁移的思路是:

  • 先定义可接受的退化阈值;
  • 再从联合规律反推数据需求;
  • 不要先选一个很大的模型,再被动发现数据不够。

4. 有限计算预算下不存在单一最优变量

训练预算固定时,模型宽度、批量大小和训练步数会相互制约。

课程介绍 critical batch size:批量太小,硬件吞吐和梯度估计效率不足;批量过大,新增样本对一次更新的边际收益变小,计算被浪费。

图 4

有限计算预算下模型规模、批量大小与训练步数的权衡。

原视频 · 07:40 ↗

原报告基于所述论文给出的直觉是:计算预算增加时,最优参数量增长较快,而最优训练步数增长较慢;因此新增预算不应全部换成“多训练几轮”,而应同时调整模型规模和有效批量。

这不是可以直接复制到所有现代模型的配方。模型架构、优化器、数据重复率和训练目标变化后,指数与最优点都需要重估。

5. “能力涌现”可能是测量方式造成的

如果多选题必须全对才计分,或者字符串必须完全匹配才算正确,那么底层 token 准确率的连续提升会被映射成 0 或 1 的跳变。

图 5

不同任务中所谓能力涌现的非线性评价曲线。

原视频 · 12:20 ↗

假设每个 token 独立且单 token 正确率为 pp,长度为 mm 的序列“全对”概率约为 pmp^m。当 pp 缓慢上升时,pmp^m 在某个区间会显得陡峭,于是宏观指标看起来像能力突然出现。

把指标改为平均 token 正确率、编辑距离或其他连续评分后,一部分涌现曲线会恢复为平滑的规模趋势。

因此看到“某能力只在大模型出现”时,应先问:

  • 评价函数是否只有满分和零分?
  • 任务长度是否把小差异指数放大?
  • 小模型是否真的没有部分能力,还是指标看不见过程分?
  • 更连续的指标下,结论是否仍成立?

这并不证明所有涌现都是幻觉,只说明“曲线跳变”本身不足以证明内部机制发生突变。

6. Scaling 不能替代路线选择

课程最后比较了 LSTM 与 Transformer 的规模曲线:二者都可能随规模改善,但更能利用长上下文的架构在同等尺度下拥有更好的渐近表现。

图 6

模型架构、长上下文利用与能力扩展边界的讨论。

原视频 · 18:00 ↗

因此 Scaling Law 没有回答以下问题:

  • 应该扩展哪一种模型结构?
  • 数据来自网页、合成数据还是多模态交互?
  • 损失函数是否对真正目标敏感?
  • 数据筛选、去重和课程安排能否提高单位 token 的价值?
  • 当前路线是否通往想要的能力,而不是只把代理指标做低?

更准确的表述是:在确定的模型族、数据分布、训练目标和观测区间内,Scaling Law 提供资源—损失关系;当其中任一项改变,规律也应重新测量。

跟练与练习

原视频练习

编者练习

你有两种训练方案:A 把参数量扩大四倍但数据不变;B 把参数量和去重后的数据各扩大两倍。没有更多信息时,哪一种更值得先做小规模验证?说明理由。

查看参考答案

优先验证 B。联合规律提醒我们,参数和数据任一方都可能成为瓶颈。A 更容易落入数据不足区;B 至少保持两种主要资源同步增长。最终仍应通过多个小规模点拟合联合曲线,而不是直接训练完整模型。

编者练习 2

一个任务采用“整道题完全正确才得 1 分”的指标,大模型分数突然上升。设计一个检查,判断这是否属于测量造成的表观涌现。

查看参考答案

把指标拆成连续的局部得分,例如子问题正确率、token 正确率或编辑距离,再按模型规模重画曲线。如果局部指标平滑提升而全对率突然上升,跳变主要来自聚合规则;如果局部指标也发生稳定可复现的突变,才需要进一步研究内部机制。

常见误区

  • 误区:Scaling Law 证明参数越大一定越好。纠正:它依赖数据、计算与模型族的条件,固定数据时会出现瓶颈。
  • 误区:拟合出的指数是普适常数。纠正:更换架构、优化器、数据或目标后都应重新估计。
  • 误区:损失下降等于所有能力同步提高。纠正:下游能力还受评价方式、数据覆盖和推理结构影响。
  • 误区:出现陡峭曲线就证明能力突然涌现。纠正:先排除非连续指标和任务长度的放大效应。
  • 误区:有了 Scaling Law 就不需要模型创新。纠正:规模规律只描述给定路线,不能替你选择路线。

本课小结

  • Scaling Law 是在明确条件下对资源与损失关系的经验拟合。
  • 参数、数据、计算和步数需要联合规划,不能单独最大化某一项。
  • 连续评价能帮助区分真实机制变化与表观涌现。
  • 下一步学习后训练方法时,要比较它是否改变单位计算的收益、数据效率或最终可达边界。
02

待整理 · 1:11:05

【学习小记】:一个小时从强化学习0基础到理解GRPO

03

待整理 · 42:10

40分钟了解OPD的主要工作:为什么RL时代还需要On-Policy Distillation