LEARNING UNIT · 01
规模化训练与强化学习
从 Scaling Law、GRPO 与 On-Policy Distillation 理解模型能力如何随计算、数据和后训练策略变化。
- 已整理章节
- 3 节
- 单元来源
- 3 条视频
- 总时长
- 2:12:33
- 状态
- 已整理试读
- 学习位置
- 1 / 6
主题讲解 · 19:18
从经验幂律到计算最优训练
学习目标
- 能用一句话解释 Scaling Law 预测的对象,而不是把它等同于“模型越大越好”。
- 能区分参数量、数据量、计算量和训练步数在实验中的不同角色。
- 能根据数据瓶颈与计算预算判断“继续加参数”何时会失效。
- 能解释一部分“能力涌现”为何可能来自评价指标,而非模型内部突然发生跳变。
- 能列出 Scaling Law 不能替代的模型设计与数据设计问题。
前置与衔接
本课不要求推导幂律指数,但需要理解训练损失、测试损失、过拟合和计算预算。
它是“规模化训练与强化学习”单元的起点:先学会读规模规律,后续才能判断后训练方法究竟改变了规律,还是只在相同预算下提高了效率。
核心讲解
1. Scaling Law 是关于可预测性的经验规律
课程先用生成模型能力随计算投入扩展的图示建立直觉:算力增加后,模型可能依次学会反射、风格、组合属性、文字渲染与更复杂的视觉关系。
模型计算规模增加时能力边界逐层扩展的直观示意。
原视频 · 01:20 ↗这幅图不是严格的因果证明。它表达的是一个研究动机:如果能力随资源变化存在稳定趋势,我们能否在训练大模型之前,用小模型实验估计更大规模的损失和资源需求?
因此 Scaling Law 的核心价值不是“鼓励堆参数”,而是把昂贵的大规模实验变成可外推的问题。
2. 三条最基本的幂律
课程引用 Kaplan 等人的语言模型实验,将测试损失分别写成计算量 、数据量 和非 embedding 参数量 的函数:
测试损失分别随计算量、数据量和参数量呈幂律下降。
原视频 · 04:20 ↗读图时要抓住三点:
- 纵轴是损失,不是所有下游任务的最终分数。
- 每条曲线都隐含“其余资源足够或取近似最优值”的条件。
- 幂指数来自观测区间内的拟合,外推到更大数量级时仍需验证。
在双对数坐标里,幂律会接近直线。这使研究者可以先做多个小规模实验,拟合斜率,再估计目标损失对应的资源规模。
课程还强调,在合理范围内,深宽比等局部架构超参数对这组实验的影响小于 ;这不意味着架构永远不重要,只说明在特定模型族和实验区间内,主要变化可由规模变量解释。
3. 参数和数据必须共同考虑
只看 容易得出“参数越多越好”的片面结论。课程进一步给出参数量与数据量的联合形式:
当数据量固定时,模型增大到一定程度后,测试损失不再下降,甚至因过拟合而回升。
数据不足导致性能瓶颈和过拟合的联合图示。
原视频 · 06:00 ↗课程用相对额外损失衡量数据不足带来的过拟合:
若把允许的过拟合阈值设为 ,就能反推出给定参数规模所需的最低数据量。这里真正可迁移的思路是:
- 先定义可接受的退化阈值;
- 再从联合规律反推数据需求;
- 不要先选一个很大的模型,再被动发现数据不够。
4. 有限计算预算下不存在单一最优变量
训练预算固定时,模型宽度、批量大小和训练步数会相互制约。
课程介绍 critical batch size:批量太小,硬件吞吐和梯度估计效率不足;批量过大,新增样本对一次更新的边际收益变小,计算被浪费。
有限计算预算下模型规模、批量大小与训练步数的权衡。
原视频 · 07:40 ↗原报告基于所述论文给出的直觉是:计算预算增加时,最优参数量增长较快,而最优训练步数增长较慢;因此新增预算不应全部换成“多训练几轮”,而应同时调整模型规模和有效批量。
这不是可以直接复制到所有现代模型的配方。模型架构、优化器、数据重复率和训练目标变化后,指数与最优点都需要重估。
5. “能力涌现”可能是测量方式造成的
如果多选题必须全对才计分,或者字符串必须完全匹配才算正确,那么底层 token 准确率的连续提升会被映射成 0 或 1 的跳变。
不同任务中所谓能力涌现的非线性评价曲线。
原视频 · 12:20 ↗假设每个 token 独立且单 token 正确率为 ,长度为 的序列“全对”概率约为 。当 缓慢上升时, 在某个区间会显得陡峭,于是宏观指标看起来像能力突然出现。
把指标改为平均 token 正确率、编辑距离或其他连续评分后,一部分涌现曲线会恢复为平滑的规模趋势。
因此看到“某能力只在大模型出现”时,应先问:
- 评价函数是否只有满分和零分?
- 任务长度是否把小差异指数放大?
- 小模型是否真的没有部分能力,还是指标看不见过程分?
- 更连续的指标下,结论是否仍成立?
这并不证明所有涌现都是幻觉,只说明“曲线跳变”本身不足以证明内部机制发生突变。
6. Scaling 不能替代路线选择
课程最后比较了 LSTM 与 Transformer 的规模曲线:二者都可能随规模改善,但更能利用长上下文的架构在同等尺度下拥有更好的渐近表现。
模型架构、长上下文利用与能力扩展边界的讨论。
原视频 · 18:00 ↗因此 Scaling Law 没有回答以下问题:
- 应该扩展哪一种模型结构?
- 数据来自网页、合成数据还是多模态交互?
- 损失函数是否对真正目标敏感?
- 数据筛选、去重和课程安排能否提高单位 token 的价值?
- 当前路线是否通往想要的能力,而不是只把代理指标做低?
更准确的表述是:在确定的模型族、数据分布、训练目标和观测区间内,Scaling Law 提供资源—损失关系;当其中任一项改变,规律也应重新测量。
跟练与练习
原视频练习
编者练习
你有两种训练方案:A 把参数量扩大四倍但数据不变;B 把参数量和去重后的数据各扩大两倍。没有更多信息时,哪一种更值得先做小规模验证?说明理由。
查看参考答案
优先验证 B。联合规律提醒我们,参数和数据任一方都可能成为瓶颈。A 更容易落入数据不足区;B 至少保持两种主要资源同步增长。最终仍应通过多个小规模点拟合联合曲线,而不是直接训练完整模型。
编者练习 2
一个任务采用“整道题完全正确才得 1 分”的指标,大模型分数突然上升。设计一个检查,判断这是否属于测量造成的表观涌现。
查看参考答案
把指标拆成连续的局部得分,例如子问题正确率、token 正确率或编辑距离,再按模型规模重画曲线。如果局部指标平滑提升而全对率突然上升,跳变主要来自聚合规则;如果局部指标也发生稳定可复现的突变,才需要进一步研究内部机制。
常见误区
- 误区:Scaling Law 证明参数越大一定越好。纠正:它依赖数据、计算与模型族的条件,固定数据时会出现瓶颈。
- 误区:拟合出的指数是普适常数。纠正:更换架构、优化器、数据或目标后都应重新估计。
- 误区:损失下降等于所有能力同步提高。纠正:下游能力还受评价方式、数据覆盖和推理结构影响。
- 误区:出现陡峭曲线就证明能力突然涌现。纠正:先排除非连续指标和任务长度的放大效应。
- 误区:有了 Scaling Law 就不需要模型创新。纠正:规模规律只描述给定路线,不能替你选择路线。
本课小结
- Scaling Law 是在明确条件下对资源与损失关系的经验拟合。
- 参数、数据、计算和步数需要联合规划,不能单独最大化某一项。
- 连续评价能帮助区分真实机制变化与表观涌现。
- 下一步学习后训练方法时,要比较它是否改变单位计算的收益、数据效率或最终可达边界。
待整理 · 1:11:05
【学习小记】:一个小时从强化学习0基础到理解GRPO
待整理 · 42:10