READING NOTES · LLAMA

更小模型,更多 token,服务推理效率

LLaMA 把 scaling law 从训练最优转向部署最优,并用公开数据配方给开源基础模型定下了新的基线。
返回中文全文 →

论文真正改变了什么

Chinchilla 讨论的是给定训练预算时怎样分配参数量和 token;LLaMA 更进一步关心长期推理成本:如果一个模型会被反复调用,那么宁可训练更久,也要得到更小、更快的最终模型。

DATA公开语料混合
TRAINING最多 1.4T token
DEPLOYMENT7B–65B 模型族

架构上没有神秘配方

  • Pre-normalization 使用 RMSNorm,提高深层训练稳定性。
  • 把 ReLU 换成 SwiGLU,并相应调整隐藏维度。
  • 用 RoPE 取代绝对位置嵌入,让 attention 直接感知相对位置关系。

创新重心不是单个模块,而是数据、规模、训练稳定性和实现效率的联合工程。

读实验时看两条线

模型大小不是唯一横轴

LLaMA‑13B 能在多数报告基准上超过 GPT‑3 175B,关键背景是它看过远多于早期 scaling 配方所建议的 token。比较模型时必须同时看参数量、训练 token 与数据质量。

“公开数据”不等于无争议数据

CommonCrawl、C4、GitHub、Wikipedia、Books、arXiv 与 Stack Exchange 构成训练混合,但可访问性、许可和可再分发性是不同问题,不能把公开抓取等同于明确授权。

批判性判断

LLaMA 的历史意义在于把高质量基础模型从少数闭源 API 拉回研究社区。论文中的“open”主要指研究访问与公开数据路线,不应直接套用今天对开放权重、许可证和训练透明度的更严格定义。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭