论文真正改变了什么
Chinchilla 讨论的是给定训练预算时怎样分配参数量和 token;LLaMA 更进一步关心长期推理成本:如果一个模型会被反复调用,那么宁可训练更久,也要得到更小、更快的最终模型。
DATA公开语料混合
TRAINING最多 1.4T token
DEPLOYMENT7B–65B 模型族
架构上没有神秘配方
- Pre-normalization 使用 RMSNorm,提高深层训练稳定性。
- 把 ReLU 换成 SwiGLU,并相应调整隐藏维度。
- 用 RoPE 取代绝对位置嵌入,让 attention 直接感知相对位置关系。
创新重心不是单个模块,而是数据、规模、训练稳定性和实现效率的联合工程。
读实验时看两条线
模型大小不是唯一横轴
LLaMA‑13B 能在多数报告基准上超过 GPT‑3 175B,关键背景是它看过远多于早期 scaling 配方所建议的 token。比较模型时必须同时看参数量、训练 token 与数据质量。
“公开数据”不等于无争议数据
CommonCrawl、C4、GitHub、Wikipedia、Books、arXiv 与 Stack Exchange 构成训练混合,但可访问性、许可和可再分发性是不同问题,不能把公开抓取等同于明确授权。
LLaMA 的历史意义在于把高质量基础模型从少数闭源 API 拉回研究社区。论文中的“open”主要指研究访问与公开数据路线,不应直接套用今天对开放权重、许可证和训练透明度的更严格定义。