READING NOTES · ARCHITECTURE SCALING
DiT
精读笔记
记住一条线:把 VAE latent patchify,交给几乎标准的 ViT;再用 adaLN-Zero 注入 timestep 与 class 条件;最后用 Gflops,而不是只用参数量,解释生成质量的 scaling。
30 秒速览
TL;DRDiT 证明 U-Net 并不是扩散模型不可替代的 inductive bias。作者把 Stable Diffusion 的 VAE latent 切成 patch sequence,用 Transformer 直接预测噪声与协方差;在 12 个模型配置上,forward-pass Gflops 与 FID 呈强负相关。
最值得记住的不是单个 2.27 FID,而是这条经验规律:更深/更宽的 Transformer 与更多 token 都能通过提高 Gflops 持续改善生成质量,而且大模型更能高效利用总训练计算量。
01 模型到底改了什么
MECHANISM左侧是 latent patch pipeline;右侧比较 adaLN-Zero、cross-attention 与 in-context conditioning。原论文最终选择 adaLN-Zero。
- 输入
- VAE 把 256×256 RGB 图像压到 32×32×4 latent;patch size p 把它转成 T=(I/p)² 个 token。p 减半,token 数变四倍。
- 条件
- Timestep t 与 class label c 的 embedding 相加,经 MLP 产生 LayerNorm 的 shift、scale,以及 residual branch 的 gate。
- adaLN-Zero
- 把 residual gate α 初始化为零,使每个 DiT block 初始等价于 identity function;它比普通 adaLN、cross-attention、in-context 都更好。
- 输出
- 每个 token 线性解码成 p×p×2C,再 unpatchify 为噪声预测与对角协方差预测。
这里真正可迁移的设计是 adaLN-Zero:条件不需要作为额外 token 或 cross-attention memory 才能进入 Transformer;让条件调制归一化参数并控制 residual branch,既便宜又易于稳定初始化。
02 论文最强的三组证据
EVIDENCE上排固定 patch size、改变模型规模;下排固定模型规模、改变 patch size。两条扩展路径都在整个训练过程中持续降低 FID。
- Conditioning 消融:训练 400K step 时,adaLN-Zero 的 FID 几乎只有 in-context 模型的一半,而且 Gflops 最低。
- Scale grid:S/B/L/XL × p=8、4、2 共 12 点;不同配置只要 Gflops 相近,FID 也相近,参数量本身不能唯一解释质量。
- 训练计算效率:小模型即使训练更久也会变得低效;XL/2 在约 10¹⁰ Gflops 后超过 XL/4。
大 DiT 比小 DiT 更有效地利用总训练 compute;曲线否定了“把小模型训练得足够久即可追上”的简单假设。
数字来自原论文 Tables 2–3;完整所有行见全文译稿。
| 分辨率 | 模型 | CFG | FID | Recall |
|---|---|---|---|---|
| 256×256 | DiT-XL/2-G | 1.50 | 2.27 | 0.57 |
| 512×512 | DiT-XL/2-G | 1.50 | 3.04 | 0.54 |
| 256×256 | DiT-XL/2 | 无 | 9.62 | 0.67 |
03 三个常见误读
MISCONCEPTIONS- “DiT 就是把 U-Net 换成 ViT”
- 大方向正确,但关键细节是 latent patchification、t/c conditioning、adaLN-Zero 初始化,以及同时预测噪声与协方差;不是裸 ViT 直接套用。
- “参数越多,FID 越好”
- 论文的核心反而是参数量不够:固定模型规模、减小 patch size 时参数略减,FID 仍随 Gflops 改善。
- “多采样几步能补小模型”
- Figure 10 明确否定。L/2 用 1000 step、80.7 Tflops/图,仍不如 XL/2 用 128 step、15.2 Tflops/图。
04 编辑判断
VERDICTDiT 的历史意义是把 diffusion backbone 带入“统一 Transformer 架构 + scaling law 式实验”的轨道;后来大量图像、视频与音频 DiT 都沿着这条路扩展。
证据边界也要看清:主实验是 class-conditional ImageNet,不是 text-to-image;backbone scale 与 token 数共同影响 Gflops,论文没有给出严格的可外推 scaling law;最佳 FID 依赖 classifier-free guidance 与特定 VAE decoder。真正稳固的结论是“U-Net 非必需、DiT 可稳定扩展”,而不是所有生成任务都必然按同一斜率获益。