SD3 / MM-DiT
精读笔记
30 秒速览
TL;DRStable Diffusion 3 这篇技术报告同时解决两件事:用更合适的 timestep sampling 让 Rectified Flow 在工业级 Text-to-Image 训练中真正胜出;用 MM-DiT 让文本与图像拥有独立参数、只在 attention 中双向汇合。
最值得记住的不是“又发明了一个 Transformer block”,而是作者用 61 组 formulation 对照和完整 scaling study,把训练选择与最终生成质量连成了可验证的证据链。
01 核心贡献
WHAT MATTERS- 训练:证明 RF + logit-normal timestep sampling 在 61 组严格控制的实验中综合最好。
- 架构:提出双流 MM-DiT,让 text token 与 image token 在 joint attention 中双向交换信息。
- 规模:从 depth 15 扩展到 depth 38,validation loss 平滑下降且能预测自动指标与人类偏好。
- 工程:用 16-channel VAE、QK-RMSNorm 与 high-resolution timestep shift 稳定 1024² 训练。
02 Rectified Flow
TRAININGRF 在数据 与噪声 之间走直线。直线不自动保证生成效果更好,但更短、更直的反向轨迹通常需要更少的 numerical solver steps。
关键改进不是修改这条直线,而是修改训练预算如何分配:均匀采样 会把大量 step 花在较容易的端点;logit-normal sampler 把更多训练样本放到数据与噪声最难区分的中间区域。
03 MM-DiT
ARCHITECTURE把它理解成两个并排的 Transformer 最准确:文本流和图像流各自完成 LayerNorm、modulation、Q/K/V projection 与 MLP;两边的 Q/K/V 只在 attention 处拼接,计算完再切回各自的流。
左侧是完整输入路径,右侧是单个 MM-DiT block。图像流的输入不是目标图,而是当前正在被去噪的 latent canvas。
- 独立什么
- LayerNorm、AdaLN modulation、Q/K/V projection、output projection、MLP。
- 共享什么
- 只有 joint attention 的 softmax 关系,让任一 modality 都能关注另一 modality。
- 为什么有效
- 文本不再只是被单向注入图像网络,而是成为可被更新、可主动对齐的表示。
04 关键证据
RESULTS这些数字分别支撑训练 formulation、少步采样、规模化和最终 Text-to-Image 质量。
| 证据 | 结果 | 说明 |
|---|---|---|
| RF + Logit-Normal | Rank 1.54 | 24 个控制条件下综合第一 |
| depth 38 · 5 steps | −2.71% | 大模型少步退化更小 |
| d38 · 1024² + DPO | 0.74 | GenEval overall |
| Scaling | 约 8B | validation loss 尚未饱和 |
| 最高训练计算量 | 5×10²² | FLOPs |
论文更有复用价值的结论是:validation loss 不只在训练曲线上好看,它与 GenEval、T2I-CompBench 和人类偏好同步改善,因此可以作为扩展模型时的早期质量代理。
05 通读时最容易卡住的地方
CLARIFICATIONS- 图像从哪里来?
- 不是输入目标图。训练时是带噪真图 latent;推理时从纯高斯噪声开始,它就是那块不断被更新的 latent canvas。
- 文本为什么有两路?
- pooled CLIP 向量负责 AdaLN modulation;CLIP 与 T5 的 sequence token 负责 joint attention。两路分别提供全局条件和逐 token 语义。
- 为何只共享 attention?
- 跨 modality 对齐必须在 attention 发生;modality 自己的特征变换则保留独立 MLP 和投影,避免一套参数同时迁就两种表示空间。
- AdaLN-Zero 做什么?
- 让每个深层 block 在初始化时近似恒等映射,再逐步学会偏移,显著降低大模型训练初期的不稳定。
06 编辑判断
VERDICTMM-DiT 是有效的工程演进;真正扎实、也更值得迁移到其他任务上的贡献,是 噪声采样的大规模对照与 validation loss 能预测下游质量这两条方法论证据。
这篇论文的局限同样清楚:它证明了“在这套数据、计算预算与评测下继续扩大仍有效”,却没有证明 scaling 会无限延续;3 个大型文本编码器、16-channel VAE 和 8B backbone 也意味着性能来自完整系统,而不是某一个 block 的孤立魔法。