LLM WIKI · PAPER 001

SD3 / MM-DiT
精读笔记

30 秒速览

TL;DR

Stable Diffusion 3 这篇技术报告同时解决两件事:用更合适的 timestep sampling 让 Rectified Flow 在工业级 Text-to-Image 训练中真正胜出;用 MM-DiT 让文本与图像拥有独立参数、只在 attention 中双向汇合。

最值得记住的不是“又发明了一个 Transformer block”,而是作者用 61 组 formulation 对照和完整 scaling study,把训练选择与最终生成质量连成了可验证的证据链。

61组训练 formulation 对照
8B最大模型参数量
0.74最佳 GenEval overall
2.71%depth-38 的 5-step 性能下降

01 核心贡献

WHAT MATTERS
  1. 训练:证明 RF + logit-normal timestep sampling 在 61 组严格控制的实验中综合最好。
  2. 架构:提出双流 MM-DiT,让 text token 与 image token 在 joint attention 中双向交换信息。
  3. 规模:从 depth 15 扩展到 depth 38,validation loss 平滑下降且能预测自动指标与人类偏好。
  4. 工程:用 16-channel VAE、QK-RMSNorm 与 high-resolution timestep shift 稳定 1024² 训练。

02 Rectified Flow

TRAINING

RF 在数据 x0x_0 与噪声 ε\varepsilon 之间走直线。直线不自动保证生成效果更好,但更短、更直的反向轨迹通常需要更少的 numerical solver steps。

zt=(1t)x0+tε,εN(0,I)z_t=(1-t)x_0+t\varepsilon,\qquad \varepsilon\sim\mathcal N(0,I)

关键改进不是修改这条直线,而是修改训练预算如何分配:均匀采样 tt 会把大量 step 花在较容易的端点;logit-normal sampler 把更多训练样本放到数据与噪声最难区分的中间区域。

03 MM-DiT

ARCHITECTURE

把它理解成两个并排的 Transformer 最准确:文本流和图像流各自完成 LayerNorm、modulation、Q/K/V projection 与 MLP;两边的 Q/K/V 只在 attention 处拼接,计算完再切回各自的流。

Figure 2MM-DiT:两条独立参数流,只在 attention 汇合

左侧是完整输入路径,右侧是单个 MM-DiT block。图像流的输入不是目标图,而是当前正在被去噪的 latent canvas。

独立什么
LayerNorm、AdaLN modulation、Q/K/V projection、output projection、MLP。
共享什么
只有 joint attention 的 softmax 关系,让任一 modality 都能关注另一 modality。
为什么有效
文本不再只是被单向注入图像网络,而是成为可被更新、可主动对齐的表示。

04 关键证据

RESULTS
Table 1只需记住的实验数字

这些数字分别支撑训练 formulation、少步采样、规模化和最终 Text-to-Image 质量。

证据结果说明
RF + Logit-NormalRank 1.5424 个控制条件下综合第一
depth 38 · 5 steps−2.71%大模型少步退化更小
d38 · 1024² + DPO0.74GenEval overall
Scaling约 8Bvalidation loss 尚未饱和
最高训练计算量5×10²²FLOPs

论文更有复用价值的结论是:validation loss 不只在训练曲线上好看,它与 GenEval、T2I-CompBench 和人类偏好同步改善,因此可以作为扩展模型时的早期质量代理。

05 通读时最容易卡住的地方

CLARIFICATIONS
图像从哪里来?
不是输入目标图。训练时是带噪真图 latent;推理时从纯高斯噪声开始,它就是那块不断被更新的 latent canvas。
文本为什么有两路?
pooled CLIP 向量负责 AdaLN modulation;CLIP 与 T5 的 sequence token 负责 joint attention。两路分别提供全局条件和逐 token 语义。
为何只共享 attention?
跨 modality 对齐必须在 attention 发生;modality 自己的特征变换则保留独立 MLP 和投影,避免一套参数同时迁就两种表示空间。
AdaLN-Zero 做什么?
让每个深层 block 在初始化时近似恒等映射,再逐步学会偏移,显著降低大模型训练初期的不稳定。

06 编辑判断

VERDICT

MM-DiT 是有效的工程演进;真正扎实、也更值得迁移到其他任务上的贡献,是 噪声采样的大规模对照validation loss 能预测下游质量这两条方法论证据。

这篇论文的局限同样清楚:它证明了“在这套数据、计算预算与评测下继续扩大仍有效”,却没有证明 scaling 会无限延续;3 个大型文本编码器、16-channel VAE 和 8B backbone 也意味着性能来自完整系统,而不是某一个 block 的孤立魔法。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭