LLM WIKI · PAPER NOTES

DEEP READING · MIT 6.S184

把 Flow Matching 与 Diffusion Model
看成同一件事

这份讲义最重要的贡献不是再给一套“扩散公式”,而是用 Probability Path、Vector Field 和微分方程建立统一坐标系:连续数据用 ODE/SDE,离散数据用 CTMC,训练的核心都由条件对象边缘化而来。
进入 84 页中文全文 →

一、先抓住统一心智模型

  1. 生成就是采样:目标不是“画出唯一正确的图”,而是从未知数据分布中产生一个合理样本。
  2. 先指定中间路线:用 Probability Path 描述从简单噪声分布到数据分布的连续变化。
  3. 再寻找动力系统:连续状态中用 Vector Field 驱动 ODE 或 SDE;离散状态中用 Rate Matrix 驱动 CTMC。
  4. 最后训练神经网络:难以直接监督的边缘对象,通过可解析、可采样的条件对象构造无仿真的回归目标。

因此,Flow Matching 不是“另一种 Diffusion Model 名称”。它首先是一种学习 ODE Vector Field 的方法;Diffusion Model 则允许在同一 Probability Path 上加入随机项,并可通过 score 与 Vector Field 相互转换。

二、Flow Matching 真正神奇在哪里

给定数据点 zz,Gaussian Conditional Probability Path 可以直接采样:

x=αtz+βtϵ,ϵN(0,I)x=\alpha_t z+\beta_t\epsilon,\qquad \epsilon\sim\mathcal N(0,I)

与它对应的 Conditional Vector Field 也有解析式。真正想学的 Marginal Vector Field 需要对后验加权,通常不可直接计算;边缘化定理却说明:用 Conditional Vector Field 做均方回归,与直接回归 Marginal Vector Field 具有相同的参数梯度。

θLFM(θ)=θLCFM(θ)\nabla_\theta \mathcal L_{\mathrm{FM}}(\theta)=\nabla_\theta \mathcal L_{\mathrm{CFM}}(\theta)

这一步把“先数值模拟整条轨迹再训练”的昂贵问题,化成对独立样本 (z,t,ϵ)(z,t,\epsilon) 的普通监督回归。所谓 simulation-free,指的是训练时不必先模拟 ODE/SDE;生成时仍然要数值求解动力系统。

三、Flow 与 score 不是两套孤立理论

Score Matching 学的是时间切片密度的对数梯度。对 Gaussian 路径,目标 Vector Field 与 score 都是 xx 和条件数据 zz 的线性函数,因此可以代数互换:

ut(x)=atlogpt(x)+btxu_t(x)=a_t\nabla\log p_t(x)+b_t x

这解释了为什么现代系统可以选择预测 velocity、score 或 noise:它们常常只是同一 Probability Path 下的不同参数化。选择哪一种,更多关乎数值稳定性、loss weighting 和工程传统,而非生成原理完全不同。

加入扩散系数后,SDE 可以保持与 ODE 相同的边缘分布。随机性因此不是“把正确轨迹弄乱”,而是另一种实现相同概率演化的动力系统。

四、CFG 为什么有效,又为什么不严格

Classifier-free guidance 用同一个网络同时估计有条件与无 Conditional Vector Field,并在推理时放大两者差值:

u~t(xy)=(1w)ut(x)+wut(xy),w>1\widetilde u_t(x\mid y)=(1-w)u_t(x\mid\varnothing)+w\,u_t(x\mid y),\qquad w>1

它把轨迹更强地推向符合 prompt 的区域,但当 w>1w>1 时,终点一般不再严格服从真实条件数据分布。CFG 的合理定位是:以分布忠实度换取条件贴合度的高效启发式,而不是“精确条件采样公式”。

五、从数学骨架到现代生成器

  • Conditioning:时间用 Fourier features;文本常由 CLIP、T5 等冻结编码器产生 embedding。
  • Backbone:U-Net 是经典卷积路线;DiT 将图像 patch 化后使用 Transformer;MMDiT 让图像与文本各自保留流并联合 attention。
  • Latent modeling:VAE 先压缩图像或视频,再在 latent space 中训练 flow/diffusion,以显著降低维度与算力。
  • Discrete extension:文本没有连续方向可走,于是用 CTMC 的 Rate Matrix 替换 Vector Field;因子化后训练可化为逐 token 去噪分类。

讲义把 Stable Diffusion 3、Meta Movie Gen 与 masked diffusion language model 放进同一框架,价值正在于让“架构名词”重新连接到 Probability Path 和训练目标。

六、阅读时要保留的批判性判断

它是一份理论骨架,不是完整工程百科

讲义对 Probability Path、ODE/SDE、Flow Matching、Score Matching 与 CTMC 的推导非常完整,但对蒸馏、少步采样、consistency model、reflow、推理缓存和训练稳定化等加速方向覆盖有限。

“等价”通常带有条件

Vector Field 与 score 的简洁互换依赖 Gaussian 条件路径;连续与离散框架的平行关系依赖各自的前向方程。阅读时应区分“概念结构类似”“训练梯度相同”和“任意设定下模型完全等价”。

最值得亲手验证的三件事

  1. 在二维 toy data 上画出条件路径与边缘路径。
  2. 实现 CondOT 的 CFM loss,并用 Euler 法从噪声采样。
  3. 固定网络,比较 ODE 与不同扩散系数 SDE 的采样误差和随机性。