LLM WIKI · 课程精读

LEARNING UNIT · 02

连续时间生成与表征空间

串联 Neural ODE、Diffusion、Flow Matching 与新型 latent 表征,建立现代生成模型的连续动力学视角。

已整理章节
3 节
单元来源
3 条视频
总时长
1:54:59
状态
已整理试读
学习位置
2 / 6
01

待整理 · 53:20

浅谈当下深度生成模型:从VAE、GAN、Diffusion、Flow Matching到世界模型

02

主题讲解 · 24:41

把神经网络写成连续动力系统

学习目标

  • 能把 Neural ODE 解释为“由神经网络参数化向量场”的初值问题。
  • 能从残差网络的离散更新理解连续深度模型。
  • 能区分 Neural ODE、Neural CDE 与 Neural SDE 各自引入的信号。
  • 能说明不规则时间序列为什么需要插值及可测性约束。
  • 能说出伴随状态法解决什么训练问题,以及它并不等于“免费反向传播”。

前置与衔接

建议先熟悉导数、常微分方程初值问题、欧拉法、残差连接与链式法则。

本课位于“连续时间生成与表征空间”单元。它提供后续理解 Diffusion、Flow Matching 和连续生成轨迹的共同语言:状态不是经过固定层数后突然变化,而是在一个可学习的向量场中持续演化。

核心讲解

1. 从向量场到神经微分方程

向量场为状态空间中的每个点指定一个变化方向。若用神经网络 fθf_\theta 表示这个方向,就得到初值问题:

y(0)=y0,dy(t)dt=fθ(t,y(t)).y(0)=y_0,\qquad \frac{dy(t)}{dt}=f_\theta(t,y(t)).
图 1

向量场、初值问题与 SIR 模型共同说明微分方程如何描述状态演化。

原视频 · 00:00 ↗

给定初值 y0y_0 后,ODE solver 沿着局部方向积分,得到任意时间 tt 的状态 y(t)y(t)。神经网络学习的不是单次输入到输出映射,而是整个状态变化规则。

课程用 SIR 传染病模型说明传统微分方程的意义:参数控制易感、感染和恢复人群之间的变化。把未知或难以显式建模的部分换成神经网络,就能在保留物理结构的同时学习残差关系。

若希望固定参数仍有清晰含义,应先拟合可解释部分,再谨慎加入神经网络;否则网络可能吸收本应由显式参数解释的效应。

2. Neural ODE 是连续深度的残差网络

残差块的离散更新为:

yj+1=yj+fθ(j,yj).y_{j+1}=y_j+f_\theta(j,y_j).

若引入步长 Δt\Delta t,可写成:

y(tj+1)y(tj)Δtfθ(tj,y(tj)),\frac{y(t_{j+1})-y(t_j)}{\Delta t}\approx f_\theta(t_j,y(t_j)),

这正是常微分方程的欧拉离散化。

图 2

残差网络的离散更新可被解释为连续深度的 Neural ODE。

原视频 · 01:20 ↗

这个视角带来三个重要变化:

  1. “深度”由积分区间和求解器精度决定,不再是固定层数。
  2. 不同样本可因数值误差控制而使用不同函数评估次数。
  3. 计算图从逐层存储转变为对动力系统求解,但精度、稳定性与计算成本会互相制约。

如果希望不同时刻使用不同变换,可把 tt 作为网络输入,也可以使用分段动力系统。若 fθf_\theta 完全自治且维度不扩展,轨迹不能任意交叉,因此表达能力受到拓扑约束;扩大隐状态维度可以缓解这一限制。

3. Neural ODE 的典型应用

连续标准化流从简单分布出发,让样本沿 ODE 流动到目标分布,并通过概率密度变化公式训练生成模型。

时间序列任务则可把观测编码为潜变量初值,再用 ODE 在潜空间中插值、预测与外推。

图 3

Latent ODE 对不规则时间序列进行插值、预测与外推。

原视频 · 04:20 ↗

图中要区分两条时间线:

  • 数据空间只有离散观测点;
  • 潜空间通过 ODE 形成连续轨迹。

连续轨迹允许查询未观测时刻,但“可查询”不等于预测一定可信。远距离外推仍取决于向量场是否学到真实动力规律,以及初始状态的不确定性是否被正确建模。

4. Neural CDE:让外部路径持续控制状态

普通 ODE 的状态由时间和当前状态驱动。受控微分方程加入控制路径 X(t)X(t)

Y(t)=Y(0)+0tfθ(Y(s))dX(s).Y(t)=Y(0)+\int_0^t f_\theta(Y(s))\,dX(s).

这里的 X(t)X(t) 来自输入时间序列。输入每次变化都会通过 dXdX 控制隐状态,因此 CDE 特别适合不规则采样。

离散观测必须先变成连续路径。插值方案不是无关紧要的预处理,而是数据表示的一部分。

图 4

不同插值方案的可测性决定 Neural CDE 能否用于在线预测。

原视频 · 10:40 ↗

课程比较两种典型方案:

  • Natural cubic spline 更平滑,但通常依赖完整序列,难以在线使用。
  • Hermite 类插值可只使用当前及历史信息,更适合数据逐步到来的场景,但平滑性较弱。

“可测性”在这里意味着当前时刻的表示不能偷看未来观测。若插值曲线使用未来点,离线分类可能没有问题,在线预测却会发生数据泄漏。

把时间 tt 本身加入控制通道也很重要,否则模型可能无法区分相同数值在不同时间间隔下的意义,甚至无法可靠感知序列长度。

5. 连续模型如何求梯度

训练目标仍是计算 L/θ\partial L/\partial\theta。伴随状态法定义:

a(t)=Lz(t),a(t)=\frac{\partial L}{\partial z(t)},

并得到反向动力系统:

da(t)dt=a(t)f(z(t),t,θ)z(t).\frac{da(t)}{dt}=-a(t)^\top\frac{\partial f(z(t),t,\theta)}{\partial z(t)}.

参数梯度可写成沿时间的积分:

dLdθ=t1t0a(t)f(z(t),t,θ)θdt.\frac{dL}{d\theta} =\int_{t_1}^{t_0}a(t)^\top \frac{\partial f(z(t),t,\theta)}{\partial\theta}\,dt.
图 5

伴随状态法将连续动力系统中的梯度写成反向微分方程。

原视频 · 14:00 ↗

直觉上,伴随状态是“最终损失对当前连续状态的敏感度”。它从终点向起点传播,与离散网络的反向传播相似。

但伴随法不是零成本技巧:

  • 反向积分可能放大数值误差;
  • 前向与反向轨迹不一致会造成梯度偏差;
  • 更严格的误差容限会增加函数评估次数;
  • 某些任务中直接对求解器步骤自动微分更稳定。

因此需要同时报告求解器、误差容限、函数评估次数和梯度实现,而不只报告网络参数量。

6. Neural SDE:把不确定性写进动力系统

ODE 在给定初值后产生确定轨迹。若状态变化包含真实随机性,可加入布朗运动:

dht=f(ht,t;w)dt+G(ht,t;v)dBt.dh_t=f(h_t,t;w)\,dt+G(h_t,t;v)\,dB_t.
图 6

Neural SDE 通过布朗运动持续注入噪声以表达状态不确定性。

原视频 · 19:20 ↗

漂移项 ff 描述平均演化方向,扩散项 GG 决定噪声如何随状态变化。通过设计 GG,可以表示持续高斯扰动、状态相关不确定性,或与 dropout 类似的随机效应。

课程举交通流量和流速为例:早到或晚到几秒都会改变观测,单条确定轨迹无法表达全部可能结果;SDE 输出的是轨迹分布,更适合概率预测。

7. 家族边界比名称更重要

可用“状态由什么驱动”区分本课的三个核心成员:

模型状态变化来源典型用途
Neural ODE当前状态与时间连续深度、潜轨迹、连续流
Neural CDE当前状态与外部控制路径不规则时间序列、在线预测
Neural SDE漂移项与随机扩散项不确定性、随机动力系统

Neural Event ODE 进一步允许事件触发瞬时跳变,适合碰撞等不连续现象。Neural PDE 名称相近,但很多工作研究的是用神经网络求解偏微分方程,并不自动属于同一建模路线。

跟练与练习

原视频练习

编者练习

某传感器在不规则时刻上传数据,系统必须实时报警。应优先考虑普通 RNN、离线 Natural cubic spline CDE,还是只依赖历史点的 CDE 插值?说明判断依据。

查看参考答案

优先验证只依赖历史点的 CDE 插值。任务是不规则采样且要求在线输出,控制路径不能使用未来观测。普通 RNN 可作为基线,但它需要额外处理时间间隔;依赖完整序列的 Natural cubic spline 会泄漏未来信息,不适合实时部署。

编者练习 2

把残差块写成 yj+1=yj+Δtfθ(yj)y_{j+1}=y_j+\Delta t\,f_\theta(y_j)。当 Δt\Delta t 变小但积分区间不变时,网络深度和单步变化如何变化?

查看参考答案

离散步数增加,因此等效深度变大;每一步的状态变化缩小。若数值方法稳定,离散轨迹会更接近连续 ODE 解,但计算成本上升。更小步长并不自动改善模型本身,只降低某类离散误差。

常见误区

  • 误区:Neural ODE 就是无限深网络,所以表达能力一定无限。纠正:维度、轨迹不可交叉和求解稳定性都会限制表达。
  • 误区:连续时间意味着数据必须连续采样。纠正:CDE 正是先把离散不规则观测表示为连续控制路径。
  • 误区:任何平滑插值都能用于在线任务。纠正:若使用未来点,就违反可测性并泄漏信息。
  • 误区:伴随法不存激活,所以训练几乎免费。纠正:反向求解、误差控制和数值不稳定都可能增加成本。
  • 误区:SDE 只是给 ODE 输入加一次噪声。纠正:随机项在整个时间演化中持续作用,并定义轨迹分布。
  • 误区:所有 Neural PDE 都是 Neural ODE 的自然扩展。纠正:很多工作关注 PDE 求解器,研究问题和参数化对象不同。

本课小结

  • Neural ODE 学习连续向量场,残差网络可视为它的离散近似。
  • Neural CDE 用输入路径控制状态,插值与可测性决定能否正确处理在线不规则序列。
  • 伴随状态法提供连续系统的梯度计算框架,但必须关注数值误差。
  • Neural SDE 把随机性纳入动力系统,适合概率轨迹预测。
  • 下一课进入生成模型时,要继续追问:模型在什么空间中定义状态,学习的是确定速度场还是随机扩散过程。
03

主题讲解 · 36:58

生成模型为什么开始绕开 VAE Latent

学习目标

  • 能解释 Latent Diffusion 为什么引入 VAE,以及它牺牲了什么。
  • 能区分 REPA 的“表征对齐”和 RAE 的“替换表示空间”。
  • 能说出高维视觉表征适配 DiT 时出现的三个核心工程问题。
  • 能理解 JiT 与 MiniT2I 为什么尝试直接在像素 patch 上建模。
  • 能比较离散表征、patch embedding 和原生像素生成三种统一理解—生成路线。
  • 能避免把“去掉 VAE”误解为删除一层网络即可获得更好结果。

前置与衔接

建议先理解 VAE、自编码器、Diffusion/Flow Matching、DiT、patch embedding、视觉自监督编码器和 FID。

本课承接连续动力系统视角:生成过程仍可被描述为潜空间或像素空间中的速度场,但“状态位于什么空间”会决定语义质量、计算成本与解码上限。

核心讲解

1. Latent Diffusion 解决了计算问题,也设定了上限

像素空间的扩散在高分辨率下维度巨大。Latent Diffusion 将训练拆成两阶段:

  1. 用编码器 E\mathcal E 把图像 xx 压缩为潜变量 zz,再用解码器 D\mathcal D 重建图像。
  2. 在低维 zz 空间训练去噪模型,并通过 cross-attention 注入文本等条件。
z=E(x),x~=D(z).z=\mathcal E(x),\qquad \tilde x=\mathcal D(z).
图 1

Latent Diffusion 将自编码压缩与潜空间扩散拆成两个训练阶段。

原视频 · 05:20 ↗

这一设计把昂贵的像素生成转移到更紧凑的 latent,极大提高训练和采样效率,也促成 Stable Diffusion 一类系统。

代价是:生成器只能在编码器提供的表示空间中工作。若 VAE 丢失高频细节、语义结构不足或潜空间几何不利于去噪,后面的 DiT 再强也无法完全恢复被压缩阶段抹去的信息。

课程还引用一种更强的质疑:持续降低像素重建误差未必改善生成,甚至可能塑造不适合扩散动力学的 latent 几何。这里应谨慎理解——“重建好”与“生成好”不是同一个目标,但不能仅凭这一点断言所有 VAE 都应被删除。

2. REPA:先修正 DiT 的中间表征

自监督视觉编码器如 DINO、MAE 或 MoCo 专门学习语义表征,而传统扩散模型中间层与这些高质量表示存在差距。

REPA 保留原有 latent diffusion 主体,在 DiT 中间层接一个 MLP,预测冻结视觉编码器的表征:

y=f(x),ht=fθ(zt),y_*=f(x_*),\qquad h_t=f_\theta(z_t),

并把表征相似度损失加入原始去噪目标:

L=Lvelocity+λLREPA.\mathcal L=\mathcal L_{\text{velocity}}+\lambda\mathcal L_{\text{REPA}}.
图 2

REPA 用高质量视觉编码器监督扩散 Transformer 的中间表征。

原视频 · 09:40 ↗

它解决的是“DiT 学到的内部表征语义不够好”,并没有直接替换 VAE latent。课程中呈现的主要收益是更快对齐、更快收敛和更好的生成指标。

因此 REPA 更像桥梁:它证明生成模型可以从判别式/自监督表征中受益,为下一步直接把高质量视觉编码器变成生成 latent 奠定基础。

3. RAE:用表征编码器替换 VAE

Representation Autoencoder 的核心主张是:冻结的高质量视觉编码器不仅能做识别,其表示也能通过训练解码器用于生成;高维 latent 在合适架构下不是负担,反而可以保留更多语义。

第一步是训练 decoder,把冻结 encoder 的 token 表征还原为图像。第二步把这个 RAE latent 接入 DiT。

直接替换会失败。课程展示的实验中,原有窄 DiT 甚至无法过拟合一张图,因为高维 latent 加噪后占据更大的有效空间,网络宽度不足以表达去噪映射。

RAE 适配集中在三个问题:

  1. 宽度匹配:模型宽度至少要能承载输入 latent 的有效维度。
  2. 维度相关的噪声调度:不同分辨率和 token 维度下,相同噪声强度对应的信息破坏程度不同。
  3. 带噪解码训练:实际 DiT 输出的 latent 含残余噪声,decoder 训练时必须见过这类输入。
图 3

RAE 适配 DiT 时需要处理高维 latent、噪声调度与宽扩散头。

原视频 · 21:20 ↗

扩大整个 DiT backbone 虽然有效,却会显著增加参数。课程介绍的 Wide Diffusion Head 把较宽映射集中在输出头:先用常规宽度 backbone 得到状态,再联合 (xt,t,y)(x_t,t,y) 预测速度,从而在表达力和成本之间折中。

这里还要区分两个 FID:

  • reconstruction FID 衡量干净图像编码后再解码的重建质量;
  • generation FID 衡量生成模型产生的带误差 latent 解码后的图像质量。

给 decoder 加噪训练可能牺牲一点干净重建,却改善真正关心的生成质量。这说明优化代理指标时必须与部署输入分布一致。

4. JiT:不依赖预训练 latent,直接学习像素 patch

JiT 进一步问:如果高质量 latent 仍需要外部预训练 encoder,能否直接把图像切成 patch,在像素空间完成 Flow Matching?

输入 H×W×CH\times W\times C 被切成 p×pp\times p patch,经过线性映射成为 token,再交给 Transformer;没有 VAE,也没有 RAE encoder。

课程重点讨论预测目标。设干净图像为 xx、噪声为 ϵ\epsilon、速度为 vv。三者可相互换算,但学习难度不同。

噪声遍布整个高维空间,而自然图像更接近低维流形。直接预测干净 xx 可能比预测高维噪声更容易捕捉结构。

图 4

JiT 在像素 patch 上直接建模,并强调预测目标和模型宽度的作用。

原视频 · 27:20 ↗

报告强调的实验结论是:在该设置下,xx-prediction 至关重要,而用 velocity loss 配合效果最好;单纯增加隐藏单元并不一定继续改善 FID。

这些结论属于特定模型和训练设置,不能机械推广为“所有生成模型都应预测 xx”。当数据表示、噪声路径、参数化或分辨率改变时,应重新做消融。

5. MiniT2I:验证低成本像素生成基线

MiniT2I 将像素路线扩展到文本到图像,并追问能否用接近 ImageNet 级别的计算量得到可用结果。

它使用较轻的文本编码器、像素级 MM-DiT 基线和高质量 caption 数据。课程强调两个经验:

  • 去掉 VAE 后,基线在速度和 FID 上可以保持竞争力;
  • 更复杂的 AdaLN 等模块未必必要,简化文本适配和信息交换反而可能更有效。
图 5

MiniT2I 用简化的像素生成基线检验低成本文本到图像训练。

原视频 · 32:00 ↗

但课程也指出 FID 的边界:模型可能得到不错的分布指标,却生成语义过于平均、无法细致服从文本的图像。使用与文本严格对应的合成图像进行微调,可以改善 prompt adherence,但也会引入合成数据偏差。

因此“像素生成更简洁”不等于数据问题消失;相反,当结构先验减少后,数据标注质量和目标设计更重要。

6. 工业统一模型的三条路线

课程最后比较理解与生成统一模型:

图 6

Representation Forcing、Tuna-2 与 SenseNova-U1 的统一理解生成路线对比。

原视频 · 36:40 ↗

Representation Forcing

先预测图像的离散表征 token,再以该表征为条件生成图像。它给自回归模型一个可预测的视觉“中间语言”,但仍依赖图像编码器、在线 codebook 和离散化质量。

Tuna-2

去掉独立 representation encoder,直接对图像做 patch embedding。为了学到可用于理解和生成的 patch 表征,训练中加入 masked autoencoding 和 image-to-text 等辅助任务。生成阶段仍在同一 Transformer 中执行迭代去噪。

SenseNova-U1

用卷积把像素 patch 转成 embedding,在原生 pixel space 中做 Flow Matching,再由 MLP 预测像素。卷积提供更强局部归纳偏置,可能减少对复杂辅助表征任务的依赖。

三条路线并不是简单的“有无 VAE”二选一,而是在回答:

  • 视觉状态应连续还是离散?
  • 表征由外部 encoder、辅助任务还是卷积先验获得?
  • 理解和生成共享到哪一层?
  • 去噪循环如何嵌入自回归 backbone?

7. 何时值得替换 VAE latent

可以按瓶颈选择路线:

主要瓶颈优先验证方向代价
DiT 中间语义弱REPA 式表征对齐增加教师编码器与辅助损失
VAE latent 限制细节或语义RAE高维适配、decoder 与噪声调度更复杂
外部 encoder 成本或依赖过高JiT/像素 patch训练更依赖预测目标、宽度和数据质量
理解生成需统一表征 token 或共享 patch embedding任务冲突、辅助目标与推理流程复杂

真正的判断标准不是“模块数量更少”,而是在相同计算、数据和分辨率下,比较生成质量、文本遵循、训练稳定性、解码成本和下游理解能力。

跟练与练习

原视频练习

编者练习

一个 RAE 系统的 reconstruction FID 变差,但 generation FID 明显改善。是否应立即回滚?还要检查哪些证据?

查看参考答案

不应只因重建指标变差就回滚。系统目标是生成,应优先检查生成样本质量、文本遵循、generation FID、训练稳定性和解码鲁棒性;同时确认重建退化没有破坏需要的编辑或理解任务。若 decoder 训练输入更接近生成时带噪 latent,适度牺牲干净重建可能是合理权衡。

编者练习 2

你想验证“VAE 是当前系统的主要瓶颈”,请设计一个最小对照实验,避免同时改变太多因素。

查看参考答案

固定数据、文本编码器、训练预算、分辨率和主干规模,比较原 VAE latent 与一个替代表征。先分别验证两种表征的重建与噪声鲁棒性,再用匹配的模型宽度和噪声调度训练生成器。若直接替换失败,应先排除宽度不匹配、decoder 未见带噪 latent 等适配问题,不能把工程失配当成替代表征无效。

常见误区

  • 误区:VAE 重建越好,生成一定越好。纠正:重建误差与适合去噪的表示几何不是同一目标。
  • 误区:REPA 已经替换了 VAE。纠正:REPA 主要监督 DiT 中间表征,原 latent 路线仍可保留。
  • 误区:把 VAE 换成自监督 encoder 就完成 RAE。纠正:高维 latent 还要求宽度、噪声调度和 decoder 输入分布适配。
  • 误区:高维一定是负担,应该先压到尽可能低。纠正:过度压缩会丢语义,高维是否困难取决于模型容量与训练方案。
  • 误区:像素空间建模不需要表示学习。纠正:patch embedding、预测目标和辅助任务仍在决定表示质量。
  • 误区:FID 更好就说明文本到图像更好。纠正:FID 对 prompt adherence 和细节一致性不敏感。
  • 误区:去掉 VAE 自动降低总成本。纠正:像素 token 数、更宽模型、辅助任务和采样过程可能把成本转移到别处。

本课小结

  • Latent Diffusion 用压缩换效率,但 VAE 表征也可能成为生成上限。
  • REPA 证明外部高质量视觉表征能改善扩散内部状态;RAE 进一步把它变成生成 latent。
  • RAE 的成功来自完整适配,而不是一次模块替换。
  • JiT 与 MiniT2I 展示像素 patch 路线,但预测目标和数据质量成为新的关键变量。
  • 工业统一模型在离散表征、共享 patch embedding 与卷积像素编码之间做不同权衡。
  • 后续比较生成模型时,应把表示空间、动力学目标、解码器和评价指标放在同一张决策表中。