LEARNING UNIT · 02
连续时间生成与表征空间
串联 Neural ODE、Diffusion、Flow Matching 与新型 latent 表征,建立现代生成模型的连续动力学视角。
- 已整理章节
- 3 节
- 单元来源
- 3 条视频
- 总时长
- 1:54:59
- 状态
- 已整理试读
- 学习位置
- 2 / 6
待整理 · 53:20
浅谈当下深度生成模型:从VAE、GAN、Diffusion、Flow Matching到世界模型
主题讲解 · 24:41
把神经网络写成连续动力系统
学习目标
- 能把 Neural ODE 解释为“由神经网络参数化向量场”的初值问题。
- 能从残差网络的离散更新理解连续深度模型。
- 能区分 Neural ODE、Neural CDE 与 Neural SDE 各自引入的信号。
- 能说明不规则时间序列为什么需要插值及可测性约束。
- 能说出伴随状态法解决什么训练问题,以及它并不等于“免费反向传播”。
前置与衔接
建议先熟悉导数、常微分方程初值问题、欧拉法、残差连接与链式法则。
本课位于“连续时间生成与表征空间”单元。它提供后续理解 Diffusion、Flow Matching 和连续生成轨迹的共同语言:状态不是经过固定层数后突然变化,而是在一个可学习的向量场中持续演化。
核心讲解
1. 从向量场到神经微分方程
向量场为状态空间中的每个点指定一个变化方向。若用神经网络 表示这个方向,就得到初值问题:
向量场、初值问题与 SIR 模型共同说明微分方程如何描述状态演化。
原视频 · 00:00 ↗给定初值 后,ODE solver 沿着局部方向积分,得到任意时间 的状态 。神经网络学习的不是单次输入到输出映射,而是整个状态变化规则。
课程用 SIR 传染病模型说明传统微分方程的意义:参数控制易感、感染和恢复人群之间的变化。把未知或难以显式建模的部分换成神经网络,就能在保留物理结构的同时学习残差关系。
若希望固定参数仍有清晰含义,应先拟合可解释部分,再谨慎加入神经网络;否则网络可能吸收本应由显式参数解释的效应。
2. Neural ODE 是连续深度的残差网络
残差块的离散更新为:
若引入步长 ,可写成:
这正是常微分方程的欧拉离散化。
残差网络的离散更新可被解释为连续深度的 Neural ODE。
原视频 · 01:20 ↗这个视角带来三个重要变化:
- “深度”由积分区间和求解器精度决定,不再是固定层数。
- 不同样本可因数值误差控制而使用不同函数评估次数。
- 计算图从逐层存储转变为对动力系统求解,但精度、稳定性与计算成本会互相制约。
如果希望不同时刻使用不同变换,可把 作为网络输入,也可以使用分段动力系统。若 完全自治且维度不扩展,轨迹不能任意交叉,因此表达能力受到拓扑约束;扩大隐状态维度可以缓解这一限制。
3. Neural ODE 的典型应用
连续标准化流从简单分布出发,让样本沿 ODE 流动到目标分布,并通过概率密度变化公式训练生成模型。
时间序列任务则可把观测编码为潜变量初值,再用 ODE 在潜空间中插值、预测与外推。
Latent ODE 对不规则时间序列进行插值、预测与外推。
原视频 · 04:20 ↗图中要区分两条时间线:
- 数据空间只有离散观测点;
- 潜空间通过 ODE 形成连续轨迹。
连续轨迹允许查询未观测时刻,但“可查询”不等于预测一定可信。远距离外推仍取决于向量场是否学到真实动力规律,以及初始状态的不确定性是否被正确建模。
4. Neural CDE:让外部路径持续控制状态
普通 ODE 的状态由时间和当前状态驱动。受控微分方程加入控制路径 :
这里的 来自输入时间序列。输入每次变化都会通过 控制隐状态,因此 CDE 特别适合不规则采样。
离散观测必须先变成连续路径。插值方案不是无关紧要的预处理,而是数据表示的一部分。
不同插值方案的可测性决定 Neural CDE 能否用于在线预测。
原视频 · 10:40 ↗课程比较两种典型方案:
- Natural cubic spline 更平滑,但通常依赖完整序列,难以在线使用。
- Hermite 类插值可只使用当前及历史信息,更适合数据逐步到来的场景,但平滑性较弱。
“可测性”在这里意味着当前时刻的表示不能偷看未来观测。若插值曲线使用未来点,离线分类可能没有问题,在线预测却会发生数据泄漏。
把时间 本身加入控制通道也很重要,否则模型可能无法区分相同数值在不同时间间隔下的意义,甚至无法可靠感知序列长度。
5. 连续模型如何求梯度
训练目标仍是计算 。伴随状态法定义:
并得到反向动力系统:
参数梯度可写成沿时间的积分:
伴随状态法将连续动力系统中的梯度写成反向微分方程。
原视频 · 14:00 ↗直觉上,伴随状态是“最终损失对当前连续状态的敏感度”。它从终点向起点传播,与离散网络的反向传播相似。
但伴随法不是零成本技巧:
- 反向积分可能放大数值误差;
- 前向与反向轨迹不一致会造成梯度偏差;
- 更严格的误差容限会增加函数评估次数;
- 某些任务中直接对求解器步骤自动微分更稳定。
因此需要同时报告求解器、误差容限、函数评估次数和梯度实现,而不只报告网络参数量。
6. Neural SDE:把不确定性写进动力系统
ODE 在给定初值后产生确定轨迹。若状态变化包含真实随机性,可加入布朗运动:
Neural SDE 通过布朗运动持续注入噪声以表达状态不确定性。
原视频 · 19:20 ↗漂移项 描述平均演化方向,扩散项 决定噪声如何随状态变化。通过设计 ,可以表示持续高斯扰动、状态相关不确定性,或与 dropout 类似的随机效应。
课程举交通流量和流速为例:早到或晚到几秒都会改变观测,单条确定轨迹无法表达全部可能结果;SDE 输出的是轨迹分布,更适合概率预测。
7. 家族边界比名称更重要
可用“状态由什么驱动”区分本课的三个核心成员:
| 模型 | 状态变化来源 | 典型用途 |
|---|---|---|
| Neural ODE | 当前状态与时间 | 连续深度、潜轨迹、连续流 |
| Neural CDE | 当前状态与外部控制路径 | 不规则时间序列、在线预测 |
| Neural SDE | 漂移项与随机扩散项 | 不确定性、随机动力系统 |
Neural Event ODE 进一步允许事件触发瞬时跳变,适合碰撞等不连续现象。Neural PDE 名称相近,但很多工作研究的是用神经网络求解偏微分方程,并不自动属于同一建模路线。
跟练与练习
原视频练习
编者练习
某传感器在不规则时刻上传数据,系统必须实时报警。应优先考虑普通 RNN、离线 Natural cubic spline CDE,还是只依赖历史点的 CDE 插值?说明判断依据。
查看参考答案
优先验证只依赖历史点的 CDE 插值。任务是不规则采样且要求在线输出,控制路径不能使用未来观测。普通 RNN 可作为基线,但它需要额外处理时间间隔;依赖完整序列的 Natural cubic spline 会泄漏未来信息,不适合实时部署。
编者练习 2
把残差块写成 。当 变小但积分区间不变时,网络深度和单步变化如何变化?
查看参考答案
离散步数增加,因此等效深度变大;每一步的状态变化缩小。若数值方法稳定,离散轨迹会更接近连续 ODE 解,但计算成本上升。更小步长并不自动改善模型本身,只降低某类离散误差。
常见误区
- 误区:Neural ODE 就是无限深网络,所以表达能力一定无限。纠正:维度、轨迹不可交叉和求解稳定性都会限制表达。
- 误区:连续时间意味着数据必须连续采样。纠正:CDE 正是先把离散不规则观测表示为连续控制路径。
- 误区:任何平滑插值都能用于在线任务。纠正:若使用未来点,就违反可测性并泄漏信息。
- 误区:伴随法不存激活,所以训练几乎免费。纠正:反向求解、误差控制和数值不稳定都可能增加成本。
- 误区:SDE 只是给 ODE 输入加一次噪声。纠正:随机项在整个时间演化中持续作用,并定义轨迹分布。
- 误区:所有 Neural PDE 都是 Neural ODE 的自然扩展。纠正:很多工作关注 PDE 求解器,研究问题和参数化对象不同。
本课小结
- Neural ODE 学习连续向量场,残差网络可视为它的离散近似。
- Neural CDE 用输入路径控制状态,插值与可测性决定能否正确处理在线不规则序列。
- 伴随状态法提供连续系统的梯度计算框架,但必须关注数值误差。
- Neural SDE 把随机性纳入动力系统,适合概率轨迹预测。
- 下一课进入生成模型时,要继续追问:模型在什么空间中定义状态,学习的是确定速度场还是随机扩散过程。
主题讲解 · 36:58
生成模型为什么开始绕开 VAE Latent
学习目标
- 能解释 Latent Diffusion 为什么引入 VAE,以及它牺牲了什么。
- 能区分 REPA 的“表征对齐”和 RAE 的“替换表示空间”。
- 能说出高维视觉表征适配 DiT 时出现的三个核心工程问题。
- 能理解 JiT 与 MiniT2I 为什么尝试直接在像素 patch 上建模。
- 能比较离散表征、patch embedding 和原生像素生成三种统一理解—生成路线。
- 能避免把“去掉 VAE”误解为删除一层网络即可获得更好结果。
前置与衔接
建议先理解 VAE、自编码器、Diffusion/Flow Matching、DiT、patch embedding、视觉自监督编码器和 FID。
本课承接连续动力系统视角:生成过程仍可被描述为潜空间或像素空间中的速度场,但“状态位于什么空间”会决定语义质量、计算成本与解码上限。
核心讲解
1. Latent Diffusion 解决了计算问题,也设定了上限
像素空间的扩散在高分辨率下维度巨大。Latent Diffusion 将训练拆成两阶段:
- 用编码器 把图像 压缩为潜变量 ,再用解码器 重建图像。
- 在低维 空间训练去噪模型,并通过 cross-attention 注入文本等条件。
Latent Diffusion 将自编码压缩与潜空间扩散拆成两个训练阶段。
原视频 · 05:20 ↗这一设计把昂贵的像素生成转移到更紧凑的 latent,极大提高训练和采样效率,也促成 Stable Diffusion 一类系统。
代价是:生成器只能在编码器提供的表示空间中工作。若 VAE 丢失高频细节、语义结构不足或潜空间几何不利于去噪,后面的 DiT 再强也无法完全恢复被压缩阶段抹去的信息。
课程还引用一种更强的质疑:持续降低像素重建误差未必改善生成,甚至可能塑造不适合扩散动力学的 latent 几何。这里应谨慎理解——“重建好”与“生成好”不是同一个目标,但不能仅凭这一点断言所有 VAE 都应被删除。
2. REPA:先修正 DiT 的中间表征
自监督视觉编码器如 DINO、MAE 或 MoCo 专门学习语义表征,而传统扩散模型中间层与这些高质量表示存在差距。
REPA 保留原有 latent diffusion 主体,在 DiT 中间层接一个 MLP,预测冻结视觉编码器的表征:
并把表征相似度损失加入原始去噪目标:
REPA 用高质量视觉编码器监督扩散 Transformer 的中间表征。
原视频 · 09:40 ↗它解决的是“DiT 学到的内部表征语义不够好”,并没有直接替换 VAE latent。课程中呈现的主要收益是更快对齐、更快收敛和更好的生成指标。
因此 REPA 更像桥梁:它证明生成模型可以从判别式/自监督表征中受益,为下一步直接把高质量视觉编码器变成生成 latent 奠定基础。
3. RAE:用表征编码器替换 VAE
Representation Autoencoder 的核心主张是:冻结的高质量视觉编码器不仅能做识别,其表示也能通过训练解码器用于生成;高维 latent 在合适架构下不是负担,反而可以保留更多语义。
第一步是训练 decoder,把冻结 encoder 的 token 表征还原为图像。第二步把这个 RAE latent 接入 DiT。
直接替换会失败。课程展示的实验中,原有窄 DiT 甚至无法过拟合一张图,因为高维 latent 加噪后占据更大的有效空间,网络宽度不足以表达去噪映射。
RAE 适配集中在三个问题:
- 宽度匹配:模型宽度至少要能承载输入 latent 的有效维度。
- 维度相关的噪声调度:不同分辨率和 token 维度下,相同噪声强度对应的信息破坏程度不同。
- 带噪解码训练:实际 DiT 输出的 latent 含残余噪声,decoder 训练时必须见过这类输入。
RAE 适配 DiT 时需要处理高维 latent、噪声调度与宽扩散头。
原视频 · 21:20 ↗扩大整个 DiT backbone 虽然有效,却会显著增加参数。课程介绍的 Wide Diffusion Head 把较宽映射集中在输出头:先用常规宽度 backbone 得到状态,再联合 预测速度,从而在表达力和成本之间折中。
这里还要区分两个 FID:
- reconstruction FID 衡量干净图像编码后再解码的重建质量;
- generation FID 衡量生成模型产生的带误差 latent 解码后的图像质量。
给 decoder 加噪训练可能牺牲一点干净重建,却改善真正关心的生成质量。这说明优化代理指标时必须与部署输入分布一致。
4. JiT:不依赖预训练 latent,直接学习像素 patch
JiT 进一步问:如果高质量 latent 仍需要外部预训练 encoder,能否直接把图像切成 patch,在像素空间完成 Flow Matching?
输入 被切成 patch,经过线性映射成为 token,再交给 Transformer;没有 VAE,也没有 RAE encoder。
课程重点讨论预测目标。设干净图像为 、噪声为 、速度为 。三者可相互换算,但学习难度不同。
噪声遍布整个高维空间,而自然图像更接近低维流形。直接预测干净 可能比预测高维噪声更容易捕捉结构。
JiT 在像素 patch 上直接建模,并强调预测目标和模型宽度的作用。
原视频 · 27:20 ↗报告强调的实验结论是:在该设置下,-prediction 至关重要,而用 velocity loss 配合效果最好;单纯增加隐藏单元并不一定继续改善 FID。
这些结论属于特定模型和训练设置,不能机械推广为“所有生成模型都应预测 ”。当数据表示、噪声路径、参数化或分辨率改变时,应重新做消融。
5. MiniT2I:验证低成本像素生成基线
MiniT2I 将像素路线扩展到文本到图像,并追问能否用接近 ImageNet 级别的计算量得到可用结果。
它使用较轻的文本编码器、像素级 MM-DiT 基线和高质量 caption 数据。课程强调两个经验:
- 去掉 VAE 后,基线在速度和 FID 上可以保持竞争力;
- 更复杂的 AdaLN 等模块未必必要,简化文本适配和信息交换反而可能更有效。
MiniT2I 用简化的像素生成基线检验低成本文本到图像训练。
原视频 · 32:00 ↗但课程也指出 FID 的边界:模型可能得到不错的分布指标,却生成语义过于平均、无法细致服从文本的图像。使用与文本严格对应的合成图像进行微调,可以改善 prompt adherence,但也会引入合成数据偏差。
因此“像素生成更简洁”不等于数据问题消失;相反,当结构先验减少后,数据标注质量和目标设计更重要。
6. 工业统一模型的三条路线
课程最后比较理解与生成统一模型:
Representation Forcing、Tuna-2 与 SenseNova-U1 的统一理解生成路线对比。
原视频 · 36:40 ↗Representation Forcing
先预测图像的离散表征 token,再以该表征为条件生成图像。它给自回归模型一个可预测的视觉“中间语言”,但仍依赖图像编码器、在线 codebook 和离散化质量。
Tuna-2
去掉独立 representation encoder,直接对图像做 patch embedding。为了学到可用于理解和生成的 patch 表征,训练中加入 masked autoencoding 和 image-to-text 等辅助任务。生成阶段仍在同一 Transformer 中执行迭代去噪。
SenseNova-U1
用卷积把像素 patch 转成 embedding,在原生 pixel space 中做 Flow Matching,再由 MLP 预测像素。卷积提供更强局部归纳偏置,可能减少对复杂辅助表征任务的依赖。
三条路线并不是简单的“有无 VAE”二选一,而是在回答:
- 视觉状态应连续还是离散?
- 表征由外部 encoder、辅助任务还是卷积先验获得?
- 理解和生成共享到哪一层?
- 去噪循环如何嵌入自回归 backbone?
7. 何时值得替换 VAE latent
可以按瓶颈选择路线:
| 主要瓶颈 | 优先验证方向 | 代价 |
|---|---|---|
| DiT 中间语义弱 | REPA 式表征对齐 | 增加教师编码器与辅助损失 |
| VAE latent 限制细节或语义 | RAE | 高维适配、decoder 与噪声调度更复杂 |
| 外部 encoder 成本或依赖过高 | JiT/像素 patch | 训练更依赖预测目标、宽度和数据质量 |
| 理解生成需统一 | 表征 token 或共享 patch embedding | 任务冲突、辅助目标与推理流程复杂 |
真正的判断标准不是“模块数量更少”,而是在相同计算、数据和分辨率下,比较生成质量、文本遵循、训练稳定性、解码成本和下游理解能力。
跟练与练习
原视频练习
编者练习
一个 RAE 系统的 reconstruction FID 变差,但 generation FID 明显改善。是否应立即回滚?还要检查哪些证据?
查看参考答案
不应只因重建指标变差就回滚。系统目标是生成,应优先检查生成样本质量、文本遵循、generation FID、训练稳定性和解码鲁棒性;同时确认重建退化没有破坏需要的编辑或理解任务。若 decoder 训练输入更接近生成时带噪 latent,适度牺牲干净重建可能是合理权衡。
编者练习 2
你想验证“VAE 是当前系统的主要瓶颈”,请设计一个最小对照实验,避免同时改变太多因素。
查看参考答案
固定数据、文本编码器、训练预算、分辨率和主干规模,比较原 VAE latent 与一个替代表征。先分别验证两种表征的重建与噪声鲁棒性,再用匹配的模型宽度和噪声调度训练生成器。若直接替换失败,应先排除宽度不匹配、decoder 未见带噪 latent 等适配问题,不能把工程失配当成替代表征无效。
常见误区
- 误区:VAE 重建越好,生成一定越好。纠正:重建误差与适合去噪的表示几何不是同一目标。
- 误区:REPA 已经替换了 VAE。纠正:REPA 主要监督 DiT 中间表征,原 latent 路线仍可保留。
- 误区:把 VAE 换成自监督 encoder 就完成 RAE。纠正:高维 latent 还要求宽度、噪声调度和 decoder 输入分布适配。
- 误区:高维一定是负担,应该先压到尽可能低。纠正:过度压缩会丢语义,高维是否困难取决于模型容量与训练方案。
- 误区:像素空间建模不需要表示学习。纠正:patch embedding、预测目标和辅助任务仍在决定表示质量。
- 误区:FID 更好就说明文本到图像更好。纠正:FID 对 prompt adherence 和细节一致性不敏感。
- 误区:去掉 VAE 自动降低总成本。纠正:像素 token 数、更宽模型、辅助任务和采样过程可能把成本转移到别处。
本课小结
- Latent Diffusion 用压缩换效率,但 VAE 表征也可能成为生成上限。
- REPA 证明外部高质量视觉表征能改善扩散内部状态;RAE 进一步把它变成生成 latent。
- RAE 的成功来自完整适配,而不是一次模块替换。
- JiT 与 MiniT2I 展示像素 patch 路线,但预测目标和数据质量成为新的关键变量。
- 工业统一模型在离散表征、共享 patch embedding 与卷积像素编码之间做不同权衡。
- 后续比较生成模型时,应把表示空间、动力学目标、解码器和评价指标放在同一张决策表中。