READING NOTES · CONTINUOUS-TOKEN AR SPEECH
Patch 内双向,Patch 间自回归
DiTAR 精读笔记
DiTAR 的关键不是简单地给 causal LM 接一个 diffusion head,而是先划定 causal dependency 真正该工作的时间尺度。
30 秒速览
TL;DRDiTAR 从 speech VAE 取得 40 Hz、64 维连续 token,每 4 帧组成一个 patch。Aggregation encoder 把 patch 压成一个 10 Hz embedding;causal language model 只预测 patch 间的长程条件,LocDiT 则以 bidirectional attention 一次生成下一整个 patch。
一句话记忆:LM 决定“下一块说什么”,LocDiT 决定“这一块的连续帧如何彼此协调”。
01 为什么必须切 Patch
DIVIDE AND CONQUER上方是训练路径:aggregation encoder 把连续 token patch 压成 LM 输入,LocDiT 在 LM 条件与历史 patch 上学习下一 patch。下方是 inference 的逐 patch 生成。
- 不逐帧 AR
- 连续相邻帧高度相关;如果强迫每帧只看左侧,causal attention 会切断 patch 内自然存在的双向协同。
- 不整段 Diffusion
- 整段 non-causal diffusion 需要反复计算全部序列;当长上下文和模型规模增长时,计算代价迅速上升。
- Patch 间由 LM
- LM 在压缩后的 10 Hz 序列上维护长程文本、音色和进度,保留 autoregressive scaling 的路径。
- Patch 内由 LocDiT
- LocDiT 用 bidirectional attention 处理局部连续相关性,而且 diffusion 只作用于短 patch。
太小会退化成 causal AR;太大则把太多生成压力压给 LocDiT。论文默认 P=4,是两种瓶颈之间的折中。
02 LocDiT 为什么要看历史
OUTPAINTING + GUIDANCE只给 LocDiT 当前 LM condition,它更像从零生成一个局部块;加入一个历史 patch 后,任务变成沿已有连续信号做 outpainting。Table 5 的结果很尖锐:不使用历史 patch 时,P=4 的 WER 从 1.736 上升到 22.874,而且大量样本不能正常停止。
LM guidance 也不是通常“条件/无条件各跑完整模型”的 CFG。论文复用同一个 LM,只让 LocDiT 分别接收真实 LM hidden state 与 null condition:
因此代价是一次 LM forward 加两次很小的 LocDiT forward;guidance 把额外计算限制在局部 decoder,而不是放大长上下文 LM 的成本。
03 连续 LM 的 Temperature 是什么
NOISE INJECTION TIME离散 LM 的 temperature 改变 categorical logits;DiTAR 没有这样的 logits。作者把 定义为反向 diffusion ODE 轨迹中“开始注入随机噪声”的时间点: 接近确定性 ODE, 则从标准 Gaussian noise 开始完整采样。
同一文本生成 500 次后,WavLM speaker embedding 的 PCA 分布会随 τ 增大而扩散;Table 6 则显示 WER 略偏好低 τ,SIM 略偏好高 τ。
直觉上, 越大,越早把轨迹交给随机性; 越小,越长时间沿模型给出的确定方向走。
04 哪些证据最有分量
EVIDENCEbatch 增大后,DiTAR 只对短 patch 执行 LocDiT,吞吐增长快于整段 NAR diffusion;这不等于所有单请求场景都更快。
05 证据边界
LIMITS- “连续”不等于 raw waveform
- 模型预测的是 speech VAE latent;VAE 本身仍决定重建上限和 40 Hz、64 维表示的性质。
- Single-stage 是系统级定义
- 它不先生成 semantic/prosody 离散 token 再 refinement,但内部仍有 aggregation encoder、LM 与 LocDiT 的隐式 coarse-to-local 分工。
- 语言范围有限
- 主要 zero-shot 结果集中在英文 LibriSpeech,以及 Seed-EN/Seed-ZH;不能直接外推到更广泛多语、方言或 expressive speech。
- 大量关键条件不公开
- 280k 小时数据、内部 ASR/G2P、训练实现和部分 baseline 均不可复现,SOTA 结论依赖作者设定。
- FLOPs 是估算
- Appendix A.4 明确忽略 bias、normalization 等项;TFLOPs 适合比较主干趋势,不等于真实 wall-clock 成本。
- 后续稳定性问题仍存在
- 后来的低帧率连续 token 工作继续针对 AR error accumulation、token geometry 与长时 drift 做设计,说明 DiTAR 没有终结这一问题。
06 编辑判断
VERDICTDiTAR 最重要的贡献是一个计算边界的重划分:把长程、可扩展的依赖留给 causal LM,把局部连续相关性和多步采样限制在小型 LocDiT。
它比“LM + diffusion head”更完整,因为 patchification、historical outpainting、LM guidance 与 continuous temperature 共同组成可训练、可采样、可扩展的闭环。最值得保留的谨慎是:论文的 SOTA 证据强于可复现性证据;patch 切分缓解了局部因果冲突,却没有从理论上消除长时 autoregressive drift。