READING NOTES · CONTINUOUS-TOKEN AR SPEECH

Patch 内双向,Patch 间自回归
DiTAR 精读笔记

DiTAR 的关键不是简单地给 causal LM 接一个 diffusion head,而是先划定 causal dependency 真正该工作的时间尺度。

30 秒速览

TL;DR

DiTAR 从 speech VAE 取得 40 Hz、64 维连续 token,每 4 帧组成一个 patch。Aggregation encoder 把 patch 压成一个 10 Hz embedding;causal language model 只预测 patch 间的长程条件,LocDiT 则以 bidirectional attention 一次生成下一整个 patch。

一句话记忆:LM 决定“下一块说什么”,LocDiT 决定“这一块的连续帧如何彼此协调”。

40 HzVAE 连续 token 帧率
P = 4默认 patch size
10 HzLM 看到的 patch 序列
NFE 10主实验 LocDiT 步数

01 为什么必须切 Patch

DIVIDE AND CONQUER
Figure 1DiTAR 的两层时间尺度

上方是训练路径:aggregation encoder 把连续 token patch 压成 LM 输入,LocDiT 在 LM 条件与历史 patch 上学习下一 patch。下方是 inference 的逐 patch 生成。

不逐帧 AR
连续相邻帧高度相关;如果强迫每帧只看左侧,causal attention 会切断 patch 内自然存在的双向协同。
不整段 Diffusion
整段 non-causal diffusion 需要反复计算全部序列;当长上下文和模型规模增长时,计算代价迅速上升。
Patch 间由 LM
LM 在压缩后的 10 Hz 序列上维护长程文本、音色和进度,保留 autoregressive scaling 的路径。
Patch 内由 LocDiT
LocDiT 用 bidirectional attention 处理局部连续相关性,而且 diffusion 只作用于短 patch。
Figure 3Patch 不能太小,也不能太大

太小会退化成 causal AR;太大则把太多生成压力压给 LocDiT。论文默认 P=4,是两种瓶颈之间的折中。

02 LocDiT 为什么要看历史

OUTPAINTING + GUIDANCE

只给 LocDiT 当前 LM condition,它更像从零生成一个局部块;加入一个历史 patch 后,任务变成沿已有连续信号做 outpainting。Table 5 的结果很尖锐:不使用历史 patch 时,P=4 的 WER 从 1.736 上升到 22.874,而且大量样本不能正常停止。

LM guidance 也不是通常“条件/无条件各跑完整模型”的 CFG。论文复用同一个 LM,只让 LocDiT 分别接收真实 LM hidden state 与 null condition:

v~θ=vθ(xt,t,)+w(vθ(xt,t,hi)vθ(xt,t,))\tilde v_\theta=v_\theta(x_t,t,\varnothing)+w\bigl(v_\theta(x_t,t,h_i)-v_\theta(x_t,t,\varnothing)\bigr)

因此代价是一次 LM forward 加两次很小的 LocDiT forward;guidance 把额外计算限制在局部 decoder,而不是放大长上下文 LM 的成本。

03 连续 LM 的 Temperature 是什么

NOISE INJECTION TIME

离散 LM 的 temperature 改变 categorical logits;DiTAR 没有这样的 logits。作者把 τ\tau 定义为反向 diffusion ODE 轨迹中“开始注入随机噪声”的时间点:τ=0\tau=0 接近确定性 ODE,τ=1\tau=1 则从标准 Gaussian noise 开始完整采样。

Figure 5Temperature 控制说话人分布的展开程度

同一文本生成 500 次后,WavLM speaker embedding 的 PCA 分布会随 τ 增大而扩散;Table 6 则显示 WER 略偏好低 τ,SIM 略偏好高 τ。

直觉上,τ\tau 越大,越早把轨迹交给随机性;τ\tau 越小,越长时间沿模型给出的确定方向走。

04 哪些证据最有分量

EVIDENCE
质量与成本同时报告LibriSpeech A 上 WER 1.78、SIM 0.64、UTMOS 4.15,估算约 2.75 TFLOPs;作者据此强调不是只靠更重 diffusion 换质量。
双轴 Scaling数据从 20k 到 280k 小时、模型从 0.1B 到 1B,WER 与 SIM 都持续改善;组件消融显示 LM 与 LocDiT 比 encoder 更值得扩。
机制消融闭环patch size、历史 patch、guidance scale、NFE 与 temperature 都有独立实验,能把最终指标连回设计理由。
吞吐/延迟分开大 batch 下 DiTAR 的 throughput 优势明显;batch=1 时 NAR 的 RTF 更低,但 DiTAR 首帧 latency 更小。
Figure 6吞吐优势来自 batch 并行的局部 Diffusion

batch 增大后,DiTAR 只对短 patch 执行 LocDiT,吞吐增长快于整段 NAR diffusion;这不等于所有单请求场景都更快。

05 证据边界

LIMITS
“连续”不等于 raw waveform
模型预测的是 speech VAE latent;VAE 本身仍决定重建上限和 40 Hz、64 维表示的性质。
Single-stage 是系统级定义
它不先生成 semantic/prosody 离散 token 再 refinement,但内部仍有 aggregation encoder、LM 与 LocDiT 的隐式 coarse-to-local 分工。
语言范围有限
主要 zero-shot 结果集中在英文 LibriSpeech,以及 Seed-EN/Seed-ZH;不能直接外推到更广泛多语、方言或 expressive speech。
大量关键条件不公开
280k 小时数据、内部 ASR/G2P、训练实现和部分 baseline 均不可复现,SOTA 结论依赖作者设定。
FLOPs 是估算
Appendix A.4 明确忽略 bias、normalization 等项;TFLOPs 适合比较主干趋势,不等于真实 wall-clock 成本。
后续稳定性问题仍存在
后来的低帧率连续 token 工作继续针对 AR error accumulation、token geometry 与长时 drift 做设计,说明 DiTAR 没有终结这一问题。

06 编辑判断

VERDICT

DiTAR 最重要的贡献是一个计算边界的重划分:把长程、可扩展的依赖留给 causal LM,把局部连续相关性和多步采样限制在小型 LocDiT。

它比“LM + diffusion head”更完整,因为 patchification、historical outpainting、LM guidance 与 continuous temperature 共同组成可训练、可采样、可扩展的闭环。最值得保留的谨慎是:论文的 SOTA 证据强于可复现性证据;patch 切分缓解了局部因果冲突,却没有从理论上消除长时 autoregressive drift。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭