READING NOTES · CONTINUOUS AUTOREGRESSIVE TTS
语义负责不跑偏
声学负责像真人
dots.tts 的核心并非简单地把离散 token 换成连续 latent,而是把长程语义历史和局部声学渲染拆开,再让声学生成器学习修复自己的 rollout 误差。
30 秒速览
TL;DRdots.tts 是一个 20 亿参数的全连续端到端 AR TTS。AudioVAE 把 48 kHz 语音压成 25 Hz、128 维 latent;每四帧组成一个 patch,semantic encoder 再把 patch 压到 6.25 Hz,供 LLM 做长程历史建模;AR Flow Matching head 根据完整历史生成下一块连续 latent。
最值得记住的设计是:LLM 只接收语义摘要,不接收原始高方差 VAE latent。连续声学细节留给 AR-FM,语义历史留给 LLM,从结构上减少误差在长 rollout 中被放大。
01 连续 AR 为什么不容易跑偏
ARCHITECTURE文本 token 与 semantic embedding 共用 LLM stream。LLM hidden state 驱动 AR-FM 生成下一块四帧 VAE latent;新 patch 再经 causal semantic encoder 压成下一步的语义反馈。
- 语义 AudioVAE
- 重建训练之后,再用 WavLM frame alignment 和 ASR/情感/说话人多任务监督塑造 latent,使连续空间不仅能还原,而且更容易被下游生成器预测。
- 完整历史 AR-FM
- 生成第 n 个 patch 时不只看 LLM 当前状态,还看所有历史干净 patch。声学连续性有显式上下文,不必全部压进 LLM hidden state。
- block-causal 并行训练
- cause 与 generation 两半共享 position index;训练一次并行计算全部 patch,却让每块只看到推理时应有的历史。
- 1T1A 双流
- 一个文本 token 与一个 6.25 Hz 音频步交错,文本流结束后音频尾部继续,避免等完整句子才开口。
训练时,Z→C 只看当前及历史条件,Z→Z 在不同 patch 间隔离;position ID 在 Z 段重置,使每步噪声 patch 的 RoPE slot 与逐步推理一致。
02 后训练不是偏好优化
POST-TRAINING- Self-corrective alignment:当前 DiT 先按 CFG 自己走一步,构造 detached 的 off-trajectory state,再学习把该状态拉回干净 endpoint。没有 reward model,也没有外部 acoustic teacher。
- 它修正什么:预训练只在真实直线路径上学 velocity,推理却会落到模型自己的偏离轨迹;自校正把这种 train–inference mismatch 显式加入训练。
- CFG-aware MeanFlow:把自校正 DiT 冻结成 teacher,以带 CFG 的轨迹区间平均速度监督 student;CFG 已融入 target,推理每步只需一次 conditional forward。
- 工程结果:MF 在 NFE=4 时基本保持 SOAR 的 WER,但平均损失约 1 点 SIM;换来 plain / 1T1A 模式 85.4 / 54.4 ms 首包延迟。
03 结果应怎样读
EVIDENCE完整五张表与所有模型行见中文全文页。
| 评估 | 报告结果 | 支持的结论 |
|---|---|---|
| Seed-TTS 平均 | Pretrain WER 2.92 · SOAR SIM 79.2 | 报告表中平均 WER / SIM 分别最佳,但来自不同 checkpoint |
| MiniMax 24 语种 | SOAR 平均 SIM 83.9 | 说话人相似度领先;平均 WER 6.8 并不领先 |
| CV3 跨语种 | SIM 75.0 / 72.8 | 音色解耦强;WER 仍落后 CosyVoice 3 |
| EmergentTTS | Syntax 65.7% · Emotions 72.7% | 两个最佳值来自 SOAR 与 Pretrain,不是同一模型全面领先 |
| 推理效率 | 54.4 ms · RTF 0.245 | 单张 H800、MF NFE=4、1T1A interleaved 条件下成立 |
SOAR 的收益不是单调的:它提高 Seed-TTS SIM、CV3 hard-en 与 EmergentTTS 的 Syntax,但让 EmergentTTS 的 Emotions 和 Paralinguistics 下降。更合理的解释是,自校正加强文本忠实度与轨迹稳定性,同时可能收紧一部分表达自由度。
04 证据边界
LIMITS- 数据不可复现
- 150 万小时里约 120 万小时是内部中英语音;质量过滤分数、数据配比和 caption 生成细节不足以复建同一训练集。
- BPE 的低资源缺口
- 阿拉伯语、印地语、土耳其语等语言 SIM 仍高,但 WER 显著偏大;这支持“音色克隆成功、文本覆盖不足”的诊断。
- 表现力取舍
- SOAR 在语法复杂度上提升,却在情感与副语言上回落;不能把 post-training 简化为所有质量维度同时提高。
- 效率条件窄
- 54 ms 是单张 H800、vllm-omni、MeanFlow student、NFE=4 与双流输入共同作用的结果,不能直接外推到消费级 GPU 或普通离线调用;MeanFlow 只减少每个 patch 内部的函数评估,外层自回归串行性仍然存在。
- 模态能力尚未兑现
- AudioVAE 原理上可覆盖一般声音,但 backbone 训练仍以语音为主;本次发布不证明歌唱或统一 speech-and-sound 生成。
- 滥用风险
- zero-shot voice cloning 的高相似度同时提高冒用风险;论文只给出政策性建议,没有检测或水印实验。
05 编辑判断
VERDICTdots.tts 最有价值的贡献是把连续 AR 的稳定性问题拆成 representation、history conditioning 与 off-trajectory post-training 三层,并给出能跑到实时双流的完整工程闭环。
创新不是单个模块“第一次出现”:AudioVAE、DiT head、SOAR 与 MeanFlow 均有前置工作。真正有辨识度的是组合方式——LLM 只看语义摘要、AR-FM 保留完整声学历史,再把自校正和 CFG 蒸馏只施加到 acoustic DiT。证据强项是跨多个公开基准的一致性和完整发布;薄弱处是内部数据占比高、缺乏正式主观听测,以及若干表现力维度的 post-training trade-off。