资料摘要:dots.tts
dots.tts 是一套约 20 亿参数的 continuous autoregressive TTS 系统:它直接在 AudioVAE 连续潜变量上逐 patch 生成,以 full-history AR-Flow 保留完整语音历史,并用 reward-free Self-corrective alignment 与 CFG-aware MeanFlow 分别改善难例对齐和少步推理。
🔒 dots.tts Technical Report
中文全文译稿 · 精读笔记 · 官方 GitHub · arXiv
- 连续表征而非离散 codec token:AudioVAE 把 48 kHz 波形压缩为 25 Hz、128 维连续潜变量;生成器以 flow matching 每次预测四帧组成的潜变量 patch,避免量化误差与大词表 softmax。
- full-history AR-Flow:系统不是只依赖上一个 patch 或固定窗口,而是让当前 patch 访问此前全部已生成的干净语音 patch;因此局部声学连续性与长程韵律都能进入同一个因果上下文。
- 约 20 亿参数、150 万小时训练数据:报告把训练规模、模型容量与连续 AR 建模共同作为通用性来源,覆盖多语言、方言、音色、情感及复杂文本。
- reward-free 自校正:Self-corrective alignment 不训练 reward model,也不做策略优化;它让当前 DiT 从理想 flow 路径做一次 detached CFG Euler rollout,构造 off-trajectory auxiliary state,再用指向 clean latent endpoint 的速度做辅助 flow-matching 回归。
- CFG-aware MeanFlow 蒸馏:蒸馏目标直接感知 classifier-free guidance 后的向量场,使少量 NFE 的学生模型逼近实际部署时的引导轨迹,而不是只拟合无引导 teacher。
- 质量与效率是两条独立优化线:自校正主要缩小预训练直线路径与多步 ODE 推理轨迹之间的 mismatch;MeanFlow 主要降低每个声学 patch 的 flow 求解次数,二者不能互相替代。
- 开源边界较清晰:官方仓库以 Apache-2.0 发布代码与模型使用入口;论文、源码包和仓库可相互核验,但 150 万小时训练语料本身并未公开。
1. 为什么用连续 AR
Section titled “1. 为什么用连续 AR”离散 AR TTS 把语音压成 codec token,再对有限词表做分类。它的优势是能直接复用语言模型式 next-token prediction,但量化器会引入信息瓶颈,多个 codebook 还需要人为安排 time/depth 顺序。dots.tts 选择另一条路:AudioVAE 输出连续声学帧,每四帧组成一个生成 patch;Transformer 负责建立文本、说话人条件与历史语音之间的上下文,flow matching head 再从噪声恢复当前 patch。
于是外层仍是自回归分解:
但每个条件分布不再是词表 softmax,而是连续生成问题。这里 表示文本、音色提示等条件, 是第 个四帧 AudioVAE 潜变量 patch。
2. full-history 的含义
Section titled “2. full-history 的含义”“full-history”描述的是因果条件范围:预测第 个 patch 时,AR-FM 能够读取 的完整干净 patch 历史,而不是只保留上一个 patch 或截断在短窗口。它仍然遵守因果性,并不允许看到未来 patch。
这一设计对 TTS 尤其重要,但职责不是落在“同一个 Transformer”上:Qwen2.5-1.5B 初始化的 LLM 只读取每个 patch 经 semantic encoder 压出的 6.25 Hz 语义摘要;18 层 AR-FM DiT 则读取当前 LLM hidden state 、全部历史 clean patch 与当前 noisy patch 。前者负责紧凑的长程语义历史,后者保留高方差声学细节与完整 clean latent prefix。
3. Self-corrective alignment
Section titled “3. Self-corrective alignment”标准 flow matching 只在 的解析直线路径上训练,真实推理却反复使用模型速度做 Euler 积分,小误差会让下一步进入未见过的 off-trajectory state,并跨 AR patch 累积。
dots.tts 从 on-trajectory 的 出发,用当前 CFG-guided DiT 做一次 stop-gradient Euler rollout 到 ;随后把这个偏轨状态向原噪声端 重新加噪,得到多个 ,并以 监督 DiT 回到 clean endpoint。它不需要完整话语生成、ASR 错误检测、reward model 或外部 acoustic teacher。独立公式解释见 Self-corrective alignment(自校正对齐)。
4. CFG-aware MeanFlow
Section titled “4. CFG-aware MeanFlow”flow matching 通常需要多次函数评估才能从噪声积分到数据。MeanFlow 将一段时间区间的平均速度压入少步学生;dots.tts 又把 classifier-free guidance 纳入蒸馏目标,因为部署时真正执行的是 conditional 与 unconditional 向量场组合后的轨迹。
如果蒸馏只看未引导 teacher,训练目标与推理轨迹就会错位。CFG-aware 版本把 guidance scale 及其形成的有效向量场直接作为学习对象,因此报告可以比较 NFE=2、3、4 等效率工作点。
5. 训练阶段
Section titled “5. 训练阶段”- 训练 AudioVAE,建立 48 kHz 波形与 25 Hz、128 维连续潜变量之间的压缩—重建映射。
- 进行模态对齐,使文本表示、说话人条件与声学潜变量进入可协同建模的空间。
- 在大规模多语种数据上做通用预训练,再用高质量数据 annealing。
- 冻结其他模块,只用 Self-corrective alignment 训练 acoustic DiT 在自身诱发的 flow-time 偏轨状态上恢复 clean endpoint。
- 用 CFG-aware MeanFlow 蒸馏出低 NFE 推理版本。
- 报告版本:arXiv:2606.07080v2,2026-08-10;正文与参考文献共 22 页。
- 模型规模:约 2B 参数;训练数据约 1.5M 小时。
- 音频表示:48 kHz 单声道输入,AudioVAE 输出 25 Hz、128 维连续潜变量;四帧组成一个 6.25 Hz 自回归 patch。
- 论文证据规模:2 张图、5 张表、28 个展示公式、45 条实际引用文献。
- 评测覆盖:AudioVAE 重建、Seed-TTS-Eval、MiniMax 多语言测试集、CV3-Eval、EmergentTTS-Eval,以及效率对比。
- 发布许可:官方 GitHub 仓库标注 Apache License 2.0;可复现性仍取决于公开权重、推理代码和未公开训练数据之间的边界。
- 真正的新意是组合方式:连续 AR、flow matching、CFG、MeanFlow 与 exposure-bias 纠错各自都有前置工作;dots.tts 的贡献在于把它们组织成可扩展 TTS 系统,并给出较完整的训练—评测链路,而非声称所有部件均为首创。
- 自校正并不等价于“没有代价”:reward-free 省去了 reward model 与 RL,但仍需要额外的一步 CFG Euler rollout、stop-gradient auxiliary state 构造和多次 DiT 回归;实验中每个主样本产生 6 个辅助状态。
- full-history 有服务成本:完整历史有利于一致性,却让长音频上下文和逐 patch 串行长度持续增长;MeanFlow 降低的是每个 patch 内部 NFE,并没有消除外层 AR 串行性。
- 公开评测不等于完全可复现:报告给出广泛基准和消融,但 150 万小时数据不可公开复刻;训练数据组成、清洗阈值和算力预算仍会显著影响复现结果。
- 连续与离散路线并无绝对胜负:连续表征减少量化瓶颈,却把每个时间步变成生成分布求解;离散 token 更适合统一语言建模生态。应按音质、延迟、流式约束和训练基础设施选择。
- Self-corrective alignment(自校正对齐) — 用模型自身的一步 flow rollout 构造偏轨状态,并学习返回 clean latent endpoint。
- 条件流匹配(CFM) — 连续声学帧生成的基础建模范式。
- CFG(无分类器引导) — 推理引导及 CFG-aware 蒸馏的前置机制。
- VAE(变分自编码器) — AudioVAE 连续潜变量与波形重建的基础。
- CALM(连续自回归语言建模) — 同属连续 AR 思路,但模型结构、训练对象和发布背景不同。
- 资料摘要:Luna-TTS — 离散 RVQ 网格上的并行 / block-causal diffusion 对照路线。
- 资料摘要:Qwen3-TTS — 低帧率离散 codec AR 路线。
- Wiki 目录