跳转到内容

输入关键词开始搜索

    资料摘要:dots.tts

    论文摘要更新 2026-08-14置信度 high待阅读原始来源 ↗#语音合成#连续表征#流匹配#深度#研究

    dots.tts 是一套约 20 亿参数的 continuous autoregressive TTS 系统:它直接在 AudioVAE 连续潜变量上逐 patch 生成,以 full-history AR-Flow 保留完整语音历史,并用 reward-free Self-corrective alignment 与 CFG-aware MeanFlow 分别改善难例对齐和少步推理。

    🔒 dots.tts Technical Report

    中文全文译稿 · 精读笔记 · 官方 GitHub · arXiv

    • 连续表征而非离散 codec token:AudioVAE 把 48 kHz 波形压缩为 25 Hz、128 维连续潜变量;生成器以 flow matching 每次预测四帧组成的潜变量 patch,避免量化误差与大词表 softmax。
    • full-history AR-Flow:系统不是只依赖上一个 patch 或固定窗口,而是让当前 patch 访问此前全部已生成的干净语音 patch;因此局部声学连续性与长程韵律都能进入同一个因果上下文。
    • 约 20 亿参数、150 万小时训练数据:报告把训练规模、模型容量与连续 AR 建模共同作为通用性来源,覆盖多语言、方言、音色、情感及复杂文本。
    • reward-free 自校正:Self-corrective alignment 不训练 reward model,也不做策略优化;它让当前 DiT 从理想 flow 路径做一次 detached CFG Euler rollout,构造 off-trajectory auxiliary state,再用指向 clean latent endpoint 的速度做辅助 flow-matching 回归。
    • CFG-aware MeanFlow 蒸馏:蒸馏目标直接感知 classifier-free guidance 后的向量场,使少量 NFE 的学生模型逼近实际部署时的引导轨迹,而不是只拟合无引导 teacher。
    • 质量与效率是两条独立优化线:自校正主要缩小预训练直线路径与多步 ODE 推理轨迹之间的 mismatch;MeanFlow 主要降低每个声学 patch 的 flow 求解次数,二者不能互相替代。
    • 开源边界较清晰:官方仓库以 Apache-2.0 发布代码与模型使用入口;论文、源码包和仓库可相互核验,但 150 万小时训练语料本身并未公开。
    dots.tts 连续 AR 语音生成架构
    dots.tts 连续 AR 语音生成架构

    离散 AR TTS 把语音压成 codec token,再对有限词表做分类。它的优势是能直接复用语言模型式 next-token prediction,但量化器会引入信息瓶颈,多个 codebook 还需要人为安排 time/depth 顺序。dots.tts 选择另一条路:AudioVAE 输出连续声学帧,每四帧组成一个生成 patch;Transformer 负责建立文本、说话人条件与历史语音之间的上下文,flow matching head 再从噪声恢复当前 patch。

    于是外层仍是自回归分解:

    p(z1:Tc)=t=1Tp(ztz<t,c),p(\mathbf z_{1:T}\mid \mathbf c) =\prod_{t=1}^{T}p(\mathbf z_t\mid \mathbf z_{<t},\mathbf c),

    但每个条件分布不再是词表 softmax,而是连续生成问题。这里 c\mathbf c 表示文本、音色提示等条件,zt\mathbf z_t 是第 tt 个四帧 AudioVAE 潜变量 patch。

    “full-history”描述的是因果条件范围:预测第 tt 个 patch 时,AR-FM 能够读取 z1:t1\mathbf z_{1:t-1} 的完整干净 patch 历史,而不是只保留上一个 patch 或截断在短窗口。它仍然遵守因果性,并不允许看到未来 patch。

    这一设计对 TTS 尤其重要,但职责不是落在“同一个 Transformer”上:Qwen2.5-1.5B 初始化的 LLM 只读取每个 patch 经 semantic encoder 压出的 6.25 Hz 语义摘要;18 层 AR-FM DiT 则读取当前 LLM hidden state HtH_t、全部历史 clean patch P<tP_{<t} 与当前 noisy patch ZtZ_t。前者负责紧凑的长程语义历史,后者保留高方差声学细节与完整 clean latent prefix。

    标准 flow matching 只在 xt=(1t)x0+tx1x_t=(1-t)x_0+t x_1 的解析直线路径上训练,真实推理却反复使用模型速度做 Euler 积分,小误差会让下一步进入未见过的 off-trajectory state,并跨 AR patch 累积。

    dots.tts 从 on-trajectory 的 xτx_\tau 出发,用当前 CFG-guided DiT 做一次 stop-gradient Euler rollout 到 x^τ+\hat x_{\tau_+};随后把这个偏轨状态向原噪声端 x0x_0 重新加噪,得到多个 xauxx_{\mathrm{aux}},并以 uaux=(x1xaux)/(1τaux+ε)u_{\mathrm{aux}}=(x_1-x_{\mathrm{aux}})/(1-\tau_{\mathrm{aux}}+\varepsilon) 监督 DiT 回到 clean endpoint。它不需要完整话语生成、ASR 错误检测、reward model 或外部 acoustic teacher。独立公式解释见 Self-corrective alignment(自校正对齐)

    flow matching 通常需要多次函数评估才能从噪声积分到数据。MeanFlow 将一段时间区间的平均速度压入少步学生;dots.tts 又把 classifier-free guidance 纳入蒸馏目标,因为部署时真正执行的是 conditional 与 unconditional 向量场组合后的轨迹。

    如果蒸馏只看未引导 teacher,训练目标与推理轨迹就会错位。CFG-aware 版本把 guidance scale 及其形成的有效向量场直接作为学习对象,因此报告可以比较 NFE=2、3、4 等效率工作点。

    1. 训练 AudioVAE,建立 48 kHz 波形与 25 Hz、128 维连续潜变量之间的压缩—重建映射。
    2. 进行模态对齐,使文本表示、说话人条件与声学潜变量进入可协同建模的空间。
    3. 在大规模多语种数据上做通用预训练,再用高质量数据 annealing。
    4. 冻结其他模块,只用 Self-corrective alignment 训练 acoustic DiT 在自身诱发的 flow-time 偏轨状态上恢复 clean endpoint。
    5. 用 CFG-aware MeanFlow 蒸馏出低 NFE 推理版本。
    • 报告版本:arXiv:2606.07080v2,2026-08-10;正文与参考文献共 22 页。
    • 模型规模:约 2B 参数;训练数据约 1.5M 小时。
    • 音频表示:48 kHz 单声道输入,AudioVAE 输出 25 Hz、128 维连续潜变量;四帧组成一个 6.25 Hz 自回归 patch。
    • 论文证据规模:2 张图、5 张表、28 个展示公式、45 条实际引用文献。
    • 评测覆盖:AudioVAE 重建、Seed-TTS-Eval、MiniMax 多语言测试集、CV3-Eval、EmergentTTS-Eval,以及效率对比。
    • 发布许可:官方 GitHub 仓库标注 Apache License 2.0;可复现性仍取决于公开权重、推理代码和未公开训练数据之间的边界。
    • 真正的新意是组合方式:连续 AR、flow matching、CFG、MeanFlow 与 exposure-bias 纠错各自都有前置工作;dots.tts 的贡献在于把它们组织成可扩展 TTS 系统,并给出较完整的训练—评测链路,而非声称所有部件均为首创。
    • 自校正并不等价于“没有代价”:reward-free 省去了 reward model 与 RL,但仍需要额外的一步 CFG Euler rollout、stop-gradient auxiliary state 构造和多次 DiT 回归;实验中每个主样本产生 6 个辅助状态。
    • full-history 有服务成本:完整历史有利于一致性,却让长音频上下文和逐 patch 串行长度持续增长;MeanFlow 降低的是每个 patch 内部 NFE,并没有消除外层 AR 串行性。
    • 公开评测不等于完全可复现:报告给出广泛基准和消融,但 150 万小时数据不可公开复刻;训练数据组成、清洗阈值和算力预算仍会显著影响复现结果。
    • 连续与离散路线并无绝对胜负:连续表征减少量化瓶颈,却把每个时间步变成生成分布求解;离散 token 更适合统一语言建模生态。应按音质、延迟、流式约束和训练基础设施选择。