跳转到内容

输入关键词开始搜索

    资料摘要:DiTTo-TTS

    论文摘要更新 2026-08-17置信度 high待阅读原始来源 ↗#语音合成#零样本#DiT#潜空间#深度

    DiTTo-TTS 用冻结的预训练文本 encoder、10.76 Hz Mel-VAE latent 和带 cross-attention 的 Diffusion Transformer 做 zero-shot TTS;它取消音素与音素级时长,但保留一个独立的句级 Speech Length Predictor 来决定要生成多少语音 latent。

    • 文本与语音不再预先展开到同长:DiT block 用 token-level cross-attention 学习细粒度对齐,mean-pooled text 另通过 global AdaLN 提供全局条件。
    • 独立 Speech Length Predictor 以文本与参考语音 latent 预测剩余总长,只决定输出序列长度,不输出每个音素的时长。
    • Mel-VAE 把语音压到约 10.76 Hz,比 EnCodec 短约 7–8 倍;论文反复验证“时间轴更短”比 codec 单项重建分数更利于 DiT 学习可懂语音。
    • Mel-VAE++ 用冻结语言模型的 text decoding loss 把语义注入 speech latent;实验表明文本或语音 encoder 至少一侧经过 text-speech 联合训练,cross-attention 更容易形成单调对齐。
    • DiTTo-en-XL 在 LibriSpeech continuation 上报 1.78% WER,cross-sentence 上报 2.56%;用 25 个 diffusion steps 生成 10 秒语音约 1.62 秒。
    • 用户给出的 2.93–3.07% 不是最终 XL 主表:2.93% 来自 200K-step DiTTo-mls 架构/消融设置,3.07% 是 DiTTo-en-S 在 cross-sentence 上的结果。
    无音素级时长 TTS 文本到语音长度桥接 对比图
    无音素级时长 TTS 文本到语音长度桥接 对比图

    语音先经 Mel-VAE encoder 变为 zspeechz_{\text{speech}},再加噪得到 z(t)z^{(t)}。训练随机保留一段上下文 latent,对 70%–100% 的连续 mask 区域做 v-prediction:

    Ldiffusion=E[m(v(t)vθ(zmask(t),m,ztext,t))22].\mathcal L_{\text{diffusion}} =\mathbb E\left[\left|m\odot\left(v^{(t)}-v_\theta(z^{(t)}{\text{mask}},m,z{\text{text}},t)\right)\right|_2^2\right].

    文本 encoder 在 DiTTo 训练时冻结;英文模型使用 SpeechT5,多语模型使用 ByT5。DiT 内部使用 RoPE、GEGLU、shared global AdaLN、text cross-attention 和跨越整串 Transformer blocks 的 long skip。

    Speech Length Predictor 由双向 text encoder 与 causal audio decoder 组成。训练标签是每个参考位置之后“还需生成多少 audio tokens”,用 cross-entropy 学习;推理一次前向,用 top-k(K=20K=20)分布的期望或采样值决定总长。

    这比固定 20 秒 padding 显著更好:论文的小规模对比中,fixed-length WER 6.81,SLP-CE 为 5.58。改变总 latent 长度还可调整整句语速,但没有直接的局部音素时长控制。

    Text encoder Speech latent WER ↓ 解读
    ByT5 Mel-VAE 6.22 文本与语音表示均未联合对齐
    SpeechT5 Mel-VAE 3.07 文本 encoder 已见过语音
    ByT5 Mel-VAE++ 3.11 语音 latent 经文本语义注入
    SpeechT5 Mel-VAE++ 2.99 两侧都具有 text-speech 对齐归纳偏置

    这说明 cross-attention 本身不是对齐保证;条件表示的几何距离与时间压缩率同样关键。

    任务 模型 WER ↓ SIM-o ↑ 推理时间
    continuation DiTTo-en-B 1.87 0.5535 0.903 s / 10 s speech
    continuation DiTTo-en-XL 1.78 0.5773 1.616 s / 10 s speech
    cross-sentence DiTTo-en-S 3.07 0.4984
    cross-sentence DiTTo-en-XL 2.56 0.6270
    • “without domain-specific factors”不等于单模型端到端:它仍需冻结 text encoder、单独训练的 Mel-VAE、Speech Length Predictor 和 BigVGAN vocoder;取消的主要是 G2P、forced alignment 与 per-phoneme duration。
    • 数据缩放是成功条件:附录报告约 50 小时时过拟合且 WER 9.25,小数据下明显不如显式时长对齐稳定。
    • 语音 latent 压得更短可改善可懂度,但过强压缩也把重建上限交给 codec;应同时看 WER、SIM 和 codec 重建质量。
    • 论文给出了详细配置,但只声明未来解决法律问题后逐步发布推理/权重/训练实现;项目链接的 GitHub 主要是 zero-shot TTS 评测工具,不应视为完整可复现代码。
    项目 论文报告
    作者 Keon Lee, Dong Won Kim, Jaehyeon Kim, Seungjun Chung, Jaewoong Cho
    会议 ICLR 2025
    数据 55K h English;82K h / 9 languages
    模型规模 42M / 152M / 508M / 740M;multilingual 790M
    语音表示 Mel-VAE continuous latent,10.76 Hz
    采样 25 diffusion steps,CFG 5.0
    资源 项目页 · 评测仓库