资料摘要:DiTTo-TTS
DiTTo-TTS 用冻结的预训练文本 encoder、10.76 Hz Mel-VAE latent 和带 cross-attention 的 Diffusion Transformer 做 zero-shot TTS;它取消音素与音素级时长,但保留一个独立的句级 Speech Length Predictor 来决定要生成多少语音 latent。
- 文本与语音不再预先展开到同长:DiT block 用 token-level cross-attention 学习细粒度对齐,mean-pooled text 另通过 global AdaLN 提供全局条件。
- 独立 Speech Length Predictor 以文本与参考语音 latent 预测剩余总长,只决定输出序列长度,不输出每个音素的时长。
- Mel-VAE 把语音压到约 10.76 Hz,比 EnCodec 短约 7–8 倍;论文反复验证“时间轴更短”比 codec 单项重建分数更利于 DiT 学习可懂语音。
- Mel-VAE++ 用冻结语言模型的 text decoding loss 把语义注入 speech latent;实验表明文本或语音 encoder 至少一侧经过 text-speech 联合训练,cross-attention 更容易形成单调对齐。
- DiTTo-en-XL 在 LibriSpeech continuation 上报 1.78% WER,cross-sentence 上报 2.56%;用 25 个 diffusion steps 生成 10 秒语音约 1.62 秒。
- 用户给出的 2.93–3.07% 不是最终 XL 主表:2.93% 来自 200K-step DiTTo-mls 架构/消融设置,3.07% 是 DiTTo-en-S 在 cross-sentence 上的结果。
1. 生成目标与训练
Section titled “1. 生成目标与训练”语音先经 Mel-VAE encoder 变为 ,再加噪得到 。训练随机保留一段上下文 latent,对 70%–100% 的连续 mask 区域做 v-prediction:
文本 encoder 在 DiTTo 训练时冻结;英文模型使用 SpeechT5,多语模型使用 ByT5。DiT 内部使用 RoPE、GEGLU、shared global AdaLN、text cross-attention 和跨越整串 Transformer blocks 的 long skip。
2. 总时长预测器
Section titled “2. 总时长预测器”Speech Length Predictor 由双向 text encoder 与 causal audio decoder 组成。训练标签是每个参考位置之后“还需生成多少 audio tokens”,用 cross-entropy 学习;推理一次前向,用 top-k()分布的期望或采样值决定总长。
这比固定 20 秒 padding 显著更好:论文的小规模对比中,fixed-length WER 6.81,SLP-CE 为 5.58。改变总 latent 长度还可调整整句语速,但没有直接的局部音素时长控制。
3. 语义对齐的关键实验
Section titled “3. 语义对齐的关键实验”| Text encoder | Speech latent | WER ↓ | 解读 |
|---|---|---|---|
| ByT5 | Mel-VAE | 6.22 | 文本与语音表示均未联合对齐 |
| SpeechT5 | Mel-VAE | 3.07 | 文本 encoder 已见过语音 |
| ByT5 | Mel-VAE++ | 3.11 | 语音 latent 经文本语义注入 |
| SpeechT5 | Mel-VAE++ | 2.99 | 两侧都具有 text-speech 对齐归纳偏置 |
这说明 cross-attention 本身不是对齐保证;条件表示的几何距离与时间压缩率同样关键。
4. 主结果
Section titled “4. 主结果”| 任务 | 模型 | WER ↓ | SIM-o ↑ | 推理时间 |
|---|---|---|---|---|
| continuation | DiTTo-en-B | 1.87 | 0.5535 | 0.903 s / 10 s speech |
| continuation | DiTTo-en-XL | 1.78 | 0.5773 | 1.616 s / 10 s speech |
| cross-sentence | DiTTo-en-S | 3.07 | 0.4984 | — |
| cross-sentence | DiTTo-en-XL | 2.56 | 0.6270 | — |
5. 批判性判断
Section titled “5. 批判性判断”- “without domain-specific factors”不等于单模型端到端:它仍需冻结 text encoder、单独训练的 Mel-VAE、Speech Length Predictor 和 BigVGAN vocoder;取消的主要是 G2P、forced alignment 与 per-phoneme duration。
- 数据缩放是成功条件:附录报告约 50 小时时过拟合且 WER 9.25,小数据下明显不如显式时长对齐稳定。
- 语音 latent 压得更短可改善可懂度,但过强压缩也把重建上限交给 codec;应同时看 WER、SIM 和 codec 重建质量。
- 论文给出了详细配置,但只声明未来解决法律问题后逐步发布推理/权重/训练实现;项目链接的 GitHub 主要是 zero-shot TTS 评测工具,不应视为完整可复现代码。
| 项目 | 论文报告 |
|---|---|
| 作者 | Keon Lee, Dong Won Kim, Jaehyeon Kim, Seungjun Chung, Jaewoong Cho |
| 会议 | ICLR 2025 |
| 数据 | 55K h English;82K h / 9 languages |
| 模型规模 | 42M / 152M / 508M / 740M;multilingual 790M |
| 语音表示 | Mel-VAE continuous latent,10.76 Hz |
| 采样 | 25 diffusion steps,CFG 5.0 |
| 资源 | 项目页 · 评测仓库 |
- 无音素级时长 TTS 的文本—语音对齐机制对比
- 资料摘要:E3 TTS — 更早的 fixed-length waveform U-Net + text cross-attention。
- 资料摘要:SimpleSpeech — 句级总时长 + in-context prefix 的相邻路线。
- DiT(Diffusion Transformer) · VAE(变分自编码器) · CFG(无分类器引导)
- Wiki 目录