资料摘要:MegaTTS 3(S-DiT)
这篇工作早期以 S-DiT 称呼骨干,最新 arXiv v4 已将系统正式命名为 MegaTTS 3:它先从 forced alignment 中为每个音素只保留一个稀疏时间锚点,再让 LLaMA-style latent DiT 用 attention 补出细粒度对齐,以此折中显式时长的稳定性与隐式对齐的韵律自由度。
- 稀疏对齐不是无对齐:训练数据先经 MFA/外部 aligner 得到音素时长,再在每个音素占据的多帧中随机保留一个 anchor,其余位置设为 mask。
- 锚点只提供粗位置,不把整条 hard alignment 强制注入模型;Transformer 仍通过 attention 学精细边界,且可通过移动 anchor 控制整句或局部音素时长。
- WaveVAE 把 16 kHz waveform 压到 25 帧/秒、32 维 continuous latent;生成器是 24 层、16 heads、1024 维的 LLaMA-style Transformer,论文版约 339M 参数。
- 训练使用 masked speech modeling + Rectified Flow;PeRFlow 把 25-step teacher 蒸馏为 8-step 学生,Multi-condition CFG 分别调 text 与 speaker guidance,还可用 text scale 控制口音强度。
- LibriSpeech test-clean 上,339M MegaTTS 3 报 WER 1.82、SIM-O 0.71;8-step accelerated 版 WER 1.86、SIM-O 0.70。LibriSpeech-PC 上为 WER 2.31,同一表中 E2 TTS 2.95、F5-TTS 2.42。
- 稀疏对齐消融的 WER 1.82 与 forced alignment 1.80 接近,但 CMOS 高 0.17;无对齐时 WER 降为 2.14,支持“粗锚点保稳定、soft attention 保韵律”的折中。
1. WaveVAE 与 masked latent flow
Section titled “1. WaveVAE 与 masked latent flow”WaveVAE 以 waveform encoder 和 HiFi-GAN-style decoder 压缩/还原语音,损失包括频谱重建、小 KL penalty 和多种 GAN discriminator。每秒 25 个 continuous vectors 大幅缩短后续 DiT 的时间轴。
训练时把 latent 分为 prompt 区 与 masked target 区 ,prompt 比例在 0.1–0.9 间随机。Rectified Flow 学习从 Gaussian 到真实 latent 的 drift:
2. 稀疏锚点怎样构造
Section titled “2. 稀疏锚点怎样构造”若音素 的 hard duration 为 ,完整对齐是
稀疏化后每个音素随机只保留一个位置,例如
再经卷积下采样到与 WaveVAE latent 同长,并沿 channel 维拼接。这样保留大致边界,却不把每帧都锁死在 forced-alignment path 上。
3. PeRFlow 与 Multi-condition CFG
Section titled “3. PeRFlow 与 Multi-condition CFG”PeRFlow 把 分成 个 time windows,student 学每个短区间的平均 drift,从而用 8 NFE 近似 25-step teacher。Multi-condition CFG 把引导拆成
因此可分别放大音色/风格与文本标准发音的约束,但每步需要多个条件分支前向;8 sampling steps 不应与单分支 8 NFE 无条件等同。
4. 主结果与消融
Section titled “4. 主结果与消融”| 设置 | SIM-O ↑ | WER ↓ | CMOS ↑ | SMOS ↑ |
|---|---|---|---|---|
| Sparse alignment | 0.71 | 1.82 | 0.00 | 3.94 |
| Forced alignment | 0.70 | 1.80 | -0.17 | 3.94 |
| No alignment | 0.67 | 2.14 | -0.12 | 3.88 |
| Standard CFG | 0.68 | 1.79 | -0.02 | 3.89 |
| No CFG | 0.43 | 6.85 | -0.56 | 3.35 |
长文本评测上,MegaTTS 3 WER 2.39,短文本为 1.82;ELLA-V hard-sentence 集上 WER 3.95,优于官方 checkpoint 推理的 F5-TTS 4.28 与 E2-TTS 8.49。这支持其对难句的稳定性,但对比仍受 checkpoint、ASR 和 prompt 设置影响。
5. 批判性判断
Section titled “5. 批判性判断”- 这条路线明确使用外部对齐工具;它减少的是注入生成器的边界密度,不是数据处理阶段的 alignment cost。
- 论文最强的证据是“稀疏与完整 forced alignment 在 WER 上接近,但主观韵律更好”,而不是稀疏锚点在所有指标上绝对最优。
- 论文主模型训练于 60K 小时 LibriLight 伪转写和外部对齐标签;缩放到 600K 小时的结果使用私有抓取数据,不是同等可复现设置。
- 官方 MegaTTS3 仓库 已发布推理代码与部分权重,但 README 明确说明仓库提供的是 forced-align 版,并未完整释出论文的 sparse-alignment 模型;WaveVAE encoder 参数也因安全限制未公开。
| 项目 | 论文报告 |
|---|---|
| 作者 | Ziyue Jiang 等,Zhejiang University / ByteDance |
| 最新题名 | MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis |
| 生成主干 | 24-layer LLaMA-style Transformer,339M |
| 语音表示 | WaveVAE,25 Hz,32 dims |
| 主训练数据 | LibriLight 60K h,internal ASR + external alignment |
| 采样 | teacher 25 steps;PeRFlow student 8 steps |
| 资源 | Demo · 官方代码 |
- 无音素级时长 TTS 的文本—语音对齐机制对比
- 资料摘要:E2 TTS · 资料摘要:F5-TTS — 纯隐式 filler 对齐基线。
- 资料摘要:DiTTo-TTS — 总长度 + cross-attention,不用 forced alignment。
- DiT(Diffusion Transformer) · 条件流匹配(CFM) · CFG(无分类器引导)
- Wiki 目录