跳转到内容

输入关键词开始搜索

    资料摘要:MegaTTS 3(S-DiT)

    论文摘要更新 2026-08-17置信度 high待阅读原始来源 ↗#语音合成#零样本#DiT#稀疏对齐#流匹配

    这篇工作早期以 S-DiT 称呼骨干,最新 arXiv v4 已将系统正式命名为 MegaTTS 3:它先从 forced alignment 中为每个音素只保留一个稀疏时间锚点,再让 LLaMA-style latent DiT 用 attention 补出细粒度对齐,以此折中显式时长的稳定性与隐式对齐的韵律自由度。

    • 稀疏对齐不是无对齐:训练数据先经 MFA/外部 aligner 得到音素时长,再在每个音素占据的多帧中随机保留一个 anchor,其余位置设为 mask。
    • 锚点只提供粗位置,不把整条 hard alignment 强制注入模型;Transformer 仍通过 attention 学精细边界,且可通过移动 anchor 控制整句或局部音素时长。
    • WaveVAE 把 16 kHz waveform 压到 25 帧/秒、32 维 continuous latent;生成器是 24 层、16 heads、1024 维的 LLaMA-style Transformer,论文版约 339M 参数。
    • 训练使用 masked speech modeling + Rectified Flow;PeRFlow 把 25-step teacher 蒸馏为 8-step 学生,Multi-condition CFG 分别调 text 与 speaker guidance,还可用 text scale 控制口音强度。
    • LibriSpeech test-clean 上,339M MegaTTS 3 报 WER 1.82、SIM-O 0.71;8-step accelerated 版 WER 1.86、SIM-O 0.70。LibriSpeech-PC 上为 WER 2.31,同一表中 E2 TTS 2.95、F5-TTS 2.42。
    • 稀疏对齐消融的 WER 1.82 与 forced alignment 1.80 接近,但 CMOS 高 0.17;无对齐时 WER 降为 2.14,支持“粗锚点保稳定、soft attention 保韵律”的折中。
    无音素级时长 TTS 文本到语音长度桥接 对比图
    无音素级时长 TTS 文本到语音长度桥接 对比图

    WaveVAE 以 waveform encoder 和 HiFi-GAN-style decoder 压缩/还原语音,损失包括频谱重建、小 KL penalty 和多种 GAN discriminator。每秒 25 个 continuous vectors 大幅缩短后续 DiT 的时间轴。

    训练时把 latent 分为 prompt 区 zpromptz_{\text{prompt}} 与 masked target 区 ztargetz_{\text{target}},prompt 比例在 0.1–0.9 间随机。Rectified Flow 学习从 Gaussian Z0Z_0 到真实 latent Z1Z_1 的 drift:

    minv01E[(Z1Z0)v(Zt,t)2]dt.\min_v\int_0^1\mathbb E\left[\left|(Z_1-Z_0)-v(Z_t,t)\right|^2\right]dt.

    若音素 [p1,p2,p3][p_1,p_2,p_3] 的 hard duration 为 [2,2,3][2,2,3],完整对齐是

    a=[p1,p1,p2,p2,p3,p3,p3].a=[p_1,p_1,p_2,p_2,p_3,p_3,p_3].

    稀疏化后每个音素随机只保留一个位置,例如

    a=[M,p1,p2,M,M,M,p3].\tilde a=[M,p_1,p_2,M,M,M,p_3].=[M,p1,p2,M,M,M,p3].

    a~\tilde a 再经卷积下采样到与 WaveVAE latent 同长,并沿 channel 维拼接。这样保留大致边界,却不把每帧都锁死在 forced-alignment path 上。

    PeRFlow 把 t[0,1]t\in[0,1] 分成 KK 个 time windows,student 学每个短区间的平均 drift,从而用 8 NFE 近似 25-step teacher。Multi-condition CFG 把引导拆成

    g^=αspk[g(p,zprompt)g(p,)]+αtxt[g(p,)g(,)]+g(,).\hat g =\alpha_{\text{spk}}[g(p,z_{\text{prompt}})-g(p,\varnothing)] +\alpha_{\text{txt}}[g(p,\varnothing)-g(\varnothing,\varnothing)] +g(\varnothing,\varnothing).

    因此可分别放大音色/风格与文本标准发音的约束,但每步需要多个条件分支前向;8 sampling steps 不应与单分支 8 NFE 无条件等同。

    设置 SIM-O ↑ WER ↓ CMOS ↑ SMOS ↑
    Sparse alignment 0.71 1.82 0.00 3.94
    Forced alignment 0.70 1.80 -0.17 3.94
    No alignment 0.67 2.14 -0.12 3.88
    Standard CFG 0.68 1.79 -0.02 3.89
    No CFG 0.43 6.85 -0.56 3.35

    长文本评测上,MegaTTS 3 WER 2.39,短文本为 1.82;ELLA-V hard-sentence 集上 WER 3.95,优于官方 checkpoint 推理的 F5-TTS 4.28 与 E2-TTS 8.49。这支持其对难句的稳定性,但对比仍受 checkpoint、ASR 和 prompt 设置影响。

    • 这条路线明确使用外部对齐工具;它减少的是注入生成器的边界密度,不是数据处理阶段的 alignment cost。
    • 论文最强的证据是“稀疏与完整 forced alignment 在 WER 上接近,但主观韵律更好”,而不是稀疏锚点在所有指标上绝对最优。
    • 论文主模型训练于 60K 小时 LibriLight 伪转写和外部对齐标签;缩放到 600K 小时的结果使用私有抓取数据,不是同等可复现设置。
    • 官方 MegaTTS3 仓库 已发布推理代码与部分权重,但 README 明确说明仓库提供的是 forced-align 版,并未完整释出论文的 sparse-alignment 模型;WaveVAE encoder 参数也因安全限制未公开。
    项目 论文报告
    作者 Ziyue Jiang 等,Zhejiang University / ByteDance
    最新题名 MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
    生成主干 24-layer LLaMA-style Transformer,339M
    语音表示 WaveVAE,25 Hz,32 dims
    主训练数据 LibriLight 60K h,internal ASR + external alignment
    采样 teacher 25 steps;PeRFlow student 8 steps
    资源 Demo · 官方代码