资料摘要:F5-TTS
F5-TTS 是一个基于条件流匹配与 Diffusion Transformer 的非自回归、无显式音素时长预测 TTS。它把参考语音区域作为已知上下文、目标区域作为待补全 mel,以字符/拼音序列加 filler token 提供文本条件,并用 Sway Sampling 在不重训的情况下改善少步 ODE 采样。
- 核心任务是语音 infilling:训练时随机遮住 mel 片段,模型从噪声恢复缺失区域;zero-shot TTS 只是“参考音频已知、目标后缀待生成”的特例。
- 文本使用字符或拼音序列,并用 filler token 填充到 mel 长度;模型不依赖音素时长标签、外部对齐器或独立 duration predictor。
- 主干是 22 层、约 335.8M 参数的 DiT,文本先经 4 层 ConvNeXt V2 细化,再与 noisy speech、masked speech 和时间条件拼接。
- 推理时目标时长由参考语音的字符/时长比例估计,因此“无 duration predictor”不等于“完全不估时长”。
- Sway Sampling 用非均匀时间变换把更多 ODE 步数分配给生成早期;论文认为早期更决定内容和对齐,后期更多补细节。
- 32 NFE 在 Seed-TTS test-en/test-zh 上报告 1.83%/1.56% WER/CER,16 NFE 时 RTF 约 0.15;但更大数据/模型的 Seed-TTS DiT 仍在部分指标上更强。
1. 条件流匹配视角
Section titled “1. 条件流匹配视角”给定数据样本 与噪声 ,F5-TTS 沿最优传输条件路径构造中间状态 ,训练速度场 逼近目标速度。条件 同时包含文本、参考音频和掩码。推理从高斯噪声出发,用 ODE solver 把目标区域积分到 mel。
与逐 token AR 不同,所有目标 mel 帧可以并行更新;与显式时长模型不同,文本和语音的对应关系由 DiT 在 infilling 任务中隐式学习。论文用 E2 TTS 作为直接前身,主要改动是更合适的 DiT 骨干、文本卷积预处理和采样策略。
2. 文本与 mel 如何放到一起
Section titled “2. 文本与 mel 如何放到一起”文本序列先编码为字符或拼音 embedding,再补 filler token 到预计 mel 长度。ConvNeXt V2 在时间轴上扩展和局部平滑文本特征;之后文本、被遮挡的参考 mel 与当前 noisy mel 在特征维拼接,进入带 adaLN-zero 条件的 DiT。
该方法省去了对齐标注,但 filler 的位置仍隐含“总时长”假设。推理时,论文按参考语音的字符数—帧数比例估算目标持续时间;文本密度、语速和停顿结构变化大时仍可能失准。
3. Sway Sampling
Section titled “3. Sway Sampling”论文将均匀采样时间 映射为:
当 时,采样点更集中在流的早期。它不改变训练目标,只调整推理积分节点,因此可以直接应用于已有 checkpoint。消融显示少 NFE 时收益更明显,但最优 与 solver、数据和模型并非天然通用。
4. 训练与结果
Section titled “4. 训练与结果”F5-TTS Base 约 335.8M 参数,22 个 DiT block、16 个 attention head,文本 ConvNeXt V2 为 4 层。模型在 Emilia 约 10 万小时多语数据上使用 8 张 A100 训练超过一周、约 120 万次更新,输出 mel 后由 Vocos 还原波形。
| 设置 | Seed test-en WER ↓ | Seed test-zh CER ↓ | SIM-en ↑ | SIM-zh ↑ | RTF ↓ |
|---|---|---|---|---|---|
| F5-TTS,32 NFE | 1.83 | 1.56 | 0.67 | 0.76 | 约 0.31 |
| F5-TTS,16 NFE | 约 2.53(英语测试) | — | — | — | 约 0.15 |
论文还发现 E2 TTS 在约 7% 的中文测试样本上出现明显对齐失败,F5-TTS 对长文本和重复更稳。这支持骨干与文本建模改动,但并不能把所有收益单独归因于 Sway Sampling。
5. 批判性判断
Section titled “5. 批判性判断”- F5-TTS 的影响力来自极简任务定义 + 可复现开源实现,不是完全消除对齐问题;它把显式对齐转为模型内部隐式对齐。
- 低 RTF 来自较少 NFE 和并行帧更新,但 ODE 仍需多次全序列前向;长语音显存与持续延迟不能只看短句 RTF。
- mel 序列远长于文本,DiT 需要在大量 filler 位置建模,计算效率仍弱于低帧率 latent/token 路线。
- 论文明确缺少细粒度副语言与情绪控制;文本正确、音色相似并不等于风格可控。
| 项目 | 论文报告 |
|---|---|
| 模型规模 | 335.8M |
| 主干 | 22 层 DiT,16 heads;4 层 ConvNeXt V2 |
| 训练数据 | Emilia,约 10 万小时多语语音 |
| 训练资源 | 8×A100,超过一周,约 120 万更新 |
| 16 / 32 NFE RTF | 约 0.15 / 0.31(RTX 3090) |
| 主要限制 | 长 mel 序列;无细粒度副语言/情绪控制 |
| 官方实现 | SWivid/F5-TTS |
- 无音素级时长 TTS 的文本—语音对齐机制对比 — 与 E2 TTS、ZipVoice、DiTTo-TTS、SimpleSpeech、E3 TTS、MegaTTS 3 横向比较长度先验与对齐方式。
- Wiki 目录
- 资料摘要:Emilia — 核心训练数据来源
- 资料摘要:LLM-based TTS 四年全景(2023–2026) — 连续生成式路线定位
- DiT(Diffusion Transformer) · 条件流匹配(CFM) — 骨干与训练目标
- 资料摘要:DiT — 视觉 DiT 原始工作
- Voicebox — speech infilling 与 flow matching 前驱(本库尚无独立资料摘要)