跳转到内容

输入关键词开始搜索

    资料摘要:F5-TTS

    论文摘要更新 2026-08-17置信度 high待阅读原始来源 ↗#语音合成#流匹配#DiT#深度#进阶

    F5-TTS 是一个基于条件流匹配与 Diffusion Transformer 的非自回归、无显式音素时长预测 TTS。它把参考语音区域作为已知上下文、目标区域作为待补全 mel,以字符/拼音序列加 filler token 提供文本条件,并用 Sway Sampling 在不重训的情况下改善少步 ODE 采样。

    • 核心任务是语音 infilling:训练时随机遮住 mel 片段,模型从噪声恢复缺失区域;zero-shot TTS 只是“参考音频已知、目标后缀待生成”的特例。
    • 文本使用字符或拼音序列,并用 filler token 填充到 mel 长度;模型不依赖音素时长标签、外部对齐器或独立 duration predictor。
    • 主干是 22 层、约 335.8M 参数的 DiT,文本先经 4 层 ConvNeXt V2 细化,再与 noisy speech、masked speech 和时间条件拼接。
    • 推理时目标时长由参考语音的字符/时长比例估计,因此“无 duration predictor”不等于“完全不估时长”。
    • Sway Sampling 用非均匀时间变换把更多 ODE 步数分配给生成早期;论文认为早期更决定内容和对齐,后期更多补细节。
    • 32 NFE 在 Seed-TTS test-en/test-zh 上报告 1.83%/1.56% WER/CER,16 NFE 时 RTF 约 0.15;但更大数据/模型的 Seed-TTS DiT 仍在部分指标上更强。
    LLM-based TTS 九篇参考论文系统位置 架构图
    LLM-based TTS 九篇参考论文系统位置 架构图

    给定数据样本 x1x_1 与噪声 x0x_0,F5-TTS 沿最优传输条件路径构造中间状态 xtx_t,训练速度场 vθ(xt,t,c)v_\theta(x_t,t,c) 逼近目标速度。条件 cc 同时包含文本、参考音频和掩码。推理从高斯噪声出发,用 ODE solver 把目标区域积分到 mel。

    与逐 token AR 不同,所有目标 mel 帧可以并行更新;与显式时长模型不同,文本和语音的对应关系由 DiT 在 infilling 任务中隐式学习。论文用 E2 TTS 作为直接前身,主要改动是更合适的 DiT 骨干、文本卷积预处理和采样策略。

    文本序列先编码为字符或拼音 embedding,再补 filler token 到预计 mel 长度。ConvNeXt V2 在时间轴上扩展和局部平滑文本特征;之后文本、被遮挡的参考 mel 与当前 noisy mel 在特征维拼接,进入带 adaLN-zero 条件的 DiT。

    该方法省去了对齐标注,但 filler 的位置仍隐含“总时长”假设。推理时,论文按参考语音的字符数—帧数比例估算目标持续时间;文本密度、语速和停顿结构变化大时仍可能失准。

    论文将均匀采样时间 uu 映射为:

    fsway(u;s)=u+s(cosπu21+u).f_{\text{sway}}(u;s)=u+s\left(\cos\frac{\pi u}{2}-1+u\right).

    s<0s<0 时,采样点更集中在流的早期。它不改变训练目标,只调整推理积分节点,因此可以直接应用于已有 checkpoint。消融显示少 NFE 时收益更明显,但最优 ss 与 solver、数据和模型并非天然通用。

    F5-TTS Base 约 335.8M 参数,22 个 DiT block、16 个 attention head,文本 ConvNeXt V2 为 4 层。模型在 Emilia 约 10 万小时多语数据上使用 8 张 A100 训练超过一周、约 120 万次更新,输出 mel 后由 Vocos 还原波形。

    设置 Seed test-en WER ↓ Seed test-zh CER ↓ SIM-en ↑ SIM-zh ↑ RTF ↓
    F5-TTS,32 NFE 1.83 1.56 0.67 0.76 约 0.31
    F5-TTS,16 NFE 约 2.53(英语测试) 约 0.15

    论文还发现 E2 TTS 在约 7% 的中文测试样本上出现明显对齐失败,F5-TTS 对长文本和重复更稳。这支持骨干与文本建模改动,但并不能把所有收益单独归因于 Sway Sampling。

    • F5-TTS 的影响力来自极简任务定义 + 可复现开源实现,不是完全消除对齐问题;它把显式对齐转为模型内部隐式对齐。
    • 低 RTF 来自较少 NFE 和并行帧更新,但 ODE 仍需多次全序列前向;长语音显存与持续延迟不能只看短句 RTF。
    • mel 序列远长于文本,DiT 需要在大量 filler 位置建模,计算效率仍弱于低帧率 latent/token 路线。
    • 论文明确缺少细粒度副语言与情绪控制;文本正确、音色相似并不等于风格可控。
    项目 论文报告
    模型规模 335.8M
    主干 22 层 DiT,16 heads;4 层 ConvNeXt V2
    训练数据 Emilia,约 10 万小时多语语音
    训练资源 8×A100,超过一周,约 120 万更新
    16 / 32 NFE RTF 约 0.15 / 0.31(RTX 3090)
    主要限制 长 mel 序列;无细粒度副语言/情绪控制
    官方实现 SWivid/F5-TTS