跳转到内容

输入关键词开始搜索

    资料摘要:E2 TTS

    论文摘要更新 2026-08-17置信度 high待阅读原始来源 ↗#语音合成#零样本#流匹配#对齐#深度

    E2 TTS 把 zero-shot TTS 写成 mel-spectrogram infilling:文本保留字符序列,末尾追加 filler token 直到与 mel 帧数相同,再让一个带 U-Net 式长跳连的 Transformer 在条件流匹配中同时学习内容、对齐与声学生成。

    • 文本不做 G2P,也不提供帧级音素对齐;字符后用 <F> 补到 mel 序列长度,让 self-attention 自行找到单调对应。
    • 训练是大比例连续区域的 speech infilling;推理时把参考语音当作已知前缀,目标区域从噪声经 ODE 积分生成。
    • 无音素时长不等于无总时长:推理仍需先给定目标帧数 TgenT^{\text{gen}}。主实验为公平对比使用独立回归式 duration model 估计总长,论文另证明手动改总时长时模型仍有一定容错性。
    • 335M 参数、24 层 Transformer、16 heads、100 维 mel;训练主数据为 50K 小时 LibriHeavy,并验证到 200K 小时私有数据的扩展性。
    • LibriSpeech-PC test-clean 上,50K 小时从零训练为 2.0% WER,加无监督预训练为 1.9%;200K 小时从零训练也为 1.9%。
    • X1 变体不再需参考语音转写;X2 变体允许用括号内的 CMU 音素串指定局部读音。
    无音素级时长 TTS 文本到语音长度桥接 对比图
    无音素级时长 TTS 文本到语音长度桥接 对比图

    训练语音的 mel 特征记为 s^RD×T\hat s\in\mathbb R^{D\times T},转写字符为 y=(c1,,cM)y=(c_1,\ldots,c_M)。E2 TTS 构造

    y^=(c1,,cM,F,,FTM).\hat y=(c_1,\ldots,c_M,\underbrace{\langle F\rangle,\ldots,\langle F\rangle}_{T-M}).

    <F> 不表示某个真实音素或静音帧,它只把文本 condition 放到与 mel 相同的序列坐标中。文本字符都位于前部,模型必须从整句上下文与参考 mel 自行学出发音边界,它不是已知的帧级对齐。

    训练分布为 P(ms^(1m)s^,y^)P(m\odot\hat s\mid(1-m)\odot\hat s,\hat y)mm 是时间掩码。模型输入包含未遮挡 mel、noisy mel、字符/filler embedding 与 flow time,用 CFM 目标回归时变向量场。推理用 midpoint ODE solver,主表为 32 NFE。

    它与 Voicebox 的关系很直接:Voicebox 输入已展开的帧级音素,E2 TTS 改成“字符 + filler”。因此 E2 TTS 可视为把 G2P、音素时长模型与声学模型合并到同一个 Transformer。

    • 24 kHz 语音,每 10.7 ms 提取 100 维 log-mel,BigVGAN 还原 waveform。
    • mask 长度为全句的 70%–100%;20% 概率丢弃全部条件以训练 CFG。
    • 模型训练 800K updates;没有帧级音素对齐后,前期 WER 收敛显著慢于 Voicebox,但充分训练后更优。
    设置 数据 初始化 WER ↓ SIM-o ↑
    E2 TTS P1 50K h random 2.0 0.675
    E2 TTS P2 50K h unsupervised pretrain 1.9 0.708
    E2 TTS P3 200K h random 1.9 0.707
    • 简化的是音素级工具链,不是长度问题本身。没有 TgenT^{\text{gen}} 就无法知道要准备多少噪声帧,因此系统层仍需估计或指定句级总时长。
    • 字符全在序列前缀,且 mel 比文本长得多;这是方法极简的代价,也解释了为什么后续 F5-TTS 要增加 ConvNeXt 文本精炼、ZipVoice 要改为 Average Upsampling。
    • 主结果依赖 50K–200K 小时数据与 335M 模型,不能把“不用显式对齐”理解为小数据也容易学会。
    项目 论文报告
    作者 Sefik Emre Eskimez 等,Microsoft
    主干 24-layer Transformer,U-Net-style skip connections
    参数 335M
    表示 100-dim log-mel,24 kHz
    训练数据 LibriHeavy 50K h;扩展实验 200K h proprietary
    主评测 LibriSpeech-PC test-clean,HuBERT-large WER,WavLM SIM-o
    公开资源 Demo · 官方评测集复现工具