资料摘要:E2 TTS
E2 TTS 把 zero-shot TTS 写成 mel-spectrogram infilling:文本保留字符序列,末尾追加 filler token 直到与 mel 帧数相同,再让一个带 U-Net 式长跳连的 Transformer 在条件流匹配中同时学习内容、对齐与声学生成。
- 文本不做 G2P,也不提供帧级音素对齐;字符后用
<F>补到 mel 序列长度,让 self-attention 自行找到单调对应。 - 训练是大比例连续区域的 speech infilling;推理时把参考语音当作已知前缀,目标区域从噪声经 ODE 积分生成。
- 无音素时长不等于无总时长:推理仍需先给定目标帧数 。主实验为公平对比使用独立回归式 duration model 估计总长,论文另证明手动改总时长时模型仍有一定容错性。
- 335M 参数、24 层 Transformer、16 heads、100 维 mel;训练主数据为 50K 小时 LibriHeavy,并验证到 200K 小时私有数据的扩展性。
- LibriSpeech-PC test-clean 上,50K 小时从零训练为 2.0% WER,加无监督预训练为 1.9%;200K 小时从零训练也为 1.9%。
- X1 变体不再需参考语音转写;X2 变体允许用括号内的 CMU 音素串指定局部读音。
1. filler token 的真正作用
Section titled “1. filler token 的真正作用”训练语音的 mel 特征记为 ,转写字符为 。E2 TTS 构造
<F> 不表示某个真实音素或静音帧,它只把文本 condition 放到与 mel 相同的序列坐标中。文本字符都位于前部,模型必须从整句上下文与参考 mel 自行学出发音边界,它不是已知的帧级对齐。
2. 流匹配 infilling
Section titled “2. 流匹配 infilling”训练分布为 , 是时间掩码。模型输入包含未遮挡 mel、noisy mel、字符/filler embedding 与 flow time,用 CFM 目标回归时变向量场。推理用 midpoint ODE solver,主表为 32 NFE。
它与 Voicebox 的关系很直接:Voicebox 输入已展开的帧级音素,E2 TTS 改成“字符 + filler”。因此 E2 TTS 可视为把 G2P、音素时长模型与声学模型合并到同一个 Transformer。
3. 训练与评测
Section titled “3. 训练与评测”- 24 kHz 语音,每 10.7 ms 提取 100 维 log-mel,BigVGAN 还原 waveform。
- mask 长度为全句的 70%–100%;20% 概率丢弃全部条件以训练 CFG。
- 模型训练 800K updates;没有帧级音素对齐后,前期 WER 收敛显著慢于 Voicebox,但充分训练后更优。
| 设置 | 数据 | 初始化 | WER ↓ | SIM-o ↑ |
|---|---|---|---|---|
| E2 TTS P1 | 50K h | random | 2.0 | 0.675 |
| E2 TTS P2 | 50K h | unsupervised pretrain | 1.9 | 0.708 |
| E2 TTS P3 | 200K h | random | 1.9 | 0.707 |
4. 批判性判断
Section titled “4. 批判性判断”- 简化的是音素级工具链,不是长度问题本身。没有 就无法知道要准备多少噪声帧,因此系统层仍需估计或指定句级总时长。
- 字符全在序列前缀,且 mel 比文本长得多;这是方法极简的代价,也解释了为什么后续 F5-TTS 要增加 ConvNeXt 文本精炼、ZipVoice 要改为 Average Upsampling。
- 主结果依赖 50K–200K 小时数据与 335M 模型,不能把“不用显式对齐”理解为小数据也容易学会。
| 项目 | 论文报告 |
|---|---|
| 作者 | Sefik Emre Eskimez 等,Microsoft |
| 主干 | 24-layer Transformer,U-Net-style skip connections |
| 参数 | 335M |
| 表示 | 100-dim log-mel,24 kHz |
| 训练数据 | LibriHeavy 50K h;扩展实验 200K h proprietary |
| 主评测 | LibriSpeech-PC test-clean,HuBERT-large WER,WavLM SIM-o |
| 公开资源 | Demo · 官方评测集复现工具 |
- 无音素级时长 TTS 的文本—语音对齐机制对比
- 资料摘要:F5-TTS — 延续 filler 思路,但换用 DiT、ConvNeXt V2 与 Sway Sampling。
- 资料摘要:ZipVoice — 用 Average Upsampling 替代文本前缀后的大量 filler。
- 条件流匹配(CFM) · DiT(Diffusion Transformer)
- Wiki 目录