资料摘要:E3 TTS
E3 TTS 是早期的端到端 waveform diffusion TTS:English BERT 提供 subword 条件,1D U-Net 在降采样后的低分辨率层通过 cross-attention 动态学习文本—语音对齐,然后用 1000 步 DDPM 直接生成 24 kHz waveform。
- 从 plain text 直接生成 waveform,没有 mel/codec 中间表示、外部对齐或独立 vocoder。
- 文本由 English-only BERT-base 编码;对齐不是 filler 或 duration expansion,而是最深层 down/up blocks 中的 text cross-attention。
- U-Net 的浅层用卷积处理高频波形细节,深层把 24 kHz 序列降到接近 BERT token 长度再对齐;timestep 与 speaker 条件还用 adaptive kernels / FiLM 注入。
- 训练与推理长度固定为 10.92 秒,短语音后补零;推理后以每 1024 samples 的平均幅值阈值 0.02 判定并裁掉 padding。
- 主 TTS 评测是 385 小时私有美式英语、84 名职业说话人中的单一女声;只报 MOS 4.24±0.06,未报 WER/CER 或其他客观可懂度指标。
- 论文另在 LibriTTS 上演示 waveform prompt TTS、speech editing 与 speaker classification,但这些任务不等同于主表的通用 zero-shot WER 评测。
1. 从 waveform 噪声直接生成语音
Section titled “1. 从 waveform 噪声直接生成语音”模型学习条件 score
并以 noise-prediction 形式优化 U-Net。输出 是 waveform sample 序列,条件 是 BERT 文本表示。推理时从与 10.92 秒波形同长的 Gaussian noise 开始,使用 1000 步 DDPM 逐步精炼。
直接 waveform 建模避免了 codec/vocoder 重建瓶颈,但数万到数十万个 sample 位置使计算非常昂贵;这也是后续 DiTTo-TTS、SimpleSpeech 转向低帧率 latent 的根本原因。
2. 为什么 cross-attention 放在深层
Section titled “2. 为什么 cross-attention 放在深层”U-Net 逐层降采样 waveform。当序列长度已降到接近 BERT 输出长度时,模型才在顶部 downsampling/upsampling blocks 做 text cross-attention;浅层主要用卷积重建局部波形结构。论文称这种分辨率匹配对质量很重要,但没有给出单独的对齐消融指标。
3. 评测与应用
Section titled “3. 评测与应用”| 模型 | MOS ↑ |
|---|---|
| Ground truth | |
| Tacotron + WaveRNN | |
| Wave-Tacotron | |
| E3 TTS |
prompt TTS 在约 200 个 LibriTTS 样本上报 SQuId 3.75、speaker similarity 0.95;text editing 对 0.8×/1.0×/1.2× 缺口长度都有较高 speaker similarity。这说明 diffusion infilling 有灵活性,但 SQuId 不是真实人评 MOS,也不是内容准确率。
4. 批判性判断
Section titled “4. 批判性判断”- 这篇只能支持“主观自然度接近两阶段 TTS”,不能支持“可懂度与 E2/F5 相当”,因为论文未报 WER/CER。
- 固定 10.92 秒使得短句也要在整段 waveform 上跑 1000 步;尾部裁剪是基于幅值的启发式,不是可学习的精确长度模型。
- 主评测使用私有数据、单一已见说话人且没有开源 checkpoint,外部可复现性和广义 zero-shot 证据都有限。
- 它的方法史价值在于较早证明“文本 token cross-attention + 生成模型内部对齐”可行,后续 DiTTo-TTS 用 compact latent 与可变总长度解决了其两个主要瓶颈。
| 项目 | 论文报告 |
|---|---|
| 作者 | Yuan Gao, Nobuyuki Morioka, Yu Zhang, Nanxin Chen,Google |
| 会议 | ASRU 2023 |
| 生成目标 | 24 kHz raw waveform |
| 骨干 | BERT-base + 1D U-Net + cross-attention |
| 采样 | 1000-step DDPM |
| 主训练数据 | 385 h proprietary US English |
| 项目页 | E3 TTS Demo |
- 无音素级时长 TTS 的文本—语音对齐机制对比
- 资料摘要:DiTTo-TTS — 可变总长度与 compact speech latent 的后续解法。
- 资料摘要:SimpleSpeech — 句级 duration + scalar latent + Transformer diffusion。
- 得分匹配(Score Matching) · VAE(变分自编码器)
- Wiki 目录