跳转到内容

输入关键词开始搜索

    资料摘要:E3 TTS

    论文摘要更新 2026-08-17置信度 high待阅读原始来源 ↗#语音合成#扩散模型#端到端#波形生成#深度

    E3 TTS 是早期的端到端 waveform diffusion TTS:English BERT 提供 subword 条件,1D U-Net 在降采样后的低分辨率层通过 cross-attention 动态学习文本—语音对齐,然后用 1000 步 DDPM 直接生成 24 kHz waveform。

    • 从 plain text 直接生成 waveform,没有 mel/codec 中间表示、外部对齐或独立 vocoder。
    • 文本由 English-only BERT-base 编码;对齐不是 filler 或 duration expansion,而是最深层 down/up blocks 中的 text cross-attention。
    • U-Net 的浅层用卷积处理高频波形细节,深层把 24 kHz 序列降到接近 BERT token 长度再对齐;timestep 与 speaker 条件还用 adaptive kernels / FiLM 注入。
    • 训练与推理长度固定为 10.92 秒,短语音后补零;推理后以每 1024 samples 的平均幅值阈值 0.02 判定并裁掉 padding。
    • 主 TTS 评测是 385 小时私有美式英语、84 名职业说话人中的单一女声;只报 MOS 4.24±0.06,未报 WER/CER 或其他客观可懂度指标。
    • 论文另在 LibriTTS 上演示 waveform prompt TTS、speech editing 与 speaker classification,但这些任务不等同于主表的通用 zero-shot WER 评测。
    无音素级时长 TTS 文本到语音长度桥接 对比图
    无音素级时长 TTS 文本到语音长度桥接 对比图

    模型学习条件 score

    s(yx)=ylogp(yx),s(y\mid x)=\nabla_y\log p(y\mid x),

    并以 noise-prediction 形式优化 U-Net。输出 yy 是 waveform sample 序列,条件 xx 是 BERT 文本表示。推理时从与 10.92 秒波形同长的 Gaussian noise 开始,使用 1000 步 DDPM 逐步精炼。

    直接 waveform 建模避免了 codec/vocoder 重建瓶颈,但数万到数十万个 sample 位置使计算非常昂贵;这也是后续 DiTTo-TTS、SimpleSpeech 转向低帧率 latent 的根本原因。

    U-Net 逐层降采样 waveform。当序列长度已降到接近 BERT 输出长度时,模型才在顶部 downsampling/upsampling blocks 做 text cross-attention;浅层主要用卷积重建局部波形结构。论文称这种分辨率匹配对质量很重要,但没有给出单独的对齐消融指标。

    模型 MOS ↑
    Ground truth 4.56±0.044.56\pm0.04
    Tacotron + WaveRNN 4.36±0.054.36\pm0.05
    Wave-Tacotron 4.07±0.064.07\pm0.06
    E3 TTS 4.24±0.064.24\pm0.06

    prompt TTS 在约 200 个 LibriTTS 样本上报 SQuId 3.75、speaker similarity 0.95;text editing 对 0.8×/1.0×/1.2× 缺口长度都有较高 speaker similarity。这说明 diffusion infilling 有灵活性,但 SQuId 不是真实人评 MOS,也不是内容准确率。

    • 这篇只能支持“主观自然度接近两阶段 TTS”,不能支持“可懂度与 E2/F5 相当”,因为论文未报 WER/CER。
    • 固定 10.92 秒使得短句也要在整段 waveform 上跑 1000 步;尾部裁剪是基于幅值的启发式,不是可学习的精确长度模型。
    • 主评测使用私有数据、单一已见说话人且没有开源 checkpoint,外部可复现性和广义 zero-shot 证据都有限。
    • 它的方法史价值在于较早证明“文本 token cross-attention + 生成模型内部对齐”可行,后续 DiTTo-TTS 用 compact latent 与可变总长度解决了其两个主要瓶颈。
    项目 论文报告
    作者 Yuan Gao, Nobuyuki Morioka, Yu Zhang, Nanxin Chen,Google
    会议 ASRU 2023
    生成目标 24 kHz raw waveform
    骨干 BERT-base + 1D U-Net + cross-attention
    采样 1000-step DDPM
    主训练数据 385 h proprietary US English
    项目页 E3 TTS Demo