跳转到内容

输入关键词开始搜索

    资料摘要:SimpleSpeech

    论文摘要更新 2026-08-17置信度 high待阅读原始来源 ↗#语音合成#扩散模型#标量量化#零样本#深度

    SimpleSpeech 用 Whisper 为无标注语音生成伪转写,ByT5 与 XLSR-53 提供内容/音色条件,SQ-Codec 把 waveform 压成有限标量 latent;再以句级总时长决定噪声序列长度,把全部条件当作 GPT-like diffusion Transformer 的 prefix,隐式学习字词到语音 latent 的对齐。

    • “speech-only 训练”指原始数据无人工文本/时长标注;实际仍用 Whisper-base 产生 transcript,因此并非完全 transcript-free。
    • 取消的是 phoneme-level duration;训练时从 waveform 长度取真实句时长,推理时让 GPT-3.5-turbo 根据句子估计总时长,由它决定 target latent 序列长度。
    • 文本、说话人、timestep 和 duration 特征作为 prefix 与 noisy speech latent 拼接;最后丢弃 prefix 对应的输出。
    • SQ-Codec 先以 tanh 限幅,再逐维取整到 2S+12S+1 个标量值,用 STE 回传;作者认为有界紧致 latent 比无界 VAE/DAC latent 更易于 diffusion 建模。
    • 生成主干是 12 层、8 heads、768 维 GPT2-like Transformer,使用 100 步 DDPM;训练数据为 4K 小时 MLS English。
    • LibriTTS test-clean 上 WER 3.3、SIM 0.956、MOS 4.45±0.054.45\pm0.05;但不同论文的 ASR、prompt 与测试集不同,不能与 E2/F5/ZipVoice 数字直接排名。
    无音素级时长 TTS 文本到语音长度桥接 对比图
    无音素级时长 TTS 文本到语音长度桥接 对比图

    训练时,真实 waveform 已知,因而可直接计算句时长。推理时,论文用 GPT-3.5-turbo 根据词数与常识估计朗读时间,再用 Stable Audio 式 timing module 编码成全局 duration embedding。这个值先决定 Gaussian noise 的序列长度,模型只需在该范围内隐式分配各词时长。

    这一设计比 per-phone duration 更容易获取,但把长度稳定性部分外包给了一个通用 LLM prompt,论文没有系统报告 duration MAE 或 LLM 误差对 WER 的灵敏度。

    对 encoder 输出 hih_i,标量量化为

    hitanh(hi),si=round(Shi)S.h_i\leftarrow\tanh(h_i),\qquad s_i=\frac{\operatorname{round}(S h_i)}{S}.

    默认 S=9S=9、latent dimension d=32d=32。Codec 由 5 个卷积 block 组成,总下采样 320×;只用 waveform/STFT 重建损失与多尺度对抗损失。在论文的 LibriTTS codec 评测中,5M 参数 SQ-Codec 报 PESQ 4.16、STOI 0.95、SSIM 0.86。

    条件序列 cc 和 timestep 特征被放在 noisy scalar latent 之前。这样可直接使用标准 causal-language-model 式的 Transformer 结构,但整个 diffusion 生成仍是 NAR;“prefix”描述的是条件摆放,不是逐 token 自回归解码。

    消融显示:ByT5 换 BERT 时 WER 从 3.3 升到 19.2;Transformer 换 U-Net 为 5.75;SQ-Codec 换 VAE 为 5.1;in-context prefix 换 cross-attention 为 9.6。这些结果支持完整组合,但每个对比都同时改变了归纳偏置与优化难度,不能外推为所有 TTS 的普适排名。

    模型 WER ↓ SIM ↑ DNSMOS ↑ 生成时间 ↓ MOS ↑
    Ground Truth 2.7 3.82 4.39±0.074.39\pm0.07
    VALL-E-X 5.6 0.946 3.75 34.5 s 4.07±0.124.07\pm0.12
    SimpleSpeech 3.3 0.956 3.90 1.6 s 4.45±0.054.45\pm0.05
    • 论文最有价值的不是“完全不要时长”,而是把细粒度时长简化为句级长度先验,再让 prefix self-attention 学局部对齐。
    • “speech-only”仍依赖 Whisper pseudo-label、预训练 ByT5 和外部 LLM 时长估计,数据准备不是真正的无文本监督。
    • 评测规模与可复现性有限:论文声称未来发布 code/checkpoint,但论文与官方 demo 本身不足以复现训练结果。
    • 这是初代 SimpleSpeech;后续 SimpleSpeech 2 换成 flow-based scalar latent 生成并系统研究多种句级时长预测器,不应混为同一篇;本库尚未为后者建立独立页面。
    项目 论文报告
    作者 Dongchao Yang, Dingdong Wang, Haohan Guo, Xueyuan Chen, Xixin Wu, Helen Meng
    会议 Interspeech 2024
    生成主干 12-layer GPT2-like diffusion Transformer,100 DDPM steps
    语音表示 5M SQ-Codec,scalar latent
    数据 4K h MLS English pseudo-transcribed by Whisper-base
    项目页 SimpleSpeech Demo