跳转到内容

输入关键词开始搜索

    资料摘要:CuteTTS

    论文摘要更新 2026-08-16置信度 high待阅读原始来源 ↗#语音合成#连续表示#自回归#流匹配#教程

    CuteTTS 是约 2.3 亿参数的流式连续潜变量自回归 TTS:它把 24 kHz 语音压成 12.5 Hz、64 维连续 latent,再把相邻两帧组成 patch,由因果 LM 负责跨 patch 历史、局部 flow-matching diffusion head 负责 patch 内生成;guidance-step distillation 将双分支、多步 CFG 采样压到单分支 4 NFE。

    🔒 CuteTTS 原始论文

    arXiv

    ASR-TTS 论文周报 015 技术路线图
    ASR-TTS 论文周报 015 技术路线图
    • 低速连续序列:因果 σ-VAE 输出 12.5 Hz latent,相邻两帧打包后 LM 只需以 6.25 patch/s 推进,避免多码本离散 codec 的长序列。
    • 语义与音色分工:冻结 WavLM 提供语义对齐目标;ECAPA 风格说话人编码器通过 WavLM-Large 蒸馏显式注入音色。去掉说话人条件时 SIM 从 71.3 降到 53.4,说明音色不能只靠 prompt latent 隐式承担。
    • 跨 patch AR、patch 内 flow:因果 LM 建模长历史,8 层局部扩散头在当前 patch 内双向建模连续分布,属于 DiTAR 一类“AR 规划 + 局部 flow 解码”路线。
    • 蒸馏直接作用于求解器成本:teacher 使用两条 CFG 分支、每条 10 NFE;student 将其压成单分支 4 NFE。论文报告 RTX 4090 上平均首音频延迟降低 23.3%,RTF 降低 40.8%。
    • 质量与规模:约 55 万小时内部多语数据训练;完整版在 LibriSpeech test-clean、Seed-EN、Seed-ZH 上分别为 WER 2.16/2.04、CER 1.41,SIM 78.9/76.5/77.8。
    • 开源边界:截至 2026-08-16,只确认论文;未确认官方代码、权重或可复现实验配置。

    为什么连续 latent 仍需要语义锚点

    Section titled “为什么连续 latent 仍需要语义锚点”

    连续 latent 保留更多声学细节,却没有离散 token 的显式类别监督。CuteTTS 用 WavLM feature alignment 让 VAE latent 保留可辨识语音结构,再让 AR 主干预测低帧率 patch。它与 SemBridge 的共同判断是:连续表示解决量化损失,不自动解决文本忠实度。

    teacher 的条件/无条件速度场先通过 CFG 合成,再沿多个时间区间积分;student 学习每个区间的等效更新,因此同时吸收 guidance 与 solver trajectory。1–2 NFE 时仍能生成,但 4 NFE 是质量与速度的主要折中点。这里蒸馏的是采样过程,不是把 AR 主干换成更小模型。

    • 版本:arXiv:2608.08638v1,2026-08-09;19 页。
    • 数据:约 55 万小时内部多语语音,外部无法独立复核数据构成与去重。
    • 效率:RTX 4090 的 P50/P95 首音频延迟由 48.7/52.3 ms 降至 37.1/40.8 ms;这些是作者实现内对比。
    • 局限:主观评测样本仅 50 条;训练数据不公开;未验证噪声、长文本和跨域条件下的稳定性;尚无公开复现证据。