资料摘要:CuteTTS
CuteTTS 是约 2.3 亿参数的流式连续潜变量自回归 TTS:它把 24 kHz 语音压成 12.5 Hz、64 维连续 latent,再把相邻两帧组成 patch,由因果 LM 负责跨 patch 历史、局部 flow-matching diffusion head 负责 patch 内生成;guidance-step distillation 将双分支、多步 CFG 采样压到单分支 4 NFE。
🔒 CuteTTS 原始论文
- 低速连续序列:因果 σ-VAE 输出 12.5 Hz latent,相邻两帧打包后 LM 只需以 6.25 patch/s 推进,避免多码本离散 codec 的长序列。
- 语义与音色分工:冻结 WavLM 提供语义对齐目标;ECAPA 风格说话人编码器通过 WavLM-Large 蒸馏显式注入音色。去掉说话人条件时 SIM 从 71.3 降到 53.4,说明音色不能只靠 prompt latent 隐式承担。
- 跨 patch AR、patch 内 flow:因果 LM 建模长历史,8 层局部扩散头在当前 patch 内双向建模连续分布,属于 DiTAR 一类“AR 规划 + 局部 flow 解码”路线。
- 蒸馏直接作用于求解器成本:teacher 使用两条 CFG 分支、每条 10 NFE;student 将其压成单分支 4 NFE。论文报告 RTX 4090 上平均首音频延迟降低 23.3%,RTF 降低 40.8%。
- 质量与规模:约 55 万小时内部多语数据训练;完整版在 LibriSpeech test-clean、Seed-EN、Seed-ZH 上分别为 WER 2.16/2.04、CER 1.41,SIM 78.9/76.5/77.8。
- 开源边界:截至 2026-08-16,只确认论文;未确认官方代码、权重或可复现实验配置。
为什么连续 latent 仍需要语义锚点
Section titled “为什么连续 latent 仍需要语义锚点”连续 latent 保留更多声学细节,却没有离散 token 的显式类别监督。CuteTTS 用 WavLM feature alignment 让 VAE latent 保留可辨识语音结构,再让 AR 主干预测低帧率 patch。它与 SemBridge 的共同判断是:连续表示解决量化损失,不自动解决文本忠实度。
Guidance-step distillation
Section titled “Guidance-step distillation”teacher 的条件/无条件速度场先通过 CFG 合成,再沿多个时间区间积分;student 学习每个区间的等效更新,因此同时吸收 guidance 与 solver trajectory。1–2 NFE 时仍能生成,但 4 NFE 是质量与速度的主要折中点。这里蒸馏的是采样过程,不是把 AR 主干换成更小模型。
- 版本:arXiv:2608.08638v1,2026-08-09;19 页。
- 数据:约 55 万小时内部多语语音,外部无法独立复核数据构成与去重。
- 效率:RTX 4090 的 P50/P95 首音频延迟由 48.7/52.3 ms 降至 37.1/40.8 ms;这些是作者实现内对比。
- 局限:主观评测样本仅 50 条;训练数据不公开;未验证噪声、长文本和跨域条件下的稳定性;尚无公开复现证据。