资料摘要:Confucius4-TTS
Confucius4-TTS 是面向 14 种语言的跨语 zero-shot TTS。核心工程选择是把参考音频的音色压成可学习 speaker embedding,使 reference mode 不需要参考转写;同时保留带转写和语义前缀的 continuation mode,以更高输入成本换更强音色相似度。
🔒 Confucius4-TTS 原始论文
- T2S/S2A 两阶段:24 层 decoder-only Transformer 从文本与 speaker condition 生成 MaskGCT semantic token;随后 DiT conditional flow-matching 由 semantic token、T2S hidden、CAM++ speaker embedding 与 prompt mel 生成 80 维 mel,再由 BigVGAN 合成波形。
- reference mode 无需参考转写:可学习 ECAPA speaker encoder 从 w2v-BERT 2.0 表征中抽取说话人信息,输入仅为参考音频与目标文本,适合低资源跨语克隆。
- continuation mode 更像传统 prompt continuation:额外输入参考转写和参考 semantic prefix,通常提高 SIM,但部分集合的 WER/CER 会变差,说明音色复制与内容准确率并非同一目标。
- 不依赖 G2P 前端:文本侧使用冻结 LLM embedding,统一处理 14 种语言;训练数据约 50 万小时真实与合成多语语音,每种语言约补 1,000 小时合成数据。
- 跨语结果有优势但不是全面领先:CV3 六个跨语方向平均 WER/CER 3.73,在四个方向最好;Seed 同语 reference mode 为 EN WER 1.49/SIM 0.700、ZH CER 0.94/SIM 0.765。
- 已提供可运行实现:官方仓库含 Python 包、配置、checkpoint 下载入口、示例、WebUI 与 vLLM 路径;仓库许可证不是标准 SPDX 声明,使用前仍需核对模型与依赖许可。
为什么可学习 speaker encoder 能免 transcript
Section titled “为什么可学习 speaker encoder 能免 transcript”传统 cross-lingual continuation 依赖“参考文本—参考语义 token”对应关系,才能把 prompt 接到目标内容上。Confucius4-TTS 让 speaker encoder 直接把参考音频压成固定条件,使 T2S 不再需要解析参考内容;代价是韵律、情绪和局部风格更容易在压缩中丢失,所以 continuation mode 仍保留为高相似度选项。
论文的内部跨语主观排序支持整体可用性,但部分基线需要参考 transcript,而本模型 reference mode 不需要,输入条件并不完全对等。自动 SIM 超过 ground truth 或某一方向领先,也不等于人类听感全面优于真实语音。
- 版本:arXiv:2608.11650v1,2026-08-12;12 页。
- 数据:约 50 万小时、14 语言,包含内部真实和合成数据;训练使用 32 张 A40。
- 推理:S2A 使用 25 步 Euler 与 CFG 0.7。
- CV3 例子:ja→zh 的 CER 4.87,论文表中 CosyVoice 2 为 48.1;该极大差距可能同时受跨语前端与输入条件影响。
- 局限:数据与内部测试集不可完全复核;长尾语言、方言、流式延迟与运行效率仍列为未来工作;说话人克隆存在授权与冒用风险。