跳转到内容

输入关键词开始搜索

    资料摘要:Confucius4-TTS

    论文摘要更新 2026-08-16置信度 high待阅读原始来源 ↗#语音合成#多语言#零样本#说话人#工具

    Confucius4-TTS 是面向 14 种语言的跨语 zero-shot TTS。核心工程选择是把参考音频的音色压成可学习 speaker embedding,使 reference mode 不需要参考转写;同时保留带转写和语义前缀的 continuation mode,以更高输入成本换更强音色相似度。

    🔒 Confucius4-TTS 原始论文

    论文 · 官方代码与模型

    ASR-TTS 论文周报 015 技术路线图
    ASR-TTS 论文周报 015 技术路线图
    • T2S/S2A 两阶段:24 层 decoder-only Transformer 从文本与 speaker condition 生成 MaskGCT semantic token;随后 DiT conditional flow-matching 由 semantic token、T2S hidden、CAM++ speaker embedding 与 prompt mel 生成 80 维 mel,再由 BigVGAN 合成波形。
    • reference mode 无需参考转写:可学习 ECAPA speaker encoder 从 w2v-BERT 2.0 表征中抽取说话人信息,输入仅为参考音频与目标文本,适合低资源跨语克隆。
    • continuation mode 更像传统 prompt continuation:额外输入参考转写和参考 semantic prefix,通常提高 SIM,但部分集合的 WER/CER 会变差,说明音色复制与内容准确率并非同一目标。
    • 不依赖 G2P 前端:文本侧使用冻结 LLM embedding,统一处理 14 种语言;训练数据约 50 万小时真实与合成多语语音,每种语言约补 1,000 小时合成数据。
    • 跨语结果有优势但不是全面领先:CV3 六个跨语方向平均 WER/CER 3.73,在四个方向最好;Seed 同语 reference mode 为 EN WER 1.49/SIM 0.700、ZH CER 0.94/SIM 0.765。
    • 已提供可运行实现:官方仓库含 Python 包、配置、checkpoint 下载入口、示例、WebUI 与 vLLM 路径;仓库许可证不是标准 SPDX 声明,使用前仍需核对模型与依赖许可。

    为什么可学习 speaker encoder 能免 transcript

    Section titled “为什么可学习 speaker encoder 能免 transcript”

    传统 cross-lingual continuation 依赖“参考文本—参考语义 token”对应关系,才能把 prompt 接到目标内容上。Confucius4-TTS 让 speaker encoder 直接把参考音频压成固定条件,使 T2S 不再需要解析参考内容;代价是韵律、情绪和局部风格更容易在压缩中丢失,所以 continuation mode 仍保留为高相似度选项。

    论文的内部跨语主观排序支持整体可用性,但部分基线需要参考 transcript,而本模型 reference mode 不需要,输入条件并不完全对等。自动 SIM 超过 ground truth 或某一方向领先,也不等于人类听感全面优于真实语音。

    • 版本:arXiv:2608.11650v1,2026-08-12;12 页。
    • 数据:约 50 万小时、14 语言,包含内部真实和合成数据;训练使用 32 张 A40。
    • 推理:S2A 使用 25 步 Euler 与 CFG 0.7。
    • CV3 例子:ja→zh 的 CER 4.87,论文表中 CosyVoice 2 为 48.1;该极大差距可能同时受跨语前端与输入条件影响。
    • 局限:数据与内部测试集不可完全复核;长尾语言、方言、流式延迟与运行效率仍列为未来工作;说话人克隆存在授权与冒用风险。