跳转到内容

输入关键词开始搜索

    资料摘要:CTC-TTS

    论文摘要更新 2026-08-17置信度 high待阅读原始来源 ↗#语音合成#流式#对齐#深度#易过时

    CTC-TTS 不以扩大基座模型为主,而是把双流式 TTS 的关键问题定位为“如何得到轻量、单调、可复用的文本—语音结构对齐”。它用 CTC Viterbi 路径替换传统 MFA,再以 bi-word 单元交织音素与单码本语音 token,并提供质量优先的 L 版与延迟优先的 F 版。

    • CTC 对齐服务于结构组织,不追求绝对物理边界:CTC-ASR 对齐器在 25 Hz 特征上输出 Viterbi 路径,blank 被归到后继音素,随后映射到 75 Hz 的神经音频 codec token。
    • bi-word block 是核心训练单元:当前词音素、分隔符、下一词音素、当前词对应语音 token 与 <eob> 被组装为局部块,使模型反复学习“少量文本到对应语音”的单调推进关系。
    • CTC-TTS-L 沿序列长度拼接,通常需要两个词的 lookahead,质量更高;CTC-TTS-F 沿特征维堆叠,首个音素到达后即可开始,延迟更低。
    • 模型采用单码本神经 codec 与单个自回归 Transformer,只对语音 token 和 <eob> 计算交叉熵;它不是完整文本 LLM,也没有额外 NAR 声学补全器。
    • 单说话人实验中,CTC-TTS-L 的 WER/CER 为 1.50%/0.79%,优于 LLMVoX 的 2.40%/1.36%;但不同系统的输入等待和首包口径仍需分开看。
    • 论文 PDF 的版本仍写着“submitted to INTERSPEECH 2026”和“录用后发布代码”;后续收录与代码状态属于易变信息,不能仅凭这份 PDF 判定。
    LLM-based TTS 九篇参考论文系统位置 架构图
    LLM-based TTS 九篇参考论文系统位置 架构图

    1. 问题:文本还没结束,语音已经要开始

    Section titled “1. 问题:文本还没结束,语音已经要开始”

    传统 text-first TTS 可以先读完整句子,再规划时长和韵律。双流式系统收到的却是不断增长的文本前缀,既要尽早开始,又不能在缺少右上下文时错误断词或破坏首词韵律。CTC-TTS 将问题拆成两步:先得到稳定的单调对齐,再让训练序列本身模拟文本—语音交替到达。

    论文没有直接使用 CTC blank 作为精确边界。对齐器先输出音素与 blank 的最优路径,再把音素后的 blank 归入后继音素,句尾 blank 归入最后音素。由于 CTC 特征率为 25 Hz,而音频 token 率为 75 Hz,每个对齐帧最终对应 3 个语音 token。这种映射是结构近似,不应解读为毫秒级强制对齐真值。

    每个 block 大致由下列顺序构成:

    当前词音素 → 分隔符 → 下一词音素 → 当前词语音 token → <eob>

    相比固定文本/语音比例交织,这一布局能适应不同词长、语速和停顿;相比整句 text-first,它又把局部 lookahead 明确写进训练分布。下一词音素提供有限右上下文,当前词语音 token 则保持可单调提交。

    版本 组合方式 启动条件 主要取舍
    CTC-TTS-L 音素与语音 embedding 沿序列长度拼接 通常等待两个词 更低 WER/CER,首包稍慢
    CTC-TTS-F 文本与语音 embedding 沿特征维堆叠,不存在的一侧补零/Pad 首个音素即可 序列更短、首包更快,质量略低

    L 版仍是典型 next-token 预测;F 版把同一位置的文本条件与历史语音放入同一特征向量。两者都依赖前端 G2P 和 CTC 对齐器,因而“端到端”并不等于完全没有外部文本处理。

    单说话人实验使用 VoiceAssistant400K:约 1750 小时训练、50 小时验证、5 小时测试;多说话人实验使用 LibriSpeech 960 小时,并分别测试 continuation 与跨说话人 zero-shot。论文报告:

    模型 参数量 WER ↓ CER ↓ FPL-A ↓ UTMOS ↑
    LLMVoX 31.5M 2.40 1.36 167 ms 4.15
    CTC-TTS-F 33.6M 1.80 1.04 159 ms 4.15
    CTC-TTS-L 34.7M 1.50 0.79 210 ms 4.15

    多说话人 continuation 中,CTC-TTS-L 的 WER/CER 为 4.82%/2.47%,优于 MFA+bi-word 的 5.14%/2.63%;跨说话人条件下为 6.33%/3.21%,优于 7.53%/3.99%。这些结果支持“CTC 对齐 + bi-word”组合,但还不能证明 CTC 在所有语言、所有 G2P 前端和噪声域都优于 MFA。

    • 创新更接近数据组织与因果接口设计,而不是新的大模型骨架。
    • 单说话人数据规模和模型规模都较克制,消融较容易解释;但论文仍使用 WFST Phonetisaurus G2P,神经化并未覆盖整个文本前端。
    • FPL-A 只覆盖作者定义的音频首包,不等于用户侧端到端响应;上游 LLM 何时产出首词、网络、播放器缓冲均未计入。
    • 这套方法最值得复用的是“用神经单调对齐构造局部可提交训练块”,而不是把 CTC 当作通用 TTS 损失。
    项目 论文报告
    CTC 特征率 / codec token 率 25 Hz / 75 Hz
    单说话人训练数据 约 1750 小时
    多说话人训练数据 LibriSpeech 960 小时
    最佳单说话人 WER/CER CTC-TTS-L:1.50% / 0.79%
    最低 FPL-A CTC-TTS-F:159 ms
    主要依赖 G2P、CTC 对齐器、单码本 NAC、AR Transformer
    生成式 AI 声明 仅用于语言润色