资料摘要:CTC-TTS
CTC-TTS 不以扩大基座模型为主,而是把双流式 TTS 的关键问题定位为“如何得到轻量、单调、可复用的文本—语音结构对齐”。它用 CTC Viterbi 路径替换传统 MFA,再以 bi-word 单元交织音素与单码本语音 token,并提供质量优先的 L 版与延迟优先的 F 版。
- CTC 对齐服务于结构组织,不追求绝对物理边界:CTC-ASR 对齐器在 25 Hz 特征上输出 Viterbi 路径,blank 被归到后继音素,随后映射到 75 Hz 的神经音频 codec token。
- bi-word block 是核心训练单元:当前词音素、分隔符、下一词音素、当前词对应语音 token 与
<eob>被组装为局部块,使模型反复学习“少量文本到对应语音”的单调推进关系。 - CTC-TTS-L 沿序列长度拼接,通常需要两个词的 lookahead,质量更高;CTC-TTS-F 沿特征维堆叠,首个音素到达后即可开始,延迟更低。
- 模型采用单码本神经 codec 与单个自回归 Transformer,只对语音 token 和
<eob>计算交叉熵;它不是完整文本 LLM,也没有额外 NAR 声学补全器。 - 单说话人实验中,CTC-TTS-L 的 WER/CER 为 1.50%/0.79%,优于 LLMVoX 的 2.40%/1.36%;但不同系统的输入等待和首包口径仍需分开看。
- 论文 PDF 的版本仍写着“submitted to INTERSPEECH 2026”和“录用后发布代码”;后续收录与代码状态属于易变信息,不能仅凭这份 PDF 判定。
1. 问题:文本还没结束,语音已经要开始
Section titled “1. 问题:文本还没结束,语音已经要开始”传统 text-first TTS 可以先读完整句子,再规划时长和韵律。双流式系统收到的却是不断增长的文本前缀,既要尽早开始,又不能在缺少右上下文时错误断词或破坏首词韵律。CTC-TTS 将问题拆成两步:先得到稳定的单调对齐,再让训练序列本身模拟文本—语音交替到达。
论文没有直接使用 CTC blank 作为精确边界。对齐器先输出音素与 blank 的最优路径,再把音素后的 blank 归入后继音素,句尾 blank 归入最后音素。由于 CTC 特征率为 25 Hz,而音频 token 率为 75 Hz,每个对齐帧最终对应 3 个语音 token。这种映射是结构近似,不应解读为毫秒级强制对齐真值。
2. bi-word 交织
Section titled “2. bi-word 交织”每个 block 大致由下列顺序构成:
当前词音素 → 分隔符 → 下一词音素 → 当前词语音 token → <eob>相比固定文本/语音比例交织,这一布局能适应不同词长、语速和停顿;相比整句 text-first,它又把局部 lookahead 明确写进训练分布。下一词音素提供有限右上下文,当前词语音 token 则保持可单调提交。
3. L/F 两个实现
Section titled “3. L/F 两个实现”| 版本 | 组合方式 | 启动条件 | 主要取舍 |
|---|---|---|---|
| CTC-TTS-L | 音素与语音 embedding 沿序列长度拼接 | 通常等待两个词 | 更低 WER/CER,首包稍慢 |
| CTC-TTS-F | 文本与语音 embedding 沿特征维堆叠,不存在的一侧补零/Pad | 首个音素即可 | 序列更短、首包更快,质量略低 |
L 版仍是典型 next-token 预测;F 版把同一位置的文本条件与历史语音放入同一特征向量。两者都依赖前端 G2P 和 CTC 对齐器,因而“端到端”并不等于完全没有外部文本处理。
4. 实验与边界
Section titled “4. 实验与边界”单说话人实验使用 VoiceAssistant400K:约 1750 小时训练、50 小时验证、5 小时测试;多说话人实验使用 LibriSpeech 960 小时,并分别测试 continuation 与跨说话人 zero-shot。论文报告:
| 模型 | 参数量 | WER ↓ | CER ↓ | FPL-A ↓ | UTMOS ↑ |
|---|---|---|---|---|---|
| LLMVoX | 31.5M | 2.40 | 1.36 | 167 ms | 4.15 |
| CTC-TTS-F | 33.6M | 1.80 | 1.04 | 159 ms | 4.15 |
| CTC-TTS-L | 34.7M | 1.50 | 0.79 | 210 ms | 4.15 |
多说话人 continuation 中,CTC-TTS-L 的 WER/CER 为 4.82%/2.47%,优于 MFA+bi-word 的 5.14%/2.63%;跨说话人条件下为 6.33%/3.21%,优于 7.53%/3.99%。这些结果支持“CTC 对齐 + bi-word”组合,但还不能证明 CTC 在所有语言、所有 G2P 前端和噪声域都优于 MFA。
5. 批判性判断
Section titled “5. 批判性判断”- 创新更接近数据组织与因果接口设计,而不是新的大模型骨架。
- 单说话人数据规模和模型规模都较克制,消融较容易解释;但论文仍使用 WFST Phonetisaurus G2P,神经化并未覆盖整个文本前端。
- FPL-A 只覆盖作者定义的音频首包,不等于用户侧端到端响应;上游 LLM 何时产出首词、网络、播放器缓冲均未计入。
- 这套方法最值得复用的是“用神经单调对齐构造局部可提交训练块”,而不是把 CTC 当作通用 TTS 损失。
| 项目 | 论文报告 |
|---|---|
| CTC 特征率 / codec token 率 | 25 Hz / 75 Hz |
| 单说话人训练数据 | 约 1750 小时 |
| 多说话人训练数据 | LibriSpeech 960 小时 |
| 最佳单说话人 WER/CER | CTC-TTS-L:1.50% / 0.79% |
| 最低 FPL-A | CTC-TTS-F:159 ms |
| 主要依赖 | G2P、CTC 对齐器、单码本 NAC、AR Transformer |
| 生成式 AI 声明 | 仅用于语言润色 |
- Wiki 目录
- 资料摘要:LLM-based TTS 四年全景(2023–2026) — 本文所在的四路线全景
- 资料摘要:LLMVoX · 资料摘要:SpeakStream — 两条不同的双流式实现
- 流式语音合成 — 输入等待、首包、持续生成速度的统一延迟框架
- 自动语音识别(ASR) — CTC 对齐器的来源机制
- CTC(连接时序分类) — blank、路径折叠、forward-backward 与训练/解码边界
- 资料摘要:Connectionist Temporal Classification — CTC 原始论文、TIMIT 证据与中文全文译稿
- 神经音频编解码(RVQ) — 语音 token 与帧率背景