资料摘要:LLM-based TTS 四年全景(2023–2026)
瑶光守护者以 CTC-TTS 为切入点,把 2023–2026 年 LLM-based TTS 整理为 Codec LM、非自回归生成、统一语音 LLM、流式/双流式四条路线,并横向讨论对齐、tokenizer、交织序列、低延迟、评测、开放问题与合规风险。它最适合作为“技术地图”,不适合作为跨论文数字的最终证据表。
🔒 微信原文完整快照 · 微信原文
- “四条路线”应理解为四个观察角度,而非互斥类别:同一系统可能既是 codec LM,又含 Flow Matching/DiT 声学头,同时支持流式;CosyVoice 2/3、Qwen3-TTS 正是混合范式。
- Codec LM 把 TTS 改写为条件序列建模:文本/音素与参考语音作为条件,LM 预测离散语音 token,再由 codec decoder 重建波形。它继承上下文学习和零样本克隆能力,但承受长序列、多码本和自回归误差累积。
- 生成式路线把声学输出放在连续空间:扩散或 Flow Matching 并行生成 mel、VAE latent 或连续 token;推理速度与稳定性较好,但必须在采样步数、质量、因果性和流式能力间权衡。
- 统一语音 LLM 把“听—想—说”放入一个联合系统:Moshi、Qwen3-Omni、PersonaPlex 等以语音输入、语音输出和多流 token 交互为目标;“端到端”描述的是训练/接口边界,不代表内部没有 tokenizer、文本通道或层级解码器。
- CTC-TTS 的核心不是再造一个更大的 TTS 基座:它针对双流式场景,用 CTC 神经对齐替换 MFA,并设计 bi-word 文本—语音交织序列;L 版沿长度维拼接以质量优先,F 版沿特征维堆叠以延迟优先。
- 真正的低延迟依赖整条链路:增量文本输入、单调对齐、因果 LM、chunk 声学生成、流式 vocoder、KV cache 和调度缺一不可;只报首包延迟不能代表可对话性。
- 文章最重要的趋势判断是“路线趋同”:离散/连续表示、AR/NAR 生成、ASR/TTS、专模/通模的边界正在互相渗透,系统竞争逐渐转向数据规模、后训练、长上下文稳定性、可控性与工程成本。
!🔒 01-routes.png
1. 一张更准确的四路线坐标表
Section titled “1. 一张更准确的四路线坐标表”| 路线 | 主要中间表示 | 主生成方式 | 文章代表模型 | 关键优势 | 主要代价 |
|---|---|---|---|---|---|
| Codec LM | RVQ、FSQ、单码本或多码本离散 token | 自回归 LM,常配 NAR/Flow 声学补全 | VALL-E、CosyVoice、Seed-TTS、Qwen3-TTS、Fish Audio S2 | 零样本克隆、上下文建模、可复用 LLM 工程栈 | 序列长、多码本复杂、AR 循环/重复、曝光偏差 |
| 非自回归/生成式 | mel、VAE latent、连续 token | Diffusion、DiT、Flow Matching | Voicebox、F5-TTS、MegaTTS 3、LongCat-AudioDiT、VibeVoice | 并行生成、质量稳定、连续空间高保真 | 采样步数与质量权衡,因果/流式改造更难 |
| 统一语音 LLM | 语义—声学分层 token 或连续表示 | 时序 LM + 深度解码器/语音头 | Moshi、GPT-4o、GLM-4-Voice、Qwen3-Omni、PersonaPlex | 统一语音理解、对话状态和语音输出 | 系统边界复杂,知识/指令能力与声学实时性同时受约束 |
| 流式/双流式专项 | 增量文本、对齐后的音素与语音 token/chunk | 因果 LM + chunk decoder/vocoder | LLMVoX、SpeakStream、StreamMel、VoXtream、CTC-TTS | 文本边到边、语音边生成,降低交互等待 | 首词韵律、lookahead、跨句上下文与质量退化 |
这个表比“从路线 1 升级到路线 4”更准确。文章标题中的“三级跳”是传播性叙事,而实际演进更像多个设计轴同时移动:
- 表示轴:mel → 多码本 codec token → 低帧率单码本/连续 latent;
- 生成轴:纯 AR → AR + NAR → block-wise DiT/Flow → 联合语音 LLM;
- 时序轴:完整文本离线生成 → chunk streaming → 文本与语音双流式;
- 任务轴:TTS 专模 → 语音理解/生成统一 → 全双工对话。
2. Codec LM:VALL-E 之后的主流骨架
Section titled “2. Codec LM:VALL-E 之后的主流骨架”文章把 VALL-E 视为范式转折点:波形先经 EnCodec 等神经 codec 离散化,TTS 变成条件概率建模。给定文本/音素 、参考语音 与历史语音 token,模型逐步预测当前语音 token。
这条路线的价值有三层:
- 接口统一:文本 token 与语音 token 都可进入 Transformer 序列;
- 上下文学习:参考语音可以在不微调的情况下提供说话人和风格条件;
- 工程复用:可以复用 KV cache、并行服务、采样和后训练等 LLM 工具链。
其困难也由 token 结构直接决定:
- 帧率越高,时间序列越长;
- RVQ 层数越多,每个时间步的深度依赖越复杂;
- 低层语义/粗声学错误会传递给高层和后续时间步;
- 纯 AR 生成容易发生循环、漏词、重复和长文本漂移。
文章列出的改进方向包括低帧率 tokenizer、单码本/FSQ、Dual-AR、重复感知采样、chunk-aware 因果 Flow Matching,以及 RL/DPO/GRPO 类后训练。这里要注意:这些改进并不都发生在“一个纯 AR 模型”内部,现代 Codec LM 常常已经是 LM 负责规划、Flow/DiT 负责声学渲染的混合系统。
3. 非自回归/生成式:连续声学空间的另一条主线
Section titled “3. 非自回归/生成式:连续声学空间的另一条主线”Voicebox、F5-TTS 等系统不逐个离散 token 生成,而是学习从噪声到目标 mel/latent 的速度场或去噪过程。文章强调三点:
- 同一语音片段的多个时间位置可以并行更新;
- 少步 Flow Matching 能把 RTF 压到适合在线服务的范围;
- 连续 latent 避免离散码本的量化损失和多层预测复杂度。
但“生成式 = 非自回归”也不能机械等同。VibeVoice 的 next-token diffusion 仍然按较慢时间尺度做块级/next-token 推进;Qwen3-TTS 25Hz 路线也可由 AR 语义规划接 block-wise DiT 重建。更合适的判断是:AR 决定长程时序计划,Diffusion/Flow 决定局部连续分布的生成,两者可以组合。
4. 统一语音 LLM:把 TTS 放回对话系统
Section titled “4. 统一语音 LLM:把 TTS 放回对话系统”文章将 Moshi、GPT-4o、GLM-4-Voice、Qwen3-Omni、Sesame CSM、PersonaPlex、Hibiki-Zero 放在同一路线,关注的是 speech-in/speech-out 接口和实时对话,而不是传统“文本一次给全、语音一次生成完”的 TTS。
Moshi 的 inner-monologue 代表一种常见设计:
- 文本通道承担高密度语义和语言计划;
- 语音 codec 通道承担声学输出;
- temporal Transformer 建模时间进展;
- depth Transformer 在同一时间步展开多码本细节;
- 用户与系统音频流并行推进,实现全双工。
文章据此判断 ASR 与 TTS 会逐渐成为同一语音模型的输入/输出视图。这个方向成立,但 2026 年生产系统是否“主流仍为 ASR→LLM→TTS 管线”属于文章推断,需按实际产品、延迟和质量要求分别判断。
5. CTC-TTS:从对齐和训练序列切入双流式
Section titled “5. CTC-TTS:从对齐和训练序列切入双流式”CTC-TTS 处理的核心场景是:输入文本尚未结束,系统已经要开始说话。这要求模型在只看到局部文本时,就知道哪些语音片段可以安全生成。
5.1 为什么替换 MFA
Section titled “5.1 为什么替换 MFA”传统 MFA 以 GMM-HMM、发音词典和外部工具链输出音素边界,精确但流水线较重。CTC-TTS 使用 CTC-ASR 风格的神经对齐器:
- 音频编码成声学帧;
- CTC 输出音素和 blank 的逐帧分布;
- 通过 Viterbi 路径获得单调对齐;
- blank 归并与帧率后处理把声学帧映射到文本/音素单元;
- 对齐结果用于构造流式训练序列。
文章的关键解释是:TTS 训练不一定需要“绝对精确的物理音素边界”,更需要稳定、单调、可复用的文本—语音结构对应;因此神经 CTC 对齐器可能比传统 MFA 更契合 LLM 粒度。
5.2 bi-word 交织序列
Section titled “5.2 bi-word 交织序列”固定比例交织假设每个文本 token 对应近似固定数量的语音 token,难以适应真实语速、停顿和音素时长。CTC-TTS 改为以相邻两个词为局部单元,根据对齐结果插入对应语音 token,使模型在训练时反复看到“少量文本 → 相应语音”的局部推进结构。
这一设计把双流式问题从“推理时临时切 chunk”前移到训练分布:模型本来就是在交织的局部文本/语音上下文中学习下一 token。
5.3 L 与 F 两个版本
Section titled “5.3 L 与 F 两个版本”| 版本 | 组合方式 | 主要取舍 | 推理直觉 |
|---|---|---|---|
| CTC-TTS-L | 音素与语音 embedding 沿序列长度拼接 | 质量优先,序列更长 | 通常需要约两个词的 prefill,再按 bi-word 推进 |
| CTC-TTS-F | 音素与语音 embedding 沿特征维堆叠 | 延迟优先,序列更短 | 首个音素到达后即可更早开始生成 |
论文摘要确认了这两个版本的定位,并报告它们相对固定比例交织和 MFA 基线在流式与 zero-shot 任务上更好。文章进一步引用四组消融,将“CTC 对齐优于 MFA”和“bi-word 序列优于 ELLA-V”拆开比较;解读时仍应回到论文具体测试集、模型规模与统计显著性。
!🔒 14-pipeline.png
6. 四个真正决定系统能力的技术轴
Section titled “6. 四个真正决定系统能力的技术轴”6.1 对齐
Section titled “6.1 对齐”| 方法 | 需要什么 | 优势 | 风险 |
|---|---|---|---|
| MFA 强制对齐 | 声学模型、词典、已知文本 | 精确、成熟、可解释 | 外部流水线重,对跨语言/新域维护成本高 |
| CTC 对齐 | CTC 声学模型、G2P/音素目标 | 神经化、单调、可与 ASR 复用 | 仍需处理 blank、帧率差和发音词典 |
| 端到端隐式对齐 | 文本与完整语音对 | 系统简单,不保存显式边界 | 收敛和鲁棒性更依赖数据与模型容量 |
| 单调注意力/时长模型 | 可学习的单调约束 | 易控制 lookahead,适合流式 | 增加组件与训练约束 |
6.2 tokenizer 与表示
Section titled “6.2 tokenizer 与表示”文章把 tokenizer 的演进概括为:高帧率多码本 → 低帧率单码本/多码本 → 语义—声学解耦 → 连续 latent。真正需要共同观察的是:
- 帧率:决定 LM 的时间步数量;
- 码本深度/向量维度:决定每步信息量与局部生成难度;
- 语义可预测性:决定内容错误与跟词能力;
- 重建保真度:决定生成上限;
- 因果性:决定是否能边编码、边解码;
- 解码复杂度:决定首包与持续吞吐。
因此,“帧率越低越好”并不成立:压缩过强会损失细节;连续 latent 也可能把离散 token 的易预测性问题改写为高维分布建模问题。详见 神经音频编解码(RVQ)、FSQ(有限标量量化) 和 CALM(连续自回归语言建模)。
6.3 训练序列
Section titled “6.3 训练序列”序列布局决定模型看到怎样的因果关系:
- text-first:先读完整文本,再生成语音,质量高但不是真正双流式;
- 固定比例交织:实现简单,但与真实时长不匹配;
- alignment-aware 交织:用 MFA/CTC/时长模型决定插入位置;
- 双流/多流:文本、语义 token、声学 token 并行推进;
- block-wise:LM 以低频 block 做长程计划,局部 DiT/decoder 生成高频细节。
6.4 低延迟工程
Section titled “6.4 低延迟工程”文章列出 prefill、chunk 解码、depth transformer、Multi-Token Prediction、KV cache、vLLM/CUDA Graph 与 RadixAttention 等手段。这里应把延迟拆成:
- 输入等待:必须等到多少文本/音素才能启动;
- 模型首步计算:首次 LM/DiT forward 的耗时;
- 声码器缓冲:多少声学帧才能输出第一个可播放音频块;
- 传输与调度:队列、并发、网络和播放器缓冲;
- 持续生成速度:首包之后能否长期保持 RTF < 1。
7. 文章给出的 2025–2026 趋势快照
Section titled “7. 文章给出的 2025–2026 趋势快照”- Qwen3-TTS:文章强调 500 万小时、10 语言、双 tokenizer 和 97 ms 首包;技术报告确认 12.5 Hz、16 层多码本路径及其特定设置下的 97 ms 首包。该数字不能脱离模型规模、并发、实现和硬件泛化。
- Fish Audio S2:被归入 Dual-AR、细粒度情绪标签、多语种和 GRPO 对齐路线;开源状态需要区分代码、权重与研究许可。
- VibeVoice:被用于说明 next-token diffusion、长文本和多说话人;OpenReview显示其为 ICLR 2026 Oral,但“生成式”不等于完全 NAR。
- LongCat-AudioDiT:代表波形 latent DiT 与 APG 引导;与 TTS 专模相比更接近统一音频/语音生成方向。
- Moshi/PersonaPlex:把交互重点从单句 TTS 推到全双工、角色/人格和会话状态。
- CTC-TTS:代表从对齐与训练序列而非单纯扩大模型规模改善双流式。
文章的时间线适合发现候选,不应直接替代逐篇论文摄取。模型版本、许可、数据量和开源状态都属于 易过时 信息。
8. 评测:不能用一列数字决定“最好”
Section titled “8. 评测:不能用一列数字决定“最好””| 维度 | 常见指标 | 能回答什么 | 不能回答什么 |
|---|---|---|---|
| 内容准确性 | WER、CER、MixER | 是否说对字词/跨语种内容 | 音质、自然度、情感是否真实 |
| 说话人一致性 | SIM-o、SIM-S | 参考音色是否保留 | 角色稳定、韵律、伪装安全 |
| 自然度/偏好 | MOS、CMOS、SMOS、UTMOS、Arena Elo | 人类/代理对整体听感的偏好 | 跨研究绝对可比性 |
| 音质/重建 | PESQ、STOI、DNSMOS、ViSQOL | 波形或重建质量的某些侧面 | 文本正确性和长时一致性 |
| 实时性 | FPL、TTFA、RTF | 多快开始、能否实时持续 | 双向对话中的打断、回声和 turn-taking |
| 长时/交互 | 漂移、重复、turn-state、误打断率 | 长文本和会话是否稳定 | 单句基准上的静态质量 |
原文的首包延迟图明确提示“口径因论文而异”。图中数字还混合了不同模型规模、硬件、并发、输入条件和首包定义,因此只能看量级,不能据此排序。
!🔒 21-latency.png
9. 开放问题
Section titled “9. 开放问题”- 流式质量退化:lookahead 越小,模型越难建立首词韵律和跨句计划。
- 长文本稳定性:内容错误、音色漂移、重复和情感断裂会随时间累积。
- 文本无关情感控制:中性文本被要求表达悲伤/愤怒时,控制信号与内容先验冲突。
- 多说话人一致性:角色绑定、换人时机、共享环境声学和跨语音段连续性需要同时成立。
- 评测标准化:不同 ASR、文本规范化、提示语、参考时长和硬件让横向数字难以复现。
- 规模化成本:百万到千万小时数据、超大模型和低延迟部署提高复现门槛。
- 音色安全与版权:授权、可撤回、来源标识、水印、活体检测和滥用追踪需要成为系统层能力。
文章列举美国、欧盟和中国的监管动态,但没有为所有法律断言提供一手链接。法律状态高度易变,若用于产品合规决策,必须另行核对官方法条、生效时间、适用地区和豁免条件。
10. 可信度与批判性判断
Section titled “10. 可信度与批判性判断”有较强证据支持的部分
Section titled “有较强证据支持的部分”- CTC-TTS 的问题设定、CTC 对齐、bi-word 交织、L/F 两版定位与论文摘要一致;
- Qwen3-TTS 的 500 万小时、双 tokenizer、12.5 Hz 多码本与特定设置 97 ms 首包可由官方报告确认;
- VibeVoice 的 ICLR 2026 Oral 状态可由 OpenReview 确认;
- 四个技术轴——表示、对齐、训练序列、低延迟——能有效组织文章覆盖的模型。
需要谨慎使用的部分
Section titled “需要谨慎使用的部分”- 分类有重叠:把模型只放进一个格子会掩盖 AR + Flow、离散 + 连续、TTS + 对话的混合设计;
- 跨论文数字不可直接排名:WER/CER、首包、RTF、MOS 与 SIM 的测试集、实现和硬件不同;
- “开源”粒度不够:代码、训练脚本、推理代码、基础权重、论文完整系统权重和许可不是一回事;
- 商业模型透明度不足:GPT-4o、MiniMax 等公开材料无法支持所有内部架构推断;
- 二手来源覆盖不均:参考清单只列出部分论文和项目,若干数据量、法律和行业结论缺少逐条一手链接;
- 发布日期未暴露:微信正文快照没有可靠的公开发布日期字段,本页用 2026-08-17 作为摄取日期,而非文章发布日期。
| 条目 | 文章报告 | 本页处理 |
|---|---|---|
| Qwen3-TTS 数据 | 500 万小时、10 语言 | 官方报告可确认 |
| Qwen3-TTS 首包 | 97 ms | 仅限 12Hz 路径的特定测试设置,不外推到所有部署 |
| CTC-TTS-F | 特征维堆叠、延迟优先 | 论文摘要可确认设计定位;具体延迟需看正文口径 |
| CTC-TTS-L | 长度维拼接、质量优先 | 论文摘要可确认设计定位 |
| Fun-CosyVoice3 CER | test-zh 0.81 | 保留为文章引用,不与闭源/人类数字脱离协议直接比较 |
| Fish Audio S2 | 80+ 语言、细粒度标签、GRPO | 需按具体版本和官方仓库继续核验 |
| 长文本能力 | Qwen3-TTS 10 分钟级、VibeVoice 90 分钟级 | “支持长度”不等于全程无错误或稳定音色 |
| 监管日期 | 文章列出 2024–2026 多地法规 | 只作为线索,不能代替法律一手核验 |
- Wiki 目录
- 本文正式参考论文已独立摄取:资料摘要:CTC-TTS、资料摘要:Qwen3-TTS、资料摘要:LLMVoX、资料摘要:F5-TTS、资料摘要:Emilia、资料摘要:WavTokenizer、资料摘要:可控语音合成系统综述、资料摘要:离散音频 Token 综述与基准、资料摘要:SpeakStream、资料摘要:Moshi
- 流式语音合成 — 双流式任务、延迟分解与质量权衡
- 资料摘要:Qwen3-TTS — 双 tokenizer 与 97 ms 数字的原报告边界
- 资料摘要:CosyVoice 2 · 资料摘要:CosyVoice 3 — Codec LM 与 Flow Matching 混合路线
- 资料摘要:MOSS-TTS — 离散 token + AR 基础模型路线
- 资料摘要:DiTAR · CALM(连续自回归语言建模) — AR 长程建模与连续流匹配头的融合
- 资料摘要:LongCat-AudioDiT — 波形 latent DiT 对照路线
- LALM(大型音频语言模型) — 统一语音理解/生成的模型边界
- 自动语音识别(ASR) — CTC 对齐与 ASR/TTS 协同的基础
- 神经音频编解码(RVQ) · FSQ(有限标量量化) — tokenizer 设计坐标
- 条件流匹配(CFM) · DiT(Diffusion Transformer) — 连续声学生成骨干