跳转到内容

输入关键词开始搜索

    资料摘要:LLM-based TTS 四年全景(2023–2026)

    文章摘要更新 2026-08-17置信度 medium待阅读原始来源 ↗#语音合成#大模型#流式#综述#深度

    瑶光守护者以 CTC-TTS 为切入点,把 2023–2026 年 LLM-based TTS 整理为 Codec LM、非自回归生成、统一语音 LLM、流式/双流式四条路线,并横向讨论对齐、tokenizer、交织序列、低延迟、评测、开放问题与合规风险。它最适合作为“技术地图”,不适合作为跨论文数字的最终证据表。

    🔒 微信原文完整快照 · 微信原文

    • “四条路线”应理解为四个观察角度,而非互斥类别:同一系统可能既是 codec LM,又含 Flow Matching/DiT 声学头,同时支持流式;CosyVoice 2/3、Qwen3-TTS 正是混合范式。
    • Codec LM 把 TTS 改写为条件序列建模:文本/音素与参考语音作为条件,LM 预测离散语音 token,再由 codec decoder 重建波形。它继承上下文学习和零样本克隆能力,但承受长序列、多码本和自回归误差累积。
    • 生成式路线把声学输出放在连续空间:扩散或 Flow Matching 并行生成 mel、VAE latent 或连续 token;推理速度与稳定性较好,但必须在采样步数、质量、因果性和流式能力间权衡。
    • 统一语音 LLM 把“听—想—说”放入一个联合系统:Moshi、Qwen3-Omni、PersonaPlex 等以语音输入、语音输出和多流 token 交互为目标;“端到端”描述的是训练/接口边界,不代表内部没有 tokenizer、文本通道或层级解码器。
    • CTC-TTS 的核心不是再造一个更大的 TTS 基座:它针对双流式场景,用 CTC 神经对齐替换 MFA,并设计 bi-word 文本—语音交织序列;L 版沿长度维拼接以质量优先,F 版沿特征维堆叠以延迟优先。
    • 真正的低延迟依赖整条链路:增量文本输入、单调对齐、因果 LM、chunk 声学生成、流式 vocoder、KV cache 和调度缺一不可;只报首包延迟不能代表可对话性。
    • 文章最重要的趋势判断是“路线趋同”:离散/连续表示、AR/NAR 生成、ASR/TTS、专模/通模的边界正在互相渗透,系统竞争逐渐转向数据规模、后训练、长上下文稳定性、可控性与工程成本。

    !🔒 01-routes.png

    LLM-based TTS 四路线与共同瓶颈 架构图
    LLM-based TTS 四路线与共同瓶颈 架构图
    路线 主要中间表示 主生成方式 文章代表模型 关键优势 主要代价
    Codec LM RVQ、FSQ、单码本或多码本离散 token 自回归 LM,常配 NAR/Flow 声学补全 VALL-E、CosyVoice、Seed-TTS、Qwen3-TTS、Fish Audio S2 零样本克隆、上下文建模、可复用 LLM 工程栈 序列长、多码本复杂、AR 循环/重复、曝光偏差
    非自回归/生成式 mel、VAE latent、连续 token Diffusion、DiT、Flow Matching Voicebox、F5-TTS、MegaTTS 3、LongCat-AudioDiT、VibeVoice 并行生成、质量稳定、连续空间高保真 采样步数与质量权衡,因果/流式改造更难
    统一语音 LLM 语义—声学分层 token 或连续表示 时序 LM + 深度解码器/语音头 Moshi、GPT-4o、GLM-4-Voice、Qwen3-Omni、PersonaPlex 统一语音理解、对话状态和语音输出 系统边界复杂,知识/指令能力与声学实时性同时受约束
    流式/双流式专项 增量文本、对齐后的音素与语音 token/chunk 因果 LM + chunk decoder/vocoder LLMVoX、SpeakStream、StreamMel、VoXtream、CTC-TTS 文本边到边、语音边生成,降低交互等待 首词韵律、lookahead、跨句上下文与质量退化

    这个表比“从路线 1 升级到路线 4”更准确。文章标题中的“三级跳”是传播性叙事,而实际演进更像多个设计轴同时移动:

    • 表示轴:mel → 多码本 codec token → 低帧率单码本/连续 latent;
    • 生成轴:纯 AR → AR + NAR → block-wise DiT/Flow → 联合语音 LLM;
    • 时序轴:完整文本离线生成 → chunk streaming → 文本与语音双流式;
    • 任务轴:TTS 专模 → 语音理解/生成统一 → 全双工对话。

    2. Codec LM:VALL-E 之后的主流骨架

    Section titled “2. Codec LM:VALL-E 之后的主流骨架”

    文章把 VALL-E 视为范式转折点:波形先经 EnCodec 等神经 codec 离散化,TTS 变成条件概率建模。给定文本/音素 xx、参考语音 rr 与历史语音 token,模型逐步预测当前语音 token。

    这条路线的价值有三层:

    1. 接口统一:文本 token 与语音 token 都可进入 Transformer 序列;
    2. 上下文学习:参考语音可以在不微调的情况下提供说话人和风格条件;
    3. 工程复用:可以复用 KV cache、并行服务、采样和后训练等 LLM 工具链。

    其困难也由 token 结构直接决定:

    • 帧率越高,时间序列越长;
    • RVQ 层数越多,每个时间步的深度依赖越复杂;
    • 低层语义/粗声学错误会传递给高层和后续时间步;
    • 纯 AR 生成容易发生循环、漏词、重复和长文本漂移。

    文章列出的改进方向包括低帧率 tokenizer、单码本/FSQ、Dual-AR、重复感知采样、chunk-aware 因果 Flow Matching,以及 RL/DPO/GRPO 类后训练。这里要注意:这些改进并不都发生在“一个纯 AR 模型”内部,现代 Codec LM 常常已经是 LM 负责规划、Flow/DiT 负责声学渲染的混合系统。

    3. 非自回归/生成式:连续声学空间的另一条主线

    Section titled “3. 非自回归/生成式:连续声学空间的另一条主线”

    Voicebox、F5-TTS 等系统不逐个离散 token 生成,而是学习从噪声到目标 mel/latent 的速度场或去噪过程。文章强调三点:

    • 同一语音片段的多个时间位置可以并行更新;
    • 少步 Flow Matching 能把 RTF 压到适合在线服务的范围;
    • 连续 latent 避免离散码本的量化损失和多层预测复杂度。

    但“生成式 = 非自回归”也不能机械等同。VibeVoice 的 next-token diffusion 仍然按较慢时间尺度做块级/next-token 推进;Qwen3-TTS 25Hz 路线也可由 AR 语义规划接 block-wise DiT 重建。更合适的判断是:AR 决定长程时序计划,Diffusion/Flow 决定局部连续分布的生成,两者可以组合。

    4. 统一语音 LLM:把 TTS 放回对话系统

    Section titled “4. 统一语音 LLM:把 TTS 放回对话系统”

    文章将 Moshi、GPT-4o、GLM-4-Voice、Qwen3-Omni、Sesame CSM、PersonaPlex、Hibiki-Zero 放在同一路线,关注的是 speech-in/speech-out 接口和实时对话,而不是传统“文本一次给全、语音一次生成完”的 TTS。

    Moshi 的 inner-monologue 代表一种常见设计:

    • 文本通道承担高密度语义和语言计划;
    • 语音 codec 通道承担声学输出;
    • temporal Transformer 建模时间进展;
    • depth Transformer 在同一时间步展开多码本细节;
    • 用户与系统音频流并行推进,实现全双工。

    文章据此判断 ASR 与 TTS 会逐渐成为同一语音模型的输入/输出视图。这个方向成立,但 2026 年生产系统是否“主流仍为 ASR→LLM→TTS 管线”属于文章推断,需按实际产品、延迟和质量要求分别判断。

    5. CTC-TTS:从对齐和训练序列切入双流式

    Section titled “5. CTC-TTS:从对齐和训练序列切入双流式”

    CTC-TTS 处理的核心场景是:输入文本尚未结束,系统已经要开始说话。这要求模型在只看到局部文本时,就知道哪些语音片段可以安全生成。

    传统 MFA 以 GMM-HMM、发音词典和外部工具链输出音素边界,精确但流水线较重。CTC-TTS 使用 CTC-ASR 风格的神经对齐器:

    1. 音频编码成声学帧;
    2. CTC 输出音素和 blank 的逐帧分布;
    3. 通过 Viterbi 路径获得单调对齐;
    4. blank 归并与帧率后处理把声学帧映射到文本/音素单元;
    5. 对齐结果用于构造流式训练序列。

    文章的关键解释是:TTS 训练不一定需要“绝对精确的物理音素边界”,更需要稳定、单调、可复用的文本—语音结构对应;因此神经 CTC 对齐器可能比传统 MFA 更契合 LLM 粒度。

    固定比例交织假设每个文本 token 对应近似固定数量的语音 token,难以适应真实语速、停顿和音素时长。CTC-TTS 改为以相邻两个词为局部单元,根据对齐结果插入对应语音 token,使模型在训练时反复看到“少量文本 → 相应语音”的局部推进结构。

    这一设计把双流式问题从“推理时临时切 chunk”前移到训练分布:模型本来就是在交织的局部文本/语音上下文中学习下一 token。

    版本 组合方式 主要取舍 推理直觉
    CTC-TTS-L 音素与语音 embedding 沿序列长度拼接 质量优先,序列更长 通常需要约两个词的 prefill,再按 bi-word 推进
    CTC-TTS-F 音素与语音 embedding 沿特征维堆叠 延迟优先,序列更短 首个音素到达后即可更早开始生成

    论文摘要确认了这两个版本的定位,并报告它们相对固定比例交织和 MFA 基线在流式与 zero-shot 任务上更好。文章进一步引用四组消融,将“CTC 对齐优于 MFA”和“bi-word 序列优于 ELLA-V”拆开比较;解读时仍应回到论文具体测试集、模型规模与统计显著性。

    !🔒 14-pipeline.png

    6. 四个真正决定系统能力的技术轴

    Section titled “6. 四个真正决定系统能力的技术轴”
    方法 需要什么 优势 风险
    MFA 强制对齐 声学模型、词典、已知文本 精确、成熟、可解释 外部流水线重,对跨语言/新域维护成本高
    CTC 对齐 CTC 声学模型、G2P/音素目标 神经化、单调、可与 ASR 复用 仍需处理 blank、帧率差和发音词典
    端到端隐式对齐 文本与完整语音对 系统简单,不保存显式边界 收敛和鲁棒性更依赖数据与模型容量
    单调注意力/时长模型 可学习的单调约束 易控制 lookahead,适合流式 增加组件与训练约束

    文章把 tokenizer 的演进概括为:高帧率多码本 → 低帧率单码本/多码本 → 语义—声学解耦 → 连续 latent。真正需要共同观察的是:

    • 帧率:决定 LM 的时间步数量;
    • 码本深度/向量维度:决定每步信息量与局部生成难度;
    • 语义可预测性:决定内容错误与跟词能力;
    • 重建保真度:决定生成上限;
    • 因果性:决定是否能边编码、边解码;
    • 解码复杂度:决定首包与持续吞吐。

    因此,“帧率越低越好”并不成立:压缩过强会损失细节;连续 latent 也可能把离散 token 的易预测性问题改写为高维分布建模问题。详见 神经音频编解码(RVQ)FSQ(有限标量量化)CALM(连续自回归语言建模)

    序列布局决定模型看到怎样的因果关系:

    • text-first:先读完整文本,再生成语音,质量高但不是真正双流式;
    • 固定比例交织:实现简单,但与真实时长不匹配;
    • alignment-aware 交织:用 MFA/CTC/时长模型决定插入位置;
    • 双流/多流:文本、语义 token、声学 token 并行推进;
    • block-wise:LM 以低频 block 做长程计划,局部 DiT/decoder 生成高频细节。

    文章列出 prefill、chunk 解码、depth transformer、Multi-Token Prediction、KV cache、vLLM/CUDA Graph 与 RadixAttention 等手段。这里应把延迟拆成:

    • 输入等待:必须等到多少文本/音素才能启动;
    • 模型首步计算:首次 LM/DiT forward 的耗时;
    • 声码器缓冲:多少声学帧才能输出第一个可播放音频块;
    • 传输与调度:队列、并发、网络和播放器缓冲;
    • 持续生成速度:首包之后能否长期保持 RTF < 1。

    7. 文章给出的 2025–2026 趋势快照

    Section titled “7. 文章给出的 2025–2026 趋势快照”
    • Qwen3-TTS:文章强调 500 万小时、10 语言、双 tokenizer 和 97 ms 首包;技术报告确认 12.5 Hz、16 层多码本路径及其特定设置下的 97 ms 首包。该数字不能脱离模型规模、并发、实现和硬件泛化。
    • Fish Audio S2:被归入 Dual-AR、细粒度情绪标签、多语种和 GRPO 对齐路线;开源状态需要区分代码、权重与研究许可。
    • VibeVoice:被用于说明 next-token diffusion、长文本和多说话人;OpenReview显示其为 ICLR 2026 Oral,但“生成式”不等于完全 NAR。
    • LongCat-AudioDiT:代表波形 latent DiT 与 APG 引导;与 TTS 专模相比更接近统一音频/语音生成方向。
    • Moshi/PersonaPlex:把交互重点从单句 TTS 推到全双工、角色/人格和会话状态。
    • CTC-TTS:代表从对齐与训练序列而非单纯扩大模型规模改善双流式。

    文章的时间线适合发现候选,不应直接替代逐篇论文摄取。模型版本、许可、数据量和开源状态都属于 易过时 信息。

    8. 评测:不能用一列数字决定“最好”

    Section titled “8. 评测:不能用一列数字决定“最好””
    维度 常见指标 能回答什么 不能回答什么
    内容准确性 WER、CER、MixER 是否说对字词/跨语种内容 音质、自然度、情感是否真实
    说话人一致性 SIM-o、SIM-S 参考音色是否保留 角色稳定、韵律、伪装安全
    自然度/偏好 MOS、CMOS、SMOS、UTMOS、Arena Elo 人类/代理对整体听感的偏好 跨研究绝对可比性
    音质/重建 PESQ、STOI、DNSMOS、ViSQOL 波形或重建质量的某些侧面 文本正确性和长时一致性
    实时性 FPL、TTFA、RTF 多快开始、能否实时持续 双向对话中的打断、回声和 turn-taking
    长时/交互 漂移、重复、turn-state、误打断率 长文本和会话是否稳定 单句基准上的静态质量

    原文的首包延迟图明确提示“口径因论文而异”。图中数字还混合了不同模型规模、硬件、并发、输入条件和首包定义,因此只能看量级,不能据此排序。

    !🔒 21-latency.png

    1. 流式质量退化:lookahead 越小,模型越难建立首词韵律和跨句计划。
    2. 长文本稳定性:内容错误、音色漂移、重复和情感断裂会随时间累积。
    3. 文本无关情感控制:中性文本被要求表达悲伤/愤怒时,控制信号与内容先验冲突。
    4. 多说话人一致性:角色绑定、换人时机、共享环境声学和跨语音段连续性需要同时成立。
    5. 评测标准化:不同 ASR、文本规范化、提示语、参考时长和硬件让横向数字难以复现。
    6. 规模化成本:百万到千万小时数据、超大模型和低延迟部署提高复现门槛。
    7. 音色安全与版权:授权、可撤回、来源标识、水印、活体检测和滥用追踪需要成为系统层能力。

    文章列举美国、欧盟和中国的监管动态,但没有为所有法律断言提供一手链接。法律状态高度易变,若用于产品合规决策,必须另行核对官方法条、生效时间、适用地区和豁免条件。

    • CTC-TTS 的问题设定、CTC 对齐、bi-word 交织、L/F 两版定位与论文摘要一致;
    • Qwen3-TTS 的 500 万小时、双 tokenizer、12.5 Hz 多码本与特定设置 97 ms 首包可由官方报告确认;
    • VibeVoice 的 ICLR 2026 Oral 状态可由 OpenReview 确认;
    • 四个技术轴——表示、对齐、训练序列、低延迟——能有效组织文章覆盖的模型。
    • 分类有重叠:把模型只放进一个格子会掩盖 AR + Flow、离散 + 连续、TTS + 对话的混合设计;
    • 跨论文数字不可直接排名:WER/CER、首包、RTF、MOS 与 SIM 的测试集、实现和硬件不同;
    • “开源”粒度不够:代码、训练脚本、推理代码、基础权重、论文完整系统权重和许可不是一回事;
    • 商业模型透明度不足:GPT-4o、MiniMax 等公开材料无法支持所有内部架构推断;
    • 二手来源覆盖不均:参考清单只列出部分论文和项目,若干数据量、法律和行业结论缺少逐条一手链接;
    • 发布日期未暴露:微信正文快照没有可靠的公开发布日期字段,本页用 2026-08-17 作为摄取日期,而非文章发布日期。
    条目 文章报告 本页处理
    Qwen3-TTS 数据 500 万小时、10 语言 官方报告可确认
    Qwen3-TTS 首包 97 ms 仅限 12Hz 路径的特定测试设置,不外推到所有部署
    CTC-TTS-F 特征维堆叠、延迟优先 论文摘要可确认设计定位;具体延迟需看正文口径
    CTC-TTS-L 长度维拼接、质量优先 论文摘要可确认设计定位
    Fun-CosyVoice3 CER test-zh 0.81 保留为文章引用,不与闭源/人类数字脱离协议直接比较
    Fish Audio S2 80+ 语言、细粒度标签、GRPO 需按具体版本和官方仓库继续核验
    长文本能力 Qwen3-TTS 10 分钟级、VibeVoice 90 分钟级 “支持长度”不等于全程无错误或稳定音色
    监管日期 文章列出 2024–2026 多地法规 只作为线索,不能代替法律一手核验