READING NOTES · STREAMING TEXT-TO-SPEECH

Qwen3-TTS
精读笔记

它的核心不是把 TTS 模型单纯做大,而是用两种离散语音 representation 覆盖两套工程目标:语义建模与极低延迟。

30 秒速览

TL;DR

Qwen3-TTS 是一族 0.6B/1.7B、12Hz/25Hz 的流式自回归 TTS 模型,覆盖 voice cloning、预定义声音、Voice Design 和 Voice Editing。模型在超过 500 万小时、10 种语言的语音上训练,并用自然语言指令统一控制说话人、风格与韵律。

最值得记住的是一条分工:LM 负责沿文本—语音双轨预测离散 token,speech tokenizer 负责把 token 还原成波形。12Hz 版本把 residual codebook 交给 MTP 一帧内补齐,因果 ConvNet 立即解码;25Hz 版本则用 single-codebook 和 block-wise Flow Matching 换取另一种语义—声学平衡。

5M+ h多语言训练语音
10支持并评测的语言
97 ms12Hz 0.6B、并发 1 首包
3 sec作者主张的 voice cloning 参考长度

01 系统怎样拼起来

ARCHITECTURE
Figure 3Qwen3-TTS 整体架构

文本 token 与 speech token 沿通道轴组成双轨输入。Backbone 预测当前主码本;12Hz 路径再由 MTP 一次生成残余码本,speech tokenizer 最终把离散表示还原为波形。虚线模块为可选条件。

  1. 文本入口:沿用标准 Qwen tokenizer,收到文本 token 后便可开始预测对应语音。
  2. 身份控制:可学习 speaker encoder 与 backbone 联合训练,voice cloning 既可用 speaker embedding,也可用 text–speech pair 做 in-context learning。
  3. dual-track LM:文本与声学表示在 channel 维拼接,使在线文本输入和在线语音输出处于同一自回归过程。
  4. 12Hz 层级预测:Backbone 预测第 0 码本,MTP 补齐 15 个 residual codebook,避免为每层另走一轮长自回归。

02 25Hz 与 12Hz 不是高低配

TRADE-OFF
Figure 2两种 Qwen-TTS tokenizer

左:25Hz single-codebook 建立在 Qwen2-Audio 之上,经 DiT/Flow Matching 生成 mel,再由 BigVGAN 重建波形。右:12.5Hz 采用 semantic codebook 加 15 层 residual VQ,纯因果编码器/解码器直接流式还原。

25Hz 路径
single-codebook、语义与声学信息融合;解码依赖 3-block lookback 与 1-block lookahead 的 block-wise DiT,首包需要等待未来 token。
12Hz 路径
1 个 semantic codebook 加 15 个残差 acoustic codebook;完全因果,4 个 token 组成 320 ms packet,可在 token 到达后直接开始波形输出。
标准克隆
Seed-TTS 中 12Hz 的 WER 一贯低于同规模 25Hz;作者认为较短的 token 序列更利于建模长期依赖。12Hz tokenizer 的重建指标也在报告对比中全面领先。
长语音
Table 10 中反而是 25Hz-1.7B 更稳:long-zh / long-en WER 为 1.517 / 1.225,优于 12Hz 的 2.356 / 2.812。

所以“12Hz 更快”不等于“12Hz 在所有任务都更好”。论文在 Table 5 前的解释是:12Hz 的粗时间分辨率缩短了序列,使 autoregressive model 更容易建模长期依赖;但 Table 10 的超长语音结果又显示 25Hz 更稳。这是报告内部值得继续验证的任务差异,不能简化成一条普遍规律。

03 结果应当怎样读

EVIDENCE
Table 1最能界定能力边界的结果

完整 10 张表及全部模型行见中文全文页。

评估报告结果可支持的结论
Seed-TTS12Hz-1.7B:ZH 0.77 · EN 1.24 WEREN 最低;ZH 次于 CosyVoice3 的 0.71
10 语种 SIMQwen3-TTS 每种语言的最高值均高于 MiniMax 与 ElevenLabs报告评测下 voice cloning 相似度优势一致
zh→ko12Hz 4.82 · CosyVoice3 14.4目标为韩语的跨语言迁移改善显著
first-packet latency12Hz-0.6B:97 / 179 / 299 ms并发 1 / 3 / 6 下均低于对应 25Hz 模型
Voice DesignZH DSD 81.1 · EN DSD 82.4在列出的开源 Voice Design 模型中领先

“达到 SOTA”必须带上任务限定。多语言内容一致性方面,Qwen3-TTS 是 10 种语言中的 6 种最低 WER,不是 10 种全部;跨语言 zh→ja、en→ja、ja→zh 等若干方向仍由 CosyVoice3 更好。Target Speaker 指令控制表里,Gemini 系列在多数 APS、DSD、RP 指标上仍高于 Qwen3-TTS。

04 两处原文异常与四条证据边界

LIMITS
数字冲突
长语音正文写 25Hz-1.7B 的 long-zh / long-en WER 为 1.533 / 1.571,但紧邻 Table 10 给出 1.517 / 1.225。译文忠实保留两组数字;比较时以表格值为表格证据,不能替作者擅自纠正。
占位符残留
引言原文写“一组 x 个精选声音”,其中 x 未替换。表 1 列的是 10 个模型变体,不等于精选声音数;因此不能从表格反推 x。
内部评测
长语音集是内部的 100 条中英文本;效率也在内部 vLLM V0 后端和“一种典型计算资源”上测得,硬件型号与复现实验细节不足。
识别器依赖
长语音 WER 用 Qwen3-ASR 转写;跨系统比较仍会受 ASR 偏差、标点和语言分词方案影响。
指标不是听感
WER、speaker cosine similarity 和 tokenizer 重建指标不能完全代表自然度、情感可信度、可控性和真实用户偏好。
对比版本冻结
商业系统与开源基线是报告时点的版本;结果只能支持报告配置下的比较,不能自动外推到后续版本。

05 编辑判断

VERDICT

Qwen3-TTS 的工程贡献很清晰:它把voice cloning、Voice Design、预定义声音和流式输出放进同一套 ChatML 与 autoregressive LM 框架,并用两种 tokenizer 明确暴露质量、语义容量与 first-packet latency 的取舍。

更谨慎的判断是:报告给出的 tokenizer 重建、标准克隆、多语言相似度和延迟证据相当强,但部分 SOTA 叙述依赖内部集、未具名硬件和异构商业基线;指令控制也没有在所有设定中胜过强商业系统。这是一套很有竞争力、很适合落地研究的开放模型家族,而不是“所有 TTS 维度全面最佳”的证明。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭