资料摘要:Qwen3-TTS
Qwen 团队首个成系列公开的流式 text-to-speech 模型报告:用 25Hz 单码本与 12.5Hz 多码本两种 speech tokenizer 覆盖语义容量、重建质量和首包延迟的不同取舍,再以双轨自回归 LM 统一声音克隆、Voice Design、预定义声音与细粒度指令控制。
🔒 Qwen3-TTS Technical Report
- 模型家族:报告列出 10 个 0.6B/1.7B、12Hz/25Hz 变体,按 Base、VoiceDesign、CustomVoice、VoiceEditing 划分能力;并非一个权重通过开关覆盖全部任务。
- 训练规模:预训练使用超过 500 万小时、覆盖 10 种语言的语音;训练依次经历通用、高质量、长上下文三个阶段,最大 token 长度从 8,192 提升到 32,768。
- 双轨流式 LM:文本 token 与声学 token 沿 channel 轴组合;文本到达后,backbone 即预测当前主 speech code,降低等待完整文本的需求。
- 25Hz tokenizer:在 Qwen2-Audio 上构建 25Hz 单码本表示,将语义与声学线索压入同一 code;分块 DiT 以 Flow Matching 生成 mel,再由修改版 BigVGAN 重建波形。
- 12Hz tokenizer:12.5Hz、16 层多码本结构由 1 个语义码本和 15 层 residual VQ 组成;纯因果 encoder/decoder 与轻量 ConvNet 可在 token 到达后立即输出波形。
- MTP 帧内补全:12Hz 模型由 LM backbone 预测第 0 码本,Multi-Token Prediction 模块在同一帧生成残余码本,避免把 16 层都展开成长时间自回归序列。
- 控制路径:声音克隆可使用参考语音的 speaker embedding 实时克隆,也可用 text–speech pair 做 in-context learning 以更好保留韵律;Voice Design 则由自然语言描述创造新声音。
- 后训练:先用 DPO 对齐多语言人类偏好,再以规则奖励和 GSPO 增强能力与稳定性,最后在 Base 上做轻量 speaker fine-tuning。
两种 tokenizer 的核心取舍
Section titled “两种 tokenizer 的核心取舍”| 维度 | Qwen-TTS-Tokenizer-25Hz | Qwen-TTS-Tokenizer-12Hz |
|---|---|---|
| 时间分辨率 | 25 fps,每 token 约 40 ms | 12.5 fps,每 token 约 80 ms |
| 离散结构 | 单码本,codebook size 32,768 | 16 层多码本,每层 size 2,048 |
| 语义来源 | Qwen2-Audio ASR 继续预训练 | WavLM teacher 引导第 1 语义层 |
| 声学细节 | 单 code 融合语义与声学信息 | 15 层 residual VQ 逐层补细节 |
| 波形解码 | DiT/Flow Matching → mel → BigVGAN | 轻量因果 ConvNet 直接解码 |
| 流式约束 | 3-block lookback + 1-block lookahead | 纯左上下文,无 lookahead |
| 报告中的主要优势 | 长语音稳定性 | 重建质量、常规 WER、首包延迟 |
25Hz 路径不是简单的“更高帧率高配版”。它用单码本降低 LM 输出结构复杂度,却把高保真解码交给分块扩散;12Hz 路径把每帧的信息容量扩到 16 层,LM 只预测主码本,剩余层由 MTP 补齐。两者优化的是不同瓶颈。
25Hz 解码器需要未来块:chunk size 为 8 时,LM 要先生成 16 个 token,DiT 才能生成首个 8-token mel chunk。12Hz 解码器只看左上下文,理论上单 token 即可出声;报告为了减少调度开销,把 4 个 token(320 ms 语音)定义为一个 packet。
Table 2 的并发 1 结果:
| 模型 | LM TTFP | Tokenizer decode | First-packet latency | RTF |
|---|---|---|---|---|
| 25Hz-1.7B | 125 ms | 25 ms | 150 ms | 0.253 |
| 25Hz-0.6B | 113 ms | 25 ms | 138 ms | 0.234 |
| 12Hz-1.7B | 97 ms | 4 ms | 101 ms | 0.313 |
| 12Hz-0.6B | 93 ms | 4 ms | 97 ms | 0.288 |
这里的 97 ms 是 12Hz-0.6B、并发 1、内部 vLLM V0 与特定优化下的端到端首包值,不能脱离模型规模、并发和未具名硬件泛化成所有 Qwen3-TTS 请求的固定延迟。
训练与能力统一
Section titled “训练与能力统一”预训练先建立多语言文本到语音的单调映射,再用高质量数据继续预训练以减少噪声数据造成的幻觉,最后扩大长上下文并上采样长语音。所有输入统一成 ChatML;控制指令作为前缀进入同一语言建模任务。
这套统一主要发生在接口与 backbone 层:
- Base 支持 zero-shot voice cloning。
- VoiceDesign 根据描述创造未见过的新声音。
- CustomVoice 使用预定义/微调声音并接收风格指令。
- 25Hz VoiceEditing 可在参考说话人上编辑属性。
因此“统一框架”不等于“单一 checkpoint 拥有所有表 1 勾选项”。
Tokenizer 重建
Section titled “Tokenizer 重建”Qwen-TTS-Tokenizer-12Hz 在 LibriSpeech test-clean 的报告结果为 PESQ-WB 3.21、PESQ-NB 3.68、STOI 0.96、UTMOS 4.16、SIM 0.95,均高于表中 SpeechTokenizer、X-codec、XY-Tokenizer、Mimi 与 FireRedTTS 2 tokenizer。
Zero-shot 与多语言
Section titled “Zero-shot 与多语言”- Seed-TTS:12Hz-1.7B 的 test-zh / test-en WER 为 0.77 / 1.24;其中 test-en 为表中最低,test-zh 次于 CosyVoice3 的 0.71。25Hz-1.7B 为 1.10 / 1.49。
- 10 语种内容一致性:Qwen3-TTS 在中文、英文、意大利语、法语、韩语、俄语 6 种语言取得最低 WER;德语、葡萄牙语、西班牙语、日语并非全部领先。
- 10 语种说话人相似度:每种语言中至少一个 Qwen3-TTS 变体高于报告列出的 MiniMax 与 ElevenLabs 对应值。
- 跨语言 zh→ko:12Hz-1.7B error rate 为 4.82,CosyVoice3 为 14.4;但 zh→ja、en→ja、ja→zh 等方向仍有 CosyVoice3 更优。
可控性与长语音
Section titled “可控性与长语音”Voice Design 的 Qwen3-TTS-12Hz-1.7B 在报告所列开源模型中整体领先;但 Target Speaker 表中 Gemini-flash/pro 的多数 APS、DSD、RP 仍更高,不能概括成全面超过商业系统。
Table 10 的长语音 WER:
- 25Hz-1.7B-CustomVoice:long-zh / long-en = 1.517 / 1.225。
- 12Hz-1.7B-CustomVoice:long-zh / long-en = 2.356 / 2.812。
- 25Hz 在此项优于 12Hz,说明更细时间分辨率可能有利于超长序列的单层 AR 稳定性。
- 原文数字冲突:长语音正文写 25Hz-1.7B 的 WER 为 1.533 / 1.571,紧邻 Table 10 却是 1.517 / 1.225。完整译稿保留两组原始数字;本文做表格比较时使用 Table 10 值,不替作者静默修正。
- 占位符未替换:引言原文写“一组 x 个精选声音”,
x明显仍是占位符。表 1 的 10 行是模型变体,不是声音数量,不能拿来补这个值。 - 内部设置限制复现:长语音集为内部 100 条中英文本;流式效率使用内部 vLLM V0 后端和“一种典型计算资源”,未给出具体 GPU 与完整部署配置。
- 指标边界:WER、speaker cosine similarity、PESQ/UTMOS 不能穷尽自然度、情感可信度和真实用户偏好;部分商业基线版本也会随时间变化。
- SOTA 需绑定任务:报告确实给出多项强结果,但不是 10 种语言、所有跨语言方向、所有控制设定都第一。
- 资料摘要:InstructTTSEval — 本报告 Voice Design 与 Target Speaker 可控性表格所使用的 APS/DSD/RP 基准来源。
- Qwen 音频四模型对比 — 区分本报告的 Qwen3-TTS 与 2026.07 的 Qwen-Audio-3.0-TTS。
- 资料摘要:Qwen-Audio-3.0-TTS — 后续生产型 TTS 系统采用 LM hidden states → chunk Flow Matching 的不同路线。
- 神经音频编解码(RVQ) — 12Hz tokenizer 的 1+15 层 residual quantization 背景。
- 条件流匹配(CFM) — 25Hz tokenizer 的分块 DiT 波形重建基础。
- DPO(直接偏好优化) · GRPO(组相对策略优化) — 报告所述后训练方法背景。
- 资料摘要:Luna-TTS — 继承 Qwen3-0.6B 文本 backbone、但把 RVQ 网格从 AR/MTP 改为 full-grid 与 block-causal masked diffusion 的对照路线。
- Wiki 目录