资料摘要:Qwen-Audio-3.0-TTS
Alibaba Token Foundry 面向生产部署的 TTS 系统:以 12.5 Hz 监督语义 tokenizer 降低自回归成本,让 LM 的连续隐状态直接条件化 Flow-Matching 声学生成器,再用因果 BigVGAN 输出波形;通过 LM/FM 分阶段训练与两类强化学习,同时覆盖 16 种语言、20 个中文方言区域、自然语言指令、86 种行内标签、最长 3 分钟单次生成和劣质参考音频克隆。
🔒 Qwen-Audio-3.0-TTS Technical Report
- 不是旧 Qwen3-TTS 的改名:Qwen3-TTS 是更早的开放模型/服务系列;Qwen-Audio-3.0-TTS 是 2026 年 7 月的新生产系统,沿 CosyVoice2/3 的 LM→FM→vocoder 混合路线演进。
- 低帧率监督 tokenizer:SenseVoice + FSQ 把语音压成 12.5 Hz token;10 维、每维 3 级,组合码本为 ,用更大码本补偿帧率从 25 Hz 减半的信息损失。
- 连续隐状态桥接:LM 仍预测离散语义 token,但 FM 不只读取 token ID,而直接读取 LM continuous hidden states,使声学损失能反向塑造 LM 表征,缓解“离散单码本接口”的信息瓶颈。
- 五阶段训练:LM/FM 独立预训练→联合训练+高质量数据退火→LM 的 GRPO+DiffRO→冻结 LM 做劣质参考鲁棒训练→冻结 LM 做 FlowTTS-GRPO。
- 生产能力:16 语言、20 中文方言区域、86 个局部控制标签、自然语言控制角色/情绪/语速/音色/口音、3 分钟 one-pass 长文、噪声/混响/窄带参考音频克隆、两阶段 speaker adaptation 和 48 kHz 超分 vocoder。
- 结果边界:在多数测试上强调的是“质量、相似度、自然度与可控性的综合平衡”,并非所有 WER/CER 都第一;Artificial Analysis 2026-07-16 快照中 Plus 版本以点估计第一,但置信区间与 Simba 3.2 重叠。
总体架构:LM→FM→因果 Vocoder
Section titled “总体架构:LM→FM→因果 Vocoder”系统由三部分串联:
- Language Model:根据指令、文本和参考提示自回归预测 12.5 Hz audio-semantic token。
- Flow-Matching Model:读取上采样后的 LM hidden states、参考 Mel、说话人 embedding 和带噪 Mel,通过 chunk-based flow matching 重建声学特征。
- Causal BigVGAN:把 Mel 频谱流式还原为波形;speaker-adapted 版本另有 48 kHz 超分 vocoder。
与纯 codec LM 相比,它用连续 FM 补回声学细节;与纯非自回归 TTS 相比,它保留自回归 LM 的文本规划、流式和长上下文能力;与旧级联系统相比,联合 LM-FM 训练允许声学损失沿 hidden-state 通路回传。
12.5 Hz Speech Tokenizer
Section titled “12.5 Hz Speech Tokenizer”Tokenizer 延续 CosyVoice3 的监督设计:Whisper-style 128-bin Mel 前端(16 kHz,100 Hz)→32 层 causal SenseVoice encoder(宽 1280、20 头)→Voice Encoder-1 降至 25 Hz→Quantizer Encoder 降至 12.5 Hz→FSQ→Quantizer Decoder 回到 25 Hz→Voice Encoder-2→MinMo LLM 多任务监督。
监督任务包括 ASR、语言识别、情感识别、音频事件检测、说话人分析和通用音频分析。训练先绕过 FSQ 学连续表示,再启用 FSQ 并冻结监督 LLM。消融显示:
| 帧率/码本 | test-zh CER | test-en WER | 结论 |
|---|---|---|---|
| 25 Hz / 6,561 | 1.45 | 2.57 | CosyVoice3 基线 |
| 12.5 Hz / 6,561 | 2.59 | 3.21 | 只减帧率会显著丢信息 |
| 12.5 Hz / 19,683 | 1.48 | 2.56 | 扩码本基本恢复 |
| 12.5 Hz / 59,049 | 1.23 | 2.37 | 最佳内容一致性折中 |
因此论文的关键不是“低帧率天然更好”,而是用更大的 FSQ 状态空间和多任务语义监督换取更短序列。
五阶段渐进训练
Section titled “五阶段渐进训练”1. LM 与 FM 独立预训练
Section titled “1. LM 与 FM 独立预训练”LM 学文本/提示→语义 token,FM 学 token→Mel;二者分别在多语言、方言和指令数据上建立稳定初始化,保留模块化扩展能力。
2. 联合 LM-FM + 高质量退火
Section titled “2. 联合 LM-FM + 高质量退火”FM 改为条件化 LM hidden states,同时保留 token prediction 与 flow-matching 双目标。先在广覆盖数据上对齐,再切到更干净、更有表现力的高质量子集,兼顾覆盖面与音质。
3. LM 强化学习
Section titled “3. LM 强化学习”冻结 FM/vocoder,用 token-only rollout 做 online GRPO(组相对策略优化),奖励联合内容一致性、时长稳定、多样性和韵律自然度,并加 KL 到参考策略。另叠加 Gumbel-Softmax 的正优势 DiffRO(可微奖励优化) 分支,给 token 级可微纠正。第一阶段先做通用生成,第二阶段再加入方言属性奖励。
4. 冻结 LM 的声学鲁棒训练
Section titled “4. 冻结 LM 的声学鲁棒训练”FM 学会从噪声、混响、远场、电话/蓝牙/笔记本麦克风、遮挡、codec/DAC/放大器失真、丢包和强回声参考中恢复干净语音,无需推理时另开显式 denoise 模式。
5. FM 强化学习
Section titled “5. FM 强化学习”FlowTTS-GRPO 把确定性 ODE 采样临时改为保持边缘分布的 SDE 探索,对同一提示采样一组波形,以说话人相似度、ASR 与 DNSMOS 的标准化复合奖励更新 FM;只在早期采样步探索,后期回到 ODE 稳定收敛。
可控性与部署能力
Section titled “可控性与部署能力”- 自然语言指令:角色、情绪、风格、语速、音色、口音,可同时描述多个属性。
- 86 种 inline tag:在词/短语局部切换情绪、风格、速度,或插入笑声、呼吸、咳嗽、叹气等非语言事件。
- 16 种语言:在 CosyVoice3 基础上新增马来语、他加禄语、阿拉伯语、葡萄牙语、印尼语、泰语、越南语。
- 20 个中文方言区域:以地域粒度评测方言真实性、发音准确性和韵律自然度。
- 3 分钟 one-pass:不依赖外部分段拼接;另覆盖数字、货币、代码、缩写、单位和 LaTeX 公式的 text normalization。
- Speaker adaptation:先 LM+FM 配合 replay 联合微调,再冻结 LM 用目标说话人数据精修 FM。
- SEED-TTS-Eval:test-zh CER 0.84、test-en WER 1.54;ERes2Net SIM 在中/英/hard 三组最高,但 WavLM 排名不同,说明“说话人相似度”高度依赖表征模型。
- CV3-Eval 16 语言:在日、韩、俄、阿、马来、泰等语言内容一致性第一;12 个跨语言方向中 8 个第一、4 个第二,相对 CosyVoice3 平均错误率约降 60%。
- 长文:中文 all CER 2.22、英文 all WER 5.00;内容明显强于 CosyVoice3,但英文不如部分专用模型,优势主要在高 prompt/segment speaker consistency。
- 劣质参考:Noisy/Reverb 的 DNSMOS 3.962/3.925,接近 ElevenLabs denoise,同时 SIM 76.14/74.12,避免显式去噪常见的“干净了但声音不像”权衡。
- 指令遵循:中/英 overall 78.94/80.45,优于 IndexTTS2 和 CosyVoice3;自动裁判在复杂指令上与人类 criterion-level agreement 仅 56.7%,需谨慎解读。
- 方言人评:发音准确 93.5% Perfect,但方言真实性和韵律自然度 Perfect 只有 66.7%/68.1%,说明“支持方言”不等于每条都达到母语级。
局限与批判性判断
Section titled “局限与批判性判断”- 关键规模不透明:报告未公开完整 LM/FM 参数量、训练总小时数、数据构成和训练算力;核心系统不能由论文独立复现。
- Plus/Flash/论文模型边界不完整:论文只明确 Artificial Analysis 的
Qwen-Audio-3.0-TTS-Plus对应本文模型;服务中的 Flash 与论文配置关系未展开。 - 自动裁判仍是薄弱环节:text normalization 和指令遵循依赖 Gemini;复杂指令的人机逐项一致率不高,自动分数不是可靠的人评替代。
- “第一”是快照:Artificial Analysis 榜单结果来自 2026-07-16,且第一名置信区间与 Simba 3.2 重叠,不应把动态榜单点估计写成稳定结论。
- 不是全面 WER SOTA:论文主动承认过度压低 CER/WER 会牺牲自然度和表现力,系统追求 Pareto 平衡而非单指标第一。
- 论文:Qwen-Audio-3.0-TTS,arXiv:2607.23938v1,2026-07-27。
- 团队:Alibaba Token Foundry。
- 官方服务模型:
qwen-audio-3.0-tts-plus/qwen-audio-3.0-tts-flash;论文明确映射 Plus,未完整说明 Flash。 - Tokenizer:12.5 Hz,10 维 FSQ,每维 3 级,59,049 状态。
- 覆盖:16 语言、20 中文方言区域、86 个行内控制标签、最长 3 分钟单次生成。