跳转到内容

输入关键词开始搜索

    资料摘要:Qwen3-TTS

    论文摘要更新 2026-08-06置信度 high待阅读原始来源 ↗#语音合成#语言模型#流式#声音克隆#深度

    Qwen 团队首个成系列公开的流式 text-to-speech 模型报告:用 25Hz 单码本与 12.5Hz 多码本两种 speech tokenizer 覆盖语义容量、重建质量和首包延迟的不同取舍,再以双轨自回归 LM 统一声音克隆、Voice Design、预定义声音与细粒度指令控制。

    🔒 Qwen3-TTS Technical Report

    中文全文译稿 · 精读笔记 · 官方代码

    • 模型家族:报告列出 10 个 0.6B/1.7B、12Hz/25Hz 变体,按 Base、VoiceDesign、CustomVoice、VoiceEditing 划分能力;并非一个权重通过开关覆盖全部任务。
    • 训练规模:预训练使用超过 500 万小时、覆盖 10 种语言的语音;训练依次经历通用、高质量、长上下文三个阶段,最大 token 长度从 8,192 提升到 32,768。
    • 双轨流式 LM:文本 token 与声学 token 沿 channel 轴组合;文本到达后,backbone 即预测当前主 speech code,降低等待完整文本的需求。
    • 25Hz tokenizer:在 Qwen2-Audio 上构建 25Hz 单码本表示,将语义与声学线索压入同一 code;分块 DiT 以 Flow Matching 生成 mel,再由修改版 BigVGAN 重建波形。
    • 12Hz tokenizer:12.5Hz、16 层多码本结构由 1 个语义码本和 15 层 residual VQ 组成;纯因果 encoder/decoder 与轻量 ConvNet 可在 token 到达后立即输出波形。
    • MTP 帧内补全:12Hz 模型由 LM backbone 预测第 0 码本,Multi-Token Prediction 模块在同一帧生成残余码本,避免把 16 层都展开成长时间自回归序列。
    • 控制路径:声音克隆可使用参考语音的 speaker embedding 实时克隆,也可用 text–speech pair 做 in-context learning 以更好保留韵律;Voice Design 则由自然语言描述创造新声音。
    • 后训练:先用 DPO 对齐多语言人类偏好,再以规则奖励和 GSPO 增强能力与稳定性,最后在 Base 上做轻量 speaker fine-tuning。
    维度 Qwen-TTS-Tokenizer-25Hz Qwen-TTS-Tokenizer-12Hz
    时间分辨率 25 fps,每 token 约 40 ms 12.5 fps,每 token 约 80 ms
    离散结构 单码本,codebook size 32,768 16 层多码本,每层 size 2,048
    语义来源 Qwen2-Audio ASR 继续预训练 WavLM teacher 引导第 1 语义层
    声学细节 单 code 融合语义与声学信息 15 层 residual VQ 逐层补细节
    波形解码 DiT/Flow Matching → mel → BigVGAN 轻量因果 ConvNet 直接解码
    流式约束 3-block lookback + 1-block lookahead 纯左上下文,无 lookahead
    报告中的主要优势 长语音稳定性 重建质量、常规 WER、首包延迟

    25Hz 路径不是简单的“更高帧率高配版”。它用单码本降低 LM 输出结构复杂度,却把高保真解码交给分块扩散;12Hz 路径把每帧的信息容量扩到 16 层,LM 只预测主码本,剩余层由 MTP 补齐。两者优化的是不同瓶颈。

    25Hz 解码器需要未来块:chunk size 为 8 时,LM 要先生成 16 个 token,DiT 才能生成首个 8-token mel chunk。12Hz 解码器只看左上下文,理论上单 token 即可出声;报告为了减少调度开销,把 4 个 token(320 ms 语音)定义为一个 packet。

    Table 2 的并发 1 结果:

    模型 LM TTFP Tokenizer decode First-packet latency RTF
    25Hz-1.7B 125 ms 25 ms 150 ms 0.253
    25Hz-0.6B 113 ms 25 ms 138 ms 0.234
    12Hz-1.7B 97 ms 4 ms 101 ms 0.313
    12Hz-0.6B 93 ms 4 ms 97 ms 0.288

    这里的 97 ms 是 12Hz-0.6B、并发 1、内部 vLLM V0 与特定优化下的端到端首包值,不能脱离模型规模、并发和未具名硬件泛化成所有 Qwen3-TTS 请求的固定延迟。

    预训练先建立多语言文本到语音的单调映射,再用高质量数据继续预训练以减少噪声数据造成的幻觉,最后扩大长上下文并上采样长语音。所有输入统一成 ChatML;控制指令作为前缀进入同一语言建模任务。

    这套统一主要发生在接口与 backbone 层:

    1. Base 支持 zero-shot voice cloning。
    2. VoiceDesign 根据描述创造未见过的新声音。
    3. CustomVoice 使用预定义/微调声音并接收风格指令。
    4. 25Hz VoiceEditing 可在参考说话人上编辑属性。

    因此“统一框架”不等于“单一 checkpoint 拥有所有表 1 勾选项”。

    Qwen-TTS-Tokenizer-12Hz 在 LibriSpeech test-clean 的报告结果为 PESQ-WB 3.21、PESQ-NB 3.68、STOI 0.96、UTMOS 4.16、SIM 0.95,均高于表中 SpeechTokenizer、X-codec、XY-Tokenizer、Mimi 与 FireRedTTS 2 tokenizer。

    • Seed-TTS:12Hz-1.7B 的 test-zh / test-en WER 为 0.77 / 1.24;其中 test-en 为表中最低,test-zh 次于 CosyVoice3 的 0.71。25Hz-1.7B 为 1.10 / 1.49。
    • 10 语种内容一致性:Qwen3-TTS 在中文、英文、意大利语、法语、韩语、俄语 6 种语言取得最低 WER;德语、葡萄牙语、西班牙语、日语并非全部领先。
    • 10 语种说话人相似度:每种语言中至少一个 Qwen3-TTS 变体高于报告列出的 MiniMax 与 ElevenLabs 对应值。
    • 跨语言 zh→ko:12Hz-1.7B error rate 为 4.82,CosyVoice3 为 14.4;但 zh→ja、en→ja、ja→zh 等方向仍有 CosyVoice3 更优。

    Voice Design 的 Qwen3-TTS-12Hz-1.7B 在报告所列开源模型中整体领先;但 Target Speaker 表中 Gemini-flash/pro 的多数 APS、DSD、RP 仍更高,不能概括成全面超过商业系统。

    Table 10 的长语音 WER:

    • 25Hz-1.7B-CustomVoice:long-zh / long-en = 1.517 / 1.225
    • 12Hz-1.7B-CustomVoice:long-zh / long-en = 2.356 / 2.812。
    • 25Hz 在此项优于 12Hz,说明更细时间分辨率可能有利于超长序列的单层 AR 稳定性。
    • 原文数字冲突:长语音正文写 25Hz-1.7B 的 WER 为 1.533 / 1.571,紧邻 Table 10 却是 1.517 / 1.225。完整译稿保留两组原始数字;本文做表格比较时使用 Table 10 值,不替作者静默修正。
    • 占位符未替换:引言原文写“一组 x 个精选声音”,x 明显仍是占位符。表 1 的 10 行是模型变体,不是声音数量,不能拿来补这个值。
    • 内部设置限制复现:长语音集为内部 100 条中英文本;流式效率使用内部 vLLM V0 后端和“一种典型计算资源”,未给出具体 GPU 与完整部署配置。
    • 指标边界:WER、speaker cosine similarity、PESQ/UTMOS 不能穷尽自然度、情感可信度和真实用户偏好;部分商业基线版本也会随时间变化。
    • SOTA 需绑定任务:报告确实给出多项强结果,但不是 10 种语言、所有跨语言方向、所有控制设定都第一。