Qwen 音频四模型对比
Qwen 2026 年 7 月的音频产品线不是“一个模型的四种模式”:Music、TTS 与 General 是三套生成系统,ASR Flash 则是输入音频、输出文字的托管识别服务族;四者的任务方向、架构公开度和部署边界都不同。
| 维度 | Qwen-Music | Qwen-Audio-3.0-TTS | Qwen-Audio-3.0-Gen-Preview | Qwen-Audio-3.0-ASR-Flash |
|---|---|---|---|---|
| 任务方向 | 文本/旋律→音乐 | 文本/参考声→语音 | 结构化描述→混合音频 | 音频→文字 |
| 核心任务 | 完整歌曲与翻唱 | 生产级语音合成/克隆 | 通用音频与富时间线混合场景 | 实时/文件语音识别 |
| 典型输入 | 描述+歌词+音乐属性;可选参考旋律 | 文本+参考语音+自然语言/行内控制 | 自由场景描述、对白、角色、事件时间线;可选参考语音 | 音频流、URL 或 Base64;可选热词与 prompt context |
| 典型输出 | 分钟级 48 kHz stereo 完整歌曲 | 流式/单次最长约 3 分钟语音;speaker-adapted 48 kHz | 48 kHz stereo 完整 mixed waveform | 带规范化标点的文本;Filetrans 可分离说话人 |
| 已公开结构 | 3B AR LM + 1.3B FM DiT + VAE | AR LM + chunk FM + causal BigVGAN | NAR DiT + shared continuous VAE | 未公开模型结构;只公开 API/能力规格 |
| 显式控制 | Melody-CoT(旋律链式规划) | LM hidden states + 五阶段训练 | 富时间线 record | 热词 + prompt context;三种服务端点 |
| 专项优势 | 旋律/结构、完整人声歌曲、翻唱 | 低延迟、克隆、语言/方言、可控与鲁棒 | 多角色一致性、事件重叠与时间定位 | 30 语言、中文方言/口音、长文件与专业词 |
| 主要短板 | 私有 5M 小时数据、黑箱基线 | 规模/数据不公开、自动裁判 | Preview、内部 benchmark、event recall 权衡 | 无技术报告/公开权重/公开 WER-CER 对比 |
1. 四者先按任务方向分组
Section titled “1. 四者先按任务方向分组”- 生成侧:Qwen-Music、Qwen-Audio-3.0-TTS 与 Qwen-Audio-3.0-Gen-Preview 都把符号条件转成声音。
- 理解侧:Qwen-Audio-3.0-ASR-Flash 把声音转成文本,是独立的 ASR 云服务,不是 Gen-Preview 的“转录模式”。
因此前三者可以直接比较生成表示与声学解码器;ASR 只能在产品矩阵中比较输入输出、接口和覆盖,不能在没有官方披露时补写同一套内部架构。
2. 三个生成模型优化的“时间尺度”不同
Section titled “2. 三个生成模型优化的“时间尺度”不同”- Qwen-Music 优化的是分钟级音乐结构:verse/chorus、旋律重复、歌词演唱、编配推进和 stereo production。
- Qwen-Audio-3.0-TTS 优化的是语音信息密度与实时性:发音内容、说话人身份、韵律、语言/方言、流式和劣质参考鲁棒性。
- Qwen-Audio-3.0-Gen-Preview 优化的是场景时间轴:对白轮次、角色跨轮一致、环境持续、事件起止/重叠和整段混音。
三者都处理长音频,但“长”并非同一个问题:歌曲是结构长程性,TTS 是文本与声音稳定性,Gen 是异质声源的时间组织。
ASR 的长程问题则是持续输入、文本上下文与文件切分:Streaming 时长不限,Filetrans 面向最长 12 小时文件,短版 Flash 面向 5 分钟同步请求。
3. 离散 token 与连续 latent 的分工不同
Section titled “3. 离散 token 与连续 latent 的分工不同”Qwen-Music 和 TTS 都保留自回归语义层,因为旋律/歌词或文本/发音适合按序规划;但它们都不再指望离散 token 单独承担最终音质:
- Qwen-Music 的 25 Hz token 是音乐语义草图,最终由连续 DiT+VAE 渲染。
- TTS 的 12.5 Hz token 是语音语义计划,FM 额外读取 LM hidden states,绕开 token ID 信息瓶颈。
- Gen-Preview 直接在共享连续 VAE latent 上 NAR 生成,没有外部 AR token planner;复杂规划被前移到结构化文字条件和训练数据。
因此三条线共同反映一个趋势:离散 token 擅长长程语义组织,连续生成器擅长高保真声学;是否保留 AR 层取决于任务对顺序规划与流式的需求。
4. “控制”落在不同中间表示或输入增强上
Section titled “4. “控制”落在不同中间表示或输入增强上”| 模型 | 控制接口 | 为何有效 | 代价 |
|---|---|---|---|
| Qwen-Music | Melody token、段落标签、歌词、音乐 tags | 将抽象风格与具体旋律分开 | 旋律条件过强会压制重新编配 |
| TTS | 自然语言 instruction、86 个 inline tag、参考音频 | 全局风格与局部事件都可控制 | 多属性自动评测可靠性有限 |
| Gen-Preview | 角色 profile、事件起止、scene/ambience、primary text | 把声源 owner 和时间 scope 显式绑定 | 依赖 prompt enhancer 和复杂结构化数据 |
| ASR Flash | 热词、prompt context、端点选择 | 向识别器补充专业词和任务背景 | 增益未用公开 WER/CER 定量披露 |
5. 四者并非能力严格包含
Section titled “5. 四者并非能力严格包含”- Gen-Preview 能生成 speech/music/general audio,不代表它在专门歌曲的音乐性、歌词可懂度和专业 production 上取代 Qwen-Music。
- Gen-Preview 在 Seed-TTS speaker SIM 很强,不代表它比 TTS 模型更适合实时客服、方言合成、低延迟流式或稳定 text normalization。
- TTS 能插入笑声、咳嗽等事件,不等于它能组织多角色、背景乐、环境与 Foley 的完整场景。
- Qwen-Music 的翻唱是“保旋律、换风格”,与 TTS 的“保说话人、换文本”和 Gen 的“保角色、组场景”是三种不同 reference conditioning。
- ASR Flash 能识别歌曲或专业语音,也不意味着它能编辑、合成或继续生成这些声音。
6. 命名容易混淆的两组关系
Section titled “6. 命名容易混淆的两组关系”Qwen-Audio-3.0-TTS 论文把 Qwen3-TTS-12Hz-1.7B-Base 当作基线,说明二者不是同一模型:
| 系列 | 时间/定位 | 本组关系 |
|---|---|---|
| Qwen3-TTS | 2026.01 报告的开放模型家族:0.6B/1.7B × 12Hz/25Hz,含 Base/CustomVoice/VoiceDesign/VoiceEditing | 三篇新报告中的比较基线,不是“Audio 3 TTS”的简称 |
| Qwen-Audio-3.0-TTS | 2026.07 生产型新系统,Plus/Flash 服务线 | 本组三模型之一 |
命名相近,但架构、训练报告与产品 ID 都应分开记录。Qwen3-TTS 由离散 speech tokenizer 直接重建波形:25Hz 路径使用单码本 + block-wise DiT,12Hz 路径使用 1 个语义码本 + 15 层 residual VQ + 因果 ConvNet;Qwen-Audio-3.0-TTS 则让 chunk Flow Matching 直接读取 LM hidden states,属于后续的另一套生产系统。
同理,qwen-audio-3.0-asr-flash* 与较早的 qwen3-asr-flash* 也由官方分开列为两代产品。前者突出热词、prompt context 与 Filetrans 的 speaker diarization,后者有独立 Qwen3-ASR 技术报告和开源模型;不能把旧论文的参数、训练集或架构直接归给新服务。
7. Qwen-Audio-VAE 是基础设施报告,不是第五个产品模型
Section titled “7. Qwen-Audio-VAE 是基础设施报告,不是第五个产品模型”资料摘要:Qwen-Audio-VAE 单独研究 24 kHz mono、12.5 Hz × 128 维连续潜表示,以及 500 万小时多领域训练和编码器加速。它是面向通用音频生成的 representation backbone 技术报告,不是 Music / TTS / Gen / ASR 之外的第五类用户任务。
尤其要与 Gen-Preview 的 shared VAE 分开:后者是 48 kHz stereo、25 Hz × 128 维,并加入冻结 Qwen2.5-3B 的 semantic continuation 训练。两篇报告可以共同说明 Qwen 对连续音频潜空间的路线,但不能相互补齐未公开实现细节。
- 写歌、歌词演唱、参考旋律翻唱:优先 Qwen-Music。
- 播客旁白、客服、配音、声音克隆、多语种/方言、实时语音:优先 Qwen-Audio-3.0-TTS。
- 电影/游戏/广播剧场景,一次生成对白+环境+动作音效+背景结构:优先 Qwen-Audio-3.0-Gen-Preview。
- 实时字幕、会议/访谈转写、专业词识别:选 Qwen-Audio-3.0-ASR-Flash;实时用 Streaming,长文件和分说话人用 Filetrans,短同步请求用 Flash。
- 只需短音效或开源本地部署:还需对比 资料摘要:MOSS-SoundEffect v2、资料摘要:AudioX、资料摘要:Dasheng AudioGen;这三篇报告并未给出完整开放权重承诺。
共同趋势与判断
Section titled “共同趋势与判断”- 语义—声学分层成为共同架构语言:显式 token/结构化文字负责意图,连续 latent/flow/DiT 负责声音。
- 数据结构比单纯规模更重要:质量分桶、角色绑定、时间线、反事实 recipe、高质量退火直接决定可控性。
- 后训练进入音频主链路:DPO、GSPO、GRPO、DiffRO、Flow-GRPO 分别优化音乐偏好、token 规划和声学波形。
- 评测仍是最大薄弱环节:大量结论依赖内部 benchmark、LLM/LALM-as-judge 和动态商业 API,必须保留“指标在哪些裁判下成立”的限定。
- 产品矩阵同时覆盖生成与理解:General 模型没有吞并 Music/TTS 专模,ASR 也不是它们的附属模式;专模继续保留结构、延迟或输入输出方向上的优势。
- 公开度不一致:三篇生成报告可审计架构与实验;ASR Flash 当前只有产品文档,因此比较必须把“论文证据”和“云服务规格”分开。