跳转到内容

输入关键词开始搜索

    Qwen 音频四模型对比

    对比分析更新 2026-08-12置信度 high#音频生成#音频理解#语音识别#综述#深度

    Qwen 2026 年 7 月的音频产品线不是“一个模型的四种模式”:Music、TTS 与 General 是三套生成系统,ASR Flash 则是输入音频、输出文字的托管识别服务族;四者的任务方向、架构公开度和部署边界都不同。

    维度 Qwen-Music Qwen-Audio-3.0-TTS Qwen-Audio-3.0-Gen-Preview Qwen-Audio-3.0-ASR-Flash
    任务方向 文本/旋律→音乐 文本/参考声→语音 结构化描述→混合音频 音频→文字
    核心任务 完整歌曲与翻唱 生产级语音合成/克隆 通用音频与富时间线混合场景 实时/文件语音识别
    典型输入 描述+歌词+音乐属性;可选参考旋律 文本+参考语音+自然语言/行内控制 自由场景描述、对白、角色、事件时间线;可选参考语音 音频流、URL 或 Base64;可选热词与 prompt context
    典型输出 分钟级 48 kHz stereo 完整歌曲 流式/单次最长约 3 分钟语音;speaker-adapted 48 kHz 48 kHz stereo 完整 mixed waveform 带规范化标点的文本;Filetrans 可分离说话人
    已公开结构 3B AR LM + 1.3B FM DiT + VAE AR LM + chunk FM + causal BigVGAN NAR DiT + shared continuous VAE 未公开模型结构;只公开 API/能力规格
    显式控制 Melody-CoT(旋律链式规划) LM hidden states + 五阶段训练 R=(G,P,E,U)R=(G,P,E,U) 富时间线 record 热词 + prompt context;三种服务端点
    专项优势 旋律/结构、完整人声歌曲、翻唱 低延迟、克隆、语言/方言、可控与鲁棒 多角色一致性、事件重叠与时间定位 30 语言、中文方言/口音、长文件与专业词
    主要短板 私有 5M 小时数据、黑箱基线 规模/数据不公开、自动裁判 Preview、内部 benchmark、event recall 权衡 无技术报告/公开权重/公开 WER-CER 对比
    • 生成侧:Qwen-Music、Qwen-Audio-3.0-TTS 与 Qwen-Audio-3.0-Gen-Preview 都把符号条件转成声音。
    • 理解侧:Qwen-Audio-3.0-ASR-Flash 把声音转成文本,是独立的 ASR 云服务,不是 Gen-Preview 的“转录模式”。

    因此前三者可以直接比较生成表示与声学解码器;ASR 只能在产品矩阵中比较输入输出、接口和覆盖,不能在没有官方披露时补写同一套内部架构。

    2. 三个生成模型优化的“时间尺度”不同

    Section titled “2. 三个生成模型优化的“时间尺度”不同”
    • Qwen-Music 优化的是分钟级音乐结构:verse/chorus、旋律重复、歌词演唱、编配推进和 stereo production。
    • Qwen-Audio-3.0-TTS 优化的是语音信息密度与实时性:发音内容、说话人身份、韵律、语言/方言、流式和劣质参考鲁棒性。
    • Qwen-Audio-3.0-Gen-Preview 优化的是场景时间轴:对白轮次、角色跨轮一致、环境持续、事件起止/重叠和整段混音。

    三者都处理长音频,但“长”并非同一个问题:歌曲是结构长程性,TTS 是文本与声音稳定性,Gen 是异质声源的时间组织。

    ASR 的长程问题则是持续输入、文本上下文与文件切分:Streaming 时长不限,Filetrans 面向最长 12 小时文件,短版 Flash 面向 5 分钟同步请求。

    3. 离散 token 与连续 latent 的分工不同

    Section titled “3. 离散 token 与连续 latent 的分工不同”

    Qwen-Music 和 TTS 都保留自回归语义层,因为旋律/歌词或文本/发音适合按序规划;但它们都不再指望离散 token 单独承担最终音质:

    • Qwen-Music 的 25 Hz token 是音乐语义草图,最终由连续 DiT+VAE 渲染。
    • TTS 的 12.5 Hz token 是语音语义计划,FM 额外读取 LM hidden states,绕开 token ID 信息瓶颈。
    • Gen-Preview 直接在共享连续 VAE latent 上 NAR 生成,没有外部 AR token planner;复杂规划被前移到结构化文字条件和训练数据。

    因此三条线共同反映一个趋势:离散 token 擅长长程语义组织,连续生成器擅长高保真声学;是否保留 AR 层取决于任务对顺序规划与流式的需求。

    4. “控制”落在不同中间表示或输入增强上

    Section titled “4. “控制”落在不同中间表示或输入增强上”
    模型 控制接口 为何有效 代价
    Qwen-Music Melody token、段落标签、歌词、音乐 tags 将抽象风格与具体旋律分开 旋律条件过强会压制重新编配
    TTS 自然语言 instruction、86 个 inline tag、参考音频 全局风格与局部事件都可控制 多属性自动评测可靠性有限
    Gen-Preview 角色 profile、事件起止、scene/ambience、primary text 把声源 owner 和时间 scope 显式绑定 依赖 prompt enhancer 和复杂结构化数据
    ASR Flash 热词、prompt context、端点选择 向识别器补充专业词和任务背景 增益未用公开 WER/CER 定量披露
    • Gen-Preview 能生成 speech/music/general audio,不代表它在专门歌曲的音乐性、歌词可懂度和专业 production 上取代 Qwen-Music。
    • Gen-Preview 在 Seed-TTS speaker SIM 很强,不代表它比 TTS 模型更适合实时客服、方言合成、低延迟流式或稳定 text normalization。
    • TTS 能插入笑声、咳嗽等事件,不等于它能组织多角色、背景乐、环境与 Foley 的完整场景。
    • Qwen-Music 的翻唱是“保旋律、换风格”,与 TTS 的“保说话人、换文本”和 Gen 的“保角色、组场景”是三种不同 reference conditioning。
    • ASR Flash 能识别歌曲或专业语音,也不意味着它能编辑、合成或继续生成这些声音。

    Qwen-Audio-3.0-TTS 论文把 Qwen3-TTS-12Hz-1.7B-Base 当作基线,说明二者不是同一模型:

    系列 时间/定位 本组关系
    Qwen3-TTS 2026.01 报告的开放模型家族:0.6B/1.7B × 12Hz/25Hz,含 Base/CustomVoice/VoiceDesign/VoiceEditing 三篇新报告中的比较基线,不是“Audio 3 TTS”的简称
    Qwen-Audio-3.0-TTS 2026.07 生产型新系统,Plus/Flash 服务线 本组三模型之一

    命名相近,但架构、训练报告与产品 ID 都应分开记录。Qwen3-TTS 由离散 speech tokenizer 直接重建波形:25Hz 路径使用单码本 + block-wise DiT,12Hz 路径使用 1 个语义码本 + 15 层 residual VQ + 因果 ConvNet;Qwen-Audio-3.0-TTS 则让 chunk Flow Matching 直接读取 LM hidden states,属于后续的另一套生产系统。

    同理,qwen-audio-3.0-asr-flash* 与较早的 qwen3-asr-flash* 也由官方分开列为两代产品。前者突出热词、prompt context 与 Filetrans 的 speaker diarization,后者有独立 Qwen3-ASR 技术报告和开源模型;不能把旧论文的参数、训练集或架构直接归给新服务。

    7. Qwen-Audio-VAE 是基础设施报告,不是第五个产品模型

    Section titled “7. Qwen-Audio-VAE 是基础设施报告,不是第五个产品模型”

    资料摘要:Qwen-Audio-VAE 单独研究 24 kHz mono、12.5 Hz × 128 维连续潜表示,以及 500 万小时多领域训练和编码器加速。它是面向通用音频生成的 representation backbone 技术报告,不是 Music / TTS / Gen / ASR 之外的第五类用户任务。

    尤其要与 Gen-Preview 的 shared VAE 分开:后者是 48 kHz stereo、25 Hz × 128 维,并加入冻结 Qwen2.5-3B 的 semantic continuation 训练。两篇报告可以共同说明 Qwen 对连续音频潜空间的路线,但不能相互补齐未公开实现细节。

    • 写歌、歌词演唱、参考旋律翻唱:优先 Qwen-Music。
    • 播客旁白、客服、配音、声音克隆、多语种/方言、实时语音:优先 Qwen-Audio-3.0-TTS。
    • 电影/游戏/广播剧场景,一次生成对白+环境+动作音效+背景结构:优先 Qwen-Audio-3.0-Gen-Preview。
    • 实时字幕、会议/访谈转写、专业词识别:选 Qwen-Audio-3.0-ASR-Flash;实时用 Streaming,长文件和分说话人用 Filetrans,短同步请求用 Flash。
    • 只需短音效或开源本地部署:还需对比 资料摘要:MOSS-SoundEffect v2资料摘要:AudioX资料摘要:Dasheng AudioGen;这三篇报告并未给出完整开放权重承诺。
    1. 语义—声学分层成为共同架构语言:显式 token/结构化文字负责意图,连续 latent/flow/DiT 负责声音。
    2. 数据结构比单纯规模更重要:质量分桶、角色绑定、时间线、反事实 recipe、高质量退火直接决定可控性。
    3. 后训练进入音频主链路:DPO、GSPO、GRPO、DiffRO、Flow-GRPO 分别优化音乐偏好、token 规划和声学波形。
    4. 评测仍是最大薄弱环节:大量结论依赖内部 benchmark、LLM/LALM-as-judge 和动态商业 API,必须保留“指标在哪些裁判下成立”的限定。
    5. 产品矩阵同时覆盖生成与理解:General 模型没有吞并 Music/TTS 专模,ASR 也不是它们的附属模式;专模继续保留结构、延迟或输入输出方向上的优势。
    6. 公开度不一致:三篇生成报告可审计架构与实验;ASR Flash 当前只有产品文档,因此比较必须把“论文证据”和“云服务规格”分开。