资料摘要:Qwen-Music
Qwen Team 的完整歌曲生成系统,将语义作曲与声学生成拆开:Qwen-Music-Tokenizer 把歌曲压成 25 Hz 单码本语义 token,3B Qwen-Music-LLM 用 Melody-CoT 先规划人声旋律再生成整曲 token,1.3B Qwen-Music-Render 通过 Flow-Matching DiT、Spec-VAE 与 Band-Mode Refiner 渲染 48 kHz 立体声。模型支持文本生歌与参考旋律翻唱,并在超过 500 万小时多语言音乐上训练。
🔒 Qwen-Music Technical Report
- 三段式架构:Tokenizer 负责把歌曲变成适合 LM 的紧凑语义序列;LLM 负责分钟级作曲与结构规划;Render 负责补回离散 token 丢失的音色、相位、高频和立体声细节。
- Music Semantic Tokens:0.6B、24 层 Conformer 经 BestRQ→因果适配→CTC/Mel/Chroma 多任务 SFT→VQ 四阶段训练,产出 25 Hz、单码本 32,768 项、375 bit/s 的音乐语义 token。
- Melody-CoT:把人声音高轨迹转成 6.25 Hz 相对 MIDI token,让 LLM 在整曲 token 前显式生成旋律计划;翻唱时则把参考旋律 token 作为条件,实现“保旋律、换编曲/音色/风格”。
- 高保真渲染:1.3B DiT 在 128 维连续潜空间做条件流匹配;Spec-VAE 解码复数频谱,Band-Mode Refiner 按低/中/高频分别修相位或幅度,最终合成 48 kHz stereo。
- 规模化训练:Qwen-Music-LLM 以 Qwen3.5-Omni 的 3B dense 变体初始化,在超过 500 万小时、数百种语言的音乐上训练;预训练采用分质量课程,后训练依次为 SFT、离线 DPO、在线 GSPO。
- 结果边界:600 条中英提示上,16 个音乐性/音质指标中 13 项第一;50 名专业评审更偏好 Qwen-Music 胜过 MiniMax/Mureka/Suno V5,与 Suno V5.5 基本持平。翻唱中“逐段旋律”更保旋律,“唯一段落旋律”更服从新风格。
任务定位:完整歌曲,而非短音乐片段
Section titled “任务定位:完整歌曲,而非短音乐片段”Qwen-Music 同时支持两类任务:
- Text-to-Music:输入自然语言、歌词与音乐属性,生成带完整人声演唱的原创歌曲。
- Cover Song Generation:输入参考歌曲/旋律,再指定目标风格、编曲、人声音色与性别,生成重新演绎版本。
系统先由 prompt rewriter 把自由描述整理为音乐标签、歌手属性、编制和结构化歌词,再进入“语义作曲→声学渲染”两级生成。它不是直接在波形上做一个超长扩散过程,也不是仅靠 codec LM 还原声音,而是有意把长程结构和高频声学细节分治。
Qwen-Music-Tokenizer:25 Hz 单码本语义接口
Section titled “Qwen-Music-Tokenizer:25 Hz 单码本语义接口”Tokenizer 输入 24 kHz mono 波形的 log-Mel 特征,卷积前端降采样到 25 Hz,骨干为 24 层、宽度 1024、16 头、约 0.6B 参数的 Conformer。四阶段训练逐步加入约束:
| 阶段 | 目标 | 注意力 | 音频长度 | 作用 |
|---|---|---|---|---|
| 1 | BestRQ 掩码预测 | 双向 | 30s crop | 从无标签音乐学习通用表示 |
| 2 | BestRQ 因果适配 | 因果 | 30s crop | 适配后续自回归建模 |
| 3 | CTC + Mel + Chroma | 因果 | 完整歌曲 ≤300s | 同时保留歌词、旋律与和声 |
| 4 | SFT + 单码本 VQ | 因果 | 完整歌曲 ≤300s | 离散化并保持下游所需信息 |
码本有 项,利用率超过 99%;每 40 ms 一个 token,因此码率为 bit/s。部署时只保留 VQ 插入点之前的编码器和量化器,后续监督头全部丢弃。
Qwen-Music-LLM 与 Melody-CoT
Section titled “Qwen-Music-LLM 与 Melody-CoT”Qwen-Music-LLM 是由 Qwen3.5-Omni 3B dense 变体初始化的自回归模型,输入音乐标签、歌词、可选旋律 token,输出 Music Semantic Tokens。论文认为只给“风格+歌词”时,模型必须同时决定旋律、段落与编配,规划难度过高,因此增加 Melody-CoT(旋律链式规划):
- RMVPE 先提取 50 Hz 人声音高;8× median pooling 得到 6.25 Hz 粗旋律。
- 音高转 MIDI 后减去全段有声帧中位数,只保留相对半音轮廓;再裁剪进 256 项词表,其中一个 token 表示无声。
- 训练混合三种序列:
[text, music]、[text, section melody, music]、[text, unique-section melody, music]。 - section-level 保留每个有歌词段落的旋律,复制更准;unique-section-level 每种段落标签只采一个代表,条件更弱,更利于改编风格。
这不是把自然语言“思维过程”写出来,而是用可生成、可替换、可从参考音频提取的旋律 token 作为中间计划。
Qwen-Music-Render:语义草图到 48 kHz 立体声
Section titled “Qwen-Music-Render:语义草图到 48 kHz 立体声”渲染器包含三个阶段:
- DiT:1.3B、32 层、宽 1024、24 头;在 128 维、25 Hz 连续潜变量上做 conditional flow matching。每个 block 同时接收逐帧 Music Semantic Tokens,以及 Qwen3-Embedding-0.6B 编码的音乐标签与歌词。
- Spec-VAE:把 48 kHz stereo 的复数 STFT 压成 128 维、25 Hz 潜序列,总压缩比 192×,再解码为粗频谱。
- Band-Mode Refiner:低频只修相位,中频同时修幅度与相位,高频只修幅度;零初始化保证刚接入时不破坏 VAE 输出。
CFG 的无条件分支只丢掉文字条件,保留 LM token 这一主渲染骨架。消融显示“标签+歌词 + text-drop CFG + Spec-VAE”是整体最佳配置。DiT 最长训练到 6 分钟,对应 9,000 个 25 Hz latent frame。
数据课程与偏好对齐
Section titled “数据课程与偏好对齐”内部音乐质量模型先在每个 genre 内把样本分为 Q1–Q7,去掉最低 Q7,避免质量评分被主流风格垄断。预训练分三步:
- Q3–Q6:覆盖超过 500 万小时主体数据,动态地从低质量向高质量采样,并混入 20% 纯器乐。
- Q2:学习率退火,巩固结构、连贯性与音质。
- Q1 + 精选高质量样本:改善音乐性、可控性和指令遵循。
后训练再走 SFT 冷启动→迭代离线 DPO→在线 GSPO。奖励包含内部音乐性 MOS、Qwen3.5-Omni 的标签遵循与 Qwen3-ASR 的歌词可懂度。流程从稳定的监督分布逐步走向更强的 on-policy 探索。
评测结果与应如何解读
Section titled “评测结果与应如何解读”- 专业人评:50 人、每对样本 3 位专家;Qwen-Music 对 MiniMax 2.5+/2.6、Mureka V8、Suno V5 的胜率为 59.1%/66.7%/58.3%/55.4%,对 Suno V5.5 为 50.3%,更合理的解读是“相当”而非显著领先。
- 客观指标:中英各 300 条,SongBench/SongEval/AudioBox-Aesthetic 共 16 项中 13 项第一;歌词 PER 6.10,逊于 Suno V5.5 的 4.19。
- 翻唱权衡:AI 参考集上 section-level Melody MAE 1.48 最低,但 unique-section 的 genre/mood/乐器/声线控制明显更好;说明旋律约束越强,重新编配空间越小。
- 渲染器:Band-Mode Refiner 相对 Spec-VAE 单体改善全部报告指标,Mel Distance 从 0.572 降到 0.461。
局限与批判性判断
Section titled “局限与批判性判断”- 不可复现性高:500 万小时数据、质量奖励模型、Qwen3.5/Qwen3-ASR 打分管线和模型权重均未在技术报告中完整公开。
- 商业基线难严格控制:Suno/MiniMax/Mureka 都是随时更新的黑箱 API;采样参数与版本漂移会影响对比。
- 自动评测占比高:13/16 的“领先”依赖 SongBench、SongEval、AudioBox 等模型化指标;人评虽专业,但对 Suno V5.5 只有 50.3% 对 49.7%,报告未给置信区间。
- 真正创新集中于接口与训练系统:Tokenizer、AR LM、DiT、VAE、DPO/GSPO 各自不是新范式;更有价值的是 Melody-CoT 中间表示、语义/声学分层和完整的质量课程。
- 论文:Qwen-Music Technical Report,arXiv:2607.11699v2,2026-07-27。
- 团队:Qwen Team。
- 规模:Tokenizer 0.6B;Qwen-Music-LLM 3B;Render DiT 1.3B;训练音乐超过 500 万小时。
- 输出:48 kHz stereo;歌曲语义 token 25 Hz;旋律 token 6.25 Hz。
- 任务:文本生歌、参考旋律翻唱;评测含 600 条中英原创提示、400 条中英翻唱提示及 50 名专业人评。