跳转到内容

输入关键词开始搜索

    资料摘要:Qwen-Music

    论文摘要更新 2026-08-06置信度 high待阅读原始来源 ↗#音频生成#音乐生成#语言模型#流匹配#深度

    Qwen Team 的完整歌曲生成系统,将语义作曲声学生成拆开:Qwen-Music-Tokenizer 把歌曲压成 25 Hz 单码本语义 token,3B Qwen-Music-LLM 用 Melody-CoT 先规划人声旋律再生成整曲 token,1.3B Qwen-Music-Render 通过 Flow-Matching DiT、Spec-VAE 与 Band-Mode Refiner 渲染 48 kHz 立体声。模型支持文本生歌与参考旋律翻唱,并在超过 500 万小时多语言音乐上训练。

    🔒 Qwen-Music Technical Report

    • 三段式架构:Tokenizer 负责把歌曲变成适合 LM 的紧凑语义序列;LLM 负责分钟级作曲与结构规划;Render 负责补回离散 token 丢失的音色、相位、高频和立体声细节。
    • Music Semantic Tokens:0.6B、24 层 Conformer 经 BestRQ→因果适配→CTC/Mel/Chroma 多任务 SFT→VQ 四阶段训练,产出 25 Hz、单码本 32,768 项、375 bit/s 的音乐语义 token。
    • Melody-CoT:把人声音高轨迹转成 6.25 Hz 相对 MIDI token,让 LLM 在整曲 token 前显式生成旋律计划;翻唱时则把参考旋律 token 作为条件,实现“保旋律、换编曲/音色/风格”。
    • 高保真渲染:1.3B DiT 在 128 维连续潜空间做条件流匹配;Spec-VAE 解码复数频谱,Band-Mode Refiner 按低/中/高频分别修相位或幅度,最终合成 48 kHz stereo。
    • 规模化训练:Qwen-Music-LLM 以 Qwen3.5-Omni 的 3B dense 变体初始化,在超过 500 万小时、数百种语言的音乐上训练;预训练采用分质量课程,后训练依次为 SFT、离线 DPO、在线 GSPO。
    • 结果边界:600 条中英提示上,16 个音乐性/音质指标中 13 项第一;50 名专业评审更偏好 Qwen-Music 胜过 MiniMax/Mureka/Suno V5,与 Suno V5.5 基本持平。翻唱中“逐段旋律”更保旋律,“唯一段落旋律”更服从新风格。
    Qwen-Music 三段式生成架构
    Qwen-Music 三段式生成架构

    任务定位:完整歌曲,而非短音乐片段

    Section titled “任务定位:完整歌曲,而非短音乐片段”

    Qwen-Music 同时支持两类任务:

    1. Text-to-Music:输入自然语言、歌词与音乐属性,生成带完整人声演唱的原创歌曲。
    2. Cover Song Generation:输入参考歌曲/旋律,再指定目标风格、编曲、人声音色与性别,生成重新演绎版本。

    系统先由 prompt rewriter 把自由描述整理为音乐标签、歌手属性、编制和结构化歌词,再进入“语义作曲→声学渲染”两级生成。它不是直接在波形上做一个超长扩散过程,也不是仅靠 codec LM 还原声音,而是有意把长程结构和高频声学细节分治。

    Qwen-Music-Tokenizer:25 Hz 单码本语义接口

    Section titled “Qwen-Music-Tokenizer:25 Hz 单码本语义接口”

    Tokenizer 输入 24 kHz mono 波形的 log-Mel 特征,卷积前端降采样到 25 Hz,骨干为 24 层、宽度 1024、16 头、约 0.6B 参数的 Conformer。四阶段训练逐步加入约束:

    阶段 目标 注意力 音频长度 作用
    1 BestRQ 掩码预测 双向 30s crop 从无标签音乐学习通用表示
    2 BestRQ 因果适配 因果 30s crop 适配后续自回归建模
    3 CTC + Mel + Chroma 因果 完整歌曲 ≤300s 同时保留歌词、旋律与和声
    4 SFT + 单码本 VQ 因果 完整歌曲 ≤300s 离散化并保持下游所需信息

    码本有 215=32,7682^{15}=32{,}768 项,利用率超过 99%;每 40 ms 一个 token,因此码率为 25×15=37525\times15=375 bit/s。部署时只保留 VQ 插入点之前的编码器和量化器,后续监督头全部丢弃。

    Qwen-Music-LLM 是由 Qwen3.5-Omni 3B dense 变体初始化的自回归模型,输入音乐标签、歌词、可选旋律 token,输出 Music Semantic Tokens。论文认为只给“风格+歌词”时,模型必须同时决定旋律、段落与编配,规划难度过高,因此增加 Melody-CoT(旋律链式规划)

    • RMVPE 先提取 50 Hz 人声音高;8× median pooling 得到 6.25 Hz 粗旋律。
    • 音高转 MIDI 后减去全段有声帧中位数,只保留相对半音轮廓;再裁剪进 256 项词表,其中一个 token 表示无声。
    • 训练混合三种序列:[text, music][text, section melody, music][text, unique-section melody, music]
    • section-level 保留每个有歌词段落的旋律,复制更准;unique-section-level 每种段落标签只采一个代表,条件更弱,更利于改编风格。

    这不是把自然语言“思维过程”写出来,而是用可生成、可替换、可从参考音频提取的旋律 token 作为中间计划

    Qwen-Music-Render:语义草图到 48 kHz 立体声

    Section titled “Qwen-Music-Render:语义草图到 48 kHz 立体声”

    渲染器包含三个阶段:

    1. DiT:1.3B、32 层、宽 1024、24 头;在 128 维、25 Hz 连续潜变量上做 conditional flow matching。每个 block 同时接收逐帧 Music Semantic Tokens,以及 Qwen3-Embedding-0.6B 编码的音乐标签与歌词。
    2. Spec-VAE:把 48 kHz stereo 的复数 STFT 压成 128 维、25 Hz 潜序列,总压缩比 192×,再解码为粗频谱。
    3. Band-Mode Refiner:低频只修相位,中频同时修幅度与相位,高频只修幅度;零初始化保证刚接入时不破坏 VAE 输出。

    CFG 的无条件分支只丢掉文字条件,保留 LM token 这一主渲染骨架。消融显示“标签+歌词 + text-drop CFG + Spec-VAE”是整体最佳配置。DiT 最长训练到 6 分钟,对应 9,000 个 25 Hz latent frame。

    内部音乐质量模型先在每个 genre 内把样本分为 Q1–Q7,去掉最低 Q7,避免质量评分被主流风格垄断。预训练分三步:

    • Q3–Q6:覆盖超过 500 万小时主体数据,动态地从低质量向高质量采样,并混入 20% 纯器乐。
    • Q2:学习率退火,巩固结构、连贯性与音质。
    • Q1 + 精选高质量样本:改善音乐性、可控性和指令遵循。

    后训练再走 SFT 冷启动→迭代离线 DPO→在线 GSPO。奖励包含内部音乐性 MOS、Qwen3.5-Omni 的标签遵循与 Qwen3-ASR 的歌词可懂度。流程从稳定的监督分布逐步走向更强的 on-policy 探索。

    • 专业人评:50 人、每对样本 3 位专家;Qwen-Music 对 MiniMax 2.5+/2.6、Mureka V8、Suno V5 的胜率为 59.1%/66.7%/58.3%/55.4%,对 Suno V5.5 为 50.3%,更合理的解读是“相当”而非显著领先。
    • 客观指标:中英各 300 条,SongBench/SongEval/AudioBox-Aesthetic 共 16 项中 13 项第一;歌词 PER 6.10,逊于 Suno V5.5 的 4.19。
    • 翻唱权衡:AI 参考集上 section-level Melody MAE 1.48 最低,但 unique-section 的 genre/mood/乐器/声线控制明显更好;说明旋律约束越强,重新编配空间越小。
    • 渲染器:Band-Mode Refiner 相对 Spec-VAE 单体改善全部报告指标,Mel Distance 从 0.572 降到 0.461。
    • 不可复现性高:500 万小时数据、质量奖励模型、Qwen3.5/Qwen3-ASR 打分管线和模型权重均未在技术报告中完整公开。
    • 商业基线难严格控制:Suno/MiniMax/Mureka 都是随时更新的黑箱 API;采样参数与版本漂移会影响对比。
    • 自动评测占比高:13/16 的“领先”依赖 SongBench、SongEval、AudioBox 等模型化指标;人评虽专业,但对 Suno V5.5 只有 50.3% 对 49.7%,报告未给置信区间。
    • 真正创新集中于接口与训练系统:Tokenizer、AR LM、DiT、VAE、DPO/GSPO 各自不是新范式;更有价值的是 Melody-CoT 中间表示、语义/声学分层和完整的质量课程。
    • 论文:Qwen-Music Technical Report,arXiv:2607.11699v2,2026-07-27。
    • 团队:Qwen Team。
    • 规模:Tokenizer 0.6B;Qwen-Music-LLM 3B;Render DiT 1.3B;训练音乐超过 500 万小时。
    • 输出:48 kHz stereo;歌曲语义 token 25 Hz;旋律 token 6.25 Hz。
    • 任务:文本生歌、参考旋律翻唱;评测含 600 条中英原创提示、400 条中英翻唱提示及 50 名专业人评。