Melody-CoT(旋律链式规划)
在完整歌曲 token 生成前,先由语言模型生成一条低帧率离散旋律计划,使“作曲结构”与“整曲声学实现”分阶段完成。
Melody-CoT 是 Qwen-Music 提出的音乐生成中间表示。模型不直接从“风格+歌词”一步预测包含人声、伴奏和混音的整曲 Music Semantic Tokens,而是可先预测一段粗粒度人声旋律 token,再以该旋律为计划生成完整歌曲 token。
名称借用了 Chain-of-Thought,但这里的“思维链”不是可读自然语言推理,而是可听觉解释、可从参考音频提取、可被模型自回归生成的离散旋律轨迹。
它同时统一两类任务:
- 原创歌曲:模型从歌词与标签主动“想出”旋律计划。
- Cover:直接把参考歌曲抽取出的旋律计划放入条件,模型在保留旋律的同时换风格、编配和声线。
完整歌曲生成同时包含两个难度层级:
- 作曲层:歌词分句、音高走向、段落重复、主歌/副歌关系与长程结构。
- 实现层:歌手音色、演唱细节、和声、乐器、频谱、相位与 stereo production。
如果一个 LM 从文字直接预测 full-mixture token,就必须在每一步同时决定旋律与伴奏实现,搜索空间高度纠缠。Melody-CoT 先固定粗旋律,使后续生成围绕一个中间计划展开,类似写文章先列提纲、代码生成先列计划,但计划本身位于音乐域。
它还有三项工程价值:
- 可控:用户可用参考旋律替换模型自己规划的旋律。
- 可复用:同一旋律计划可生成多种 genre、instrumentation、vocal timbre。
- 可弱化:只保留部分段落或每类段落一个代表,可在“像原曲”和“服从新风格”之间调节。
1. 从波形提取粗人声旋律
Section titled “1. 从波形提取粗人声旋律”Qwen-Music 使用 RMVPE 从参考音频提取 50 Hz vocal pitch curve:
随后以 8× median pooling 降采样到 6.25 Hz:
中位数池化抑制 vibrato、装饰音和局部抖动,保留作曲层面的主旋律轮廓。
2. 去掉绝对音域
Section titled “2. 去掉绝对音域”有声帧先从 Hz 转 MIDI,再减去全局有声 MIDI 中位数:
无声帧使用独立 token 255。最终得到 256 项词表:0–254 表示相对半音偏移,255 表示 unvoiced。
减中位数的目的不是提高压缩率,而是阻止参考条件泄漏绝对 key、音域和 singer-dependent 信息。模型只复制旋律形状,目标声线与编配仍由文字标签控制。
3. 与整曲 token 联合自回归训练
Section titled “3. 与整曲 token 联合自回归训练”模型混合三种训练序列:
[text, music semantic tokens][text, section-level melody, music semantic tokens][text, unique-section-level melody, music semantic tokens]loss 同时覆盖 melody region 和最终 music region。第一种保留直接文字生歌能力;后两种教模型先规划再实现,也支持参考旋律 conditioning。
4. 两种旋律条件强度
Section titled “4. 两种旋律条件强度”Section-level Melody-CoT:每个含歌词的 verse/chorus 都写入对应旋律;intro、间奏、outro 和 silence 不写。它最大程度保留参考曲的段落旋律,但条件更强。
Unique-section-level Melody-CoT:同一 section label 多次出现时,只随机选一个代表段落。它不暴露精确全曲长度,鼓励模型把旋律当可复用主题,而不是逐帧复制。
- 早期 MusicGen 等模型已支持文本/旋律 conditioning,但通常把旋律作为外部条件直接注入生成器。
- 2025–2026 的 planning-based audio LM 开始把“先规划、后生成”显式化,例如前缀 plan 或多阶段 token。
- Qwen-Music 将旋律本身变成 LM 可生成的中间 token,并把原创规划和 reference cover 统一成同一序列接口。
与相邻概念的区别
Section titled “与相邻概念的区别”| 概念 | 中间表示 | 主要目标 |
|---|---|---|
| 文本 CoT | 自然语言推理步骤 | 解释/分解问题 |
| Melody-CoT | 6.25 Hz 相对音高 token | 先定旋律轮廓,再生成整曲 |
| MusicGen melody conditioning | 参考音频/chroma 条件 | 跟随外部旋律,不一定由 LM 先生成计划 |
| MIDI/乐谱生成 | 音符事件、时值、力度等符号 | 生成可编辑符号音乐 |
| Music Semantic Tokens | 25 Hz full-mixture 离散 token | 承载歌词、旋律、伴奏与结构,供 renderer 使用 |
Melody-CoT 比完整 MIDI 更弱:没有精确乐器轨、节奏记谱和演奏控制;比 chroma 更聚焦主唱旋律,减少背景和声/编配泄漏。
- “Melody-CoT 会输出文字解释”:不会,它输出离散旋律 token,不是自然语言 rationale。
- “它等于复制参考歌曲”:相对音高去掉绝对调和音域;section/unique-section 设计也有意削弱逐帧复制。
- “条件越完整越好”:逐段条件的 Melody MAE 更低,但 genre、mood、instrument 和声线服从度反而常低于 unique-section 模式。
- “旋律计划决定最终音质”:音质主要由 Music Semantic Tokens 和 Qwen-Music-Render 决定;Melody-CoT 主要改善作曲结构与可控性。
- “CoT 一定意味着更可解释”:这里可视化的是音高轨迹,确实比隐藏状态更可检查,但仍不能解释模型为何选择该旋律。
- 论文没有单独给出“有/无 Melody-CoT”的完整原创歌曲消融,很多证据来自两种 cover conditioning 的对比。
- RMVPE 对多声部、强混响和主唱不清晰歌曲的提取误差会直接污染旋律计划。
- 相对 pitch 表示有利于风格迁移,但牺牲绝对 key、音域与细粒度演唱表情控制。
- “链式思维”命名有传播优势,但技术本质更接近离散音乐 plan token,不应机械类比 LLM 推理过程。
- 资料摘要:Qwen-Music — 概念来源与完整架构
- Qwen 音频四模型对比
- LALM(大型音频语言模型)
- 神经音频编解码(RVQ)
- 自回归解码与采样
- 资料摘要:MusicGen — 早期文本/旋律条件音乐 LM
- 资料摘要:Plan-Critic — 音频 LM 的另一种显式规划路线
- Wiki 目录