跳转到内容

输入关键词开始搜索

    Melody-CoT(旋律链式规划)

    概念更新 2026-08-03置信度 high#概念#音乐生成#语言模型#进阶

    在完整歌曲 token 生成前,先由语言模型生成一条低帧率离散旋律计划,使“作曲结构”与“整曲声学实现”分阶段完成。

    Melody-CoT 是 Qwen-Music 提出的音乐生成中间表示。模型不直接从“风格+歌词”一步预测包含人声、伴奏和混音的整曲 Music Semantic Tokens,而是可先预测一段粗粒度人声旋律 token,再以该旋律为计划生成完整歌曲 token。

    名称借用了 Chain-of-Thought,但这里的“思维链”不是可读自然语言推理,而是可听觉解释、可从参考音频提取、可被模型自回归生成的离散旋律轨迹

    它同时统一两类任务:

    • 原创歌曲:模型从歌词与标签主动“想出”旋律计划。
    • Cover:直接把参考歌曲抽取出的旋律计划放入条件,模型在保留旋律的同时换风格、编配和声线。

    完整歌曲生成同时包含两个难度层级:

    1. 作曲层:歌词分句、音高走向、段落重复、主歌/副歌关系与长程结构。
    2. 实现层:歌手音色、演唱细节、和声、乐器、频谱、相位与 stereo production。

    如果一个 LM 从文字直接预测 full-mixture token,就必须在每一步同时决定旋律与伴奏实现,搜索空间高度纠缠。Melody-CoT 先固定粗旋律,使后续生成围绕一个中间计划展开,类似写文章先列提纲、代码生成先列计划,但计划本身位于音乐域。

    它还有三项工程价值:

    • 可控:用户可用参考旋律替换模型自己规划的旋律。
    • 可复用:同一旋律计划可生成多种 genre、instrumentation、vocal timbre。
    • 可弱化:只保留部分段落或每类段落一个代表,可在“像原曲”和“服从新风格”之间调节。

    Qwen-Music 使用 RMVPE 从参考音频提取 50 Hz vocal pitch curve:

    f=(f1,,fT).f=(f_1,\ldots,f_T).

    随后以 8× median pooling 降采样到 6.25 Hz:

    f=MedianPool8(f).\tilde f=\operatorname{MedianPool}_8(f).=MedianPool8(f).

    中位数池化抑制 vibrato、装饰音和局部抖动,保留作曲层面的主旋律轮廓。

    有声帧先从 Hz 转 MIDI,再减去全局有声 MIDI 中位数:

    zi=clip ⁣(round(hz2midi(fi))mˉ,127,127)+127.z_i=\operatorname{clip}!\left(\operatorname{round}(\operatorname{hz2midi}(\tilde f_i))-\bar m,-127,127\right)+127.i))mˉ,127,127)+127.

    无声帧使用独立 token 255。最终得到 256 项词表:0–254 表示相对半音偏移,255 表示 unvoiced。

    减中位数的目的不是提高压缩率,而是阻止参考条件泄漏绝对 key、音域和 singer-dependent 信息。模型只复制旋律形状,目标声线与编配仍由文字标签控制。

    模型混合三种训练序列:

    [text, music semantic tokens]
    [text, section-level melody, music semantic tokens]
    [text, unique-section-level melody, music semantic tokens]

    loss 同时覆盖 melody region 和最终 music region。第一种保留直接文字生歌能力;后两种教模型先规划再实现,也支持参考旋律 conditioning。

    Section-level Melody-CoT:每个含歌词的 verse/chorus 都写入对应旋律;intro、间奏、outro 和 silence 不写。它最大程度保留参考曲的段落旋律,但条件更强。

    Unique-section-level Melody-CoT:同一 section label 多次出现时,只随机选一个代表段落。它不暴露精确全曲长度,鼓励模型把旋律当可复用主题,而不是逐帧复制。

    • 早期 MusicGen 等模型已支持文本/旋律 conditioning,但通常把旋律作为外部条件直接注入生成器。
    • 2025–2026 的 planning-based audio LM 开始把“先规划、后生成”显式化,例如前缀 plan 或多阶段 token。
    • Qwen-Music 将旋律本身变成 LM 可生成的中间 token,并把原创规划和 reference cover 统一成同一序列接口。
    概念 中间表示 主要目标
    文本 CoT 自然语言推理步骤 解释/分解问题
    Melody-CoT 6.25 Hz 相对音高 token 先定旋律轮廓,再生成整曲
    MusicGen melody conditioning 参考音频/chroma 条件 跟随外部旋律,不一定由 LM 先生成计划
    MIDI/乐谱生成 音符事件、时值、力度等符号 生成可编辑符号音乐
    Music Semantic Tokens 25 Hz full-mixture 离散 token 承载歌词、旋律、伴奏与结构,供 renderer 使用

    Melody-CoT 比完整 MIDI 更弱:没有精确乐器轨、节奏记谱和演奏控制;比 chroma 更聚焦主唱旋律,减少背景和声/编配泄漏。

    • “Melody-CoT 会输出文字解释”:不会,它输出离散旋律 token,不是自然语言 rationale。
    • “它等于复制参考歌曲”:相对音高去掉绝对调和音域;section/unique-section 设计也有意削弱逐帧复制。
    • “条件越完整越好”:逐段条件的 Melody MAE 更低,但 genre、mood、instrument 和声线服从度反而常低于 unique-section 模式。
    • “旋律计划决定最终音质”:音质主要由 Music Semantic Tokens 和 Qwen-Music-Render 决定;Melody-CoT 主要改善作曲结构与可控性。
    • “CoT 一定意味着更可解释”:这里可视化的是音高轨迹,确实比隐藏状态更可检查,但仍不能解释模型为何选择该旋律。
    • 论文没有单独给出“有/无 Melody-CoT”的完整原创歌曲消融,很多证据来自两种 cover conditioning 的对比。
    • RMVPE 对多声部、强混响和主唱不清晰歌曲的提取误差会直接污染旋律计划。
    • 相对 pitch 表示有利于风格迁移,但牺牲绝对 key、音域与细粒度演唱表情控制。
    • “链式思维”命名有传播优势,但技术本质更接近离散音乐 plan token,不应机械类比 LLM 推理过程。