Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering
Alibaba Token Foundry · “Lucky Dolphin” Elo 1129
DEEP TECHNICAL COMPARISON · FULL-SONG MUSIC GENERATION
同一条“语义 tokenizer → 自回归规划 → flow-matching 渲染”路线,两套系统却在码本、旋律表征、模型规模和整曲合成方式上作出了不同选择。
阅读主线:表示 → 旋律 → LLM → Decoder → 训练 → 数据 → 评测。
Alibaba Token Foundry · “Lucky Dolphin” Elo 1129
Qwen Team · 2026-07-28 · “JazzCat” 英文人声第 3
共同范式
两者都采用离散语义 Tokenizer(25 Hz)→ 自回归 LLM → Flow/Diffusion DiT 渲染 → 48 kHz 立体声,并引入显式旋律规划、Cover 与偏好对齐。


Key Ideas
两篇报告都围绕分词、旋律、渲染和对齐展开;差异主要来自“保留多少音乐细节”与“把控制权放在哪一层”。
任务侧重
P1 多出“纯器乐生成”;P2 多出“一句话生曲”,由 Prompt Rewriter 自动补齐音乐 tags 与歌词。两家的 Cover 也分别强调“还原”和“改编”。
| 能力 | P1 · Full-Song | P2 · Qwen-Music |
|---|---|---|
| 词生曲 / 文生曲 | 需提供歌词 + 描述 | 一句话即可,自动写词 + tags |
| 纯器乐 | 独有核心任务 | 未列为核心任务 |
| Cover | 保旋律 + 演唱细节还原 | 旋律克隆 + 换音色 / 性别 / 调 |
| 歌词自动生成 | 外部输入 | Prompt Rewriter |
| 控制维度 | 风格、情绪、乐器、演唱、段落、场景 | genre、mood、乐器、音色、性别 |
| 多语言 | 500 例多语基准 | 数百语言,5M+ 小时 |
| Cover 定量评测 | 留作未来工作 | Melody MAE 等,优于所列对比系统 |
侧重总结:P1 的任务面更宽,Cover 追求绝对音高和演唱细节的“原汁原味”;P2 的使用门槛更低,Cover 只借旋律骨架,把风格、音色和编曲控制权交给文本。
System Scale
| 模块 / 规格 | P1 · Full-Song | P2 · Qwen-Music |
|---|---|---|
| Tokenizer 编码器 | 24 层 Conformer | 0.6B Conformer(24 层、width 1024、16 heads) |
| Codebook | 8 码本 × 8192 | 单码本 × 32768(),375 bit/s |
| 帧率 | 25 Hz | 25 Hz(每 40 ms) |
| LLM | 全局 8B + 局部 0.4B(约 8.4B) | 3B Qwen3.5-Omni dense |
| Render DiT | FullDiT 8B(消融另有 1.5B) | 1.3B DiT(32 层) |
| 渲染隐空间 | 连续 VAE latent → VAE 直出波形 | 连续 latent()→ Spec-VAE 复数 STFT → Refiner |
| Melody | MIDI 音符 + 各 128 级,25 Hz 帧对齐 | RMVPE 50 Hz → 6.25 Hz 相对 MIDI,256 词表 |
| 整体量级 | 8B + 0.4B + 8B | 0.6B + 3B + 1.3B |
P1 走“大模型 + 多码本 + 整曲一次性”;P2 走“轻量单码本 + 频谱域后处理”。
Representation
多码本 RVQ 与单码本超压缩走向不同,但训练配方高度同构:BEST-RQ 预训练 → 多任务微调 → 离散化。


| 阶段 | P1 · 三阶段 | P2 · 四阶段 |
|---|---|---|
| 预训练 | BEST-RQ 掩码,RPQ 目标 | BestRQ 双向掩码,CE |
| 因果适配 | — | Causal Conformer + RPQ |
| 多任务 | ASR + 重建 + chroma | CTC 歌词 + Mel + chroma;全曲 ≤ 300 s |
| 量化 | 冻结底部 12 层,训练顶部 12 层 + 8 码本 | Straight-through + commitment |
| Loss | CE → 多任务 → RVQ + 重建 |
Explicit Planning
两者都从人声基频出发,把旋律离散成 token;真正差别是绝对 MIDI vs. 相对 MIDI、双粒度 vs. 单粒度、外挂条件 vs. CoT 规划。
| 维度 | P1 · 两级绝对 | P2 · 单级相对 |
|---|---|---|
| 人声提取 | BS-RoFormer 分离 | RMVPE 50 Hz 基频 |
| MIDI 用法 | 绝对 MIDI 音符 | 减中位数后的相对 MIDI |
| 粒度 | MIDI 音符 + 帧级 | 6.25 Hz 粗轮廓 |
| 演唱细节 | 保留 vibrato 与表现 | 中值池化后主动丢弃 |
| 绝对音高 / 调 | 保留 | 去除,register 无关 |
| 接入方式 | Hybrid-LM 外部条件 | Melody-CoT 规划 + 前缀条件 |

减去 去掉音区与调性,低帧率则抹掉装饰音,最终只保留可迁移的旋律骨架。
Melody Tokenizer 是“读谱器”:把参考歌的人声旋律变成 6.25 Hz 的相对半音 token。Melody-CoT 是“用法”:规定这串 token 在 LLM 序列里由谁产生、放在哪一段。它不是音频,也不直接进入渲染器。
tags + lyrics → LLM 自生成 melody plan → Music Semantic Tokens → Render
tags + lyrics + 参考旋律 token 前缀 → Music Semantic Tokens → Render
同:都基于人声基频、MIDI 与离散 token,并服务于 Cover。异:P1 力求同时还原旋律和演唱;P2 只保留旋律骨架,以换取更强的换调、换音色与风格改编能力。
Autoregressive Backbone
Flow-Matching Rendering
二者都用 flow-matching DiT,但 P1 以 8B 非因果模型一次性处理整曲,P2 以 1.3B DiT 生成 latent,再在频谱域做两段精修。


Post-Training
Hybrid-LM 依次经过 SFT → DPO → GRPO → OPD;OPD 以冻结 teacher 做稠密 token 蒸馏。FullDiT 使用 flow-based GRPO,EMDC 根据 增强较难条件。
先按质量分级做课程预训练,再执行监督初始化 → 离线 DPO → 在线 GSPO;渲染 DiT 还经过预训练与无损 SFT。
Data Pipeline
过滤去重后做风格、情绪、乐器、演唱、段落与场景的细粒度标注;依次用于预训练、风格均衡 mid-training 和高质量 SFT。渲染器只使用按带宽、立体声宽、Audiobox 与码率筛出的无损子集。
覆盖数百语言,并以低质量到高质量的课程顺序训练;Prompt Rewriter 生成标签与歌词,渲染 DiT 使用无损 SFT 数据。

Evaluation
SongBench Melody 7.20、Arrangement 7.39,多维度得分最高;Artificial Analysis 快照中 Lucky-Dolphin-Music-WQ-0618 的 Elo 为 1129,排名处于第 2–3 档。
在 SongBench、SongEval 与 AudioBox 的 16 项指标中有 13 项最佳;多组 A/B 胜率为 50.3%、55.4%、58.3%、66.7% 和 59.1%;榜单中 JazzCat 排第 3。


Takeaways
P1 显著更大:8B 全局 + 0.4B 局部 + 8B FullDiT;P2 更轻:0.6B tokenizer + 3B LLM + 1.3B DiT。
P1 使用 8 × 8192 的多码本 RVQ;P2 使用 32768 规模的单码本,码率仅 375 bit/s。
P1 以 MIDI + 两级外部条件追求细节还原;P2 以音区无关轮廓和 Melody-CoT 追求规划与改编自由。
P1 用 8B 非因果 flow matching 保证整曲一致;P2 用 1.3B DiT + Spec-VAE / Refiner 保证频谱细节。
Tokenizer → LLM → flow/diffusion 渲染,加上显式旋律和偏好对齐,已经形成这一代整曲生成系统的共同技术框架。