音频生成
通用音频生成领域 31 篇有影响力论文与 1 篇作者深度解读的汇总导航,覆盖 2023–2026 奠基性工作到最新进展。
Qwen Audio 3.0 新系列
Section titled “Qwen Audio 3.0 新系列”| 论文 | 发表 | 路线 | 亮点 |
|---|---|---|---|
| Qwen-Music | 2026.07 | AR 语义 LM + Flow-Matching DiT | 25 Hz 单码本音乐语义 token、48 kHz stereo、Melody-CoT 与覆盖生成 |
| Qwen-Audio-3.0-TTS | 2026.07 | 12.5 Hz LM + chunk FM | 16 语言、20 方言区域、86 标签、劣质参考鲁棒性与五阶段训练 |
| Qwen-Audio-3.0-Gen-Preview | 2026.07 | NAR DiT + 共享连续 VAE | 富时间线 record 统一多角色对白、音乐、音效与环境声 |
| Qwen-Audio-VAE | 2026.07 | 12.5 Hz 连续 VAE-GAN | 24 kHz mono、128 维潜变量、500 万小时多域数据与 3.62× 编码加速;含中文全文译稿 |
统一基础模型
Section titled “统一基础模型”| 论文 | 发表 | 路线 | 亮点 |
|---|---|---|---|
| SonicWeave | 2026.08 | Flow-Matching DiT + CPE-MoE | 快手 Kling+港中文+清华:连续 4 帧共享 Top-2 路由,conflict gate 融合 text/phase prior 与局部 acoustic evidence;复杂场景 MOS-R 4.49 |
| SwanTale | 2026.08 | Flow-DiT + Unified MoE | ByteDance+浙大:同一模型统一自然语言声线设计与参考音频 zero-shot,单波形联合多说话人语音、环境与局部音效;25 Hz SwanVAE、两级动态专家与 GRPO |
| Bagpiper | 2026.02 | Rich Caption + 理解-生成一体 | CMU+LY+NVIDIA:8B,用「丰富字幕」作认知概念代理建立音频⇄字幕双向映射,caption-then-process 把音频任务化为文本推理,首批通用「理解-生成一体化」,单段混合语音+音乐+音效 |
| AudioCALM | 2026.06 | CALM(连续 AR + 流匹配) | 阿里通义+港科大:自回归 LM + 流匹配头替代 softmax,单一权重语音/音效/音乐均达 SOTA,AR-Flow + A-MoME |
| Dasheng AudioGen | 2026.05 | Flow-Matching DiT | 小米+交大:首个非自回归统一「混合音频场景」生成(语音+音乐+音效同段),结构化多视图字幕 |
| AudioX | ICLR 2026 | DiT | 一个模型覆盖全部音频生成任务,SOTA |
| AudioX-Turbo | 2026.06 | MMDiT + DMD | AudioX-Base → 4-step CFG-free 学生,IF-caps-Pro 9.2M,最高约 25× NFE 加速 |
| UniSonate | 2026.04 | MM-DiT + CFM | 首个统一 TTS/TTM/TTA 三模态,正迁移 |
| UniMoE-Audio | 2025.10 | Dynamic-Capacity MoE | 哈工大+微信AI:Top-P 动态路由 + 三类专家,~40k hrs 数据效率惊人 |
| Fugatto 1 | ICLR 2025 | T5-Transformer | NVIDIA 首个音频基础模型,ComposableART |
语言模型路线
Section titled “语言模型路线”| 论文 | 发表 | 核心创新 | 亮点 |
|---|---|---|---|
| Siren | EMNLP 2025 | 反因果对齐 + RL | LM 首次超越 Diffusion |
| Plan-Critic | EACL 2026 | 前缀规划 + GAE 引导 | +10 CLAP,AR 新 SOTA |
| Khala | 2026.05 | 64 层 RVQ | 声学 Token LM 极限探索 |
扩散模型路线
Section titled “扩散模型路线”| 论文 | 发表 | 核心创新 | 亮点 |
|---|---|---|---|
| Stable Audio 3 | 2026.05 | 潜空间扩散 + 对抗后训练 | Stability AI 旗舰,4096× SAME 自编码器 + 原生变长 + 8 步 Ping-Pong,<2s 生成 6m20s,开源 SOTA |
| DreamAudio | TASLP 2026 | 定制化 T2A | 音频生成的“DreamBooth” |
| LongCat-AudioDiT | 2026.03 | 波形潜空间 DiT | 零样本语音克隆 SOTA |
| GenAU | arXiv 2024.06 | FIT + 1D-VAE | 47M 数据管道 + 1.25B 模型双缩放,FAD 1.21 |
| DiffRhythm | 2025.03 | 潜空间扩散 + VAE | 10 秒内生成长达 4m45s 完整歌曲(人声+伴奏) |
| MOSS-SoundEffect v2 | 2026.05 | DiT + Flow Matching | 复旦开源双语音效模型,v1 离散 AR → v2 连续扩散 |
| ControlAudio | ACL 2026 | 渐进 DiT 扩散 | 清华+生数:首个统一时间控制+可懂语音 TTA,三阶段渐进训练+渐进引导采样,AudioCondition Eb/At + AC-Filtered WER 均 SOTA |
奠基性工作(2023–2024)
Section titled “奠基性工作(2023–2024)”| 论文 | 发表 | 路线 | 亮点 |
|---|---|---|---|
| MusicGen | NeurIPS 2023 | Transformer LM | Meta 单阶段多流 token 音乐生成,开源基准 |
| AudioLDM | ICML 2023 | CLAP + LDM | TTA 奠基之作,首次零样本音频操作,单 GPU SOTA |
| Tango | ACL 2024 | Flan-T5 + LDM | 以 1/63 数据量超越 AudioLDM,LLM 编码器首秀 |
| Tango 2 | ACM MM 2024 | LDM + DPO 对齐 | Tango 直系升级:diffusion-DPO 在 Audio-alpaca 偏好集上微调,架构不变、成本仅 3.5h |
| TangoFlux | 2024.12 | Rectified Flow + MMDiT/DiT | Tango 三代:换 Flow Matching,515M 参数 3.7s 生成 30s 音频,在线偏好优化 CRPO,SOTA |
| 论文 | 发表 | 核心创新 | 亮点 |
|---|---|---|---|
| 连续值 Token LM | ICML 2025 | 连续 token + 掩码预测 | 绕过离散量化瓶颈 |
| DashengTokenizer | 2026.03 | 冻结语义 + 声学注入 | 小米 MiLM Plus:连续统一 tokenizer,唯一新训练部件仅 0.66M 线性层;理解(X-ARES 22 任务多项 SOTA)与生成(TTA/TTM 超 VAE)共用一套表示,挑战「合成必须靠 VAE」 |
| Locodec + MP-ELD 作者解读 | 2026.08 | 8 Hz 高维连续 token + 多路径 single-token AR | 以 core manifold、PDD、LC/SC/AC 与 residual CFG 联合缓解长时误差累积;论文为 arXiv v1,解读补充失败实验与设计动机 |
| 论文 | 发表 | 覆盖范围 |
|---|---|---|
| Score-Based 综述 | Found. Trends 2025 | 扩散/Score-Based 模型全面综述 + AudioDiffuser 代码库 |
| 通用听觉智能综述 | 2025.11 | LLM + 音频融合全景 + AGI 路线图 |
技术路线对比
Section titled “技术路线对比”| 维度 | 扩散/DiT | 语言模型 (LM) | 连续表示 | CALM(自回归+流匹配) |
|---|---|---|---|---|
| 代表 | AudioX, AudioX-Turbo, DreamAudio | Siren, Plan-Critic | ICML 2025 连续 Token | AudioCALM |
| 优势 | 高保真、灵活条件、可少步蒸馏 | 时间一致性、指令遵循 | 无量化损失 | 保留 AR 流式/上下文 + 连续表示高保真 |
| 劣势 | 推理慢 | 量化误差 | 探索早期 | 训练/推理漂移需正则化 |
| 2025-26 态势 | 主流,统一框架 | 快速崛起 | 新兴方向 | 2026.06 新范式,三类均达 SOTA |
- 音频生成 — 概念页
- CALM(连续自回归语言建模) — 自回归 + 流匹配融合新范式(AudioCALM 核心)
- DiT(Diffusion Transformer) — 扩散生成主流骨干
- 条件流匹配(CFM) — 扩散模型加速方法
- 对抗后训练(Adversarial Post-Training) — 少步生成加速(Stable Audio 3 第三阶段)
- 分布匹配蒸馏(DMD) — AudioX-Turbo 的 Flow Matching 少步蒸馏核心
- MoE(混合专家) — A-MoME / Dynamic-Capacity MoE 的架构基础
- 多模态 LLM — 跨模态基础模型
- Melody-CoT(旋律链式规划) — 将参考旋律变成低频率相对音高计划
- 富时间线音频生成(Rich-Timeline Audio) — 显式绑定角色、事件与时间范围的场景生成
- Locodec–MP-ELD 语音生成系统 — 低帧率高维连续 token 的长时稳定 AR 系统
- Qwen 音频四模型对比
- 资料摘要:Qwen-Audio-3.0-ASR-Flash — 同期音频理解/转写产品线,不计入本页 29 篇生成论文
- 自动语音识别(ASR)
- Wiki 目录
- 知识库概览