READING NOTES · AUDIO-ONLY GENERATIVE TRAINING
AudioLDM
精读笔记
最关键的不是“把 Stable Diffusion 搬到音频”,而是把跨模态对齐从生成模型训练里拆出去:LDM 训练只看音频条件,推理时再用 CLAP 对齐后的文本 embedding 替换它。
30 秒速览
TL;DRAudioLDM 是 2023 年的文本到音频 latent diffusion 系统。它用 CLAP 对齐文本和音频 embedding,用卷积 VAE 把 mel-spectrogram 压入连续 latent,再用条件 UNet 做 diffusion,最后由 HiFi-GAN 恢复波形。
记住这一条机制链:CLAP 音频条件训练 → 文本条件采样 → VAE 连续 latent → DDIM + CFG → HiFi-GAN 波形。
01 关键技巧:训练与推理使用不同模态的条件
MECHANISMCLAP 把音频 embedding 与文本 embedding 对齐;LDM 训练使用前者,文本到音频采样使用后者。补绘与风格迁移都复用同一个反向扩散过程。
- 为什么不用 caption 训练 LDM
- 自然语言 caption 往往不完整、主观或过于抽象。音频 embedding 直接从目标音频提取,更接近模型真正要生成的内容;CLAP 预训练已经负责跨模态对齐。
- 为什么推理能换成文本
- 理想情况下,匹配的音频和文本在 CLAP joint space 中接近,因此 LDM 训练学到的条件接口可以在推理时接受文本 embedding。真正的假设是 embedding 对齐质量,而不是两种 encoder 完全相同。
- 为什么使用连续 latent
- VAE 把 mel-spectrogram 压成较小连续 tensor,减少 diffusion 的时频计算量;与离散 token TTA 相比,不再引入离散码本与自回归序列。
- 条件怎样进入 UNet
- 时间步 embedding 与 CLAP embedding 拼接,再通过 FiLM 注入卷积 block;论文没有沿用 Stable Diffusion 的 cross-attention 条件路径。
相同模型规模下,直接用音频 embedding 训练在 FD、IS 与 KL 上持续优于文本 embedding;更大模型收敛较慢但最终更好。
02 论文最能支撑主张的结果
EVIDENCE完整 10 张表和所有模型行见中文全文页。
| 比较 | 关键结果 | 能支持的结论 |
|---|---|---|
| AudioCaps 主结果 | AudioLDM-L-Full:FD 23.31、IS 8.13、KL 1.59 | 扩大模型与音频训练数据后,客观指标明显改善 |
| 条件模态 | Audio embedding:FD 29.48;Text embedding:FD 31.26 | 生成模型直接使用目标音频 embedding 比 noisy caption 条件更有效 |
| 计算规模 | AudioLDM-S 181M,单卡训练;DiffSound 32×V100,AudioGen 64×A100 | 论文的效率优势主要来自 latent diffusion 与条件解耦 |
| VAE 压缩 | r=4:FD 29.48;r=16:FD 34.32 | 压缩越高越省算力,但生成质量下降 |
| 人工评测 | AudioLDM-L-Full:OVL 65.91、REL 65.97;DiffSound:45.00、43.83 | 客观指标改善与人工感知趋势基本一致 |
这些数字不能脱离配置比较。AudioLDM-L-Full 使用了 AudioSet、Freesound 与 BBC SFX,并在 AudioCaps 上额外微调;AudioGen 的部分指标直接引用其论文,未在同一代码栈复测。论文证明了当时设置下的优势,不等于严格控制变量的统一 benchmark。
03 生成与操作共用同一 diffusion prior
MANIPULATION- 风格迁移:先把源音频 latent 前向加噪到中间时间步,再从该状态按文本条件反向生成;起点越靠后,文本风格越强、源内容保留越少。
- 补绘:每个反向步后,用 mask 把已观测 latent 覆盖回去,只允许缺失区域继续生成。
- 超分辨率:与补绘使用同一 masked reverse process,只是 mask 位于时频图的低频已观测区域。
- 能力边界:这些任务无需专门微调,但质量依赖 VAE 的近似空间对应关系,也依赖文本 embedding 是否能准确指定缺失内容。
已观测的两端保持不变,中间缺失区分别由 ambient music、人声与鸟叫、猫叫、风雨等文本控制。
04 四个常见误读
MISCONCEPTIONS- 误读 1
- “AudioLDM 完全不需要文本数据。” LDM 训练可以 audio-only,但 CLAP 预训练本身仍需要大规模语言—音频配对;跨模态监督只是被前置了。
- 误读 2
- “音频与文本 embedding 相近,所以可无损互换。” 它们只是落在同一对比空间。模态 gap、caption 歧义与 unseen prompt 都会影响条件替换质量。
- 误读 3
- “这就是音频版 Stable Diffusion。” UNet backbone 有继承关系,但条件不是 token-level cross-attention,而是单一 CLAP vector 经 FiLM 注入;音频还需要 VAE 与 vocoder 两级重建。
- 误读 4
- “零样本音频操作等于专用任务 SOTA。” 论文在超分辨率上仍落后 NVSR;其贡献是统一的无任务微调接口,而不是每个操作都超过专门模型。
05 编辑判断与开放问题
VERDICTAudioLDM 最有价值的思想是把“学会音频—文本关系”和“学会生成音频”拆成两个阶段。这让生成器能够吸收无 caption 音频,也为后续 CLAP-conditioned audio diffusion 奠定了经典范式。
论文证据较强的是音频条件对文本条件的消融、连续 latent 的效率、主客观结果趋势与统一操作案例。主要限制也很清楚:16 kHz 对音乐保真度不足,各模块独立训练导致 latent 与 diffusion 可能不对齐,CLAP 单向量难以表达复杂长文本的局部时序结构,且不同模型的数据规模和微调设置并非完全一致。后续值得追踪的方向包括更高采样率 codec、更强 token-level text conditioning、端到端对齐,以及严格同数据同算力的第三方复现。