资料摘要:AudioLDM
萨里大学与帝国理工学院提出的文本到音频(TTA)生成模型:用 CLAP 对齐条件模态,在 VAE 的连续 mel latent 中训练扩散模型,并首次在 TTA 系统中统一展示多种零样本文本引导音频操作,ICML 2023。 🔒 AudioLDM - Text-to-Audio Generation with Latent Diffusion Models
- 条件模态替换:LDM 训练时使用 CLAP 音频 embedding,TTA 采样时换成与其对齐的文本 embedding
- 连续 VAE latent:生成空间是 mel-spectrogram 经卷积 VAE 压缩后的连续 latent;CLAP embedding 负责提供条件,而不是被扩散的目标空间
- 单 GPU 训练:在 AudioCaps 上仅用单张 GPU 取得 SOTA
- 零样本音频操作:首个支持文本引导音频风格迁移等零样本操作的 TTA 系统
- 计算高效:不显式建模跨模态关系,只学习潜空间中的音频表示和组合
- 统一音频操作:同一个 diffusion prior 通过浅层反向过程或 masked reverse process 支持风格迁移、补绘与超分辨率
- 开源:demo 和评估工具链完整发布
早期 TTA 系统生成质量有限且计算成本高。AudioLDM 的核心思路是把两件事拆开:CLAP 预训练负责音频—文本对齐;生成模型只需在 VAE 连续 latent 中学习音频分布。训练 LDM 时使用目标音频自身的 CLAP embedding,采样时再换成对齐后的文本 embedding。
- CLAP(Contrastive Language-Audio Pretraining):联合训练文本和音频编码器,使对应文本-音频对在潜空间中靠近
- 卷积 VAE:把 mel-spectrogram 压缩到连续 latent;论文默认压缩级别
- Latent Diffusion Model (LDM):在 VAE latent 中训练条件扩散模型,条件由 CLAP embedding 经 FiLM 注入 UNet
- 文本条件引导:去噪采样时以 CLAP 文本嵌入为条件,引导音频生成
- HiFi-GAN:把 VAE decoder 重建的 mel-spectrogram 转换为 kHz 波形
- AudioCaps 上 AudioLDM-L-Full 达到 FD 、IS 、KL ;人工评测 OVL 、REL
- 条件消融中,使用音频 embedding 训练明显优于直接使用文本 embedding,支持其条件解耦主张
- 首次在 TTA 中演示零样本音频风格迁移
- 单 GPU 即可训练完整系统
AudioLDM 系列后续推出了 AudioLDM 2(2023.08, arXiv:2308.05734),引入自监督预训练实现更全面的音频生成。
- 发表:ICML 2023
- 机构:萨里大学(University of Surrey)、帝国理工学院(Imperial College London)
- 作者:Haohe Liu, Zehua Chen, Yi Yuan, Xinhao Mei, Xubo Liu, Danilo Mandic, Wenwu Wang, Mark D. Plumbley
- arXiv: 2301.12503
- 项目页:audioldm.github.io
- 评估工具:github.com/haoheliu/audioldm_eval