跳转到内容

输入关键词开始搜索

    资料摘要:AudioLDM

    论文摘要更新 2026-08-14置信度 high待阅读原始来源 ↗#音频生成#深度学习#扩散模型#多模态

    萨里大学与帝国理工学院提出的文本到音频(TTA)生成模型:用 CLAP 对齐条件模态,在 VAE 的连续 mel latent 中训练扩散模型,并首次在 TTA 系统中统一展示多种零样本文本引导音频操作,ICML 2023。 🔒 AudioLDM - Text-to-Audio Generation with Latent Diffusion Models

    中文全文译稿 · 精读笔记

    • 条件模态替换:LDM 训练时使用 CLAP 音频 embedding,TTA 采样时换成与其对齐的文本 embedding
    • 连续 VAE latent:生成空间是 mel-spectrogram 经卷积 VAE 压缩后的连续 latent;CLAP embedding 负责提供条件,而不是被扩散的目标空间
    • 单 GPU 训练:在 AudioCaps 上仅用单张 GPU 取得 SOTA
    • 零样本音频操作:首个支持文本引导音频风格迁移等零样本操作的 TTA 系统
    • 计算高效:不显式建模跨模态关系,只学习潜空间中的音频表示和组合
    • 统一音频操作:同一个 diffusion prior 通过浅层反向过程或 masked reverse process 支持风格迁移、补绘与超分辨率
    • 开源:demo 和评估工具链完整发布

    早期 TTA 系统生成质量有限且计算成本高。AudioLDM 的核心思路是把两件事拆开:CLAP 预训练负责音频—文本对齐;生成模型只需在 VAE 连续 latent 中学习音频分布。训练 LDM 时使用目标音频自身的 CLAP embedding,采样时再换成对齐后的文本 embedding。

    • CLAP(Contrastive Language-Audio Pretraining):联合训练文本和音频编码器,使对应文本-音频对在潜空间中靠近
    • 卷积 VAE:把 mel-spectrogram 压缩到连续 latent;论文默认压缩级别 r=4r=4
    • Latent Diffusion Model (LDM):在 VAE latent 中训练条件扩散模型,条件由 CLAP embedding 经 FiLM 注入 UNet
    • 文本条件引导:去噪采样时以 CLAP 文本嵌入为条件,引导音频生成
    • HiFi-GAN:把 VAE decoder 重建的 mel-spectrogram 转换为 1616 kHz 波形
    • AudioCaps 上 AudioLDM-L-Full 达到 FD 23.3123.31、IS 8.138.13、KL 1.591.59;人工评测 OVL 65.9165.91、REL 65.9765.97
    • 条件消融中,使用音频 embedding 训练明显优于直接使用文本 embedding,支持其条件解耦主张
    • 首次在 TTA 中演示零样本音频风格迁移
    • 单 GPU 即可训练完整系统

    AudioLDM 系列后续推出了 AudioLDM 2(2023.08, arXiv:2308.05734),引入自监督预训练实现更全面的音频生成。

    • 发表:ICML 2023
    • 机构:萨里大学(University of Surrey)、帝国理工学院(Imperial College London)
    • 作者:Haohe Liu, Zehua Chen, Yi Yuan, Xinhao Mei, Xubo Liu, Danilo Mandic, Wenwu Wang, Mark D. Plumbley
    • arXiv: 2301.12503
    • 项目页:audioldm.github.io
    • 评估工具:github.com/haoheliu/audioldm_eval