资料摘要:Qwen-Audio-VAE
Qwen 团队为通用音频生成单独训练的连续波形 VAE:把 24 kHz mono 音频压缩成 12.5 Hz、128 维的对角高斯潜序列,在约 500 万小时跨语音、音乐和音效数据上联合优化重建、频谱、对抗、特征匹配与 KL 损失。报告的关键贡献不是提出新的 VAE 数学形式,而是在低帧率、高保真与在线编码吞吐之间做系统平衡。
🔒 Qwen-Audio-VAE Technical Report
- 规格:输入为 24 kHz mono 波形;连续潜变量为 128 维、12.5 Hz,时间压缩率 1920×。每秒音频只对应 12.5 个连续 token。
- 两级压缩:因果卷积编码器先按 倍下采样到 50 Hz,再由 bottleneck 额外 4× 降到 12.5 Hz;解码端对称恢复帧率,但骨干容量有意不对称。
- 低帧率 Transformer:潜变量前后各放一个 8 层 window Transformer,宽度 1024、16 个头、窗口 72;最重的序列建模集中在最低帧率处,控制计算量。
- 多判别器训练:同时采用 Multi-Period、Multi-Resolution STFT、Multi-Scale STFT 与 Sub-band CQT 判别器,覆盖周期结构、时频分辨率与不同频带。
- 大规模多域数据:约 500 万小时,近似由 300 万小时语音、130 万小时音乐和 80 万小时音效组成;总数为四舍五入口径,不应机械相加追求精确相等。
- 编码器提速:将计算推向低帧率层、裁剪编码器 residual unit,并把首层通道从 64 降到 24,使 64 条、每条 30 秒音频的编码延迟从 1957 ms 降至 541 ms,提升 3.62×,报告中未观察到重建退化。
- 公开重建结果:在 LibriSpeech、AudioCaps 与 Song Describer 上覆盖语音、一般声音和音乐;不同指标并非全胜,但整体展示了跨域重建能力。
- 下游生成价值:固定 150M DiT 与 LAION-Audio-630K 训练设置时,Qwen-Audio-VAE 的 CLAP 从 Stable Audio Open 基线的 0.27 提升到 0.33,同时生成模型训练时长从 60 小时降到 36 小时。
问题定义:三个目标必须同时满足
Section titled “问题定义:三个目标必须同时满足”通用音频生成的自编码器不能只看重建音质。论文把目标明确拆成三项:
- 高保真重建:自编码器误差直接构成下游生成质量上限;
- 紧凑潜序列:潜帧率越低,下游 diffusion / flow Transformer 的序列越短;
- 高吞吐编码:大规模文本到音频训练常在线计算潜变量,编码器过慢会直接限制每步可处理的音频量。
这三个目标存在结构性冲突:提高压缩比容易损害瞬态与高频细节;堆大编码器能改善重建,却会拖慢在线训练;只为语音优化的 codec 也不一定能覆盖音乐和自然声音。
架构:480× 卷积压缩 + 4× 潜空间瓶颈
Section titled “架构:480× 卷积压缩 + 4× 潜空间瓶颈”编码器由 1D 因果卷积和残差单元组成,四个下采样 stage 的 stride 依次是 8、5、4、3,把 24 kHz 波形降到 50 Hz。最终编码器配置中,每个 block 保留一个 dilation 为 1 的 residual unit;随后先额外 4× 下采样到 12.5 Hz,再进入 pre-window Transformer,并由线性投影预测对角高斯的均值与方差,采样得到 128 维、12.5 Hz 潜变量 。解码器每个 block 才使用 dilation 为 1、3、9 的三个 residual unit。
post-window Transformer 和卷积解码器执行反向过程。解码器基准通道宽度为 1536,高于编码器;这种不对称是有意的:编码发生在下游训练的高频在线路径上,而解码通常只在采样或评测时使用,因此团队把更多容量留给解码器。
Window Transformer 的作用边界
Section titled “Window Transformer 的作用边界”两个 Transformer 块均为 8 层、模型宽度 1024、16 头、window size 72,并且都运行在 12.5 Hz。它们不是全局自注意力:固定窗口限制了序列长度增长带来的二次复杂度。pre-block 位于 latent projection 之前,post-block 位于其后;额外 4× 下采样在 pre-block 之前已经完成。
论文的工程取向很明确:重计算模块应尽量位于低帧率位置。编码器消融也验证,把下采样提前、把重块后移,能在基本不改重建的情况下显著降延迟。
损失:重建与可生成潜空间之间的折中
Section titled “损失:重建与可生成潜空间之间的折中”生成器总损失由五类组成:multi-scale mel reconstruction、multi-resolution STFT、adversarial、feature matching 与 KL regularization。前两类直接约束波形的时频重建;对抗和特征匹配改善感知真实度;KL 把 posterior 约束向标准高斯,便于下游生成模型学习。
主模型的 KL 权重只有 。文本到音频消融把权重提高到 后,FD、IS、CLAP 三项下游生成指标都变差;论文没有给出该 checkpoint 的重建指标对照。这说明此处 KL 更像轻量的潜空间规整,而不是越强越好;低帧率高保真的第一优先级仍是保住声学信息。
多判别器为何同时存在
Section titled “多判别器为何同时存在”- Multi-Period:针对语音基频、音乐音高等周期结构;
- Multi-Resolution STFT:用多种窗长/步长观察时频细节;
- Multi-Scale STFT:在多时间尺度上判断频谱真实性;
- Sub-band CQT:以近似对数频率轴细看各子频带,尤其适合跨音高与音乐结构。
四者共同监督不是为了堆名词,而是补偿单一判别器对一般音频域覆盖不足的问题。
数据与训练设置
Section titled “数据与训练设置”预训练数据约 500 万小时,覆盖语音、音乐和一般声音。所有样本以 6 秒片段训练。优化器为 AdamW,、;生成器与判别器学习率分别为 和 ,warm-up 8000 步,40 万步后衰减。训练共 240 万步,在 32 张 A100 80GB 上完成,每 GPU batch size 为 2。
编码吞吐优化
Section titled “编码吞吐优化”基线在 batch 64、每条 30 秒音频时需要 1957 ms。最终编码器做了三类改动:
- 重排 stride,让序列更早缩短;
- 删除高帧率位置的部分 residual unit;
- 首层通道从 64 减到 24,并保留低帧率位置的主要建模容量。
延迟降到 541 ms,3.62× 加速。这个指标只描述论文给定硬件与 batch 设置下的 encoder forward,不等同于端到端实时因子,也不自动代表移动端部署速度。
重建与下游生成证据
Section titled “重建与下游生成证据”论文在三种公开域测试重建:LibriSpeech 代表语音,AudioCaps 代表一般声音,Song Describer 代表音乐。作者报告 Qwen-Audio-VAE 在低至 12.5 Hz 的帧率下仍保持竞争力,并通过波形/频谱对照展示高频与瞬态结构。
更有价值的验证是下游受控实验:使用相同的 150M DiT、相同 LAION-Audio-630K 数据与训练流程,仅替换自编码器。Qwen-Audio-VAE 的 CLAP 为 0.33,高于 Stable Audio Open 的 0.27;训练耗时 36 小时,低于后者的 60 小时。这个结果支持“低帧率潜序列同时改善语义对齐与训练效率”,但单一数据集和小型 DiT 仍不足以证明对所有生成器都普遍成立。
与 Qwen-Audio-3.0-Gen-Preview 的 VAE 不是同一规格
Section titled “与 Qwen-Audio-3.0-Gen-Preview 的 VAE 不是同一规格”本报告描述的是 24 kHz mono、12.5 Hz、128 维的独立 Qwen-Audio-VAE。资料摘要:Qwen-Audio-3.0-Gen-Preview 披露的共享 VAE 则是 48 kHz stereo、25 Hz、128 维,还加入冻结 Qwen2.5-3B 的 semantic continuation 训练。两者都属于连续音频 VAE,但采样率、声道、帧率与训练目标均不同,不能把本报告当成 Gen-Preview VAE 的完整架构说明。
- 强项是系统工程闭环:论文把数据规模、架构位置、编码吞吐、重建指标和下游生成放进同一个可检验链条;独立技术报告的价值主要在这里。
- 速度证据范围有限:只有单一 batch/时长设置和内部实现基线,未给硬件型号、峰值显存、吞吐曲线或不同长度 scaling。
- 数据不可复现:500 万小时训练集未公开,也没有完整数据治理、版权、去重和域内配比细节。
- 下游实验仍偏小:150M DiT 与 LAION-Audio-630K 能做受控比较,但不能代表大规模通用音频生成系统的最终上限。
- KL 消融很重要: 比 更差,直接反驳“潜分布越标准、下游越好”的简单推断。
- 论文:Qwen-Audio-VAE Technical Report,arXiv:2607.11738v1,提交于 2026-07-13。
- 署名:Qwen Team。报告另列 14 位 Core Contributors:Ziyue Jiang、Dake Guo、Zekai Zhang、Hangrui Hu、Ting He、Xinfa Zhu、Xiong Wang、Yongqi Wang、Jiapeng Wang、Wenxiang Guo、Zhifang Guo、Chenfei Wu、Dayiheng Liu、Jin Xu;其中 Jin Xu 同时标注为 Team Lead 与 Corresponding Author。
- 源 PDF:15 页;4 图、14 表、2 个编号公式;含 Core Contributors 与 Appendix 7.1–7.4。
- 核心规格:24 kHz mono;12.5 Hz × 128 维连续 latent;1920× 时间压缩;约 500 万小时训练数据。
- 训练:240 万步,32×A100 80GB,6 秒切片,batch size 2/GPU。
- VAE(变分自编码器)
- 资料摘要:Qwen-Audio-3.0-Gen-Preview — 另一套 48 kHz stereo、25 Hz shared VAE,不能与本报告混同
- 资料摘要:Stable Audio 3
- 资料摘要:DashengTokenizer
- 资料摘要:MOSS-Audio-Tokenizer
- DiT(Diffusion Transformer)
- 音频生成
- Wiki 目录