我们提出 Qwen-Audio-VAE:一组面向可扩展通用音频生成的低码率、高速编码连续音频自编码器。模型围绕一条简单但重要的原则构建:音频 VAE 不仅要高保真地重建多样音频,还必须足够快地产生紧凑潜表示,以支撑大规模文本到音频训练。Qwen-Audio-VAE 结合因果编码器—解码器、window Transformer 与多判别器训练,在重建质量和压缩率之间取得稳健平衡。模型在 500 万小时多领域音频上进行规模化训练,因而能在异质声学条件下稳定重建。为进一步提升计算效率,我们采用非对称编码器—解码器骨干,并引入面向延迟的编码器剪枝以最大化编码吞吐。公开语音、音乐和一般声音重建基准表明,Qwen-Audio-VAE 能跨不同音频域泛化;其效率尤其突出:编码 32 分钟音频只需 541 ms。总体而言,它为高效通用音频生成提供了高质量、紧凑且高吞吐的表示骨干。
1 引言
多模态基础模型 [14, 3, 18] 推动了文本到音频—视频生成 [26, 1, 22, 19] 的快速发展。这些系统 [5, 16] 不直接建模波形,而是在自编码器的紧凑潜空间中生成 [12, 6, 2, 20, 23]。因此,自编码器是基础组件:它决定生成器必须学习的表示,也限定了解码后音频质量所能达到的上限。
面向通用音频生成,一个好的自编码器必须同时满足三项要求。第一,跨多类音频的高保真重建,因为重建误差为生成器最终能达到的质量设定了上限。第二,紧凑的潜表示,因为更短的潜序列会直接降低下游 diffusion Transformer [16] 的训练成本。第三,高吞吐编码:在大规模文本到音频训练中,潜变量往往在线计算,缓慢的编码器会成为训练瓶颈,限制每一步能够处理的音频量。
然而,现有表示通常只优先满足其中一部分,而没有同时平衡三者。离散音频 codec [27, 4, 11, 7, 28] 很擅长压缩语音,但其量化误差往往削弱对含噪一般声音和高保真音乐的重建。连续音频 VAE [9] 避开了量化损失,又能自然配合 diffusion 与 flow 生成器,因此适合高保真通用音频。它们的问题转而是效率与覆盖面:多数模型以相对较高的帧率运行 [2, 20, 6],会拉长潜序列并增加下游 DiT 成本;还有许多模型 [17] 只为干净语音等单一域设计,无法覆盖通用音频生成所需的异质野外音频。
为弥合这一缺口,我们提出 Qwen-Audio-VAE:一种同时面向上述三项要求的 连续音频自编码器。主要贡献如下:
- 在 500 万小时多领域音频上训练 Qwen-Audio-VAE,结合因果编码器—解码器、window Transformer 与多判别器训练,得到紧凑、高保真且跨域稳健的表示。
- 通过非对称编码器—解码器骨干、面向延迟的编码器剪枝,并把最重的 window Transformer 集中到最低帧率处,提高编码效率: 音频的编码延迟从 1957 ms 降至 541 ms,加速 ,且不损害重建。
- 在公开语音、一般声音和音乐基准(LibriSpeech、AudioCaps、SongDescriber)上展示跨域泛化,并改善下游文本到音频生成质量。
2 架构
2.1 总览
Qwen-Audio-VAE 是面向 mono 音频的连续 VAE;它被设计为可扩展通用音频生成的表示骨干,而不是独立 codec。如图 2 所示,因果编码器 把波形 映射为潜序列 的对角高斯 posterior 参数,解码器 再把信号重建为 ;二者使用 2.3 节的频谱重建与对抗目标端到端训练。架构围绕 1 节提出的三项目标展开:高保真重建、紧凑潜表示和高吞吐编码;本节后续内容依次说明如何实现它们。
紧凑潜表示是这套设计的核心机制,因此先对其量化。编码器把波形下采样 到 ,瓶颈再压缩 ,总计缩短 ,得到 潜序列。于是, 音频只对应约 个潜帧;而既有 VAE 常见的 – 会产生约 – 帧。由于 diffusion Transformer(DiT)[16] 的 self-attention 成本会随潜序列长度 近似按 增长,低帧率是降低下游训练成本的首要杠杆。另外两个目标围绕这条紧凑潜序列实现:2.3 节的训练目标在激进压缩下保留精细声学细节,非对称编解码器与 2.4 节面向延迟的编码器剪枝则让潜变量本身也能低成本地产生。
2.2 模型组件
Qwen-Audio-VAE 采用 VAE-GAN 设计:生成器由带连续潜瓶颈的因果编码器—解码器组成,负责把波形映射到紧凑潜表示并重建;一组判别器在训练时提供对抗监督。完整配置见附录 7.1 的表 11。生成器按信号流顺序包含以下四个模块。
- 因果编码器。 DAC 风格 [11] 的因果卷积堆栈把波形降到 。初始卷积把 mono 输入提升到 24 通道;随后四个 stride 为 的残差块将时间分辨率降低 ,通道依次扩为 。每个块由 Snake 激活的 residual unit 与 strided convolution 配对;全程使用因果 padding,以保留流式和分块推理能力。编码器输出特征图 。
连续潜瓶颈。 模型不用向量量化,而采用连续对角高斯潜变量 [9]。进一步 的时间下采样把 降到 ,线性投影为每帧产生 posterior 均值和 log-variance:,其中 ;随后通过重参数化技巧采样:
该写法使采样仍可微。连续形式避开量化误差,也与 diffusion / flow 生成器所建模的连续轨迹自然匹配。
- Window Transformer。 潜投影前后各有一个 window Transformer(8 层、宽度 1024、16 个头、attention window 72),两者都运行在 。它们补充卷积在激进压缩下欠缺的长程上下文和建模能力。把最重的模块放在最低帧率处是有意设计:在最短序列上运行可把成本降到最低,也能避开编码器的高分辨率关键路径。
- 非对称解码器。 transposed-convolution decoder 把 压缩反演回 。解码不位于大规模潜变量提取的关键路径上(见第 4 节),因此容量显著大于编码器:base width 为 1536,每个 block 有三个 dilation 为 的 residual unit;这就是编码器—解码器不对称的来源。
判别器。 训练时,重建信号 与参考信号 交给由 个判别器 组成的判别器组评判,每个判别器专门关注信号的不同声学侧面。单一表示无法暴露所有伪影,因此模型组合互补的时域与频域 critic,共同推动语音、音乐和一般声音的重建趋于真实。
- Multi-period discriminator [10]:按周期 重排波形,以捕捉语音和歌声中的音高、浊音等周期结构。
- Multi-resolution STFT discriminator [11]:在多种 FFT size 下把幅度谱划分为子频带,强化跨频带、尤其是高频的保真度。
- Multi-scale STFT discriminator [4]:在多分辨率复数 spectrogram 上工作,同时观察精细瞬态和粗粒度时频结构。
- Sub-band CQT discriminator:使用 constant- 的对数频率分辨率,对齐音乐和歌声的谐波间距,强化音调与谐波细节。
精确的周期、FFT size 与 CQT 分辨率见附录 7.3。判别器只参与 2.3 节的对抗目标,推理时没有额外成本。
2.3 训练目标
高保真重建既要监督全局频谱包络,也要补回单独使用 频谱损失时容易被过度平滑的精细细节。因此,模型把提供稳定且感知相关梯度的多尺度频谱重建损失,与 2.2 节能锐化细节、恢复高频真实感的对抗判别器结合。令 为参考音频、 为重建信号,生成器最小化频谱、对抗、特征匹配与 KL 项的加权和:
两个频谱项 与 ,分别是 与 的 log-mel 表示和 magnitude-STFT 表示之间的多尺度 距离;它们共享从 32 到 2048 samples 的七种 analysis window,使粗粒度频谱包络与精细谐波细节得到联合监督。STFT 项采用感知加权的 auraloss.MultiResolutionSTFTLoss [21]。
对抗项与 feature-matching 项在 2.2 节的判别器组上计算。对抗训练遵循 least-squares GAN:生成器把每个 推向 ;每个判别器 则学习区分 与 ,最后在 个判别器上取平均。feature-matching 项 计算各个 从 和 提取的中间特征图之间的 距离并取平均;它相当于判别器空间中的感知损失,是稳定对抗训练的主要手段。最后, 是标准闭式 KL divergence,把对角高斯 posterior 约束向 prior 。最终配置把频谱目标的重点放在 STFT 项上(,同时保留多尺度 mel 项);对抗与 feature-matching 项权重均为 1();KL 权重则刻意保持很小(),使重建质量仍占主导,而潜空间只受到轻量规整。
| 变体 | PESQ wb/nb ↑ | STOI ↑ | MR-STFT ↓ | SI-SDR ↑ |
|---|---|---|---|---|
| 缩减前(完整通道) | 3.09 / 3.44 | 0.87 | 0.848 | 8.34 |
| 缩小全部通道后 | 1.91 / 2.37 | 0.74 | 1.08 | -2.80 |
| 编码器层 | 耗时(ms) |
|---|---|
| 第 1 层(最高分辨率) | 305.8 |
| 第 2 层 | 78.1 |
| 第 3 层 | 36.4 |
| 第 4 层 | 197.4 |
2.4 编码器加速
在文本到音频集成中,吞吐瓶颈来自编码器而不是解码器:最初编码 64 条、每条 的音频约需 。因此,作者把编码器视为系统关键模块,在固定重建质量和 潜帧率的前提下优化延迟。
指导原则是:高时间分辨率上的计算代价不成比例地昂贵。前层处理长序列,即使通道数适中也会主导延迟;后层在较低分辨率上运行,是更便宜的容量投放位置。架构本身已经体现这一点——模型最大的 window Transformer 在 瓶颈处而不是高分辨率上运行;作者又通过三个编码器专项步骤进一步落实这一原则。
Step 1:stride 重分配。 重新平衡 stride,让大部分参数作用于较低分辨率的中间特征,延迟从 降到 ,质量损失可以忽略。
Step 2:residual-unit 剪枝。 Dilated residual unit 会增加卷积成本,因此每个编码器 block 只保留一个 dilation 为 1 的 residual unit。延迟从 降到 。
Step 3:首层通道缩减。 逐层 profile 表明,运行在最高分辨率的第一层占据大部分成本(表 2)。缩小所有通道会使重建崩溃:PESQ (wb/nb) 从 3.09/3.44 降到 1.91/2.37,SI-SDR 从 8.34 降到 (表 1);因此只把首层宽度从 64 降到 24,保留后层容量。延迟从 降到 ,且没有损害收敛。
三步叠加得到 加速(),重建质量几乎不变。快速编码由此成为关键实践优势:既缩短离线潜变量提取,也允许在相同步时下使用更大的文本到音频 batch。第 4 节进一步量化端到端加速及其下游影响。
3 数据
规模化训练跨域通用音频 VAE 有三项数据挑战:语料必须足够多样,以避免过拟合任何单一声学条件;清洗必须可靠,不能让损坏或错标音频破坏重建;数据供给还必须足够高效,才能让大型 GPU 集群持续饱和。下面依次处理这三项问题。
3.1 数据收集
Qwen-Audio-VAE 在 500 万小时多领域音频上训练,以支持异质声学条件下的稳健重建。语料覆盖表 3 所列三大类别:
- 语音():中英文语音、多语言方言、历史 ASR 数据和播客。
- 音乐():器乐与人声音乐。
- 一般声音():网络音效、自然与环境声,以及网络视频中的音频。
这种混合对通用音频生成很重要,因为每一类数据都检验重建的不同侧面。语音强调可懂度、说话人特征、韵律和周期结构;音乐强调谐波结构、音色、节奏和宽频细节;一般声音与网络视频音频则引入瞬态事件、噪声环境、重叠声源和高度多样的声学场景。三者联合训练使连续潜表示更稳健,也降低了过拟合干净语音或狭窄声学条件的风险。训练前,所有音频统一重采样为 mono。
| 领域 | 数据类别 | 时长 |
|---|---|---|
| 语音 | 中英、方言、ASR、播客 | 约 300 万 |
| 音乐 | 器乐、人声 | 约 130 万 |
| 一般声音 | 网络音效、自然声、网络视频声音 | 约 80 万 |
| 总计 | 混合 | 约 500 万 |
3.2 数据清洗与质量控制
重建训练对损坏音频、错误 metadata 与分布不平衡很敏感,因此多领域原始池在打包训练前要经过清洗。如图 3 所示,每个样本都通过一系列验证阶段;异常样本会在各阶段被显式处理,而不是悄然进入训练。
- 可访问性检查:缺失且不可恢复的样本直接跳过。
- 时长过滤:检查 duration mismatch,并修复此前有 bug 的“”过滤器;可恢复或误报样本会被重新打包。
- 解码 / 采样率检查:过滤损坏音频和采样率不匹配样本。
- 内容质量分层:按领域检查洁净度与类别一致性;低质量或域不一致的样本(例如器乐中泄漏人声)被降权或排除。
除这些有效性检查外,管线还支持多级过滤和数据分层:语音、音乐、一般声音分别进行加权采样,问题子集可以通过 identifier 回溯。这有助于诊断特定领域的伪影,例如音乐高频损失、音效瞬态涂抹或含噪语音的稳健性。由于 Qwen-Audio-VAE 是文本到音频训练的表示骨干,可靠 metadata 与稳定 sample scheduling 和原始数据规模同样重要。
3.3 数据打包与加载
在 500 万小时规模下,训练不只受模型计算限制,也受 data I/O 限制:原始集合包含许多带异质 metadata 的小文件,随机访问成本高且不稳定。因此,清洗后的样本会打包进带 WebDataset-style index 的二进制 tar shard,每个样本连同 offset、duration、sample rate 和 identifier 等 metadata 一起保存。tar reader 随后可直接 seek 到样本 offset 并读入内存,避免随机小文件 I/O;与此同时,*history-records* 模块跟踪已消费样本,使长期任务能从中断处恢复,并保持稳定、去重的调度。
实践中,这套策略把训练吞吐提高了约 18%。它虽然不改变模型,却实质性加快了实验迭代,也让 500 万小时规模训练更可行。
4 评测
下面检验 Qwen-Audio-VAE 是否实现三项目标——高保真重建、紧凑潜表示与快速编码——并考察这些性质能否延伸到下游文本到音频训练。
4.1 评测设置
Qwen-Audio-VAE 从三条轴线评测:公开基准上的重建保真度、编码效率,以及对下游文本到音频训练的影响。重建分别使用语音基准 LibriSpeech [15]、一般声音基准 AudioCaps [8] 和音乐基准 SongDescriber [13],三者共同覆盖模型目标范围内的声学多样性。对比对象包括代表性的离散神经 codec:AudioDec [24]、DAC [11]、EnCodec [4] 与 WavTokenizer [7];以及连续音频 VAE:MM-Audio [2]、Stable Audio Open [6] 与 Hunyuan-Foley [20]。
论文报告 Mel distance、multi-resolution STFT distance(MR-STFT)、PESQ 与 STOI。单一指标无法完整反映感知质量——例如,客观分数可能忽略高频发闷——因此四项指标需要联合解释:Mel distance 与 MR-STFT 强调频谱保真度,PESQ 与 STOI 强调感知质量和可懂度,潜帧率则反映下游建模成本。
4.2 公开基准评测
三项基准强调互补能力:LibriSpeech 检验干净语音的可懂度,以及说话人身份与韵律的保留;AudioCaps 覆盖环境声、音效和混合场景;SongDescriber 强调音乐与歌声的谐波结构、音色和宽频细节。表 4–6 都按潜帧率对模型分组,因为有意义的比较必须考虑序列长度:Qwen-Audio-VAE 直接与其他低帧率()系统竞争,高帧率 codec 则作为参考。
| 模型 | 帧率 | Mel Dist ↓ | MR-STFT ↓ | PESQ ↑ | STOI ↑ |
|---|---|---|---|---|---|
| AudioDec | 80 Hz | 1.099 | 3.391 | 1.986 | 0.819 |
| DAC | 75 Hz | 0.305 | 0.784 | 4.464 | 0.995 |
| EnCodec | 75 Hz | 1.567 | 4.239 | 1.557 | 0.845 |
| WavTokenizer | 75 Hz | 1.104 | 3.437 | 2.380 | 0.912 |
| Hunyuan Foley | 50 Hz | 0.945 | 1.654 | 3.232 | 0.964 |
| MM Audio | 31.25 Hz | 0.816 | 1.253 | 2.492 | 0.913 |
| Stable Audio Open | 20 Hz | 0.994 | 3.240 | 2.722 | 0.930 |
| Qwen-Audio-VAE(本文) | 12.5 Hz | 0.513 | 0.715 | 3.975 | 0.980 |
| 模型 | 帧率 | Mel Dist ↓ | MR-STFT ↓ | PESQ ↑ | STOI ↑ |
|---|---|---|---|---|---|
| AudioDec | 80 Hz | 1.274 | 4.137 | 1.494 | 0.414 |
| DAC | 75 Hz | 0.320 | 0.958 | 4.392 | 0.974 |
| EnCodec | 75 Hz | 1.593 | 5.006 | 1.541 | 0.559 |
| WavTokenizer | 75 Hz | 1.374 | 3.990 | 1.477 | 0.475 |
| Hunyuan Foley | 50 Hz | 1.001 | 1.835 | 3.181 | 0.869 |
| MM Audio | 31.25 Hz | 0.832 | 1.605 | 1.946 | 0.607 |
| Stable Audio Open | 20 Hz | 1.110 | 1.533 | 2.247 | 0.666 |
| Qwen-Audio-VAE(本文) | 12.5 Hz | 0.649 | 2.315 | 2.952 | 0.812 |
4.2.1 LibriSpeech
在 LibriSpeech 上,Qwen-Audio-VAE 以仅 的帧率,在低帧率组全部指标上最优(Mel 0.513、MR-STFT 0.715、PESQ 3.975、STOI 0.980)。DAC 等高帧率 codec 的原始保真度更高,但代价是潜序列长 –;这正是下游生成希望避免的成本。帧率和架构变体见 4.3 节。
4.2.2 AudioCaps
AudioCaps 的内容更多样且瞬态更丰富,比干净语音更难。Qwen-Audio-VAE 再次在低帧率组的 Mel distance、PESQ 与 STOI 上领先,说明表示并非只适配语音;但其 MR-STFT 高于 Stable Audio Open,提醒我们在一般音频上,细粒度频谱匹配与感知可懂度并不总是同向变化。
| 模型 | 帧率 | Mel Dist ↓ | MR-STFT ↓ | PESQ ↑ | STOI ↑ |
|---|---|---|---|---|---|
| AudioDec | 80 Hz | 1.206 | 2.631 | 1.162 | 0.472 |
| DAC | 75 Hz | 0.574 | 1.740 | 4.274 | 0.978 |
| EnCodec | 75 Hz | 1.110 | 2.389 | 1.391 | 0.634 |
| WavTokenizer | 75 Hz | 1.198 | 2.584 | 1.174 | 0.501 |
| Hunyuan Foley | 50 Hz | 0.503 | 1.033 | 4.400 | 0.987 |
| Stable Audio Open | 20 Hz | 0.752 | 0.986 | 2.617 | 0.838 |
| Qwen-Audio-VAE(本文) | 12.5 Hz | 0.671 | 0.903 | 3.319 | 0.883 |
4.2.3 SongDescriber
在 SongDescriber 上,Qwen-Audio-VAE 四项指标均超过 Stable Audio Open,说明紧凑潜表示也能捕捉音乐的谐波和音色结构;高帧率系统中,面向音乐的 Hunyuan-Foley 最强,这符合一个针对音乐调优的 模型的预期。综合三项基准,Qwen-Audio-VAE 的目标工作点得到了验证:它在语音、一般声音和音乐上始终是最强的低帧率模型,同时使用最少潜帧;相对高帧率 codec,它以少量原始保真度差距换取 – 更短的潜序列。图 4 在 LibriSpeech 上给出定性证据:本文的 重建比更高帧率的 Stable Audio Open 更忠实地跟随 ground-truth 频谱,尤其体现在框选的高频区域。
4.3 消融实验
作者以 LibriSpeech 为代表基准,在表 7 中隔离各项设计选择;各行共享主模型的编码器/解码器拓扑,只改变被消融的因素。
| 变体 | 帧率 | Mel Dist ↓ | MR-STFT ↓ | PESQ ↑ | STOI ↑ |
|---|---|---|---|---|---|
| Qwen-Audio-VAE(主模型) | 12.5 Hz | 0.513 | 0.715 | 3.975 | 0.980 |
| Qwen-Audio-VAE-50Hz | 50 Hz | 0.467 | 0.637 | 4.040 | 0.987 |
| 移除 Encoder Transformer | 12.5 Hz | 0.620 | 0.728 | 3.711 | 0.973 |
| 64 dim | 12.5 Hz | 0.717 | 0.807 | 3.129 | 0.951 |
| 64 dim + 大解码器 | 12.5 Hz | 0.715 | 0.801 | 3.155 | 0.953 |
Encoder Transformer。 移除瓶颈 window Transformer 后,Mel distance 从 0.513 升至 0.620,其余指标也都下降,说明在激进时间压缩下,每个潜帧需要概括较长音频,attention 聚合确有价值。
潜维度。 把潜表示减半到 64 维会持续损害重建;加宽解码器也无法恢复。限制因素因此是信息如何在潜空间中组织,而不是解码器容量。
帧率。 变体在所有指标上最优,但序列长度是四倍。由于下游文本到音频成本随序列长度增长, 模型在效率—质量之间更合适,因此作为默认配置。
4.4 编码效率
下面从重建质量转向效率轴。表 8 报告编码 64 条、每条 音频的 wall-clock 延迟,这是文本到音频离线潜变量提取的代表负载。2.4 节的三项优化把延迟从 降到 ();主要收益来自把计算移出高分辨率前层,同时保留低分辨率后层容量。
| 模型 / 变体 | 64×30 秒编码延迟 ↓ | 相对加速 |
|---|---|---|
| Qwen-Audio-VAE 加速前 | 1957 ms | 1.00× |
| + Encoder stride 优化 | 1361 ms | 1.44× |
| + Residual unit 剪枝 | 747 ms | 2.62× |
| + 首层通道缩减 | 541 ms | 3.62× |
| Stable Audio Open† | 1640 ms | 1.19× |
低帧率与快速编码互补:前者缩短下游 DiT 序列,后者降低产生潜变量本身的成本。值得注意的是,Stable Audio Open 虽以更高的 帧率运行,却仍慢于优化后的编码器;这说明两项性质是独立优势,而不是同一个“速度—帧率”折中。
4.5 文本到音频集成
首先量化编码器加速对文本到音频训练的影响。作者固定同一个 150M 参数 diffusion Transformer,分别使用加速前、后编码器产生的潜变量训练;硬件为 L20()GPU,数据为过滤后的 LAION-Audio-630K [25]()。在固定约 的吞吐下,消除编码瓶颈后,模型可使用 更大的 batch(64 对 16),每步处理 更多音频;相同 wall-clock 预算下,AudioCaps CLAP 从 0.29 升到 0.33(表 9)。作为参照,Stable Audio Open 也通过同一管线训练;其更高帧率、更慢的编码器需要更长训练时间,质量却更低:CLAP 0.27 需要 ,而本文的 0.33 需要 。
| 设置 | GPU 配置 | Batch Size | 每 batch 音频 | 训练时间 | AudioCaps CLAP ↑ |
|---|---|---|---|---|---|
| Stable Audio Open | 32×L20 80G | 16 | 160 s | 60 h | 0.27 |
| 本文(无编码器加速) | 32×L20 80G | 16 | 160 s | 36 h | 0.29 |
| 本文 | 32×L20 80G | 64 | 640 s | 36 h | 0.33 |
除吞吐外,潜空间结构本身也影响下游生成。作者从默认潜表示(KL 权重 )出发,训练更强正则的变体(),选择一个在 reconstruction loss 与 KL loss 之间取得平衡的 checkpoint;随后在 AudioCaps test set 上,用 FD (VGG)、Inception Score(IS)与 CLAP 评测二者(表 10)。更强正则的潜表示使三项生成指标全部退化。作者将其归因于潜表示的信息密度:更强地把 posterior 拉向 prior 会丢掉 Transformer 依赖的结构;另一个独立观察是,更高维的潜表示也更难由 diffusion Transformer 拟合。将潜表示与预训练音频表示(例如 CLAP 或 Omni audio encoder)对齐,是改善生成可学习性的潜在方向。
| 设置 | FD (VGG) ↓ | IS ↑ | CLAP ↑ |
|---|---|---|---|
| 本文() | 2.44 | 8.94 | 0.33 |
| 本文() | 5.18 | 7.09 | 0.30 |
5 结论
本文提出 Qwen-Audio-VAE:一组面向可扩展通用音频生成的连续音频自编码器。设计围绕生成骨干必须同时满足的三项目标展开:跨多类音频的高保真重建、保持下游序列简短的紧凑潜表示,以及大规模训练所需的高吞吐编码。模型把因果编码器—解码器与 连续瓶颈结合,把 window Transformer 集中在这一低帧率处,并加入一组互补判别器提供对抗监督。在 500 万小时多领域音频上训练后,它能在异质声学条件下忠实重建语音、音乐和一般声音。
在公开基准(LibriSpeech、AudioCaps、SongDescriber)上,Qwen-Audio-VAE 在使用最少潜帧的同时,始终是最强的低帧率模型。非对称编解码器和面向延迟的编码器剪枝,把 编码延迟从 降到 (),且不损害重建;这种加速转化成了系统层收益:在文本到音频训练中,更快的潜变量提取可在相同训练时间下支持 更大的 batch 和更高吞吐。更广泛地说,结果表明通用音频生成的自编码器不应只优化重建,而应联合考虑压缩、编码吞吐、数据可扩展性和潜空间可学习性。未来将探索与预训练音频表示对齐、改善高频与瞬态重建、加强数据分层,并在更大规模文本到音频训练中验证。
参考文献
参考文献保留原始书目信息与论文顺序。
- Guibin Chen, Dixuan Lin, Jiangping Yang, Chunze Lin, Junchen Zhu, Mingyuan Fan, Hao Zhang, Sheng Chen, Zheng Chen, Chengcheng Ma, et al. Skyreels-v2: Infinite-length film generative model. arXiv preprint arXiv:2504.13074, 2025.
- Ho Kei Cheng, Masato Ishii, Akio Hayakawa, Takashi Shibuya, Alexander Schwing, and Yuki Mitsufuji. MMAudio: Taming multimodal joint training for high-quality video-to-audio synthesis. In Conference on Computer Vision and Pattern Recognition (CVPR), 2025.
- Gheorghe Comanici, Eric Bieber, Mike Schaekermann, Ice Pasupat, Noveen Sachdeva, Inderjit Dhillon, Marcel Blistein, Ori Ram, Dan Zhang, Evan Rosen, et al. Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities. arXiv preprint arXiv:2507.06261, 2025.
- Alexandre Défossez, Jade Copet, Gabriel Synnaeve, and Yossi Adi. High fidelity neural audio compression. arXiv:2210.13438, 2022.
- Patrick Esser, Robin Rombach, and Björn Ommer. Taming transformers for high-resolution image synthesis. In Conference on Computer Vision and Pattern Recognition (CVPR), 2021.
- Zach Evans, Julian D. Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons. Stable audio open. In IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2025.
- Shengpeng Ji, Ziyue Jiang, Wen Wang, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Xize Cheng, Zehan Wang, Ruiqi Li, et al. WavTokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling. In International Conference on Learning Representations (ICLR), 2025.
- Chris Dongjoo Kim, Byeongchang Kim, Hyunmin Lee, and Gunhee Kim. AudioCaps: Generating captions for audios in the wild. In North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), 2019.
- Diederik P. Kingma and Max Welling. Auto-encoding variational bayes. In International Conference on Learning Representations (ICLR), 2014.
- Jungil Kong, Jaehyeon Kim, and Jaekyoung Bae. HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis. In Advances in Neural Information Processing Systems (NeurIPS), 2020.
- Rithesh Kumar, Prem Seetharaman, Alejandro Luebs, Ishaan Kumar, and Kundan Kumar. High-fidelity audio compression with improved RVQGAN. In Advances in Neural Information Processing Systems (NeurIPS), 2023.
- Haohe Liu, Zehua Chen, Yi Yuan, Xinhao Mei, Xubo Liu, Danilo Mandic, Wenwu Wang, and Mark D. Plumbley. AudioLDM: Text-to-audio generation with latent diffusion models. In International Conference on Machine Learning (ICML), 2023.
- Ilaria Manco, Benno Weck, Seungheon Doh, Minz Won, Yixiao Zhang, Dmitry Bogdanov, Yusong Wu, Ke Chen, Philip Tovstogan, Emmanouil Benetos, Elio Quinton, George Fazekas, and Juhan Nam. The song describer dataset: a corpus of audio captions for music-and-language evaluation. In Machine Learning for Audio Workshop, NeurIPS, 2023.
- OpenAI. Gpt-4o, 2024. URL https://openai.com/index/hello-gpt-4o/.
- Vassil Panayotov, Guoguo Chen, Daniel Povey, and Sanjeev Khudanpur. Librispeech: an asr corpus based on public domain audio books. In 2015 IEEE international conference on acoustics, speech and signal processing (ICASSP), pp. 5206–5210. IEEE, 2015.
- William Peebles and Saining Xie. Scalable diffusion models with transformers. In International Conference on Computer Vision (ICCV), 2023.
- Zhiliang Peng, Jianwei Yu, Wenhui Wang, Yaoyao Chang, Yutao Sun, Li Dong, Yi Zhu, Weijiang Xu, Hangbo Bao, Zehua Wang, et al. Vibevoice technical report. arXiv preprint arXiv:2508.19205, 2025.
- Team Qwen. Qwen3.5-omni technical report, 2026. URL https://arxiv.org/abs/2604.15804.
- Team Seedance, De Chen, Liyang Chen, Xin Chen, Ying Chen, Zhuo Chen, Zhuowei Chen, Feng Cheng, Tianheng Cheng, Yufeng Cheng, et al. Seedance 2.0: Advancing video generation for world complexity. arXiv preprint arXiv:2604.14148, 2026.
- Sizhe Shan, Qiulin Li, Yutao Cui, Miles Yang, Yuehai Wang, Qun Yang, Jin Zhou, and Zhao Zhong. HunyuanVideo-Foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation. arXiv preprint arXiv:2508.16930, 2025.
- Christian J. Steinmetz and Joshua D. Reiss. auraloss: Audio focused loss functions in PyTorch. In Digital Music Research Network One-day Workshop (DMRN+15), 2020.
- Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, et al. Wan: Open and advanced large-scale video generative models. arXiv preprint arXiv:2503.20314, 2025.
- Jun Wang, Xijuan Zeng, Chunyu Qiang, Ruilong Chen, Shiyao Wang, Le Wang, Wangjing Zhou, Pengfei Cai, et al. Kling-Foley: Multimodal diffusion transformer for high-quality video-to-audio generation. arXiv preprint arXiv:2506.19774, 2025.
- Yi-Chiao Wu, Israel D. Gebru, Dejan Marković, and Alexander Richard. AudioDec: An open-source streaming high-fidelity neural audio codec. In IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2023a.
- Yusong Wu, Ke Chen, Tianyu Zhang, Yuchen Hui, Taylor Berg-Kirkpatrick, and Shlomo Dubnov. Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation. In IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2023b.
- Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, et al. Cogvideox: Text-to-video diffusion models with an expert transformer. In International Conference on Learning Representations, volume 2025, pp. 83048–83077, 2025.
- Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, and Marco Tagliasacchi. Soundstream: An end-to-end neural audio codec. IEEE ACM Trans. Audio Speech Lang. Process., 2022.
- Xin Zhang, Dong Zhang, Shimin Li, Yaqian Zhou, and Xipeng Qiu. Speechtokenizer: Unified speech tokenizer for speech large language models. CoRR, abs/2308.16692, 2023.
6 Core Contributors
7 附录
7.1 模型配置
为保证完整性与可复现性,表 11 按信号流顺序列出 Qwen-Audio-VAE 主模型的完整配置;关键数值也已在 2.2 节正文中给出。
| 模块 | 超参数 | 取值 |
|---|---|---|
| I/O | 音频 | 24 kHz, mono |
| 潜变量 | 12.5 Hz、128 维、对角高斯 | |
| 编码器(因果) | 下采样 | strides 8,5,4,3(480×,→50 Hz) |
| 通道 | 24→128→256→512→1024 | |
| 每 block residual unit | 1(dilation 1) | |
| 瓶颈 | 额外下采样 | 4×(50 Hz→12.5 Hz) |
| Window Transformer (pre & post) | 8 层、dim 1024、16 heads、window 72 | |
| 解码器(因果) | 上采样 | strides 8,5,4,3(480×,→24 kHz) |
| 基础通道 | 1536 | |
| 每 block residual unit | 3(dilations 1,3,9) | |
| 判别器 | 类型 | multi-period, multi-resolution STFT, multi-scale STFT, sub-band CQT |
7.2 训练细节
模型在完整多领域语料上从头训练。表 12 给出完整设置,包括 optimizer、生成器与判别器各自的 learning rate、learning-rate schedule 和硬件。
| 超参数 | 取值 |
|---|---|
| 训练数据 | 500 万小时,多领域(语音 / 音乐 / 一般声音) |
| 采样率 | 24 kHz(mono) |
| 训练片段长度 | 6 秒(144,000 samples) |
| 优化器 | AdamW, β=(0.5,0.9), ε=10^-9 |
| 学习率(G / D) | 2×10^-4 / 1×10^-4 |
| 学习率调度 | 线性 warmup 8,000 步;从第 400,000 步衰减 |
| Batch size | 每 GPU 2,gradient accumulation 1 |
| 总步数 | 240 万 |
| 梯度裁剪 | max-norm 1.0 |
| GPUs | 32×A100 80G |
| 潜帧率 / 维度 | 12.5 Hz / 128 |
7.3 判别器配置
2.2 节介绍了对抗训练使用的四个判别器;表 13 给出精确周期、FFT size 和 constant- 分辨率。
7.4 模型变体
表 14 把 4.3 节的消融行映射到对应配置字段。所有变体共享主模型的 编解码拓扑(strides ),只在潜维度(由 bottleneck projection 决定)、编码器侧 window Transformer、解码器宽度,以及决定最终帧率的瓶颈下采样因子上不同。
| 变体 | 帧率 | 潜维度 | 解码器维度 | 说明 |
|---|---|---|---|---|
| Qwen-Audio-VAE(主模型) | 12.5 Hz | 128 | 1536 | 完整模型 |
| 移除 Encoder Transformer | 12.5 Hz | 128 | 1536 | 移除编码器侧 window Transformer |
| 64 dim | 12.5 Hz | 64 | 1536 | 更小潜变量 |
| 64 dim + 大解码器 | 12.5 Hz | 64 | 2048 | 更小潜变量 + 更宽解码器 |
| 50 Hz 变体 | 50 Hz | 128 | 1536 | 无额外瓶颈下采样 |