Stable Audio 3 是一组面向变长音频生成与编辑的快速 latent diffusion 模型,包含 small、medium、large 三个规模。由于这些模型可以生成数分钟音频,原生变长能力至关重要:生成短音频时无需承担最大时长的完整计算成本。模型还支持 inpainting,可定向编辑音频,也可续写较短录音。Stable Audio 3 构建在一种新的 semantic-acoustic autoencoder 之上;它把音频映射到紧凑 latent 空间,在保留音频保真度的同时鼓励语义结构,从而提高 diffusion generation 的效率。最后,作者采用 Adversarial Post-Training,在减少推理步骤的同时提升生成质量、保真度与 prompt alignment。Stable Audio 3 仅使用获许可数据与 Creative Commons 数据训练,在 H200 GPU 上生成音乐或音效不到 2 秒,在 MacBook Pro M4 上也只需数秒。作者公开可在消费级硬件运行的 small 与 medium 模型权重,以及对应的训练、推理 pipeline。https://github.com/Stability-AI/stable-audio-tools http://github.com/Stability-AI/stable-audio-3
Stable Audio 3 text-to-audio 模型支持变长生成,以及基于 inpainting 的编辑。
Stable Audio 3 可在保持低推理延迟的同时生成长音频。参数量仅统计 Diffusion Transformer;SAME-S 与 SAME-L 分别为 108M、852M 参数。
| 模型 | 最大时长 | 可学习参数量 | H200 推理时间 | 开放权重 | 获许可数据 | 生成 | |
|---|---|---|---|---|---|---|---|
| 音乐 | 音效 | ||||||
| small-music | 2m | 459M | 0.44s | ✓ | ✓ | ✓ | — |
| small-sfx | 2m | 459M | 0.44s | ✓ | ✓ | — | ✓ |
| medium | 6m 20s | 1.4B | 1.31s | ✓ | ✓ | ✓ | ✓ |
| large | 6m 20s | 2.7B | 1.80s | — | ✓ | ✓ | ✓ |
1 · 引言
音乐与音频生成的最新进展主要由两类模型推动:自回归模型 [1,2,3,4] 与 latent diffusion 模型 [5,6,7,8,9,10]。自回归模型依次处理离散音频 token,已经取得了优异效果;latent diffusion 模型则生成连续 latent 表示,再由独立 autoencoder 解码,从而避开离散 tokenization 与自回归 sampling。还有一些混合方法先由自回归模型生成 token,再用 diffusion model 细化 [11,12]。Stable Audio 3 由 small、medium、large 三种规模的 latent diffusion 模型组成(见 Table 1)。
可变长度生成是 Stable Audio 3 的一项关键功能,特别是因为我们的模型生成非常长的音频(Table 1)。虽然自回归模型由于其顺序性质自然支持可变长度输出,但扩散模型通常需要立即生成整个音频长度 [5,6](Figure 2:a)。这意味着,例如,生成带有 small-music 的短样本将需要生成大部分无声的 2m 音频。为了解决这种计算和内存效率低下的问题,Stable Audio 3 支持可变长度生成(Figure 2:b),从而实现高效合成,而无需对短输出进行全长计算。这种效率提升对于在计算和内存预算有限的消费级硬件上部署开放权重模型至关重要。
固定长度与变长生成。(a) 固定长度生成不论请求时长 为何,都分配 个 embedding;短音频的大量计算因此浪费在 zero-padded silence 上。(b) 变长生成只分配与请求时长 成比例的 个 embedding(同样使用 silence padding,见 Section 3.1)。
可控性也是现代生成音频和音乐模型的一个重要特征。 Stable Audio 3 包含 inpainting 功能,允许编辑目标音频片段,例如修改单个片段(Figure 3:第一行)、执行多片段编辑(Figure 3:第二行)或支持延续(Figure 3,第三行),其中模型可以将给定音频连贯地扩展到其原始端点之外。这使得诸如打击乐声音的瞬态编辑、为未完成的歌曲产生想法或短录音的扩展等应用成为可能。
基于 inpainting 的编辑。用户提供音频并指定待编辑的目标区间(灰色 mask),其余原始音频保持不变(斜线区域),可完成单区间、多区间编辑和 causal continuation。
Stable Audio 3 使用构建在 semantic-acoustic autoencoder 之上的 latent diffusion 模型。该 latent 表示既要保持重建保真度,又要便于生成建模,并形成可供下游任务使用的语义结构。作者希望在高保真音频重建的同时,学习一个紧凑、适合 diffusion generation、且语义组织良好的 latent 空间;其下采样倍率为 。频谱重建损失与 adversarial training [13,14] 用于提升声学保真度,chroma 与 interaural level difference 等 latent-space regression 目标用于注入语义结构。 下采样远高于已有工作中常见的 或 [13,14,15],显著缩短序列,使 small-music 能够在消费级 GPU,甚至 MacBook Pro CPU 上生成长音频与音效。
Diffusion model 通常需要多次迭代去噪才能生成高质量输出 [16,17],但响应迅速的创作工具又要求低延迟。为此,作者采用 Adversarial Post-Training [18],在维持或提升输出质量的同时减少采样步骤。完整训练 pipeline 分为三个阶段:Flow Matching 预训练 [19,20,21]、ODE Distillation Warmup [22,23],以及 Adversarial Post-Training [18]。
Stable Audio 3 的设计目标是被广泛社区采用:模型仅使用获许可数据与 Creative Commons 数据训练,使艺术家和开发者使用时不必担忧训练数据的法律风险。此外,模型可从数据中心级 GPU(如 H200)一直扩展到消费级 GPU,乃至 MacBook Pro。Stable Audio 3 的主要贡献如下:
- 公开可在消费级硬件运行的 small 与 medium 模型权重(Table 1)。
- 在器乐 text-to-audio 与音效生成上达到 SOTA(Section 5)。
- 推理很快:在 H200 上不到 2 秒即可生成最长 6 分 20 秒的音频(Sections 5.2、5.3)。
- 支持基于 inpainting 的单区间、多区间编辑与 continuation(Section 5.6)。
- 提出以 latent diffusion model 原生生成变长音频的新方法(Section 3.1)。
- 技术改进包括:兼顾高保真重建与语义信息的 semantic-acoustic autoencoder(Section 2.1);用于上下采样的 Transformer Resampling Block(TRB);引入 differential attention [24]、AdaLN conditioning [25] 与 memory embeddings [26,27] 的 Diffusion Transformer(Figure 5);Flow Matching 的 minibatch optimal transport coupling(Section 3.2);以及先 Distillation Warmup、再 Adversarial Post-Training 的 few-step generation 训练(Sections 3.3、3.4)。
1.1 · 相关工作
开放模型。早期的开放模型主要基于自回归方法 [1,28] 或 latent diffusion 方法 [7,8,10,29,30,31,32]。最近的开放模型继续探索自回归方法 [3,4],同时还引入了 Flow Matching 方法 [18,33,34] 以及将自回归建模与 Flow Matching [12,11,33] 相结合的混合架构。这些模型已应用于一系列音频生成任务,包括器乐 [8,1,10]、音效 [7,10,18,28,29,31] 以及人声歌曲 [3,4,11,12,32,34,33]。 Stable Audio 3 是基于 Flow Matching 的开放权重模型(small、medium)系列,用于器乐和音效生成。为了进行评估,我们与最具竞争力的开放模型进行比较。
变长生成。自回归模型按序生成 token,直至产生 end-of-sequence token,因此天然支持变长输出。Latent diffusion model 通常定义在固定长度序列上,较短输入必须 padding [5,6];推理成本因而取决于预设最大长度而非实际内容长度,既低效,也限制了长音频生成的可扩展性。图像 diffusion 也经历过类似问题:早期模型 [35] 借助分辨率 conditioning 与 crop 处理不同尺寸,现代 Transformer 方法则依靠位置编码直接接收不同尺寸的输入 [36,37]。音频 diffusion 已开始采用 autoregressive blockwise diffusion 等方法 [33],但完全原生的 diffusion 变长音频生成仍未解决。作者认为 Stable Audio 3 是首个以类似现代图像 diffusion 的方式处理这一问题的音频模型。
语义 latent 空间。大多数 latent diffusion 模型对来自 VAE 的低维(64、32)latent 进行操作,这些 VAE 专注于声学重建 [28,31]。表示 autoencoder (RAE) [38,39] 已表明,在更高维、语义结构化的 latent 空间中进行扩散可以在图像域中产生更快的收敛和更好的生成质量。据我们所知,Stable Audio 3 模型是第一个在音频领域探索这一想法的模型,它依赖于 Semantically-Aligned Music autoEncoder (SAME) [40],它产生 256 维的 latent,旨在以高下采样率对声学保真度和高级语义结构进行编码(4096)。
可控性。 随着创意工作流程需要超越提示 [41] 的控制,对可控音频生成的需求正在增加。之前的工作可以分为以下几类:基于掩码、基于指令、推理时间控制、全局控制、时变控制和歌词编辑。基于掩码的方法通过生成给定音频 [42,43,44] 的掩码片段来实现本地化编辑或延续。基于指令的方法支持通过结构化命令 [45,46,47] 进行添加、删除、处理或替换声源等操作。推理时间控制包括基于引导的方法和反演方法 [18,48,49,50,51,52]。全局调节方法基于参考信号 [53,54] 生成音频,而时变控制引入时间动态约束 [55,56,57,58]。歌词编辑允许通过修改文本内容进行额外控制 [4,11,34]。 Stable Audio 3 专注于基于掩模的编辑,因为它不需要额外的训练数据注释。相反,训练依赖于简单的随机和因果掩蔽。我们不考虑基于指令的方法,这种方法通常需要带有词干的训练数据集,也不考虑歌词编辑,这超出了我们的工作范围。我们还排除了推理时间、全局和时变控制,因为这些控制通常依赖于模型微调 (LoRA [58,57]) 或辅助模型 (ControlNet [55])。请注意,此类控件可以通过在 Stable Audio 3 发布后进行微调来包含。
少步生成。扩散的迭代去噪过程会导致较高的推理延迟,从而激发了 few-step generation 方法。减少扩散中的采样步骤数量可以通过蒸馏 [22,59] 或对抗方法 [60,61] 来实现。在(步骤)蒸馏方法中,教师提供直接监督来训练蒸馏的几步生成器,该生成器通过蒸馏教师的轨迹,学习将多个推理步骤映射为单个步骤或少量步骤。然而,大多数蒸馏方法都存在实际缺陷,例如在线方法 [62,63,59,64,65,66,67,68,69](需要在内存中保存 2-3 个完整模型),因此训练成本高昂,或者离线方法 [19,22,70](需要大量资源来生成和存储轨迹以供以后训练)。为了避免这些缺点,一些人探索了 adversarial post-training(无蒸馏)[71,72]。这些工作主要是对抗性的,与使用对抗性辅助损失 [69,67,66,73,61] 的蒸馏方法相反,并且使用真实数据而不是教师生成的样本,从而免除了使用轨迹的昂贵要求。对抗性损失鼓励真实感,使每个估计都比标准的蒸馏估计更好。这种改进的估计使训练后的模型能够使用更少的采样步骤 [71,72]。在音频领域:AudioLCM [74]使用 latent 一致性蒸馏,Presto [67]组合逐步和分层蒸馏,ARC [18]组合相对论和对比对抗性损失,Woosh 使用 MeanFlow 蒸馏[75]。 Stable Audio 3 基于 ARC adversarial post-training,但也使用蒸馏作为预热。
2 · 架构
Stable Audio 3 由两个组件构成:semantic-acoustic autoencoder,负责在 waveform 与连续 latent 空间之间双向映射;以及 Diffusion Transformer,依据 text prompt、时长信息和 inpainting mask 生成 latent 序列。Figure 4 展示了完整系统。训练细节见 Section 3,更多实现细节可通过作者公开的代码在线查阅。
44.1 kHz stereo audio 经 SAME autoencoder 编码为 256 维 latent 序列( 下采样)。Diffusion Transformer 依据 T5Gemma text embedding(cross-attention)、duration embedding(cross-attention 与 AdaLN),以及 diffusion timestep (AdaLN)生成 latent。Inpainting conditioning 将 的 masked input 与 binary mask 拼接为 ,投影到模型维度后加入每个 Transformer block。最后由 SAME decoder 从 latent 重建音频。
Stable Audio 3 的模型配置。、、 分别表示 latent dimension、Transformer block 数与 attention head 数;small 不使用 differential attention。参数量仅统计 Diffusion Transformer;SAME-S 与 SAME-L 分别为 108M、852M 参数。
| 模型 | differential attention | SAME autoencoder | 最大时长 | 可学习参数量 | |||
|---|---|---|---|---|---|---|---|
| small | 1024 | 20 | 16 | — | SAME-S | 2m | 459M |
| medium | 1536 | 24 | 24 | ✓ | SAME-L | 6m 20s | 1.4B |
| large | 2048 | 26 | 32 | ✓ | SAME-L | 6m 20s | 2.7B |
2.1 · Semantic-Acoustic Autoencoder
SAME autoencoder [40]。Stereo audio 先重排为 patch embedding( 下采样),再由 encoder TRB 进一步下采样 ,经过 soft-normalization bottleneck 后投影到 latent dimension 。Decoder TRB 与 unpatching 随后重建 latent,总下采样倍率为 。
本文 autoencoder 基于 SAME [40]:一种 Transformer audio autoencoder,把最初的 patching stage 与 Transformer Resampling Block(TRB,Figure 6)组合起来。Patching 会把 stereo audio 重排为互不重叠、每通道 256 sample 的 patch,对应 下采样。TRB 将可学习 output embedding 交织进输入序列,再用包含 differential attention [24] 与 rotary positional embedding [76] 的 Transformer layer stack 处理,从而进一步完成 下采样。
TRB 以 embedding interleaving 实现 下采样的示例。输入按每 2 个元素分组,每段附加一个可学习 output embedding;完整交织序列由 层 Transformer 处理,最后保留 output embedding 、丢弃 ,形成下采样表示。
组合压缩比为 ,对于 44.1 kHz 立体声输入,产生约 10.76 Hz 的 256 维 latent 嵌入。在编码器和解码器之间,软归一化瓶颈通过使用可学习仿射变换和运行标准偏差跟踪来限制 latent 的规模,从而提供确定性编码。
对于上采样,TRB 过程相反:每个输入 embedding 与多个输出嵌入配对,然后在处理后提取这些输出嵌入。例如,为了对 2 进行上采样,我们将两个输出嵌入与每个输入 embedding 交错,以在处理后保留输出嵌入并丢弃原始输入嵌入。
SAME autoencoder 的训练联合使用五类损失:(i) 频谱重建损失、(ii) 对抗损失、(iii) diffusion alignment 损失、(iv) 语义回归损失,以及 (v) 对比式 latent alignment 损失。它们共同维持重建保真度、面向生成的可建模性,以及可供下游任务使用的语义结构。具体而言,SAME 在七种分辨率上计算多分辨率 STFT 损失(FFT size 从 32 到 2048,各分辨率均为 75% overlap),并在 STFT 前应用 K-weighting 预加重滤波。每个分辨率的损失由 spectral contrast、修正的 log-magnitude L1 距离,以及 instantaneous frequency 与 group delay(IFGD)相位损失组成 [40]。为处理 stereo audio,STFT 损失分别在和差(mid/side)表示与逐通道(left/right)表示上独立计算。对抗损失采用 relativistic GAN 目标。Diffusion alignment 损失使用一个 small diffusion transformer(4 层、768 维 embedding),在 autoencoder 的 latent 空间中以 Flow Matching 目标联合训练;梯度会回传到 encoder,从而促使 latent 几何更适合 diffusion-based generation。SAME 的语义回归损失包含两个轻量线性回归器(各为单个 convolution),分别预测 chroma 与 interaural level difference(ILD)特征。最后,对比式 latent alignment 损失使用一个基于 Transformer 的判别器(4 层、1024 维),判断 latent 序列、wavelet audio 特征与 T5Gemma text embedding 组成的三元组是否来自同一输入,从而促使 latent 同时保留音频层级与跨模态语义。综上,频谱与对抗损失负责高质量声学重建,语义回归与对比式 latent alignment 负责语义结构,而 diffusion alignment 则直接面向下游 diffusion 建模。
Diffusion training 期间会冻结 SAME autoencoder。Small 使用 SAME-S:一个参数更少、为 CPU inference 优化的 distilled variant,共 108M 参数;medium 与 large 使用 852M 参数的 SAME-L。二者的压缩率与 latent 维度相同,更多细节见 SAME 原论文 [40]。
2.2 · Diffusion Transformer
我们的生成模型是一个在 SAME latent 上运行的 Diffusion Transformer [25]。Transformer 已在 latent diffusion 中取代 U-Net [36];Stable Audio 3 在此基础上针对 text-to-audio 做了适配,加入基于 inpainting 的编辑能力、differential attention [24]、memory embeddings [26] 与变长支持。
Diffusion Transformer 架构。SAME latent 从 维线性投影到 维,并在序列前添加 个 memory embeddings,作为所有位置均可 attention 的全局 memory buffer。序列经过 个 latent dimension 为 的 Transformer block 后,移除 memory embeddings,再投影回 维。图中省略输入、输出两侧的 convolution。
SAME latent 首先经过带 residual connection 的 convolution,再由 linear projection 从 256 维映射到 Transformer latent dimension 。进入 Transformer 前,序列头部会添加 64 个可学习 memory embeddings;它们为所有位置提供可 attention 的全局 memory buffer。随后,序列经过 个 Transformer block,latent dimension 为 、attention head 数为 。最后一个 block 后移除 memory embeddings,把序列投影回 SAME 的 256 维,并以另一个带 residual connection 的 convolution 得到输出。
Conditioning 通过三条路径进入 Transformer(Figure 8)。第一,diffusion timestep 与 duration(generation length)被映射为全局 embedding,经 AdaLN 调制每个 Transformer block 的 self-attention 与 feed-forward layer。第二,冻结 T5Gemma encoder 的 text embeddings 与 duration embedding 拼接后,通过 cross-attention conditioning。第三,inpainting 使用 local-additive conditioning:参考音频与指示编辑位置的 binary mask 经 MLP projection 后,加到每个 Transformer block 的 hidden state。
我们训练了 3 个模型,它们具有相同的设计,但 Transformer 容量、最大生成长度和所用 autoencoder 不同(Table 2)。medium 与 large 在 self-attention 和 cross-attention 层中均使用 differential attention [24],相对于 small 使用的标准多头 attention,Q 和 K 投影尺寸大致增加了一倍。
Transformer 块。 每个 Transformer block 均由 self-attention、cross-attention、局部加性调节和前馈网络组成(Figure 8)。
单个 Transformer block 的高层结构(左)与细化结构(右)。 表示 sigmoid。带 gate、scale、shift 的 AdaLN 用于 diffusion timestep 与 duration conditioning;cross-attention 用于 text 与 duration conditioning;local-additive conditioning 用于 inpainting。
Self-attention 遵循 AdaLN [25,36,75] 的预规范设计。输入通过 RMSNorm [77] 进行归一化,然后扩散 timestep 和持续时间调节信号通过 AdaLN 注入(联合)。在接下来的 self-attention 层中,每个头都采用 QK-RMSNorm 来防止点积输出不受约束地增长 [78]。位置嵌入是带有部分旋转的 RoPE [76]:每个头的尺寸中只有 32 个被旋转,而其余部分不携带位置信息。最后,AdaLN 门在剩余连接之前进一步调节输出。
Cross-attention 采用相同的 pre-norm 设计,但不使用 AdaLN。输入 embedding 先经 RMSNorm,再投影为 query;key 与 value 则由 conditioning context(text 与 duration embeddings)分别投影得到。与 self-attention 一样,每个 head 都使用 QK-RMSNorm [77,78],且不加入 positional embedding。输出 embedding 随后加回 residual stream。
本地附加调节通过在前馈网络之前添加帧对齐信号来实现 inpainting。 inpainting 调节信号(与屏蔽参考音频连接的二进制屏蔽)通过具有 SiLU 的 2 层 MLP 进行投影,并直接添加到 cross-attention 输出。 MLP 层是零初始化的,因此可以将 inpainting 路径引入到预训练模型中,而不会破坏其学习的表示。
前馈网络是 SwiGLU [79],其中门控线性单元在模型维度 的 4 上运行,并且门是 Swish (SiLU) 门而不是 sigmoid。选通后,线性层从 投影回 。该部分还使用基于 RMS 的预范数和 AdaLN 作为 self-attention 进行扩散 timestep 和持续时间调节。
自适应层归一化 (AdaLN):扩散 timestep 和持续时间调节。扩散 timestep 映射到 256 维傅里叶特征向量,然后通过具有 SiLU 的 MLP 投影到 。持续时间(以秒为单位)被归一化为 ,并编码为 256 维傅里叶特征向量,然后由具有 SiLU 的 MLP 投影到 。这两个 维嵌入按元素求和,并通过另一个具有 SiLU 的 MLP,该 MLP 计算馈送到每个 Transformer block 的共享条件嵌入。因此,每个 AdaLN(、、、、、)都会获得调节嵌入(, 、、、、)在 Transformer block 之间共享。最后,每个 Transformer block 独立学习 6 个偏置项(、、、、、),这些偏置项被添加到共享条件嵌入中以获得最终的 AdaLN 条件[25]。例如,self-attention AdaLN 比例为 ,其中 跨块共享,而 是特定于块的。每个 Transformer block 的 AdaLN 参数(、、、、、)将按照 Figure 8 中的公式应用。此变体称为 AdaLN-Single [36],由于调节嵌入在所有 Transformer block 之间共享,与标准 AdaLN 相比,大大减少了调节参数的数量。此外,乘法门控项(、)的灵感来自于 FLUX [80] 中引入的调制机制。
Cross-attention:文本和持续时间调节。文本由 T5Gemma (google/t5gemma-b-b-ul2) 冻结编码器编码为维度 768 的 256 个嵌入序列。短提示使用学习的填充 embedding 填充到 256,长提示被截断为 256。持续时间(以秒为单位)被归一化为 并编码为 256 维傅里叶特征向量,然后由具有 SiLU 的 MLP 投影到 。这两个条件源沿着序列维度连接起来,形成 257 个嵌入的上下文序列。文本和持续时间调节通过 cross-attention 输入每个 Transformer block。每头 QK-RMSNorm 用于稳定 attention logits。请注意,持续时间调节因此通过两个互补路径进入每个 Transformer block:AdaLN 与扩散 timestep 一起,以及 cross-attention 与文本 prompt 一起。
Inpainting 的 local-additive conditioning。Binary mask 用 1 表示保留帧、0 表示待生成帧。原始音频先由 SAME autoencoder 编码到 latent 空间,再与 mask 逐元素相乘,使待 inpaint 区域归零。单通道 mask 与 256 通道 masked latent 沿 channel dimension 拼接,形成逐帧 257 维 conditioning tensor。每个 Transformer block 内,这一 tensor 由带 SiLU 的 MLP 投影到维度 ,再逐元素加到 cross-attention 与 feed-forward network 之间的 residual stream。MLP output layer 采用 zero initialization,因此训练开始时这一 conditioning 不产生作用,便于从非 inpainting checkpoint 平滑 fine-tune。
Inpainting 的 local-additive conditioning。Waveform 由冻结的 SAME autoencoder 编码为 latent 序列,再与 binary mask 逐元素相乘(1 为保留,0 为 inpaint)。Masked latent 与 mask 沿 channel dimension 拼接,经每个 Transformer block 内带 SiLU 的 MLP 投影后加入 residual stream。左侧 padding 为 memory embeddings 预留位置。
差分 attention。 我们构建了两对 和 ,它们共享一组公共值 ,而不是一组查询和密钥。计算两个独立的 attention 映射,并减去它们的输出:,消除两个头共有的 attention 模式。两对均经历相同的每头 QK-RMSNorm,并且在 self-attention 的情况下,使用部分 RoPE。medium 与 large 在 self-attention 和 cross-attention 中均使用 differential attention [24],而 small 则使用标准多头 attention。
RMSNorm。我们使用 RMSNorm [77] 作为 Transformer block 中的预归一化层。给定输入向量 :
其中 是可学习的比例参数,初始化为 1 和 。与 LayerNorm 不同,RMSNorm 省略了均值中心化和可学习偏差,减少了计算量,同时在实践中表现相当。
QK-RMSNorm。我们在投影之后但在添加 RoPE 之前将每头 RMSNorm 独立应用于 Q 和 K:
其中 和 具有在所有头之间共享的单独的可学习比例参数。这可以防止 attention logits 无限制增长。 QK-RMSNorm 适用于 self-attention 和 cross-attention [77,78]。
3 · 训练
Stable Audio 3 支持变长生成,并按 multi-stage pipeline 训练(Figure 10)。第一阶段以 Flow Matching 训练 Diffusion Transformer(base model);后续的 Distillation Warmup 与 Adversarial Post-Training 进一步提高速度和样本质量,得到 post-trained model。所有阶段都在离线预编码的 SAME latent 上运行,并采用下述变长训练方案。
Stable Audio 3 的训练 pipeline。
首先,我们训练一个 Flow Matching 模型,该模型学习速度场 ,定义常微分方程 (ODE),将噪声 传输到数据 。据推断,这个 ODE 是通过许多 步骤 (50--100) 进行数值求解的。
第二阶段进行 Distillation Warmup,把模型转用为一步降噪器。给定从教师 ODE 轨迹上采样的任意中间状态 ,student(与 teacher 架构相同)使用 MSE loss 训练,学习直接预测轨迹终点 (即生成结果)。这相当于把学到的 flow 拉直:对每个 ,原本的多步 ODE 求解被压缩为一次函数求值 。但 MSE objective 会使 student 向 conditional mean 回归,从而生成缺少细粒度细节的输出。
第三,adversarial post-training 用相对论对抗性设置取代了教师信号,该设置直接将学生的一步预测 与真实数据 进行比较。这将学生的映射从近似条件均值转变为从真实数据分布 进行采样,恢复 MSE 蒸馏平滑的感知锐度。至关重要的是,这个阶段完全抛弃了教师,让学生通过直接针对真实数据 进行优化来超越教师的质量上限。
由此得到的 adversarially post-trained model 虽然能够一次前向生成音频,但从纯噪声一步映射 仍然困难(Section 5.7)。Section 4 将说明 Ping-Pong sampling 如何把一个大步拆成多个较小步骤来缓解这一问题。每轮中,模型先给出去噪估计 ,随后在更低噪声水平重新加噪,再进入下一轮去噪。这种迭代式“去噪—重新加噪”调度会逐步细化输出并纠正早期误差,同时利用模型在 Adversarial Post-Training 中学到的一步去噪能力 。
3.1 · 变长训练
音频领域中的先前 latent diffusion 模型在固定长度序列上运行,用静音填充较短的音频以匹配最大训练长度 [6,5]。因此,生成短音频剪辑需要全长推理,大部分计算都会产生静音,因为对比训练序列更短的序列进行推理会导致输出降级(第 5.4 节)。这有效地将推理成本与所选的最大长度联系起来,而许多实际用例需要比该最大值短得多的音频。 Stable Audio 3,相反,原生支持可变长度生成。在训练期间,批处理需要统一的序列长度以提高效率,它依赖于以下机制:可变长度 attention 和掩蔽损失计算、每个元素 timestep 移位和静音增强。Figure 11 在一批三个序列上说明了这些机制。
变长训练。同一 batch 包含不同长度序列,并 padding 到当前 batch 的共同长度;padding embedding 不参与 loss。每条音频采用依赖长度的 timestep shift(),序列越长越偏向高噪声水平;信号末尾还会随机追加静音。
变长 attention 与 masked loss。短于当前 batch 最大长度的序列会在 latent 空间右侧 padding。借助支持变长的 FlashAttention [81],padding embedding 会同时从 self-attention 与 feed-forward 计算中排除(mask)。由于这些 padding 位置不参与 attention,其输出没有有效信息,因此 loss 也只在有效信号位置上计算。Cross-attention 不做 mask。Memory embeddings 会不经 mask 地参与所有 attention 层,但在计算任何 loss 前移除。右侧 padding 位置同样不参与 adversarial loss。
逐元素 timestep shift。噪声调度会依据每个样本未 padding 的长度进行调整。由于序列元素之间存在相关性,长序列更难被破坏:即使对每个元素独立加噪,在相同噪声水平下,较长序列仍会因相邻元素之间的冗余而保留更多可恢复结构 [82,83]。因此,相对短序列而言,固定噪声调度会让长序列加噪不足,使模型偏向于学习长输入在不够高噪声水平下的去噪。为补偿这一点,序列越长,其 timestep 分布越向高噪声区域移动;这一 shift 会给长序列在高噪声区间分配更多训练预算(Figure 12)。本文采用 Esser 等人提出的 logistic 形式 [84]。给定参数 ,它会随序列长度在 与 之间插值,则 shift 后的 timestep 为:
逐元素 timestep shift 对 timestep 映射的影响。短音频使用 ,shift 较弱;长音频使用 ,timestep 会更明显地推向高噪声区域。
静音增强。为了提高鲁棒性,并打破 duration conditioning 与信号长度之间的直接对应关系,信号区域会随机追加一段 silence embedding,其长度服从指数分布(平均延长 4 秒)。Padding 区域填入预先计算的 silence latent;该 latent 由全零 waveform 编码得到,因此模型接触到的是真实静音表示。这样,模型会学会以自然静音干净地结束音频,而不是突然截断或产生伪影。
3.2 · Flow Matching 预训练
初始训练阶段采用 Flow Matching objective [19,20]。给定 data sample (SAME latent)和噪声 ,timestep 处的带噪输入由线性插值得到:
该模型经过训练,可通过使用 inpainting 掩模的均方损失来预测速度 。
修复训练。所有模型均针对 Generation 和 inpainting 进行联合训练。在每个训练步骤中,每个示例都会采样一个随机二进制掩码,其中 表示保留音频的位置, 表示要修复的位置。根据概率绘制了三种掩码类型:全零的完整掩码相当于无条件生成(概率 80%),随机段,其中 1 到 10 个段被屏蔽为 inpainting(概率 10%),以及因果掩码,其中保留随机前缀,其余部分被掩码以继续(概率 10%)。修复掩模示例如 Figure 3 所示。掩模以及干净的 latent 与掩模的元素乘积沿通道维度连接,并作为局部加性调节提供给模型。该模型经过训练来预测速度,损失分为两个独立的平均项:修复嵌入的生成损失 () 和保留音频的上下文保留损失 ()。
其中 是预测速度, 是任何调节信号,、 分别是修复 () 和上下文 () 嵌入的数量。
minibatch 最佳传输耦合。它用于查找噪声样本的排列,以最小化每个 minibatch 内的平方 传输成本,通过 GPU [19,85] 上的 Sinkhorn 迭代计算。具体而言,给定一批 数据样本和 独立采样的噪声向量,该算法重新分配哪个噪声向量与哪个数据样本配对。标准 Flow Matching 将每个数据样本 与独立抽取的噪声样本 配对。当这些碰巧相距很远时,产生的传输路径很长并且可能与其他对交叉。通过解决每个 minibatch 内的近似分配问题,最佳传输耦合将每个 与最接近的可用 配对,从而产生更短、更直且更少纠缠的轨迹。这拉直了模型学习的速度场,从而改善了训练和采样 [50]。
时间步长采样。时间步长是从截断的 logit 正态分布 [80,84] 中提取的。 Logit 正态分布 () 中的样本在 处被截断并重新调整为 。这消除了极低噪声的时间步长,并将训练预算集中在中高噪声水平上。请记住,由于我们的可变长度训练模式,采样的 会根据公式 (3) 单独移位 。
3.3 · Distillation Warmup
distillation warmup 弥补了多步 Flow Matching 模型和 adversarial post-training 所需的一步机制之间的差距,提供比直接解决对抗目标更平滑的初始化。
在对抗训练之前,Flow Matching 模型通过 10k 步骤 [23] 的 distillation warmup 阶段进行细化。预训练的 Flow Matching 模型的冻结副本充当教师,学生也使用预训练的 Flow Matching 模型进行初始化。教师从随机噪声 生成多步 ODE 轨迹(15 个 DPM++ 步骤,CFG 设置为 5),并且中间状态 以及最终的去噪输出 被缓存。教师轨迹会定期刷新(每 4 次迭代),以平衡计算成本与目标多样性。然后训练学生在一步中匹配教师的端点 :给定从缓存轨迹中随机选择的中间状态 ,学生预测速度 并生成一步欧拉估计 。损失是和教师的去噪输出之间的 MSE:
请注意,我们的技术与 ReFlow [19] 相关,它可以拉直经过训练的流模型的传输路径。在标准 Flow Matching 中,每个数据样本 与独立抽取的噪声样本 配对,导致随机耦合,可能产生长的、交叉的传输路径。 ReFlow 通过生成耦合端点 来解决此问题。它对噪声进行采样,并对训练好的模型的 ODE 进行积分,得到相应的输出。然后训练一个新模型来连接这些耦合端点(具有需要更少采样步骤的更直路径,从而实现更快的推理)。虽然我们的方法也展开了教师的 ODE,但它在一个关键方面与 ReFlow 不同。我们的学生不是在这些新的端点对上重新训练 Flow Matching 模型(预测速度),而是学会一步将沿着教师轨迹的任何中间状态 直接映射到最终输出 。
它还与单步 ReFlow [19] 相关,它将回流模型进一步提炼为单步 Flow Matching 模型(速度预测),该模型用一步欧拉映射 。我们的方法共享相同的一步生成方法,但完全绕过中间 ReFlow 训练阶段。此外,我们的学生学习根据 MSE 损失(而不是速度预测)将沿教师 ODE 轨迹的任何中间状态 映射到最终输出 。这很方便,因为在 adversarial post-training 期间,我们的损失在信号 空间而不是矢量场 空间中运行,但这可能会引入均值回归伪影,尽管我们的教师为每个 提供了唯一的 。这激发了 adversarial post-training 阶段,其中判别器在 空间中的损失直接惩罚感知退化并恢复 MSE 蒸馏可以平滑的细粒度结构。
最后,我们的设置也与 Consistency Distillation [59] 有关。该方法训练 student 模型,把 teacher ODE 轨迹上的任意点映射到端点 。它依赖局部一致性损失:同一 ODE 轨迹上相邻两步 与 的模型预测必须一致,即 ,其中 表示 student 模型权重的指数滑动平均。可是,仅有局部一致性并不能决定轨迹各步究竟应映射到什么值;把局部一致性链锚定到真实端点 的,是 处的边界条件。训练时,模型在架构上被约束为旁路传递 ,因此按构造有 。一致性损失随后把整条链连接起来: 的预测必须匹配 ,而后者已被固定为 ; 又必须匹配已经等于 的 。这一过程一直传播到 ,使模型即便从纯噪声出发也能预测 。我们的方法不通过由边界条件锚定的局部一致性损失链传播信息,而是直接从任意中间状态 回归 teacher 端点 。这种 MSE 回归的代价是:若 teacher ODE 路径弯曲,端点估计就会不准确,这也正是需要 Ping-Pong sampling 的原因(见 Section 4)。Consistency Distillation 则通过约束相邻 timestep 的一致性来回避这一问题。
3.4 · Adversarial Post-Training
Adversarial Post-Training 用 adversarial loss 取代 Flow Matching 与 Distillation Warmup 中基于 MSE 的 conditional-mean loss,把预训练模型转成 one-step generator。Discriminator 评估去噪样本的真实性,提供超出宽泛 conditional mean 的分布级反馈;若 的输出足够真实且质量更高,所需采样步骤就会减少。相较 distillation,Adversarial Post-Training 还不再受 teacher model 性能上限约束。其目标是学习 ,其中 , 是对 的估计。工作在 空间的 relativistic discriminator 提供训练信号,恢复 MSE distillation 平滑掉的细节,以感知更锐利的输出取代 regression-to-the-mean artifact,同时保留 distilled model 的一步能力。
我们使用具有三个互补损失的 adversarial post-training 对预训练模型(Flow Matching 加上 distillation warmup)进行微调:对抗性相对论损失 、对比损失 和 CLAP 损失 。
训练在生成器(预训练的一步模型)和判别器更新之间交替进行:
驱动感知质量, 规范判别器以进行语义对齐, 为生成器提供显式文本对齐信号,以便生成器提高音频保真度和 prompt 对齐。
生成器架构。它是带有 Flow Matching 和 distillation warmup 的预训练模型。原则上,可以对网络进行参数化,直接输出。然而,我们保留了基础模型中的原始速度参数化 ,并通过一步欧拉采样恢复干净的估计:。请注意,此重新参数化还施加了有用的架构约束:在 处,模型必须输出 。随着 的增长,网络的影响力与噪声水平成线性比例,从而防止它在输入已经接近干净的低噪声下进行不成比例的大校正。此外,它保留了初始化质量:由于生成器从 开始,初始输出已经是有意义的预测,从而提高了早期训练的稳定性。 distillation warmup 使用相同的重新参数化:在整个训练后保持一步欧拉采样重新参数化可确保从 Flow Matching 平滑过渡,而不会出现任何不连续性。
判别器架构。判别器重用与生成器相同的架构作为特征提取器,从使用 Flow Matching 预训练的 base 模型进行初始化(无 distillation warmup)。它是一个完全条件判别器,接收文本 prompt、持续时间条件、inpainting 掩码和上下文以及 timestep (独立于生成器使用的 )。所有信号都经过与生成器相同的调节机制(cross-attention,自适应层规范)。经过预先训练,可以在任意条件下处理噪声数据 ,它已经生成了语义丰富的中间表示,而无需任何额外的训练。然后,此类中间表示由卷积头处理,产生逐帧真实度分数。
判别器的工作噪声电平为 ,与发生器的噪声电平 无关。具体来说,在生成器产生其去噪估计 后,我们将其重新加噪调整为判别器的新噪声级别:
其中 以从 logit 正态分布 () 抽取的时间步长评估样本,重点关注中间噪声水平,而 在真假之间共享。 和 的解耦允许判别器在多个噪声尺度上评估生成器的输出,提供有关全局结构(高 )和精细细节(低 )的训练信号,无论生成器在该迭代中使用哪个 进行训练。最后,通过在构造 和 时使用相同的噪声 ,噪声分量在相对论比较中抵消,确保判别器判断 和 之间的质量差异,而不是偶然的噪声模式。
对抗性相对论损失。生成器经过训练以最小化 ,判别器经过训练以最大化此余量。我们的损失依赖于 作为 的平滑替代。与继续奖励已经获胜的玩家( 较低)的原始保证金损失不同,softplus 饱和:当 较大且为负值时,梯度会优雅地消失。相反,当参数为正时, 和损失线性增长,提供强烈的修正信号。
损失是根据成对的真实/生成数据 [86,87] 计算的,以便生成器相对于具有相同 prompt 的配对真实样本最小化其检测。因此,生成器希望每个生成的样本“比其配对的真实样本更真实”,而判别器希望每个真实样本“比其配对的生成样本更真实”。重要的是,由于我们的文本条件任务,我们的配对总是高度相关的,其中真实/生成的配对共享相同的 prompt,从而提供比依赖随机配对更强的梯度信号。
Adversarial Post-Training。(a) 同一 text prompt 下的生成样本与真实样本在加噪后送入 discriminator;generator 与 discriminator 分别最小化、最大化 fake 与 real 输出之差。(b) Discriminator 还要最大化正确 prompt 与打乱 prompt 所对应音频之间的差异。虚线表示噪声注入。
对比损失。为了防止判别器依赖纯音频伪影并忽略文本调节,我们添加了一个对比项。给定一批真实的音频-prompt 对,我们通过在批次中循环移动(随机)提示来创建反例。然后训练判别器以区分正确配对和错误配对的音频 prompt 组合,使用相同的相对论目标来最大化它们的差异:
这种损失可以被视为对比损失 [88],其中判别器将正确的音频文本对映射得比不匹配的文本对更接近。请注意,这只是判别器的损失,因为这会鼓励它理解提示和噪声输入之间的对齐,并防止模型专注于更简单的(例如,高频 [67])音频特征。这迫使判别器了解音频文本对齐,而不仅仅是音频质量。
CLAP 损失。冻结的 CLAP 模型为生成器提供直接语义指导。生成器的去噪输出 和文本 prompt 被编码,并且我们最小化单位超球面上的平方测地距离:
其中 和 分别是来自 CLAP 文本和音频编码器的 归一化嵌入。由于在每个训练步骤中解码 latent(到波形)的成本很高,因此我们训练了一个直接在 SAME 嵌入上运行的 CLAP 模型,避免了在 adversarial post-training 期间进行波形合成的需要。我们采用单位超球面上的平方测地距离作为我们的 CLAP 对齐目标,因为与余弦距离(其梯度在小和大角度间隔处消失)不同,它提供了与整个范围内嵌入之间的角度成比例的梯度幅度。这确保了学习信号的一致性,特别是在文本和音频嵌入可能未对齐的早期阶段。因此,CLAP 损失提供了一个语义锚,通过鼓励生成器与 prompt 保持一致来防止对抗训练期间的模式崩溃。
3.5 · 训练实现细节
训练数据。medium 与 large 是在 AudioSparx 的许可音频和 Freesound 的 Creative Commons 录音的组合上进行训练的。 AudioSparx 部分(806,284 个音频)包含音乐曲目、乐器和带有文本元数据的音效。 Freesound 部分包含根据 CC-0、CC-BY 或 CCSampling+ 许可的录音。为了确保 Freesound 数据中不存在受版权保护的内容,使用 PANNs [89] 标记器识别音乐录音。我们标记了激活音乐相关标签至少 30 秒(阈值为 0.15)的音频,该音频被发送到值得信赖的内容检测公司,以验证是否存在受版权保护的材料。所有已确定的受版权保护的内容均已被删除。过滤后,Freesound 部分包括 266,324 个 CC-0、194,840 个 CC-BY 和 11,454 个 CC-Sampling+ 录音
所有 small 模型起初都在 AudioSparx 与 Freesound 的混合数据上预训练;但在预训练的最后阶段、Distillation Warmup 和 Post-Training 中,small-music 仅使用 AudioSparx,而 small-sfx 使用 Freesound 中质量更高的一个子集。因此,medium 与 large 可以在同一个统一模型中同时处理音乐和音效生成;但对 small 模型而言,加入音效数据会损害音乐连贯性。把音效子集隔离给 small-sfx 后,作者减轻了这种任务干扰,并提高了两个领域的感知质量。
及时准备。 对于 AudioSparx 曲目,元数据包括自然语言描述、标题、关键字和特定领域的元数据,例如 BPM、流派、情绪或乐器。对于 Freesound 录音,元数据包括标题、标签和自然语言描述。在训练期间,提示是通过连接可用元数据字段的随机子集来构造的。对于 AudioSparx,元数据字段标识符有 50% 的可能性被预先添加(乐器:吉他、鼓、贝斯吉他、情绪:振奋)或省略。对于 Freesound,我们有 50% 的概率使用 LLM 重写的音频标题,或者根据标题、打乱的标签和描述构建 prompt。在这两种情况(AudioSparx 和 Freesound)中,所有候选字段均以 50% 的概率进行混洗或随机二次采样。最后,字段用逗号连接,并且有 50% 的概率整个 prompt 都是小写的。
Flow Matching 预训练。通过以 的概率用零向量随机替换条件嵌入(文本和计时),在训练时启用无分类器指导 (CFG),从而允许推理指导。
判别器架构。从判别器扩散变换器的第 14 层提取潜在特征,并通过一个卷积头,该卷积头由以下部分组成:一个输入卷积、4 个残差块(每个残差块包含 2 个具有 GroupNorm 和 LeakyReLU 且具有跳跃连接的卷积)以及一个最终评分模块,其中 2 个卷积减少到单个通道,产生每个 embedding 分数。所有卷积核的大小均为 3。
时间步采样。我们为每个训练阶段使用不同的分布。在所有情况下,采样的 timestep 随后根据有效(未填充)序列长度进行移位,产生如等式(3)中定义的 。
- Flow Matching:时间步长是从截断的 logit 正态分布 [84,80] 中得出的。来自 logit-normal () 的样本在 处被截断并重新缩放为 。这消除了任务微不足道的近乎干净的时间步长,并将训练集中在中高噪声水平上。 蒸馏热身:教师使用具有 15 个步骤的 DPM++ 和 CFG 5.0 生成参考轨迹。教师的调度使用 log-SNR 调度,不根据序列长度进行移动,请参阅第 4 节。 生成器:与上述 Flow Matching 相同的设置(截断 logit 正态分布)。 判别器:真实样本和生成样本都被加噪到相同的 (logit-normal),并具有共享噪声 。
优化器。我们使用 Muon+AdamW 混合优化器[90]。 Muon(动量 0.95,学习率)应用于 attention QKV 投影和前馈网络投影,而 AdamW(学习率,,权重衰减)处理所有剩余参数。生成器和判别器使用相同的优化器配置。学习率遵循逆幂律计划(,幂 )。
指数移动平均线 (EMA)。 在整个训练和推理过程中,我们维护生成器模型权重的 EMA(,指数为 的幂律热身)。 EMA 不适用于判别器。
4 · 推理
经过 Adversarial Post-Training 后,模型能够在任意噪声水平 下,直接从带噪输入 估计干净输出 ,因此一次前向即可生成音频。不过,从纯噪声直接做一步映射 仍然困难(Section 5.7)。为此,我们采用 Ping-Pong sampling,把一个大步拆成多个较小步骤:每轮先由模型给出去噪估计 ,随后在更低噪声水平用新的噪声对其重新加噪,再进入下一轮去噪。这种反复“去噪—重新加噪”的调度会逐步细化输出、纠正早期步骤的误差,同时利用模型在 Adversarial Post-Training 中学到的一步去噪能力 。
Ping-Pong sampling。从 的纯噪声 出发,每步交替执行:去噪到 估计(实线箭头),再于更低 timestep 注入新噪声(虚线箭头)。重新加噪幅度随 递减,形成最终收敛到 data manifold 的 zigzag trajectory。
请注意,Ping-Pong sampling 本质上是自我校正的。如果早期步骤(其中 更困难)产生不准确的估计,则后续重新加噪步骤会产生一个新状态,可以纠正先前(困难)的估计。相比之下,ODE 求解器会向前传播误差,例如:错误的欧拉步骤将 从实际的最佳轨迹中取代,并且所有后续步骤都从错误的起点进行积分。Ping-Pong sampling 的这种自我校正特性意味着我们的方法可以容忍整个推理步骤中的适度偏差和错误。
我们构建了一个在 logSNR 空间中均匀的调度,而不是在 中线性间隔时间步。我们在区间 中定义 () 等距 logSNR 步长 并恢复
通过 的时间步长。这是因为 logSNR 空间 [91] 中的感知显著性大致均匀。我们发现 8 个采样步骤在推理效率和生成质量之间提供了有利的权衡。
在训练期间,我们采用与长度相关的 timestep 移位。然而,在推断中,我们使用不依赖于长度的 logSNR 统一调度(无论请求的持续时间如何,都使用相同的调度)。虽然这引入了训练-推理不匹配,但这种设置在实践中效果很好。请注意,在训练期间会对大量时间步进行采样(较高噪声下的覆盖范围很重要),而推理仅需要 8 个步骤(位置很重要)。
至关重要的是,生成长度(输入噪声 长度)是可变的,请参见 Figure 2。给定 秒的请求持续时间,我们分配 嵌入的 latent 序列,其中 是用户请求的生成持续时间, 是静音 padding,是采样率,是 autoencoder 下采样率。只有第一个 嵌入对应于目标音频内容。其余的 嵌入是静音填充。静音填充有两个目的:它可以防止模型在序列边缘精确产生突然结束时出现的边界伪影,并且它为解码器提供淡出缓冲区。生成后,可以将输出修剪为请求的 秒,并丢弃填充区域。
我们的模型在推理时不需要 classifier-free guidance (CFG)。标准扩散模型依靠 CFG 来提高样本质量和文本对齐,但每个去噪步骤需要两次前向传递(一次有条件,一次无条件)。在我们的流程中,指导通过 distillation warmup 融入到模型中,其中学生接受训练以匹配 CFG 增强的教师轨迹,从而内化 CFG 提供的质量提升。对抗性后训练直接通过 进一步细化文本-音频对齐。因此,我们的模型在推理过程中不依赖 CFG。对于内存和计算受限的设备上部署来说,这是一个关键优势。
5 · 讨论
Stable Audio 3 是一系列用于器乐和音效生成和编辑的 text prompt 模型,专门针对许可或知识共享数据进行训练,并设计为在消费级硬件上快速运行。
在以下部分中,我们讨论以下结果:
- 最先进的器乐和音效生成结果(第 5.2 节和第 5.3 节) 快速推理:在 H200 上不到 2 秒即可生成高达 6m 20 秒(第 5.2 节和第 5.3 节)。 强大的可变长度音频生成(第 5.4 节和第 5.5 节)。 通过 inpainting 进行音频编辑,包括单段和多段编辑和延续(第 5.6 节)。 对抗性后训练可以提高推理速度和样本质量(第 5.7 节)。 small 和 medium 可以在消费级 GPU 上运行,small 可以在 MacBook Pro 上运行(第 5.8 节和第 5.9 节)。
5.1 · 方法
我们使用指标和主观聆听测试根据开放权重和内部基线评估 Stable Audio 3 模型。我们比较了一组涵盖扩散和自回归架构的不同系统:
- Stable Audio 2.5 [6]:我们用于(长达 190 秒)音乐生成的内部 latent diffusion 基线。我们使用 8 个采样步骤、CFG 比例 6 和 DPM++ 3M SDE 采样器。 Stable Audio Open [31]:开放权重 latent diffusion 模型,用于(长达 47 秒)音效生成。我们使用 100 个采样步长、CFG 比例 7 和 DPM++ 3M SDE 采样器。 Stable Audio Open Small [31]:紧凑型开放权重 latent diffusion 模型,针对高效的短音频(长达 11 秒)音效生成进行了优化。我们使用 8 个采样步骤和 Ping-Pong 采样器。 Stable Audio 3“base 模型”:我们的 Flow Matching Stable Audio 3 变体(small、medium、large),无需后期训练。所有模型均使用 50 个采样步骤、CFG scale 7 和欧拉采样器进行评估。 Stable Audio 3“后训练”:我们的 Stable Audio 3 变体(small、medium、large)经过 distillation warmup 和 adversarial post-training 后训练。我们使用 8 个采样步骤和 Ping-Pong 采样器。 ACE-Step 1.5 [11]:用于全长歌曲生成的开放权重混合扩散和自回归模型。我们使用带有 acestep-v15-xl-turbo 主干的 acestep-5Hz-lm-4B 自回归模型,因为作者发现它比 acestep-v15-xl-sft 提供了更好的质量与速度权衡。生成是使用 task\_type="text2music",lyrics="[Instrumental]",thinking=True 执行的。 DiffRhythm 2 [33]:用于全长歌曲生成的开放权重半自回归块 Flow Matching 模型。提示是通过 style\_prompt 参数提供的,而歌词调节被禁用。 Woosh Flow [75]:开放权重 Flow Matching 模型,用于(最多 5 秒)音效生成。该模型使用自适应步长 ODE 求解器,平均产生 72 个采样步长。 Woosh DFlow [75]:开放权重的 Woosh Flow 的精炼版本,用于(长达 5 秒)音效生成。我们采用 4 个生成步骤,遵循官方实施。 TangoFlux [92]:开放权重 Flow Matching 模型,用于(长达 30 秒)音效生成基线。我们使用 50 个采样步骤和 CFG 比例 4.5。
请注意,不同的模型生成不同长度的音频。为了公平比较,我们考虑每个模型的最大支持持续时间来评估所有方法,例如,Woosh 生成最多 5 秒,small 生成最多 120 秒。
对于能够生成人声的模型(ACE-Step 1.5 和 DiffRhythm 2),评估仅限于器乐提示,以确保与专注于器乐生成的 Stable Audio 3 进行公平比较。我们还考虑了 JAM [34]、HeartMuLa [4] 和 YuE [3]。 JAM 被排除在外,因为它依赖于歌词和参考音频调节,而不是专注于器乐生成。 YuE 和 HeartMuLa 被排除在外,因为它们依赖于标签提示,并且是为声乐而不是从 text prompt 生成器乐而设计的。
所有在 AudioSparx 数据集(Stable Audio 2.5 和 3 个变体,不包括 Stable Audio Open 和 Open Small)上训练的稳定音频模型都会在提示前面添加“TrackType: Music, VocalType: Instrumental”(用于音乐生成)和“TrackType: SFX”(用于音效生成)。这些前缀指示目标音频模态并显著提高生成质量。因此,我们建议所有 Stable Audio 3 用户在推理时使用这些前缀。
我们报告三个指标:
- Fr\'echet 音频距离 (FAD) [93,94]:测量生成的音频分布和参考音频分布之间的分布相似性。我们使用 LAION-CLAP 音频编码器检查点 630k-audioset-best.pt 的嵌入来计算 FAD,我们发现它提供了最佳的感知对应。低 FAD 意味着生成的音频是合理的并且与参考音频非常匹配。 CLAP 分数:来自上述相同 LAION-CLAP 模型的文本和音频嵌入之间的余弦相似度,测量提示和生成的音频之间的语义对齐。越高越好。 推理时间:在标准化硬件和推理设置下测量固定长度音频生成的挂钟生成延迟。除非另有说明,推理时间是在 H200 上测量的。
我们对两个数据集进行评估:
- Song Describer Dataset (SDD) [95]:120 秒长的音乐曲目与人工编写的字幕配对的数据集。我们排除包含人声、语音或音效的提示,仅保留乐器示例。我们还删除了不连贯或不明确的提示。这会产生 424 个音乐字幕对。 BBC Sound Effects Dataset:录制的带有 text prompt 的环境和音效的集合。
对于 BBC Sound Effects 数据集,我们首先将数据集过滤为持续时间最多 120 秒的样本。我们选择此截止值是因为它足以覆盖音效和环境录音,并且与 small 模型的最大生成长度相匹配。此外,由于几个基线的持续时间限制,我们构建了多个评估子集:
- 子集:10,491 个音频字幕对。 子集:5,406 个音频字幕对。 子集:1,537 个音频字幕对。 子集:393 个音频字幕对。
对于上述所有子集,生成的音频持续时间与相应参考的持续时间匹配。这种可变长度设置可以在具有不同最大生成持续时间的模型之间进行公平比较,同时保留真实的 prompt 长度分布(例如,音效/环境录音的更短/更长的持续时间)。
我们不使用 AudioCaps[96] 数据集进行评估,因为我们发现其(参考)音频受到带宽限制。相反,我们使用 BBC Sound Effects 数据集,其录音是专业制作的全带宽。
我们使用平均意见得分协议对 14 名参与者进行了听力测试,评估生成的样本:
- 总体质量 (OVL):评估制作质量、感知真实性以及是否存在伪影。 文本相关性 (REL):评估生成的音频与条件文本 prompt 的匹配程度。 音乐性(MUS):评估表达音乐上连贯的旋律和和声的能力。
对于我们的 inpainting 音乐评估,我们使用 SDD 播放 120 秒的音乐。对于我们的 inpainting 声音评估,我们使用持续时间在 30 秒到 120 秒之间的 BBC 音效样本(5088 个音频字幕对),不包括较短的剪辑,以确保有意义的连续性和多区域 inpainting 评估。我们评估三种设置:
- 单次修复:屏蔽并重新生成对应于音频持续时间 2% 到 20% 之间的随机选择区域。遮蔽区域的长度至少为 1 秒。 双修复:使用与单个 inpainting 相同的过程生成两个独立的遮罩区域。这两个区域被限制为间隔至少 6 秒。 延续:随机选择初始片段(音频的 5 秒到 20% 之间)保留,剩余部分重新生成,直到结束。
所有比较模型都使用相同的随机采样 inpainting 区域,以确保公平比较。
在我们的 inpainting 评估中,这些信号可用:原始音频(待修复)、生成的音频(包含修复部分)和 prompt(用于引导 inpainting)。在我们的设置中,原始音频和 prompt 配对并可通过我们的评估数据集使用,并且正在评估的模型之一生成部分音频(通过 inpainting)。下面,我们使用这个术语来描述我们用来评估 inpainting 功能的指标:
- FAD full 在(完整)生成的音频和(完整)原始参考音频之间计算。该指标评估修复区域在原始音频中的集成程度,同时考虑到生成(修复)区域和原始区域之间的过渡。 FAD 修复仅考虑生成的(修复)区域及其相应的参考(原始)段来计算。该指标对于单独评估生成(修复)的部分很有用。 CLAP text-gen 测量文本 prompt 和生成(修复)区域之间的相似度。 CLAP gen-orig 测量生成(修复)区域的音频嵌入与该区域中的原始音频之间的相似性。
对于双 inpainting 实验,每个修复区域都被视为独立评估,有效地将评估的修复片段数量加倍。然而,在这种情况下,每个音频仅计算一次全音频 FAD 指标。
5.2 · 器乐生成
作者在 SDD 上以 120 秒与 190 秒两种时长评测器乐生成。120 秒对应 small 的最大生成长度;190 秒用于评测更长音频,也对应 Stable Audio 2.5 的最大生成长度,因此 small 不参与 190 秒设置。
在 SDD 数据集上生成 120 秒器乐的评测结果。
| 模型 | 时长 | FAD | CLAP | OVL | REL | MUS | 推理时间(秒) |
|---|---|---|---|---|---|---|---|
| DiffRhythm 2 | 120s | 0.293 | 0.158 | 3.05 0.94 | 2.10 1.29 | 2.60 1.10 | 3.88 |
| ACE-Step 1.5 xl-turbo | 120s | 0.193 | 0.321 | 3.35 1.09 | 3.30 1.13 | 3.15 1.31 | 6.23 |
| Stable Audio 2.5 | 120s | 0.106 | 0.395 | 3.90 0.79 | 4.30 0.66 | 3.70 0.92 | 0.85 |
| small-music | 120s | 0.145 | 0.393 | 3.20 0.89 | 3.60 0.94 | 3.15 0.81 | 0.45 |
| medium | 120s | 0.107 | 0.390 | 4.20 0.89 | 4.25 0.85 | 4.15 0.93 | 0.78 |
| large | 120s | 0.101 | 0.393 | 3.95 0.89 | 3.80 1.11 | 4.30 0.73 | 0.81 |
在 SDD 数据集上生成 190 秒器乐的评测结果(small 最长只能生成 120 秒)。
| 模型 | 时长 | FAD | CLAP | 推理时间(秒) |
|---|---|---|---|---|
| DiffRhythm 2 | 190s | 0.307 | 0.088 | 5.85 |
| ACE-Step 1.5 xl-turbo | 190s | 0.184 | 0.273 | 9.21 |
| Stable Audio 2.5 | 190s | 0.128 | 0.375 | 0.85 |
| medium | 190s | 0.116 | 0.362 | 0.88 |
| large | 190s | 0.100 | 0.373 | 0.93 |
Table 3 与 Table 4 给出了两种设置的结果。总体上,Stable Audio 系列在各指标上表现最强:Stable Audio 2.5 仍是最佳 baseline,Stable Audio 3 的 medium 与 large 则明显提升 musicality。Small 虽弱于 large,但考虑到其规模更小、autoencoder 也针对 CPU inference 优化,它相对开放权重 baseline 仍具竞争力。Stable Audio 系列的推理速度也显著更快,不到 1 秒即可生成 190 秒音频;从 120 秒扩展到 190 秒时,Stable Audio 3 的性能退化也最小。这些结果共同体现了它在长音频质量、musicality 与低延迟上的优势。
5.3 · 音效生成
我们使用 5 秒的目标持续时间(对应于 Woosh 模型支持的最大持续时间)来评估音效的生成。这种受限设置可以与一系列最新的开放权重音效生成系统进行比较。第 5.5 节讨论了较长持续时间(最多 120 秒)的附加评估。
在 BBC Sound Effects Dataset 上生成 5 秒音效的评测结果。
| 模型 | 时长 | FAD | CLAP | OVL | REL | 推理时间(秒) |
|---|---|---|---|---|---|---|
| TangoFlux | 5s | 0.760 | 0.179 | 2.35 1.04 | 3.25 1.37 | 1.90 |
| Woosh DFlow | 5s | 0.619 | 0.228 | 3.10 1.25 | 3.20 1.64 | 0.06 |
| Woosh Flow | 5s | 0.580 | 0.277 | 3.45 1.19 | 3.80 1.28 | 1.92 |
| SAO | 5s | 0.501 | 0.263 | 2.95 1.32 | 3.30 1.30 | 12.30 |
| SAO-small | 5s | 0.500 | 0.277 | 3.10 1.12 | 3.55 1.00 | 0.24 |
| small-sfx | 5s | 0.395 | 0.351 | 3.35 1.39 | 3.25 1.45 | 0.41 |
| medium | 5s | 0.369 | 0.369 | 3.65 1.14 | 3.95 1.23 | 0.60 |
| large | 5s | 0.358 | 0.370 | 3.60 0.94 | 3.85 1.04 | 0.64 |
Table 5 显示 Stable Audio 3 模型的性能始终优于所有基准。特别是,大 medium 实现了最佳的整体性能,而 Woosh Flow 仍然保持着强劲的基线。有趣的是,我们观察到 FAD 和 Woosh Flow 的 OVL 分数之间存在差异。尽管它达到了有竞争力的主观 OVL 质量,但由于产生带限信号,它经常受到 FAD 的惩罚。结果还凸显了 Stable Audio 3 模型的效率。虽然 Woosh DFlow 实现了极低的推理延迟,但这是以质量成本为代价的。相比之下,Stable Audio 3 模型保持快速推理,同时获得最先进的音效生成结果。
以往开放权重系统通常只专注于音乐生成或音效生成,而 medium 与 large 使用单个模型同时训练器乐和音效生成。尽管两类任务共享同一训练设置,它们在两个领域都取得了 SOTA 性能。由于 small 的参数预算有限,作者改为训练两个专用模型:负责器乐生成的 small-music,以及负责音效生成的 small-sfx。即使计算与内存预算都很紧,这一设计仍能提升生成质量。
5.4 · 变长器乐生成
我们评估多个生成持续时间的稳定音频模型,范围从 20 秒剪辑到 380 秒全长生成(如果可能)。请注意,small-music 最多可生成 120 秒,Stable Audio 2.5 最多可生成 190 秒。
Stable Audio 2.5 使用固定长度的 190 秒序列进行训练,如 Figure 2 (a) 所示。较短的训练示例用静音填充,以匹配 190 秒的最大持续时间,使模型能够在固定长度的生成中学习可变持续时间的内容。因此,生成较短的剪辑效率不高,因为它需要在整个序列长度上运行推理,而大多数计算都花费在生成静音上。然而,直接在比训练期间使用的序列更短的序列上运行推理(如 Figure 2 (b) 所示,尽管按照 (a) 进行训练)可能会导致质量下降。我们在 Table 6 中滥用的 Stable Audio 2.5 设置中评估了这种行为,其中直接在较短的持续时间内执行推理,而不是使用原始的固定长度生成过程。结果表明,FAD 和 CLAP 性能下降,这表明 Stable Audio 2.5 无法泛化以执行有效的可变长度推理。
尝试把 Stable Audio 2.5 用于高效变长器乐生成,但并未成功。
| 模型 | 时长 | FAD | CLAP | 推理时间(秒) |
|---|---|---|---|---|
| Stable Audio 2.5 (misused) | 20s | 0.731 | 0.285 | 0.41 |
| Stable Audio 2.5 | 20s | 0.149 | 0.389 | 0.85 |
| Stable Audio 2.5 (misused) | 120s | 0.201 | 0.382 | 0.79 |
| Stable Audio 2.5 | 120s | 0.106 | 0.395 | 0.85 |
| Stable Audio 2.5 | 190s | 0.128 | 0.375 | 0.85 |
Stable Audio 3 模型从设计上就原生支持变长生成。Table 7 的结果体现了这一能力的实际优势:推理成本会随输出时长自然缩放,因此短音频可以高效生成。总体而言,各时长下的表现都较强,最佳结果通常出现在中等长度(120--190 秒)。在很短的 20 秒条件下,FAD 与 CLAP 都会退化;作者将其归因于训练集与评测集的不匹配,因为短训练样本大多是 loop,而评测样本是完整歌曲。在很长的 380 秒条件下,性能同样下降,CLAP 尤其明显。非正式试听表明,长训练样本主要是 ambient 或 classical music,因此长时长 conditioning 会让模型偏向生成这两类音乐,并忽略给定 text prompt。
不同生成时长下的器乐生成结果。
| 模型 | 时长 | FAD | CLAP | 推理时间(秒) |
|---|---|---|---|---|
| small-music | 20s | 0.196 | 0.376 | 0.43 |
| small-music | 120s | 0.145 | 0.393 | 0.45 |
| medium | 20s | 0.163 | 0.392 | 0.62 |
| medium | 120s | 0.107 | 0.390 | 0.78 |
| medium | 190s | 0.116 | 0.362 | 0.88 |
| medium | 380s | 0.156 | 0.275 | 1.31 |
| large | 20s | 0.171 | 0.390 | 0.66 |
| large | 120s | 0.101 | 0.393 | 0.81 |
| large | 190s | 0.100 | 0.373 | 0.93 |
| large | 380s | 0.131 | 0.277 | 1.80 |
不同生成时长下的音效生成结果。
| 模型 | 时长 | FAD | CLAP | 推理时间(秒) |
|---|---|---|---|---|
| small-sfx | 5s | 0.395 | 0.35 | 0.41 |
| small-sfx | 10s | 0.367 | 0.348 | 0.44 |
| small-sfx | 30s | 0.335 | 0.343 | 0.46 |
| small-sfx | 120s | 0.293 | 0.322 | 0.47 |
| medium | 5s | 0.369 | 0.369 | 0.60 |
| medium | 10s | 0.340 | 0.361 | 0.63 |
| medium | 30s | 0.297 | 0.358 | 0.65 |
| medium | 120s | 0.266 | 0.321 | 0.77 |
| large | 5s | 0.358 | 0.370 | 0.63 |
| large | 10s | 0.328 | 0.367 | 0.67 |
| large | 30s | 0.286 | 0.361 | 0.69 |
| large | 120s | 0.259 | 0.322 | 0.81 |
| SAO | 5s | 0.501 | 0.263 | 12.30 |
| SAO | 10s | 0.452 | 0.277 | 12.30 |
| SAO | 30s | 0.364 | 0.290 | 12.30 |
| SAO-small | 5s | 0.500 | 0.277 | 0.24 |
| SAO-small | 10s | 0.456 | 0.280 | 0.24 |
| TangoFlux | 5s | 0.760 | 0.179 | 1.90 |
| TangoFlux | 10s | 0.680 | 0.214 | 1.90 |
| TangoFlux | 30s | 0.595 | 0.206 | 1.90 |
| Woosh Flow | 5s | 0.580 | 0.277 | 1.92 |
| Woosh DFlow | 5s | 0.619 | 0.228 | 0.06 |
5.5 · 变长音效生成
Table 8 评估了不同输出持续时间和模型的音效生成质量和推理速度。尽管 medium 与 large 支持高达 380 秒的生成,但为了简单起见并轻松与现有基线进行比较,我们将评估的最大持续时间限制为 120 秒。在所有评估的持续时间内,所提出的模型始终优于基线,同时保持快速的推理时间。一个有趣的趋势是,随着所有提议变体的生成长度增加,FAD 单调改进。我们假设这种行为部分是由较长持续时间样本的性质驱动的,这些样本主要由现场录音和环境音景组成,具有较低的声学多样性和较慢的时间变化。因此,生成的音频相对于评估数据表现出较低的分布差异,从而提高了 FAD 分数。相比之下,CLAP 分数随着代数的增长而下降,这可能反映了在较长时间内保持与文本 prompt 的语义对齐的困难。
5.6 · 音频编辑能力
在本节中,我们评估模型在各种任务上的编辑能力:inpainting(单区域和双区域)和音乐(Table 9)和音效(Table 10)的延续。方法细节在第 5.1 节中解释。在这两个领域中,small 的 FAD 结果比 medium 与 large 的要差,我们将其归因于其模型容量的减少和较小的(CPU 优化的)autoencoder。非正式聆听还表明,小尺寸会产生不太平滑的过渡,这反映在与 FAD 修复相比,FAD full 更差。然而,这种差异在较大的模型中不太明显,这表明 medium 与 large 模型会产生更连贯的编辑。此外,两个表中的单修复和双修复数量都很接近。这表明我们的模型处理两个独立的屏蔽区域以及一个。此外,对于连续设置,FAD 指标通常比 inpainting 更差。我们将此归因于 inpainting 设置中更强的调节约束,其中为模型提供了大量的音频上下文。这种调节有效地将修复编辑锚定到参考分布,减少偏差并导致较低的 FAD。相反,连续性需要从较短的上下文中进行推断,这会增加远程结构的可变性并导致更差的 FAD 指标。延续结果还表明,FAD 修复比 FAD full 更差,与我们在 inpainting 中看到的相反,因为生成的区域在一侧不受约束,因此与参考分布漂移得更远。 CLAP gen-orig 指标也更差,反映出如果没有周围的上下文来锚定生成,即使 prompt 对齐(CLAP 文本生成)保持较高或有所改善,延续在声学上与原始内容不太相似。
不同模型在 inpainting 与 continuation 任务上的音乐编辑结果。
| 任务 | 模型 | FAD full | FAD inpaint | CLAP text-gen | CLAP gen-orig |
|---|---|---|---|---|---|
| 单区间 inpaint | small | 0.100 | 0.086 | 0.271 | 0.833 |
| medium | 0.046 | 0.040 | 0.289 | 0.875 | |
| large | 0.047 | 0.040 | 0.289 | 0.878 | |
| 双区间 inpaint | small | 0.100 | 0.083 | 0.274 | 0.834 |
| medium | 0.046 | 0.034 | 0.288 | 0.874 | |
| large | 0.047 | 0.035 | 0.289 | 0.876 | |
| 续写 | small | 0.121 | 0.130 | 0.404 | 0.649 |
| medium | 0.074 | 0.084 | 0.400 | 0.653 | |
| large | 0.071 | 0.078 | 0.403 | 0.667 |
不同模型在 inpainting 与 continuation 任务上的音效编辑结果。
| 任务 | 模型 | FAD full | FAD inpaint | CLAP text-gen | CLAP gen-orig |
|---|---|---|---|---|---|
| 单区间 inpaint | small | 0.170 | 0.119 | 0.196 | 0.717 |
| medium | 0.086 | 0.068 | 0.220 | 0.748 | |
| large | 0.084 | 0.068 | 0.220 | 0.752 | |
| 双区间 inpaint | small | 0.171 | 0.119 | 0.195 | 0.714 |
| medium | 0.089 | 0.070 | 0.216 | 0.742 | |
| large | 0.086 | 0.069 | 0.217 | 0.746 | |
| 续写 | small | 0.208 | 0.214 | 0.351 | 0.600 |
| medium | 0.172 | 0.191 | 0.332 | 0.570 | |
| large | 0.195 | 0.218 | 0.311 | 0.546 |
5.7 · Adversarial Post-Training 讨论
Table 11 与 Table 12 将预训练的 Flow Matching base model,同经过 Distillation Warmup 和 Adversarial Post-Training 继续训练的 post-trained model 做了比较。Base model 在推理时需要 50 个采样步骤,不仅延迟显著更高,生成质量也更差;post-trained model 则生成更快,最少只需一步。然而,从纯噪声一步生成音频 latent()仍然困难,会使 FAD 与 CLAP 退化。因此,本文所有实验都选用 8-step Ping-Pong sampling。其迭代式“去噪—重新加噪”调度能够逐步细化输出并纠正早期误差,同时继续利用模型在 Distillation Warmup 和 Adversarial Post-Training 中学到的一步去噪能力 。在这一设置下,post-trained model 在生成质量与效率之间取得了良好平衡:FAD 与 CLAP 更优,同时推理时间仍显著低于 base model。
预训练与 post-trained 音乐模型在不同采样步数下的对比。
| 模型 | 训练阶段 | 时长 | 步数 | FAD | CLAP | 推理时间(秒) |
|---|---|---|---|---|---|---|
| small | base model | 120s | 50 | 0.162 | 0.370 | 2.89 |
| medium | base model | 120s | 50 | 0.143 | 0.352 | 3.87 |
| large | base model | 120s | 50 | 0.116 | 0.355 | 3.90 |
| small | post-trained | 120s | 1 | 0.439 | 0.300 | 0.09 |
| medium | post-trained | 120s | 1 | 0.258 | 0.355 | 0.27 |
| large | post-trained | 120s | 1 | 0.273 | 0.331 | 0.28 |
| small | post-trained | 120s | 8 | 0.145 | 0.393 | 0.45 |
| medium | post-trained | 120s | 8 | 0.107 | 0.390 | 0.78 |
| large | post-trained | 120s | 8 | 0.101 | 0.393 | 0.81 |
预训练与 post-trained 音效模型在不同采样步数下的对比。
| 模型 | 训练阶段 | 时长 | 步数 | FAD | CLAP | 推理时间(秒) |
|---|---|---|---|---|---|---|
| small | base model | 120s | 50 | 0.336 | 0.284 | 2.89 |
| medium | base model | 120s | 50 | 0.312 | 0.298 | 3.87 |
| large | base model | 120s | 50 | 0.282 | 0.299 | 3.90 |
| small | post-trained | 120s | 1 | 0.626 | 0.228 | 0.09 |
| medium | post-trained | 120s | 1 | 0.596 | 0.186 | 0.27 |
| large | post-trained | 120s | 1 | 0.604 | 0.188 | 0.28 |
| small | post-trained | 120s | 8 | 0.293 | 0.322 | 0.45 |
| medium | post-trained | 120s | 8 | 0.266 | 0.321 | 0.78 |
| large | post-trained | 120s | 8 | 0.259 | 0.322 | 0.81 |
5.8 · VRAM 占用
Table 13 汇报了不同模型规模与生成时长下的 peak VRAM。峰值显存会随模型规模和 sequence length 增长。Small 占用最低,即使生成 120 秒也不超过 2.5 GB;在最长设置下,medium 与 large 分别约需 6.5 GB 与 9.0 GB。
这些显存需求与多种现代消费级 GPU 兼容。Small 可轻松运行在 RTX 3050 等入门 GPU(通常为 4--8 GB VRAM)或显存相当的 laptop GPU 上,并支持最长 120 秒生成。Medium 生成长音频约需 6.5 GB VRAM,因此仍可部署在 RTX 3060(12 GB)、RTX 4060(8 GB)或 RTX 4070(12 GB)等常见消费级 GPU。
不同模型规模与生成时长下的 peak VRAM。
| 模型 | 时长 | 峰值 VRAM |
|---|---|---|
| small | 30s | 1.89 GB |
| small | 120s | 2.40 GB |
| medium | 30s | 5.49 GB |
| medium | 120s | 6.49 GB |
| medium | 380s | 6.52 GB |
| large | 30s | 8.01 GB |
| large | 120s | 9.01 GB |
| large | 380s | 9.04 GB |
5.9 · 跨硬件平台推理时间
作者比较了多个硬件平台上的推理时间。所有实验均固定使用 8-step Ping-Pong sampling,包括四种设置:(i) 仅使用 CPU 的 MacBook Pro M4;(ii) 通过 CoreML 调用 CPU、GPU 与 Neural Engine 加速的 MacBook Pro M4;(iii) 以标准 PyTorch 执行的 NVIDIA H200 GPU;(iv) 使用 TensorRT 加速的 NVIDIA H200 GPU。作者报告不同生成时长与模型规模下的端到端生成延迟。Table 14 表明,相比 MacBook Pro M4 的纯 CPU 执行,CoreML 可显著提升性能;在 H200 GPU 上,TensorRT 又进一步加速推理,使大多数配置的耗时缩短约一个数量级。
实现细节。MacBook Pro M4 的 CPU-only 结果使用 CoreML 加速 small,并用 TFLite 加速 SAME-S decoder。Medium 与 large 使用的 SAME-L decoder 则在 PyTorch 中通过 torch.compile 加速,而不是 TensorRT;TensorRT 无法加速 SAME-L 使用的 sliding-window attention,torch.compile 在这一设置下利用率更好。
不同硬件、加速设置、模型规模与生成时长下的推理时间。
| 硬件 | 加速 | 模型 | 生成长度 | |||
|---|---|---|---|---|---|---|
| 5s | 30s | 120s | 380s | |||
| MacBook Pro M4 | 仅 CPU | small | 0.70s | 1.72s | 5.92s | — |
| CoreML | small | 0.23s | 0.63s | 3.09s | — | |
| H200 | — | small | 0.41s | 0.46s | 0.45s | — |
| — | medium | 0.60s | 0.65s | 0.78s | 1.31s | |
| — | large | 0.63s | 0.69s | 0.81s | 1.80s | |
| TensorRT | small | 0.017s | 0.022s | 0.044s | — | |
| TensorRT | medium | 0.02s | 0.05s | 0.13s | 0.43s | |
| TensorRT | large | 0.03s | 0.07s | 0.19s | 0.63s | |
6 · 结论
Stable Audio 3 是面向器乐与音效生成、编辑的一组快速 latent diffusion 模型,包含 small、medium、large 三个规模。它把 下采样的 semantic-acoustic autoencoder 与 Diffusion Transformer 结合起来,并依次使用 Flow Matching、Distillation Warmup 和 Adversarial Post-Training 训练。推理时只需 8-step Ping-Pong sampling,便能在 H200 GPU 上不到 2 秒内生成最长 6 分 20 秒、44.1 kHz 的 stereo audio。在器乐生成上,Stable Audio 3 相比已有工作提升了 musicality,并超过既有开放权重 baseline;在音效生成上,它同样刷新了开放权重系统的 SOTA。模型原生支持变长生成与基于 inpainting 的编辑,可执行单区间编辑、多区间编辑和 continuation。Stable Audio 3 仅使用获许可与 Creative Commons 数据训练,并公开 small 与 medium 模型权重。Small 可在 MacBook Pro M4 CPU 上运行,medium 只需 8 GB VRAM 即可部署到消费级 GPU,使两者都能进入常见研究与创作工作流。
参考文献
参考文献保留作者原始书目信息与编号顺序。
- J. Copet, F. Kreuk, I. Gat, T. Remez, D. Kant, G. Synnaeve, Y. Adi, and A. Défossez. Simple and controllable Music Generation. In NeurIPS, 2023.
- A. Agostinelli, T. I. Denk, Z. Borsos, J. Engel, M. Verzetti, A. Caillon, Q. Huang, A. Jansen, A. Roberts, M. Tagliasacchi, M. Sharifi, N. Zeghidour, and C. Frank. MusicLM: Generating music from text. arXiv preprint, 2023.
- R. Yuan, H. Lin, S. Guo, G. Zhang, J. Pan, Y. Zang, et al. YuE: Scaling open foundation models for long-form music generation. arXiv preprint, 2025.
- D. Yang, Y. Xie, Y. Yin, Z. Wang, X. Yi, G. Zhu, et al. HeartMuLa: A family of open sourced music foundation models. arXiv preprint, 2026.
- Z. Evans, C. J. Carr, J. Taylor, S. H. Hawley, and J. Pons. Fast timing-conditioned Latent Audio Diffusion. In ICML, 2024.
- Z. Evans, J. D. Parker, C. J. Carr, Z. Zukowski, J. Taylor, and J. Pons. Long-form music generation with latent diffusion. In ISMIR, 2024.
- H. Liu, Z. Chen, Y. Yuan, X. Mei, X. Liu, D. Mandic, W. Wang, and M. D. Plumbley. AudioLDM: Text-to-audio generation with latent diffusion models. In ICML, 2023.
- K. Chen, Y. Wu, H. Liu, M. Nezhurina, T. Berg-Kirkpatrick, and S. Dubnov. MusicLDM: Enhancing novelty in text-to-music generation using beat-synchronous mixup strategies. In ICASSP, 2024.
- F. Schneider, O. Kamal, Z. Jin, and B. Schölkopf. Moûsai: Text-to-music generation with long-context latent diffusion. In ACL, 2024.
- H. Liu, Y. Yuan, X. Liu, X. Mei, Q. Kong, Q. Tian, Y. Wang, W. Wang, Y. Wang, and M. D. Plumbley. AudioLDM 2: Learning holistic audio generation with self-supervised pretraining. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2024.
- J. Gong, Y. Song, W. Zhao, S. Wang, S. Xu, J. Guo, and X. Yang. ACE-Step 1.5: Pushing the boundaries of open-source music generation. arXiv preprint, 2026.
- C. Zhang, Y. Ma, Q. Chen, W. Wang, S. Zhao, Z. Pan, H. Wang, C. Ni, T. H. Nguyen, K. Zhou, Y. Jiang, C. Tan, Z. Gao, Z. Du, and B. Ma. InspireMusic: Integrating super resolution and large language model for high-fidelity long-form music generation. arXiv preprint, 2025.
- A. Défossez, J. Copet, G. Synnaeve, and Y. Adi. High fidelity neural audio compression. Transactions on Machine Learning Research, 2023.
- R. Kumar, P. Seetharaman, A. Luebs, I. Kumar, and K. Kumar. High-fidelity audio compression with improved RVQGAN. In NeurIPS, 2023.
- K. Wang, Z. Wu, D. Zhou, R. Lin, J. Dai, and T. Jiang. Back to ear: Perceptually driven high fidelity music reconstruction. arXiv preprint, 2025.
- J. Ho, A. Jain, and P. Abbeel. Denoising diffusion probabilistic models. In NeurIPS, 2020.
- Y. Song, J. Sohl-Dickstein, D. P. Kingma, A. Kumar, S. Ermon, and B. Poole. Score-based generative modeling through stochastic differential equations. In ICLR, 2021.
- Z. Novack, Z. Evans, Z. Zukowski, J. Taylor, C. J. Carr, J. Parker, A. Al-Sinan, G. M. Iodice, J. McAuley, T. Berg-Kirkpatrick, and J. Pons. Fast text-to-audio generation with Adversarial Post-Training. In WASPAA, 2025. WASPAA 2025.
- X. Liu, C. Gong, and Q. Liu. Flow straight and fast: Learning to generate and transfer data with rectified flow. arXiv preprint, 2022.
- Y. Lipman, R. T. Q. Chen, H. Ben-Hamu, M. Nickel, and M. Le. Flow Matching for generative modeling. In ICLR, 2023.
- M. S. Albergo and E. Vanden-Eijnden. Building normalizing flows with stochastic interpolants. In ICLR, 2023.
- T. Salimans and J. Ho. Progressive distillation for fast sampling of diffusion models. arXiv preprint, 2022.
- E. Luhman and T. Luhman. Knowledge Distillation in iterative generative models for improved sampling speed. arXiv preprint, 2021.
- T. Ye, L. Li, G. Huang, S. Xia, D. Li, and F. Wei. Differential Transformer. In ICLR, 2025.
- W. Peebles and S. Xie. Scalable diffusion models with transformers. In ICCV, 2023.
- M. S. Burtsev, Y. Kuratov, A. Peganov, and G. V. Sapunov. Memory Transformer. arXiv preprint, 2020.
- T. Darcet, M. Oquab, J. Mairal, I. Misra, and H. Jegou. Vision Transformers need registers. In ICLR, 2024.
- F. Kreuk, G. Synnaeve, A. Polyak, U. Singer, A. Défossez, J. Copet, D. Parikh, Y. Taigman, and Y. Adi. AudioGen: Textually guided audio generation. In ICLR, 2023.
- D. Ghosal, N. Majumder, A. Mehrish, and S. Poria. Text-to-audio generation using instruction-tuned LLM and latent diffusion model. arXiv preprint, 2023.
- N. Majumder, C.-Y. Hung, D. Ghosal, W.-N. Hsu, R. Mihalcea, and S. Poria. Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization. In ACM MM, 2024.
- Z. Evans, J. D. Parker, C. J. Carr, Z. Zukowski, J. Taylor, and J. Pons. Stable audio open. arXiv preprint, 2024.
- Z. Ning, H. Chen, Y. Jiang, C. Hao, G. Ma, S. Wang, J. Yao, and L. Xie. Diffrhythm: Blazingly fast and embarrassingly simple end-to-end full-length song generation with latent diffusion. arXiv preprint, 2025. Weights available at https://huggingface.co/ASLP-lab/DiffRhythm-full.
- Y. Jiang, H. Chen, Z. Ning, J. Yao, Z. Han, D. Wu, M. Meng, J. Luan, Z. Fu, and L. Xie. Diffrhythm 2: Efficient and high fidelity song generation via block flow matching. arXiv preprint, 2025.
- R. Liu, C.-Y. Hung, N. Majumder, T. Gautreaux, A. A. Bagherzadeh, C. Li, D. Herremans, and S. Poria. JAM: A tiny flow-based song generator with fine-grained controllability and aesthetic alignment. arXiv preprint, 2025.
- D. Podell, Z. English, K. Lacey, A. Blattmann, T. Dockhorn, J. Müller, J. Penna, and R. Rombach. Sdxl: Improving latent diffusion models for high-resolution image synthesis. arXiv preprint, 2023.
- J. Chen, C. Ge, E. Xie, Y. Wu, L. Yao, X. Ren, Z. Wang, P. Luo, H. Lu, and Z. Li. Pixart-σ: Weak-to-strong training of diffusion transformer for 4k text-to-image generation. In ECCV, 2024.
- Z. Li, J. Zhang, Q. Lin, J. Xiong, Y. Long, X. Deng, Y. Zhang, X. Liu, M. Huang, Z. Xiao, et al. Hunyuan-dit: A powerful multi-resolution diffusion transformer with fine-grained chinese understanding. arXiv preprint, 2024.
- B. Zheng, N. Ma, S. Tong, and S. Xie. Diffusion Transformers with Representation Autoencoders. arXiv preprint, 2025.
- S. Tong, B. Zheng, Z. Wang, B. Tang, N. Ma, E. Brown, J. Yang, R. Fergus, Y. LeCun, and S. Xie. Scaling text-to-image diffusion transformers with representation autoencoders. arXiv preprint, 2026.
- J. D. Parker, Z. Evans, C. J. Carr, Z. Zukowski, J. Taylor, M. Rice, and J. Pons. SAME: A semantically-aligned music autoencoder. Technical report, 2025.
- J. Pons, Z. Zukowski, J. D. Parker, C. J. Carr, J. Taylor, and Z. Evans. Music and artificial intelligence: Artistic trends. arXiv preprint, 2025.
- H. F. García, P. Seetharaman, R. Kumar, and B. Pardo. VampNet: Music generation via masked acoustic token modeling. In ISMIR, 2023.
- P. Li, B. Chen, Y. Yao, Y. Wang, A. Wang, and A. Wang. JEN-1: Text-guided universal music generation with omnidirectional diffusion models. In IEEE CAI, 2024.
- P. Seetharaman, O. Nieto, and J. Salamon. Generative audio extension and morphing. In ICASSP, 2026.
- Y. Wang, Z. Ju, X. Tan, L. He, Z. Wu, J. Bian, and S. Zhao. AUDIT: Audio editing by following instructions with latent diffusion models. In NeurIPS, 2023.
- B. Han, J. Dai, W. Hao, X. He, D. Guo, J. Chen, Y. Wang, Y. Qian, and X. Song. InstructME: An instruction guided music edit framework with latent diffusion models. In IJCAI, 2024.
- J. D. Parker, J. Spijkervet, K. Kosta, F. Yesiler, B. Kuznetsov, J.-C. Wang, M. Avent, J. Chen, and D. Le. Stemgen: A music generation model that listens. In ICASSP, 2024.
- M. Levy, B. Di Giorgi, F. Weers, A. Katharopoulos, and T. Nickson. Controllable music production with diffusion models and guidance gradients. arXiv preprint, 2023.
- Z. Novack, Z. Zukowski, C. J. Carr, J. Parker, Z. Evans, J. Taylor, T. Berg-Kirkpatrick, J. McAuley, and J. Pons. Low-resource guidance for controllable latent audio diffusion. arXiv preprint, 2026.
- G. L. Lan, B. Shi, Z. Ni, S. Srinivasan, A. Kumar, B. Ellis, D. Kant, V. Nagaraja, E. Chang, W.-N. Hsu, et al. High fidelity text-guided music editing via single-stage flow matching. arXiv preprint, 2024.
- Z. Novack, J. Mcauley, T. Berg-Kirkpatrick, and N. J. Bryan. Ditto: Diffusion inference-time t-optimization for music generation. In ICML, 2024.
- Z. Novack, J. McAuley, T. Berg-Kirkpatrick, and N. Bryan. Ditto-2: Distilled diffusion inference-time toptimization for music generation. arXiv preprint, 2024.
- O. Tal, A. Ziv, I. Gat, F. Kreuk, and Y. Adi. Joint audio and symbolic conditioning for temporally controlled text-to-music generation. arXiv preprint, 2024.
- S. Rouard, Y. Adi, J. Copet, A. Roebel, and A. Défossez. Audio conditioning for music generation via discrete bottleneck features. arXiv preprint, 2024.
- S.-L. Wu, C. Donahue, S. Watanabe, and N. J. Bryan. Music ControlNet: Multiple time-varying controls for music generation. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2024.
- H. F. García, O. Nieto, J. Salamon, B. Pardo, and P. Seetharaman. Sketch2sound: Controllable audio generation via time-varying signals and sonic imitations. In ICASSP, 2025.
- J. Wang. Audio palette: A diffusion transformer with multi-signal conditioning for controllable foley synthesis. arXiv preprint, 2025.
- S. Kim, G. Kim, S. Yagishita, D. Han, J. Im, and Y. Sung. Enhancing diffusion-based music generation performance with lora. Applied Sciences, 2025.
- Y. Song, P. Dhariwal, M. Chen, and I. Sutskever. Consistency models. In ICML, 2023.
- Z. Xiao, K. Kreis, and A. Vahdat. Tackling the generative learning trilemma with denoising diffusion GANs. In ICLR, 2022.
- A. Sauer, D. Lorenz, A. Blattmann, and R. Rombach. Adversarial diffusion distillation. In ECCV, 2024.
- Y. Ren, X. Xia, Y. Lu, J. Zhang, J. Wu, P. Xie, X. Wang, and X. Xiao. Hyper-SD: Trajectory segmented consistency model for efficient image synthesis. arXiv preprint, 2024.
- F.-Y. Wang, Z. Huang, A. W. Bergman, D. Shen, P. Gao, M. Lingelbach, K. Sun, W. Bian, G. Song, Y. Liu, H. Li, and X. Wang. Phased consistency model. arXiv preprint, 2024.
- C. Lu and Y. Song. Simplifying, stabilizing and scaling continuous-time consistency models. arXiv preprint, 2024.
- J. Chen, S. Xue, Y. Zhao, J. Yu, S. Paul, J. Chen, H. Cai, E. Xie, and S. Han. Sana-sprint: One-step diffusion with continuous-time consistency distillation. arXiv preprint, 2025.
- D. Kim, C.-H. Lai, W.-H. Liao, N. Murata, Y. Takida, T. Uesaka, Y. He, Y. Mitsufuji, and S. Ermon. Consistency trajectory models: Learning probability flow ODE trajectory of diffusion. In ICLR, 2023.
- Z. Novack, G. Zhu, J. Casebeer, J. McAuley, T. Berg-Kirkpatrick, and N. J. Bryan. Presto! distilling steps and layers for accelerating music generation. In ICLR, 2025.
- Y. Xu, W. Nie, and A. Vahdat. One-step diffusion models with f -divergence distribution matching. arXiv preprint, 2025.
- T. Yin, M. Gharbi, T. Park, R. Zhang, E. Shechtman, F. Durand, and W. T. Freeman. Improved distribution matching distillation for fast image synthesis. arXiv preprint, 2024.
- M. Kang, R. Zhang, C. Barnes, S. Paris, S. Kwak, J. Park, E. Shechtman, J.-Y. Zhu, and T. Park. Distilling diffusion models into conditional gans. arXiv preprint, 2024.
- Y. Xu, Y. Zhao, Z. Xiao, and T. Hou. Ufogen: You forward once large scale text-to-image generation via diffusion gans. In CVPR, 2024.
- S. Lin, X. Xia, Y. Ren, C. Yang, X. Xiao, and L. Jiang. Diffusion adversarial post-training for one-step video generation. arXiv preprint, 2025.
- A. Sauer, F. Boesel, T. Dockhorn, A. Blattmann, P. Esser, and R. Rombach. Fast high-resolution image synthesis with latent adversarial diffusion distillation. arXiv preprint, 2024.
- H. Liu, R. Huang, Y. Liu, H. Cao, J. Wang, X. Cheng, S. Zheng, and Z. Zhao. AudioLCM: Text-to-audio generation with latent consistency models. In ACM MM, 2024.
- G. Hadjeres, M. Ferras, K. Koutini, B. Weck, A. Bittar, T. Hummel, Z. Lahrichi, H. Missoum, J. Serrà, and Y. Mitsufuji. Woosh: A sound effects foundation model. arXiv preprint, 2026.
- J. Su, M. Ahmed, Y. Lu, S. Pan, W. Bo, and Y. Liu. Roformer: Enhanced transformer with rotary position embedding. Neurocomputing, 2024.
- A. Liu, B. Feng, B. Wang, B. Wang, B. Liu, C. Zhao, C. Dengr, C. Ruan, D. Dai, D. Guo, et al. Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model. arXiv preprint, 2024.
- A. Henry, P. R. Dachapally, S. Pawar, and Y. Chen. Query-key normalization for transformers. arXiv preprint, 2020.
- N. Shazeer. Glu variants improve transformer. arXiv preprint, 2020.
- Black Forest Labs. Flux. https://github.com/black-forest-labs/flux, 2024.
- T. Dao. FlashAttention-2: Faster attention with better parallelism and work partitioning. In ICLR, 2024.
- E. Hoogeboom, J. Heek, and T. Salimans. Simple diffusion: End-to-end diffusion for high resolution images. In ICML, 2023.
- T. Chen. On the importance of noise scheduling for diffusion models. arXiv preprint, 2023.
- P. Esser, S. Kulal, A. Blattmann, R. Entezari, J. Müller, H. Saini, et al. Scaling Rectified Flow Transformers for high-resolution image synthesis. In ICML, 2024.
- M. Cuturi. Sinkhorn distances: Lightspeed computation of optimal transport. In NeurIPS, 2013.
- N. Huang, A. Gokaslan, V. Kuleshov, and J. Tompkin. The gan is dead; long live the gan! a modern baseline gan. In ICML Workshop on Structured Probabilistic Inference and Generative Modeling, 2024.
- A. Jolicoeur-Martineau. The relativistic discriminator: a key element missing from standard gan. arXiv preprint, 2018.
- M. Gutmann and A. Hyvärinen. Noise-contrastive estimation: A new estimation principle for unnormalized statistical models. In AISTATS, 2010.
- Q. Kong, Y. Cao, T. Iqbal, Y. Wang, W. Wang, and M. D. Plumbley. Panns: Large-scale pretrained audio neural networks for audio pattern recognition. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2020.
- K. Jordan. Muon: An optimizer for hidden layers in neural networks. 2024. https://kellerjordan.github. io/posts/muon/.
- D. Kingma, T. Salimans, B. Poole, and J. Ho. Variational diffusion models. Advances in neural information processing systems, 2021.
- C.-Y. Hung, N. Majumder, Z. Kong, A. Mehrish, A. A. Bagherzadeh, C. Li, R. Valle, B. Catanzaro, and S. Poria. TangoFlux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization. arXiv preprint, 2024.
- K. Kilgour, M. Zuluaga, D. Roblek, and M. Sharifi. Fréchet Audio Distance: A reference-free metric for evaluating music enhancement algorithms. In Interspeech, 2019.
- A. Gui, H. Gamper, S. Braun, and D. Emmanouilidou. Adapting Frechet Audio Distance for generative music evaluation. In ICASSP, 2024.
- I. Manco, B. Weck, S. Doh, M. Won, Y. Zhang, D. Bogdanov, et al. The Song Describer Dataset: a corpus of audio captions for music-and-language evaluation. In Machine Learning for Audio Workshop, NeurIPS, 2023.
- C. D. Kim, B. Kim, H. Lee, and G. Kim. AudioCaps: Generating captions for audios in the wild. In NAACL, 2019.