资料摘要:SonicWeave
快手 Kling、香港中文大学与清华大学提出的 2B 统一音频场景生成模型。SonicWeave 用同一组权重生成语音、歌声、音乐、音效及其混合场景;核心 CPE-MoE 不再逐 token 独立选专家,而让连续声学 chunk 共享路由,并用门控在“结构化文本 + diffusion phase”的全局 prior 与当前声学状态的局部 evidence 之间插值。
🔒 SonicWeave - Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation
- 统一任务:一个 conditional flow-matching DiT 同时覆盖 TTS、TTA、TTM、歌声、对话以及带背景的复杂混合场景;输入被整理为 speech、vocal attributes、music、sound effects、ambience 等结构化字段。
- 路由粒度:CPE-MoE 将连续 4 个 audio latent frame 组成一个 chunk,对 chunk 做一次 Top-2/4-expert 路由;专家仍逐帧处理原始 hidden state,因此 chunk 是路由单元,不是表示压缩单元。
- prior–evidence 融合:全局 prior 来自 text hidden state 与 diffusion time,局部 evidence 来自当前 chunk 的 acoustic state;标量 conflict gate 决定专家 logits 向哪一侧移动。
- 模态解耦:text/time token 始终走 shared expert,只有 audio token 进入 sparse experts,避免条件通道随局部声学路由漂移。
- 主要结果:在匹配数据与 backbone 的对照中,SonicWeave 全面优于 1B Dense 与 2B token-routed Base-MoE;复杂场景 MOS-R 为 4.49,高于 Base-MoE 的 4.31 与 Dasheng AudioGen 的 3.25,同时 MOS-Q 与 Base-MoE 同为 4.57。
- 证据边界:论文只报告单次训练结果,缺少多随机种子;targeted ablation 比较了固定 gate 与 chunk size 8,却没有 prior-only、evidence-only 或 chunk size 1 的完整对照。因此现有实验支持“整个 CPE-MoE 设计有效”,尚不能严格分离 chunk routing、双信号融合和其他训练细节的独立因果贡献。
论文摘要译文
Section titled “论文摘要译文”文本条件的通用音频生成正从彼此孤立的语音、音乐和音效合成,迈向用单一模型把它们组合成可控且连贯的音频场景。统一设置尤其困难:异质成分会对共享 backbone 提出相互冲突的结构要求,而复杂混合场景又可能包含局部不同或相互重叠的内容,要求模型在同一片段内进行细粒度适配。
现有 audio MoE 主要在 domain level 路由,token-wise routing 则忽略了声学信号固有的局部连续性。为此,作者提出统一音频场景生成 flow-matching 模型 SonicWeave。其核心是采用 conflict-gated prior–evidence routing 的 chunk-routed MoE,即 CPE-MoE。它把结构化文本条件与 diffusion phase 编码为全局 prior,再与不断演化的声学状态所提供的局部 evidence 结合,对连续 acoustic chunk 进行路由。
当局部状态不可靠时,学习到的 conflict gate 更偏向 prior;当某一区域偏离全局场景语境时,它允许 local evidence 对路由施加更大影响。SonicWeave 用同一组权重支持语音、音乐、音效、歌声及其细粒度混合。在 TTS、TTA 与 TTM 基准上,它持续优于受控的 Dense 和 Base-MoE;复杂场景评估也显示出更好的组合质量,路由分析则呈现出随内容和 diffusion phase 变化的专家专精。结果表明,具备时间连续性的 prior–evidence routing 是统一音频生成的一种有效 conditional-computation 策略。
1. 问题与定位
Section titled “1. 问题与定位”统一音频模型面对两层冲突:
- 跨 domain:语音依赖语言精确性,音乐依赖和声与节奏结构,环境音既包含平稳纹理也包含瞬态事件。
- 单场景内部:语音、音乐、环境和音效可能交替或重叠,不同局部区域需要不同计算路径。
Clip-level routing 无法在同一场景内适配;frame/token-level routing 又可能在高度相关的相邻帧间频繁抖动,而且 diffusion 早期的局部 acoustic state 尚不可靠。SonicWeave 将 chunk routing 放在二者之间:共享局部计算选择,同时保留 frame-level 表示。
2. 结构化文本条件
Section titled “2. 结构化文本条件”自动标注管线先移除非声学细节,再提取以下字段:类型、语言、speech text/lyrics、speaker count、speaker/vocal attributes、music、sound effect、ambience 与 recording texture。字段以显式 tag 串行化,例如:
Summary. <type>speech</type> <lang>en</lang> <speech>...</speech> <music>...</music>
这种格式把容易纠缠的场景属性拆开,同时原样保留语言内容。当前 schema 明确支持最多两位说话人;所有 domain 共用一个冻结的 language encoder。
3. Joint audio–text DiT
Section titled “3. Joint audio–text DiT”每层 Transformer 接收 time、text 与 audio 三组 token:
Stereo waveform 先由预训练 stereo VAE 编码为连续 latent;带噪 latent 与可选 masked reference 拼接并投影成 audio token。Text 与 audio 使用彼此独立的一维 RoPE 坐标,避免一种模态的序列长度改变另一种模态的位置编号。
Flow matching 本身不要求最终 audio/text hidden state 对齐,因此作者加入对称 batch 内对比损失:
4. CPE-MoE 逐步译解
Section titled “4. CPE-MoE 逐步译解”4.1 Modality-decoupled dispatch
Section titled “4.1 Modality-decoupled dispatch”Context token(time + text)只经过 shared expert;audio token 同时使用 shared expert 与 sparse mixture。这样,决定“生成什么”的条件路径保持稳定,不会被每个局部 chunk 的专家选择反向扰动。
4.2 Chunk-level routing
Section titled “4.2 Chunk-level routing”将长度为 的 audio state 分成 个不重叠 chunk。第 个 chunk 的有效帧均值为:
Router 仅用 选择专家;被选专家仍对每个原始 frame state 运算。Padding-only chunk 不参与路由与负载统计。
4.3 Global prior 与 local evidence
Section titled “4.3 Global prior 与 local evidence”Prior 汇总当前层的文本、diffusion phase 与 segment start:
Evidence 来自联合 self-attention 之后的局部 acoustic state:
两者都是输出维度为专家数 的两层 SiLU MLP,并将输出 bias 初始化为零。
4.4 Conflict gate
Section titled “4.4 Conflict gate”Gate 同时观察 prior、evidence、逐坐标乘积与绝对差:
随后在 expert-logit space 做线性插值:
精确恢复 prior logits, 精确恢复 evidence logits。它是由 generation objective 学得的 evidence reliance coefficient,不是“evidence 正确概率”的校准估计。
4.5 Sparse composition
Section titled “4.5 Sparse composition”Audio 输出固定为 shared 与 sparse 两路等权组合:
Routed expert 的 down-projection 零初始化,使 sparse 分支从近零贡献平滑进入训练;固定 1:1 权重也防止额外 learnable gate 把 routed path 压掉。Switch-Transformer-style auxiliary loss 在有效 chunk 上防止 expert collapse。
5. Flow-matching 训练与推理
Section titled “5. Flow-matching 训练与推理”给定真实 latent 与噪声 ,训练线性 probability path 上的 velocity:
总目标为 。训练随机遮蔽连续 reference span,并独立丢弃 reference 与 caption 以支持 CFG。推理采用 100 步 Euler ODE 与 Adaptive Projected Guidance(APG)。
6. 规模与实现
Section titled “6. 规模与实现”- Backbone:16 层、hidden size 1536、24 个 attention head,约 1B dense 参数。
- CPE-MoE:替换最后 4 层 FFN;4 个 routed expert、Top-2、chunk size ;总参数约 2B、每 token 激活约 1.5B。
- Audio:44.1 kHz stereo;Stable Audio 2.0 风格 VAE,时间下采样 2048,默认 256 latent frame(约 11.89 秒),模型结构本身支持变长。
- 数据:内部语料约 500 万个 10–15 秒 clip,总时长超过 20,000 小时;涵盖 speech、music、SFX、ambience 与 mixed recording。
- 训练:64 张 NVIDIA H20,约 21 天,AdamW,batch size 512,200k step。
7. 公开基准结果
Section titled “7. 公开基准结果”| 任务 | 指标 | Dense | Base-MoE | SonicWeave | 说明 |
|---|---|---|---|---|---|
| SeedTTS-en | WER↓ | 2.4% | 1.4% | 1.0% | 与表中 Higgs Audio V2 最优值持平 |
| SeedTTS-zh | CER↓ | 1.8% | 1.1% | 0.8% | 与 UniMoE-Audio、Higgs 并列 |
| LibriSpeech | WER↓ | 4.9% | 3.2% | 2.4% | 与 F5-TTS 持平 |
| AudioCaps | FAD↓ | 3.98 | 3.10 | 2.75 | 仍逊 TangoFlux 2.26 |
| AudioCaps | CLAP↑ | 0.389 | 0.422 | 0.475 | 接近 TangoFlux 0.480 |
| Song Describer | CLAP↑ | 0.29 | 0.32 | 0.36 | 表中最佳 |
MusicCaps 上 SonicWeave 的 CLAP 0.312 低于 UniMoE-Audio 0.340 与 Dasheng AudioGen 0.334;论文因此谨慎表述为 quality–alignment Pareto frontier,而非全指标 SOTA。
8. Complex-Scene 评测
Section titled “8. Complex-Scene 评测”作者构建 100 条人工策划 prompt:45 条 speech + background、10 条 singing + background、15 条 clean dialogue、30 条 dialogue + background。公开模型接收自然语言 prompt,SonicWeave 与内部对照接收语义相同的结构化 caption。
| 模型 | AI-Tech↑ | AI-Sem↑ | MOS-Q↑ | MOS-R↑ |
|---|---|---|---|---|
| Higgs Audio V2 | 4.32 | 3.54 | 3.92 ± 0.21 | 2.42 ± 0.64 |
| Dasheng AudioGen | 3.10 | 3.07 | 2.97 ± 0.41 | 3.25 ± 0.73 |
| Dense | 4.13 | 4.23 | 4.29 ± 0.24 | 4.15 ± 0.37 |
| Base-MoE | 4.62 | 4.58 | 4.57 ± 0.13 | 4.31 ± 0.31 |
| SonicWeave | 4.79 | 4.72 | 4.57 ± 0.19 | 4.49 ± 0.38 |
MOS 来自 25 位听者;每位评 25 个 case × 6 个匿名系统输出。MOS-Q 衡量听感质量,MOS-R 衡量 prompt 要求的事件与相互关系是否被共同实现。SonicWeave 对 Base-MoE 的主要提升是 compositional fidelity,而非基础音质。
9. 路由分析与消融
Section titled “9. 路由分析与消融”- 250-prompt 平衡路由集显示,speech、SFX、music、singing 与 mixed scene 使用不同 expert 分布,且分布随 routed layer 与 diffusion phase 改变。
- 固定 后,SeedTTS-en WER 从 1.0% 恶化为 2.1%,Complex-Scene AI-Sem 从 4.72 降至 4.35,说明自适应 prior–evidence 融合有价值。
- Chunk size 从 4 增至 8 后,Complex-Scene AI-Sem 降至 4.64;较长 chunk 对短事件、说话人切换与前后景变化反应较慢。
- 混合健身房案例中,密集背景和瞬态冲击区域更依赖 acoustic evidence;主 speech segment 更依赖 structured-text prior。但这是定性案例,不是逐帧因果证明。
10. 局限与批判性判断
Section titled “10. 局限与批判性判断”- 私有数据与模型未开放:20k+ 小时内部语料、checkpoint、Complex-Scene suite 和完整评测管线尚未公开,可复现性有限。
- 公平性并非完全同输入:外部系统使用自然语言,内部模型使用结构化 caption;语义要求相同,但 tokenizer-level 条件与 prompt 工程收益不能完全解耦。
- 关键消融仍不完整:缺少 token routing、prior-only、evidence-only、无 phase prior 与多 seed 方差;论文自己也承认 targeted ablation 并非 exhaustive。
- 自动评测依赖同一闭源 judge:AI-Tech/AI-Sem 使用 Gemini 3.1 Pro Preview;人评提供了独立校准,但只覆盖固定 25 个 case。
- 短时与双人上限:当前训练 clip 为 10–15 秒、结构化 schema 最多两位说话人;长音频、多人交互和显式 timeline planning 尚未验证。
- 论文状态:arXiv v1,目标模板为 AAAI 2027,尚不能当作已同行评审结论。
- 作者:Yunrui Cai, Xu Li, Yucheng Zhou, Jinchao Li, Dingdong Wang, Dongchao Yang, Xixin Wu, Chen Zhang, Zhiyong Wu, Pengfei Wan, Helen Meng
- 机构:Kling Team, Kuaishou Technology;The Chinese University of Hong Kong;Tsinghua SIGS
- 版本:arXiv:2608.09571v1,2026-08-10;19 页
- PDF SHA-256:
857c00c49b8d0dcb297ed9ed28dd4ea4ef8edc8888f0426d9a27a48f7ca60d02 - 项目页:SonicWeave Demo
- 代码:caiyunrui/SonicWeave
- 原始来源:arXiv 摘要页;PDF
- 🤖 AI/领域页/音频生成
- MoE(混合专家)
- 条件流匹配(CFM)
- DiT(Diffusion Transformer)
- 资料摘要:UniMoE-Audio — domain/token 动态容量 MoE 对照
- 资料摘要:Dasheng AudioGen — 结构化多视图统一音频生成对照
- 资料摘要:ControlAudio — 时间控制与可懂语音 TTA 对照
- Wiki 目录