跳转到内容

输入关键词开始搜索

    资料摘要:SonicWeave

    论文摘要更新 2026-09-08置信度 high待阅读原始来源 ↗#音频生成#MoE#流匹配#统一模型#深度

    快手 Kling、香港中文大学与清华大学提出的 2B 统一音频场景生成模型。SonicWeave 用同一组权重生成语音、歌声、音乐、音效及其混合场景;核心 CPE-MoE 不再逐 token 独立选专家,而让连续声学 chunk 共享路由,并用门控在“结构化文本 + diffusion phase”的全局 prior 与当前声学状态的局部 evidence 之间插值。

    🔒 SonicWeave - Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

    • 统一任务:一个 conditional flow-matching DiT 同时覆盖 TTS、TTA、TTM、歌声、对话以及带背景的复杂混合场景;输入被整理为 speech、vocal attributes、music、sound effects、ambience 等结构化字段。
    • 路由粒度:CPE-MoE 将连续 4 个 audio latent frame 组成一个 chunk,对 chunk 做一次 Top-2/4-expert 路由;专家仍逐帧处理原始 hidden state,因此 chunk 是路由单元,不是表示压缩单元。
    • prior–evidence 融合:全局 prior 来自 text hidden state 与 diffusion time,局部 evidence 来自当前 chunk 的 acoustic state;标量 conflict gate 决定专家 logits 向哪一侧移动。
    • 模态解耦:text/time token 始终走 shared expert,只有 audio token 进入 sparse experts,避免条件通道随局部声学路由漂移。
    • 主要结果:在匹配数据与 backbone 的对照中,SonicWeave 全面优于 1B Dense 与 2B token-routed Base-MoE;复杂场景 MOS-R 为 4.49,高于 Base-MoE 的 4.31 与 Dasheng AudioGen 的 3.25,同时 MOS-Q 与 Base-MoE 同为 4.57。
    • 证据边界:论文只报告单次训练结果,缺少多随机种子;targeted ablation 比较了固定 gate 与 chunk size 8,却没有 prior-only、evidence-only 或 chunk size 1 的完整对照。因此现有实验支持“整个 CPE-MoE 设计有效”,尚不能严格分离 chunk routing、双信号融合和其他训练细节的独立因果贡献。
    SonicWeave CPE-MoE 路由架构
    SonicWeave CPE-MoE 路由架构

    文本条件的通用音频生成正从彼此孤立的语音、音乐和音效合成,迈向用单一模型把它们组合成可控且连贯的音频场景。统一设置尤其困难:异质成分会对共享 backbone 提出相互冲突的结构要求,而复杂混合场景又可能包含局部不同或相互重叠的内容,要求模型在同一片段内进行细粒度适配。

    现有 audio MoE 主要在 domain level 路由,token-wise routing 则忽略了声学信号固有的局部连续性。为此,作者提出统一音频场景生成 flow-matching 模型 SonicWeave。其核心是采用 conflict-gated prior–evidence routing 的 chunk-routed MoE,即 CPE-MoE。它把结构化文本条件与 diffusion phase 编码为全局 prior,再与不断演化的声学状态所提供的局部 evidence 结合,对连续 acoustic chunk 进行路由。

    当局部状态不可靠时,学习到的 conflict gate 更偏向 prior;当某一区域偏离全局场景语境时,它允许 local evidence 对路由施加更大影响。SonicWeave 用同一组权重支持语音、音乐、音效、歌声及其细粒度混合。在 TTS、TTA 与 TTM 基准上,它持续优于受控的 Dense 和 Base-MoE;复杂场景评估也显示出更好的组合质量,路由分析则呈现出随内容和 diffusion phase 变化的专家专精。结果表明,具备时间连续性的 prior–evidence routing 是统一音频生成的一种有效 conditional-computation 策略。

    统一音频模型面对两层冲突:

    1. 跨 domain:语音依赖语言精确性,音乐依赖和声与节奏结构,环境音既包含平稳纹理也包含瞬态事件。
    2. 单场景内部:语音、音乐、环境和音效可能交替或重叠,不同局部区域需要不同计算路径。

    Clip-level routing 无法在同一场景内适配;frame/token-level routing 又可能在高度相关的相邻帧间频繁抖动,而且 diffusion 早期的局部 acoustic state 尚不可靠。SonicWeave 将 chunk routing 放在二者之间:共享局部计算选择,同时保留 frame-level 表示。

    自动标注管线先移除非声学细节,再提取以下字段:类型、语言、speech text/lyrics、speaker count、speaker/vocal attributes、music、sound effect、ambience 与 recording texture。字段以显式 tag 串行化,例如:

    Summary. <type>speech</type> <lang>en</lang> <speech>...</speech> <music>...</music>

    这种格式把容易纠缠的场景属性拆开,同时原样保留语言内容。当前 schema 明确支持最多两位说话人;所有 domain 共用一个冻结的 language encoder。

    每层 Transformer 接收 time、text 与 audio 三组 token:

    h=[ttimeT1:LA1:T]R(1+L+T)×d.\mathbf h=[\mathbf t_{\mathrm{time}}|\mathbf T_{1:L}|\mathbf A_{1:T}] \in\mathbb R^{(1+L+T)\times d}.

    Stereo waveform 先由预训练 stereo VAE 编码为连续 latent;带噪 latent 与可选 masked reference 拼接并投影成 audio token。Text 与 audio 使用彼此独立的一维 RoPE 坐标,避免一种模态的序列长度改变另一种模态的位置编号。

    Flow matching 本身不要求最终 audio/text hidden state 对齐,因此作者加入对称 batch 内对比损失:

    LCL=12[CE(S,y)+CE(S,y)].\mathcal L_{\mathrm{CL}}=\frac12\left[\operatorname{CE}(\mathbf S,\mathbf y)+\operatorname{CE}(\mathbf S^\top,\mathbf y)\right].

    Context token(time + text)只经过 shared expert;audio token 同时使用 shared expert 与 sparse mixture。这样,决定“生成什么”的条件路径保持稳定,不会被每个局部 chunk 的专家选择反向扰动。

    将长度为 TT 的 audio state 分成 Nc=T/CN_c=\lceil T/C\rceil 个不重叠 chunk。第 jj 个 chunk 的有效帧均值为:

    ej=iCjmihaud,imax(1,iCjmi).\mathbf e_j=\frac{\sum_{i\in\mathcal C_j}m_i\mathbf h_{\mathrm{aud},i}} {\max(1,\sum_{i\in\mathcal C_j}m_i)}.

    Router 仅用 ej\mathbf e_j 选择专家;被选专家仍对每个原始 frame state 运算。Padding-only chunk 不参与路由与负载统计。

    Prior 汇总当前层的文本、diffusion phase 与 segment start:

    p=[ttimeTˉ],prior=Wprior(p).\mathbf p=[\mathbf t_{\mathrm{time}}|\bar{\mathbf T}],\qquad \boldsymbol\ell^{\mathrm{prior}}=W_{\mathrm{prior}}(\mathbf p).

    Evidence 来自联合 self-attention 之后的局部 acoustic state:

    jevid=Wevid(ej).\boldsymbol\ell_j^{\mathrm{evid}}=W_{\mathrm{evid}}(\mathbf e_j).

    两者都是输出维度为专家数 NeN_e 的两层 SiLU MLP,并将输出 bias 初始化为零。

    Gate 同时观察 prior、evidence、逐坐标乘积与绝对差:

    ϕj=LN([pejpejpej]),gj=σ(MLPg(ϕj)).\boldsymbol\phi_j=\operatorname{LN}([\tilde{\mathbf p}|\mathbf e_j| \tilde{\mathbf p}\odot\mathbf e_j||\tilde{\mathbf p}-\mathbf e_j|]), \qquad g_j=\sigma(\operatorname{MLP}_g(\boldsymbol\phi_j)).ejpej∥∣pej]),gj=σ(MLPg(ϕj)).

    随后在 expert-logit space 做线性插值:

    j=(1gj)prior+gjjevid,Pj=softmax(j).\boldsymbol\ell_j=(1-g_j)\boldsymbol\ell^{\mathrm{prior}}+g_j\boldsymbol\ell_j^{\mathrm{evid}}, \qquad \mathbf P_j=\operatorname{softmax}(\boldsymbol\ell_j).

    gj=0g_j=0 精确恢复 prior logits,gj=1g_j=1 精确恢复 evidence logits。它是由 generation objective 学得的 evidence reliance coefficient,不是“evidence 正确概率”的校准估计。

    Audio 输出固定为 shared 与 sparse 两路等权组合:

    oaud=12MLPshared(haud)+12osparse.\mathbf o_{\mathrm{aud}}=\tfrac12\operatorname{MLP}{\mathrm{shared}}(\mathbf h{\mathrm{aud}}) +\tfrac12\mathbf o_{\mathrm{sparse}}.

    Routed expert 的 down-projection 零初始化,使 sparse 分支从近零贡献平滑进入训练;固定 1:1 权重也防止额外 learnable gate 把 routed path 压掉。Switch-Transformer-style auxiliary loss 在有效 chunk 上防止 expert collapse。

    给定真实 latent x1\mathbf x_1 与噪声 x0N(0,I)\mathbf x_0\sim\mathcal N(0,I),训练线性 probability path 上的 velocity:

    xt=(1t)x0+tx1,LFM=Evθ(xt,c,ctext,t)(x1x0)2.\mathbf x_t=(1-t)\mathbf x_0+t\mathbf x_1, \qquad \mathcal L_{\mathrm{FM}}=\mathbb E|\mathbf v_\theta(\mathbf x_t,\mathbf c,\mathbf c_{\mathrm{text}},t)-(\mathbf x_1-\mathbf x_0)|^2.

    总目标为 LFM+αCLLCL+αMoELMoE\mathcal L_{\mathrm{FM}}+\alpha_{\mathrm{CL}}\mathcal L_{\mathrm{CL}}+\alpha_{\mathrm{MoE}}\mathcal L_{\mathrm{MoE}}。训练随机遮蔽连续 reference span,并独立丢弃 reference 与 caption 以支持 CFG。推理采用 100 步 Euler ODE 与 Adaptive Projected Guidance(APG)。

    • Backbone:16 层、hidden size 1536、24 个 attention head,约 1B dense 参数。
    • CPE-MoE:替换最后 4 层 FFN;4 个 routed expert、Top-2、chunk size C=4C=4;总参数约 2B、每 token 激活约 1.5B。
    • Audio:44.1 kHz stereo;Stable Audio 2.0 风格 VAE,时间下采样 2048,默认 256 latent frame(约 11.89 秒),模型结构本身支持变长。
    • 数据:内部语料约 500 万个 10–15 秒 clip,总时长超过 20,000 小时;涵盖 speech、music、SFX、ambience 与 mixed recording。
    • 训练:64 张 NVIDIA H20,约 21 天,AdamW,batch size 512,200k step。
    任务 指标 Dense Base-MoE SonicWeave 说明
    SeedTTS-en WER↓ 2.4% 1.4% 1.0% 与表中 Higgs Audio V2 最优值持平
    SeedTTS-zh CER↓ 1.8% 1.1% 0.8% 与 UniMoE-Audio、Higgs 并列
    LibriSpeech WER↓ 4.9% 3.2% 2.4% 与 F5-TTS 持平
    AudioCaps FAD↓ 3.98 3.10 2.75 仍逊 TangoFlux 2.26
    AudioCaps CLAP↑ 0.389 0.422 0.475 接近 TangoFlux 0.480
    Song Describer CLAP↑ 0.29 0.32 0.36 表中最佳

    MusicCaps 上 SonicWeave 的 CLAP 0.312 低于 UniMoE-Audio 0.340 与 Dasheng AudioGen 0.334;论文因此谨慎表述为 quality–alignment Pareto frontier,而非全指标 SOTA。

    作者构建 100 条人工策划 prompt:45 条 speech + background、10 条 singing + background、15 条 clean dialogue、30 条 dialogue + background。公开模型接收自然语言 prompt,SonicWeave 与内部对照接收语义相同的结构化 caption。

    模型 AI-Tech↑ AI-Sem↑ MOS-Q↑ MOS-R↑
    Higgs Audio V2 4.32 3.54 3.92 ± 0.21 2.42 ± 0.64
    Dasheng AudioGen 3.10 3.07 2.97 ± 0.41 3.25 ± 0.73
    Dense 4.13 4.23 4.29 ± 0.24 4.15 ± 0.37
    Base-MoE 4.62 4.58 4.57 ± 0.13 4.31 ± 0.31
    SonicWeave 4.79 4.72 4.57 ± 0.19 4.49 ± 0.38

    MOS 来自 25 位听者;每位评 25 个 case × 6 个匿名系统输出。MOS-Q 衡量听感质量,MOS-R 衡量 prompt 要求的事件与相互关系是否被共同实现。SonicWeave 对 Base-MoE 的主要提升是 compositional fidelity,而非基础音质。

    • 250-prompt 平衡路由集显示,speech、SFX、music、singing 与 mixed scene 使用不同 expert 分布,且分布随 routed layer 与 diffusion phase 改变。
    • 固定 gj=0.5g_j=0.5 后,SeedTTS-en WER 从 1.0% 恶化为 2.1%,Complex-Scene AI-Sem 从 4.72 降至 4.35,说明自适应 prior–evidence 融合有价值。
    • Chunk size 从 4 增至 8 后,Complex-Scene AI-Sem 降至 4.64;较长 chunk 对短事件、说话人切换与前后景变化反应较慢。
    • 混合健身房案例中,密集背景和瞬态冲击区域更依赖 acoustic evidence;主 speech segment 更依赖 structured-text prior。但这是定性案例,不是逐帧因果证明。
    1. 私有数据与模型未开放:20k+ 小时内部语料、checkpoint、Complex-Scene suite 和完整评测管线尚未公开,可复现性有限。
    2. 公平性并非完全同输入:外部系统使用自然语言,内部模型使用结构化 caption;语义要求相同,但 tokenizer-level 条件与 prompt 工程收益不能完全解耦。
    3. 关键消融仍不完整:缺少 C=1C=1 token routing、prior-only、evidence-only、无 phase prior 与多 seed 方差;论文自己也承认 targeted ablation 并非 exhaustive。
    4. 自动评测依赖同一闭源 judge:AI-Tech/AI-Sem 使用 Gemini 3.1 Pro Preview;人评提供了独立校准,但只覆盖固定 25 个 case。
    5. 短时与双人上限:当前训练 clip 为 10–15 秒、结构化 schema 最多两位说话人;长音频、多人交互和显式 timeline planning 尚未验证。
    6. 论文状态:arXiv v1,目标模板为 AAAI 2027,尚不能当作已同行评审结论。
    • 作者:Yunrui Cai, Xu Li, Yucheng Zhou, Jinchao Li, Dingdong Wang, Dongchao Yang, Xixin Wu, Chen Zhang, Zhiyong Wu, Pengfei Wan, Helen Meng
    • 机构:Kling Team, Kuaishou Technology;The Chinese University of Hong Kong;Tsinghua SIGS
    • 版本:arXiv:2608.09571v1,2026-08-10;19 页
    • PDF SHA-256857c00c49b8d0dcb297ed9ed28dd4ea4ef8edc8888f0426d9a27a48f7ca60d02
    • 项目页SonicWeave Demo
    • 代码caiyunrui/SonicWeave
    • 原始来源arXiv 摘要页PDF