跳转到内容

输入关键词开始搜索

    资料摘要:SwanTale

    论文摘要更新 2026-08-15置信度 high待阅读原始来源 ↗#音频生成#语音合成#统一模型#流匹配#混合专家

    ByteDance 与浙江大学提出的统一多说话人语音—音频生成系统:它不仅能用参考音频做 zero-shot 声音复用,还能只凭自然语言设计说话人、表演方式、环境声场与局部音效,并在同一段波形中联合生成。技术主线是 7000 万细粒度字幕记录、48 kHz/25 Hz 连续 SwanVAE、非自回归 flow-DiT、任务级 + 帧级 Unified MoE、四阶段 curriculum learning 与针对语音错误的 GRPO 后训练。

    🔒 SwanTale 原始论文

    官方项目页 · arXiv

    SwanTale 双任务统一生成与动态专家路由架构
    SwanTale 双任务统一生成与动态专家路由架构
    • 统一 instruct 与 zero-shot:instruct 用完整字幕控制环境、说话人与内容;zero-shot 用参考音频提供说话人声学信息,内容字幕仍负责文本、局部风格与轮次。两者共用同一个 masked flow-matching 目标。
    • SwanData-Caption:数据管道从覆盖设计、人声分离/转写/对齐、多层字幕标注到波形过滤/字幕审计,形成约 7000 万条字幕记录;字幕严格分成 Environment / Speakers / Content 三个字段。
    • SwanVAE:把 48 kHz mono 波形编码为 25 Hz × 96 维连续 latent;编码器保持局部且抗混叠,解码器用局部 Transformer 完成高保真波形合成,长程依赖交给下游 DiT。
    • 条件解耦:Caption 由 Qwen 文本编码器 + Engram 记忆处理,口语内容由 CosyVoice 2.0 tokenizer + 轻量 text encoder 处理;这样把“说什么”与“环境/人设/怎么说”分开。
    • 质量作为条件:STOI、PESQ、SI-SDR 与 MOS 相关分数被离散化成质量字幕与 flag;训练时学习不同质量层级,推理时固定请求最高质量,无需 RL rollout。
    • Unified MoE:任务路由器在 sample 级选 instruct/zero-shot 共享专家;音频路由器在 frame 级用时间条件化 Top-P 动态选择声学专家与 null expert,让说话人切换/音效等复杂片段获得更多计算,稳态背景/近静音帧可跳过额外 FFN。
    • 渐进式训练:zero-shot 语音底座 → 干净语音的 dense caption adaptation → 完整字幕混合 + Unified MoE → 高表现力/高质量 SFT,最后用 GRPO 修发音、边界稳定性和属性控制。
    • 成绩不是全面第一:零样本评测中音色与表现力领先,但内容错误率和声音保真度仍被 FishSpeech/SoulX-Podcast 超过;InstructTTSEval 中明确声学属性控制强,但英文自由风格与中英文 role-play 仍是弱项。

    1. 问题定义:“先设计声音,再复用声音”

    Section titled “1. 问题定义:“先设计声音,再复用声音””

    传统 zero-shot TTS 假设目标说话人已有参考录音。影视、动画、游戏和广告生产往往恰好相反:创作者需要先用文字设计一个不存在的角色声线,说明年龄感、音色、职业/角色、情绪、节奏和所在场景,之后又需要用新生成的声音做 zero-shot 复用。

    SwanTale 因此把接口分成两类:

    任务 输入 全局说话人信息 生成区域
    Instruct 完整 caption Speakers 中的自然语言描述 整段 latent
    Zero-shot content caption + reference audio 参考音频 latent 参考帧之外的区域

    两类任务的共性是:Content 都保留说话人 tag、文本内容、局部情绪/语速变化与邻近音效。差别只在于“全局声线从文字还是波形而来”。

    2. SwanData-Caption:从媒体音频到三层可控字幕

    Section titled “2. SwanData-Caption:从媒体音频到三层可控字幕”

    数据管道有四个阶段:

    1. Coverage Design:聚合短剧、电影、动画、广告与播客等真实媒体音频,并为老年声音、中英文短句、多音字/品牌名/中英混读各合成 10 万条针对性补集。
    2. SwanData-Speech:Ultimate Vocal Remover 分离人声,3D-Speaker 做粗分段与 diarization,Seed-ASR 2.0 转写,SenseVoice 作额外发音校验,SwanAligner 保留真实停顿证据。
    3. Caption Annotation:Seed2.0 Lite 同时读音频、去标点转写与严格 prompt,输出 Environment / Speakers / Content。动画、短剧/影视剧、广告/数字人分别使用 style-persona 软先验矩阵,普通数据不强行添加人设。
    4. Data Refinement:用 DNSMOS 与 torchaudio-SQUIM 过滤语音波形,SwanVerifier 复核年龄/性别,aligner 约束标点,最后由人工审计转写、音质、表现力与过度推断。

    值得注意的边界:SwanVerifier 只在高置信、单一可分离说话人上校验粗粒度年龄和感知性别,不自动填补缺失标签,也不把角色、职业或短时情绪当成人口学属性。

    3. SwanVAE:把长程序列建模与局部波形重建分工

    Section titled “3. SwanVAE:把长程序列建模与局部波形重建分工”

    SwanVAE 用五个下采样阶段 [4, 4, 4, 5, 6] 把 48 kHz 波形压到 25 Hz,每帧为 96 维高斯连续 latent。编码器的固定低通滤波减少大步幅降采样混叠,可学的高频包络快捷支路弥补高频细节。编码器只有 CNN,受野约 0.95 s;端到端理论依赖范围约 3.23 s。

    解码器为每个 latent 插入 6 个可学 output token,经局部双向 Transformer 后,每个 token 投影为 320 个波形采样点;因此每个 latent 对应 6 × 320 = 1920 个采样点,即 40 ms。这个非对称设计让编码器保持局部、规整的生成目标,把相位连续性、patch 边界和高频细节交给大解码器。

    重建目标由 complex STFT、multi-band Mel 和帧级能量损失组成,再加 KL、MPD/MRD/MBCSD 对抗损失与 feature matching。同时对 posterior mean 施加弱辅助约束:无条件 flow predictor、因果 future predictor、多尺度 chroma、broadband energy 和 multi-band energy readout。这些头只用于 SwanVAE 训练,推理前全部丢弃;SwanTale 使用全局归一化的 posterior mean 作为确定性声学目标。

    4. 两类任务的统一 flow-matching 目标

    Section titled “4. 两类任务的统一 flow-matching 目标”

    设任务类型为 instzero,目标 latent 为 xRT×dzx^\star\in\mathbb{R}^{T\times d_z}。Instruct 不保留 prompt 上下文,zero-shot 用 mask m(τ)m^{(\tau)} 固定参考音频帧:

    c(τ)={cfull,τ=inst,ccontent,τ=zero,r(τ)=m(τ)x.c^{(\tau)}= \begin{cases} c_{\mathrm{full}}, & \tau=\mathrm{inst},\ c_{\mathrm{content}}, & \tau=\mathrm{zero}, \end{cases} \qquad r^{(\tau)}=m^{(\tau)}\odot x^\star.

    只对需生成区域加噪与计算 velocity MSE;参考帧不进入损失,但始终作为上下文。因此两类任务不需要两个独立生成器:它们共享同一 velocity parameterization,只更换 caption 和 context mask。

    条件通路分成两支:

    • Caption branch:Qwen-family text encoder 理解环境、人设和自由风格,字段类型 embedding 显式区分 speech、audio effect、environment 等语义,再经中心化 2/3-gram Engram 记忆加强重复模式。
    • Content branch:CosyVoice 2.0 tokenizer 将口语内容离散化,轻量 Transformer 编码后插值到音频 latent 时间线,speaker-turn embedding 与其对齐。

    DiT block 依次含 latent self-attention、caption cross-attention 与 Unified MoE FFN;timestep 用 AdaLN-Zero 调制,质量 flag 与 timestep 共用全局条件通路。

    5. Reward-conditioned quality:先学“质量等级”,再在推理时拉满

    Section titled “5. Reward-conditioned quality:先学“质量等级”,再在推理时拉满”

    数据并非只分成“保留/丢弃”:通过基础质量阈值的样本仍保留 STOI、SI-SDR、PESQ 与 MOS 层级。模型学到 low / normal / high / unknown 不同质量条件的声学实现,推理时统一给出 high 字幕与 flag。

    这与显式优化质量奖励不同:它不做 rollout、不把 reward model 放进训练环、也不增加采样次数;中等质量数据仍可为罕见角色、场景和音效提供覆盖,但不再默默污染“高质量”的生成条件。

    6. Unified MoE:任务稳定先验 + 帧级声学动态容量

    Section titled “6. Unified MoE:任务稳定先验 + 帧级声学动态容量”

    每隔一个 DiT FFN 层被替换为 sparse MoE,专家分三类:

    • Task-shared experts:任务路由器每个 sample 选一组,所有层和帧共用;instruct 偏字幕遵循与多事件组合,zero-shot 偏参考说话人保持。
    • Routed audio experts:对每个 latent frame 路由,承担说话人切换、重叠语音、局部音效、背景纹理与歌声/音乐律动。
    • Null experts:无 FFN 参数,作为 skip path;稳定背景、近静音或无需额外变换的帧可不执行路由声学专家。

    音频路由器不用固定 Top-K,而是选择累计概率首次达到 p(t)p(t) 的最小专家前缀。时间条件化预算 q(t)q(t) 同时控制 Top-P 阈值、null 偏置与 capacity factor;训练时用逐步降温的 Gumbel 扰动探索专家组合,推理时去掉噪声做确定性路由。

    这个模块与 UniMoE-Audio 的 Dynamic-Capacity MoE 相邻,但 SwanTale 多了显式的任务级共享路由、diffusion-time 计算预算与对字幕/参考两条任务路径的统一建模。

    7. 四阶段 curriculum learning 与 GRPO 能力保护

    Section titled “7. 四阶段 curriculum learning 与 GRPO 能力保护”
    阶段 数据/结构 主要目标
    1. Zero-shot base 单/多说话人语音,参考音频 50% dropout 先稳定发音、说话人与轮次先验
    2. Dense caption adaptation 干净中英双语属性语音,临时使用 dense FFN 先学性别、年龄、情绪等简单指令
    3. Full caption mixture 语音、环境、局部音效、人设 + Unified MoE 扩展多音频模态与稀疏专家分工
    4. High-quality SFT 自动阈值 + 人工 best–worst 审计子集 收紧质量与表现力分布

    GRPO 阶段对同一条件采样 K=8K=8 条 SDE trajectory,奖励包括音素准确率、音素长度一致性、标点—停顿对齐、首尾 RMS、波形质量,再按任务加属性奖励或参考说话人相似度。与只在终点重加噪的 surrogate 不同,它对 rollout 真实经过的每个 transition 重算 policy ratio。

    为避免单说话人可验证奖励伤害多说话人和环境音频能力,每轮 RL 后都插入原 SFT 混合中的多说话人/音频 anchor replay,并用冻结 SFT 参考策略的闭式 KL 限制漂移。这是本文比“直接把有 reward 的单人数据做 RL”更可取的地方。

    8. 推理:把内容约束与声学约束分开 CFG

    Section titled “8. 推理:把内容约束与声学约束分开 CFG”

    推理时同时计算无条件、文本+说话人轮次条件、完整任务条件三个 velocity:

    vt=v+ωtext(t)(vtextv)+ωall(t)(vfullvtext).\tilde v_t=v_{\varnothing}+\omega_{\text{text}}(t)(v_{\text{text}}-v_{\varnothing})+\omega_{\text{all}}(t)(v_{\text{full}}-v_{\text{text}}).t=v+ωtext(t)(vtextv)+ωall(t)(vfullvtext).

    ωtext\omega_{\text{text}} 主要控内容与说话人轮次,ωall\omega_{\text{all}} 再叠加 caption、质量 flag 或参考音频。两个 guidance 强度都随 flow 时间衰减;另外用 sway sampling 把更多 Euler 步分配到早期,优先建立粗粒度语音结构与文本—说话人对齐。

    • 题名SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
    • 作者:Yu Zhang, Ruiqi Li, Changhao Pan, Ke Lei, Xiang Yin, Cheng Yang(ByteDance;Zhejiang University)
    • 版本:arXiv:2608.02023v2,2026-08-04,34 页,Technical Report by ByteDance
    • PDF SHA-2568322ac0a57b1876abcfe9fbd2e2fa56986e1896e4fcf88ad49c7bbd072f298c3
    • SwanVAE:407.0M 参数(51.7M encoder + 0.3M bottleneck + 355.0M decoder);约 10 万小时内部语音/歌声/通用音频/音乐;32×A100。
    • SwanTale base:约 2B active parameters;论文报告 2300 万小时单说话人 + 170 万小时双说话人内部数据做 zero-shot 底座训练。
    • Caption adaptation:7000 万条干净属性语音,20k steps,caption encoder 为 Qwen3.0-Instruct-8B。
    • Full mixture:1000 万 SwanData-Caption samples,10k steps;高表现力/高质量子集 100 万条,4k SFT steps。
    • 所有 supervised SwanTale 阶段使用 64×A100;GRPO 使用 8 块 GPU、10 epochs。
    任务 主要结果 应如何解读
    SwanVAE 语音 PESQ 4.1683、MCD 0.9638 为对比中最优 25 Hz latent 仍保留较好语音谱结构,但 STOI/ViSQOL 不是第一
    SwanVAE 歌声 PESQ 3.9821、STOI 0.9001、MCD 1.5661 最优 同一 checkpoint 兼顾说话与歌声
    Zero-shot 独白 Timbre 0.95、Richness 3.90、Hierarchy 3.70 第一 Content Error 0.086 不及 FishSpeech 0.066,Sound Fidelity 3.95 不及 4.09
    Zero-shot 对话 Timbre 0.94、SpeechJudge 3.92、Richness 3.66、Hierarchy 3.85 第一 Sound Fidelity 3.73 与 Content Error 0.120 均不及 SoulX-Podcast
    InstructTTSEval ZH APS 86.1 第一,EN APS 84.2 并列第一,ZH DSD 80.1 第二 EN DSD 79.2,ZH/EN RP 64.1/63.6,角色推断不领先
    SwanBench-Scene 总 Mean MOS 4.22,四个维度总分均第一 是 180 条自建指令 + 专业标注,不是公开大规模基准
    Unified MoE 消融 移除 MoE 后 3.39/4.31/3.82 降到 3.02/4.09/3.56 支持 MoE 对复杂指令、音质与表现力的增益,但未拆分各路由机制
    • 核心价值是生产接口统一,不是所有指标 SOTA:它的特色是“文字设计声音 + 参考音频复用声音 + 同波形环境/音效”,应与专用 TTS 模型的 WER/音质优势分开评价。
    • 开放性不足:训练数据主要为内部媒体数据,关键标注依赖 Seed2.0 Lite、Seed-ASR 2.0 与内部 Swan 组件;尽管方法细节很多,外部团队仍无法据此低成本复现数据和训练。
    • 基准独立性有限:SwanBench-Speech/Scene/Caption 与模型同团队或同项目体系,Caption 评测只有 64 例并由 gemini-3.5-flash 自动评分;应把这些分数视为作者体系内证据,不是独立复现。
    • 年龄/性别与人设标注具有社会偏差风险:论文用置信度弃权、只复核可听证据与人工审计做了约束,但 style-persona matrix 仍可能把特定媒体的职业/角色套路固化进模型。
    • 作者自述未解问题:背景音乐类型或情绪转场、超过两分钟的多说话人+音效长场景、指定说话人的连续情绪/重音/节奏/停顿/音效精确时机,以及统一生成与编辑。

    开源与可复现边界(2026-08-15 实时核查)

    Section titled “开源与可复现边界(2026-08-15 实时核查)”
    • SwanAIGC 项目页 提供 SwanTale 音频 demo 与论文入口。
    • SwanAIGC 官方 GitHub 组织 当前只有 demo 站仓库,没有 SwanTale 模型代码、训练/推理脚本、checkpoint 或许可证。
    • Hugging Face 的 arXiv 关联查询当前返回 0 个 model、0 个 dataset 与 0 个 Space;论文页也未登记 GitHub repo。
    • 因此当前准确口径是 已公布论文与 demo,未公布可执行代码、权重或训练数据,不应称为已开源或可复现训练。