资料摘要:SwanTale
ByteDance 与浙江大学提出的统一多说话人语音—音频生成系统:它不仅能用参考音频做 zero-shot 声音复用,还能只凭自然语言设计说话人、表演方式、环境声场与局部音效,并在同一段波形中联合生成。技术主线是 7000 万细粒度字幕记录、48 kHz/25 Hz 连续 SwanVAE、非自回归 flow-DiT、任务级 + 帧级 Unified MoE、四阶段 curriculum learning 与针对语音错误的 GRPO 后训练。
🔒 SwanTale 原始论文
- 统一 instruct 与 zero-shot:instruct 用完整字幕控制环境、说话人与内容;zero-shot 用参考音频提供说话人声学信息,内容字幕仍负责文本、局部风格与轮次。两者共用同一个 masked flow-matching 目标。
- SwanData-Caption:数据管道从覆盖设计、人声分离/转写/对齐、多层字幕标注到波形过滤/字幕审计,形成约 7000 万条字幕记录;字幕严格分成
Environment / Speakers / Content三个字段。 - SwanVAE:把 48 kHz mono 波形编码为 25 Hz × 96 维连续 latent;编码器保持局部且抗混叠,解码器用局部 Transformer 完成高保真波形合成,长程依赖交给下游 DiT。
- 条件解耦:Caption 由 Qwen 文本编码器 + Engram 记忆处理,口语内容由 CosyVoice 2.0 tokenizer + 轻量 text encoder 处理;这样把“说什么”与“环境/人设/怎么说”分开。
- 质量作为条件:STOI、PESQ、SI-SDR 与 MOS 相关分数被离散化成质量字幕与 flag;训练时学习不同质量层级,推理时固定请求最高质量,无需 RL rollout。
- Unified MoE:任务路由器在 sample 级选 instruct/zero-shot 共享专家;音频路由器在 frame 级用时间条件化 Top-P 动态选择声学专家与 null expert,让说话人切换/音效等复杂片段获得更多计算,稳态背景/近静音帧可跳过额外 FFN。
- 渐进式训练:zero-shot 语音底座 → 干净语音的 dense caption adaptation → 完整字幕混合 + Unified MoE → 高表现力/高质量 SFT,最后用 GRPO 修发音、边界稳定性和属性控制。
- 成绩不是全面第一:零样本评测中音色与表现力领先,但内容错误率和声音保真度仍被 FishSpeech/SoulX-Podcast 超过;InstructTTSEval 中明确声学属性控制强,但英文自由风格与中英文 role-play 仍是弱项。
1. 问题定义:“先设计声音,再复用声音”
Section titled “1. 问题定义:“先设计声音,再复用声音””传统 zero-shot TTS 假设目标说话人已有参考录音。影视、动画、游戏和广告生产往往恰好相反:创作者需要先用文字设计一个不存在的角色声线,说明年龄感、音色、职业/角色、情绪、节奏和所在场景,之后又需要用新生成的声音做 zero-shot 复用。
SwanTale 因此把接口分成两类:
| 任务 | 输入 | 全局说话人信息 | 生成区域 |
|---|---|---|---|
| Instruct | 完整 caption | Speakers 中的自然语言描述 |
整段 latent |
| Zero-shot | content caption + reference audio | 参考音频 latent | 参考帧之外的区域 |
两类任务的共性是:Content 都保留说话人 tag、文本内容、局部情绪/语速变化与邻近音效。差别只在于“全局声线从文字还是波形而来”。
2. SwanData-Caption:从媒体音频到三层可控字幕
Section titled “2. SwanData-Caption:从媒体音频到三层可控字幕”数据管道有四个阶段:
- Coverage Design:聚合短剧、电影、动画、广告与播客等真实媒体音频,并为老年声音、中英文短句、多音字/品牌名/中英混读各合成 10 万条针对性补集。
- SwanData-Speech:Ultimate Vocal Remover 分离人声,3D-Speaker 做粗分段与 diarization,Seed-ASR 2.0 转写,SenseVoice 作额外发音校验,SwanAligner 保留真实停顿证据。
- Caption Annotation:Seed2.0 Lite 同时读音频、去标点转写与严格 prompt,输出
Environment / Speakers / Content。动画、短剧/影视剧、广告/数字人分别使用 style-persona 软先验矩阵,普通数据不强行添加人设。 - Data Refinement:用 DNSMOS 与 torchaudio-SQUIM 过滤语音波形,SwanVerifier 复核年龄/性别,aligner 约束标点,最后由人工审计转写、音质、表现力与过度推断。
值得注意的边界:SwanVerifier 只在高置信、单一可分离说话人上校验粗粒度年龄和感知性别,不自动填补缺失标签,也不把角色、职业或短时情绪当成人口学属性。
3. SwanVAE:把长程序列建模与局部波形重建分工
Section titled “3. SwanVAE:把长程序列建模与局部波形重建分工”SwanVAE 用五个下采样阶段 [4, 4, 4, 5, 6] 把 48 kHz 波形压到 25 Hz,每帧为 96 维高斯连续 latent。编码器的固定低通滤波减少大步幅降采样混叠,可学的高频包络快捷支路弥补高频细节。编码器只有 CNN,受野约 0.95 s;端到端理论依赖范围约 3.23 s。
解码器为每个 latent 插入 6 个可学 output token,经局部双向 Transformer 后,每个 token 投影为 320 个波形采样点;因此每个 latent 对应 6 × 320 = 1920 个采样点,即 40 ms。这个非对称设计让编码器保持局部、规整的生成目标,把相位连续性、patch 边界和高频细节交给大解码器。
重建目标由 complex STFT、multi-band Mel 和帧级能量损失组成,再加 KL、MPD/MRD/MBCSD 对抗损失与 feature matching。同时对 posterior mean 施加弱辅助约束:无条件 flow predictor、因果 future predictor、多尺度 chroma、broadband energy 和 multi-band energy readout。这些头只用于 SwanVAE 训练,推理前全部丢弃;SwanTale 使用全局归一化的 posterior mean 作为确定性声学目标。
4. 两类任务的统一 flow-matching 目标
Section titled “4. 两类任务的统一 flow-matching 目标”设任务类型为 inst 或 zero,目标 latent 为 。Instruct 不保留 prompt 上下文,zero-shot 用 mask 固定参考音频帧:
只对需生成区域加噪与计算 velocity MSE;参考帧不进入损失,但始终作为上下文。因此两类任务不需要两个独立生成器:它们共享同一 velocity parameterization,只更换 caption 和 context mask。
条件通路分成两支:
- Caption branch:Qwen-family text encoder 理解环境、人设和自由风格,字段类型 embedding 显式区分 speech、audio effect、environment 等语义,再经中心化 2/3-gram Engram 记忆加强重复模式。
- Content branch:CosyVoice 2.0 tokenizer 将口语内容离散化,轻量 Transformer 编码后插值到音频 latent 时间线,speaker-turn embedding 与其对齐。
DiT block 依次含 latent self-attention、caption cross-attention 与 Unified MoE FFN;timestep 用 AdaLN-Zero 调制,质量 flag 与 timestep 共用全局条件通路。
5. Reward-conditioned quality:先学“质量等级”,再在推理时拉满
Section titled “5. Reward-conditioned quality:先学“质量等级”,再在推理时拉满”数据并非只分成“保留/丢弃”:通过基础质量阈值的样本仍保留 STOI、SI-SDR、PESQ 与 MOS 层级。模型学到 low / normal / high / unknown 不同质量条件的声学实现,推理时统一给出 high 字幕与 flag。
这与显式优化质量奖励不同:它不做 rollout、不把 reward model 放进训练环、也不增加采样次数;中等质量数据仍可为罕见角色、场景和音效提供覆盖,但不再默默污染“高质量”的生成条件。
6. Unified MoE:任务稳定先验 + 帧级声学动态容量
Section titled “6. Unified MoE:任务稳定先验 + 帧级声学动态容量”每隔一个 DiT FFN 层被替换为 sparse MoE,专家分三类:
- Task-shared experts:任务路由器每个 sample 选一组,所有层和帧共用;instruct 偏字幕遵循与多事件组合,zero-shot 偏参考说话人保持。
- Routed audio experts:对每个 latent frame 路由,承担说话人切换、重叠语音、局部音效、背景纹理与歌声/音乐律动。
- Null experts:无 FFN 参数,作为 skip path;稳定背景、近静音或无需额外变换的帧可不执行路由声学专家。
音频路由器不用固定 Top-K,而是选择累计概率首次达到 的最小专家前缀。时间条件化预算 同时控制 Top-P 阈值、null 偏置与 capacity factor;训练时用逐步降温的 Gumbel 扰动探索专家组合,推理时去掉噪声做确定性路由。
这个模块与 UniMoE-Audio 的 Dynamic-Capacity MoE 相邻,但 SwanTale 多了显式的任务级共享路由、diffusion-time 计算预算与对字幕/参考两条任务路径的统一建模。
7. 四阶段 curriculum learning 与 GRPO 能力保护
Section titled “7. 四阶段 curriculum learning 与 GRPO 能力保护”| 阶段 | 数据/结构 | 主要目标 |
|---|---|---|
| 1. Zero-shot base | 单/多说话人语音,参考音频 50% dropout | 先稳定发音、说话人与轮次先验 |
| 2. Dense caption adaptation | 干净中英双语属性语音,临时使用 dense FFN | 先学性别、年龄、情绪等简单指令 |
| 3. Full caption mixture | 语音、环境、局部音效、人设 + Unified MoE | 扩展多音频模态与稀疏专家分工 |
| 4. High-quality SFT | 自动阈值 + 人工 best–worst 审计子集 | 收紧质量与表现力分布 |
GRPO 阶段对同一条件采样 条 SDE trajectory,奖励包括音素准确率、音素长度一致性、标点—停顿对齐、首尾 RMS、波形质量,再按任务加属性奖励或参考说话人相似度。与只在终点重加噪的 surrogate 不同,它对 rollout 真实经过的每个 transition 重算 policy ratio。
为避免单说话人可验证奖励伤害多说话人和环境音频能力,每轮 RL 后都插入原 SFT 混合中的多说话人/音频 anchor replay,并用冻结 SFT 参考策略的闭式 KL 限制漂移。这是本文比“直接把有 reward 的单人数据做 RL”更可取的地方。
8. 推理:把内容约束与声学约束分开 CFG
Section titled “8. 推理:把内容约束与声学约束分开 CFG”推理时同时计算无条件、文本+说话人轮次条件、完整任务条件三个 velocity:
主要控内容与说话人轮次, 再叠加 caption、质量 flag 或参考音频。两个 guidance 强度都随 flow 时间衰减;另外用 sway sampling 把更多 Euler 步分配到早期,优先建立粗粒度语音结构与文本—说话人对齐。
- 题名:SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
- 作者:Yu Zhang, Ruiqi Li, Changhao Pan, Ke Lei, Xiang Yin, Cheng Yang(ByteDance;Zhejiang University)
- 版本:arXiv:2608.02023v2,2026-08-04,34 页,Technical Report by ByteDance
- PDF SHA-256:
8322ac0a57b1876abcfe9fbd2e2fa56986e1896e4fcf88ad49c7bbd072f298c3
模型与训练规模
Section titled “模型与训练规模”- SwanVAE:407.0M 参数(51.7M encoder + 0.3M bottleneck + 355.0M decoder);约 10 万小时内部语音/歌声/通用音频/音乐;32×A100。
- SwanTale base:约 2B active parameters;论文报告 2300 万小时单说话人 + 170 万小时双说话人内部数据做 zero-shot 底座训练。
- Caption adaptation:7000 万条干净属性语音,20k steps,caption encoder 为 Qwen3.0-Instruct-8B。
- Full mixture:1000 万 SwanData-Caption samples,10k steps;高表现力/高质量子集 100 万条,4k SFT steps。
- 所有 supervised SwanTale 阶段使用 64×A100;GRPO 使用 8 块 GPU、10 epochs。
关键实验证据
Section titled “关键实验证据”| 任务 | 主要结果 | 应如何解读 |
|---|---|---|
| SwanVAE 语音 | PESQ 4.1683、MCD 0.9638 为对比中最优 | 25 Hz latent 仍保留较好语音谱结构,但 STOI/ViSQOL 不是第一 |
| SwanVAE 歌声 | PESQ 3.9821、STOI 0.9001、MCD 1.5661 最优 | 同一 checkpoint 兼顾说话与歌声 |
| Zero-shot 独白 | Timbre 0.95、Richness 3.90、Hierarchy 3.70 第一 | Content Error 0.086 不及 FishSpeech 0.066,Sound Fidelity 3.95 不及 4.09 |
| Zero-shot 对话 | Timbre 0.94、SpeechJudge 3.92、Richness 3.66、Hierarchy 3.85 第一 | Sound Fidelity 3.73 与 Content Error 0.120 均不及 SoulX-Podcast |
| InstructTTSEval | ZH APS 86.1 第一,EN APS 84.2 并列第一,ZH DSD 80.1 第二 | EN DSD 79.2,ZH/EN RP 64.1/63.6,角色推断不领先 |
| SwanBench-Scene | 总 Mean MOS 4.22,四个维度总分均第一 | 是 180 条自建指令 + 专业标注,不是公开大规模基准 |
| Unified MoE 消融 | 移除 MoE 后 3.39/4.31/3.82 降到 3.02/4.09/3.56 | 支持 MoE 对复杂指令、音质与表现力的增益,但未拆分各路由机制 |
局限性与批判性判断
Section titled “局限性与批判性判断”- 核心价值是生产接口统一,不是所有指标 SOTA:它的特色是“文字设计声音 + 参考音频复用声音 + 同波形环境/音效”,应与专用 TTS 模型的 WER/音质优势分开评价。
- 开放性不足:训练数据主要为内部媒体数据,关键标注依赖 Seed2.0 Lite、Seed-ASR 2.0 与内部 Swan 组件;尽管方法细节很多,外部团队仍无法据此低成本复现数据和训练。
- 基准独立性有限:SwanBench-Speech/Scene/Caption 与模型同团队或同项目体系,Caption 评测只有 64 例并由
gemini-3.5-flash自动评分;应把这些分数视为作者体系内证据,不是独立复现。 - 年龄/性别与人设标注具有社会偏差风险:论文用置信度弃权、只复核可听证据与人工审计做了约束,但 style-persona matrix 仍可能把特定媒体的职业/角色套路固化进模型。
- 作者自述未解问题:背景音乐类型或情绪转场、超过两分钟的多说话人+音效长场景、指定说话人的连续情绪/重音/节奏/停顿/音效精确时机,以及统一生成与编辑。
开源与可复现边界(2026-08-15 实时核查)
Section titled “开源与可复现边界(2026-08-15 实时核查)”- SwanAIGC 项目页 提供 SwanTale 音频 demo 与论文入口。
- SwanAIGC 官方 GitHub 组织 当前只有 demo 站仓库,没有 SwanTale 模型代码、训练/推理脚本、checkpoint 或许可证。
- Hugging Face 的 arXiv 关联查询当前返回 0 个 model、0 个 dataset 与 0 个 Space;论文页也未登记 GitHub repo。
- 因此当前准确口径是 已公布论文与 demo,未公布可执行代码、权重或训练数据,不应称为已开源或可复现训练。
- 🤖 AI/领域页/音频生成 — 统一语音/音频生成路线中的定位
- 音频生成 — 通用生成技术全景
- DiT(Diffusion Transformer) · 条件流匹配(CFM) — 非自回归声学生成骨干
- VAE(变分自编码器) — SwanVAE 的连续波形 latent 前端
- MoE(混合专家) — 任务级与帧级动态容量路由
- GRPO(组相对策略优化) — SDE trajectory 级音频后训练
- 资料摘要:InstructTTSEval — APS/DSD/RP 指令跟随基准
- 资料摘要:SwanVoice — 零样本长篇多说话人语音底座;SwanTale 延伸到文字设计声线、环境与音效
- 资料摘要:UniSonate — 不依赖参考音频的 TTS/TTM/TTA 统一 MM-DiT
- 资料摘要:UniMoE-Audio — 语音/音乐 Dynamic-Capacity MoE 对照
- 资料摘要:Qwen-Audio-3.0-Gen-Preview — 结构化富时间线混合音频生成
- 资料摘要:ControlAudio — 时间控制 + 可懂语音的渐进扩散路线
- Wiki 目录