资料摘要:可控语音合成系统综述
这篇 EMNLP 2025 系统综述从控制属性、模型架构、控制条件、声学表示、数据与评测六个维度梳理 LLM 时代的可控语音合成。它最有价值的结论不是列模型,而是把“控制什么、条件如何进入、表示能否解耦、评测能否验证”串成一条设计链。
- 控制目标主要包括 prosody(pitch、duration、energy)、timbre、emotion、style、language 与 environment;这些属性会相互耦合,不能只靠独立标签假设完全正交。
- NAR 架构覆盖 Transformer、VAE、diffusion 与 flow;AR 架构从 RNN 演进到 codec/LLM。当前趋势是语言模型负责指令与内容,Flow/DiT 负责连续声学细节。
- 控制信号可来自离散 style tag、参考语音、自然语言描述或 instruction;自然语言最灵活,但也最依赖标注覆盖和语义—声学对齐。
- 连续表示保留细节、便于梯度建模但计算重;离散 token 高效且适配 LLM,却可能丢失细粒度韵律。二者正通过混合架构互补。
- 数据集可分为标签型、自然语言描述型与对话型;真正的瓶颈不是“有没有音频”,而是属性覆盖、标注一致性、说话人/文本/情绪纠缠与许可。
- WER、speaker similarity、MCD、FSD、PESQ 与 MOS 各自只覆盖一部分质量;可控性还需要属性识别、成对偏好和人类对指令符合度的评测。
1. 控制对象
Section titled “1. 控制对象”| 属性 | 典型控制量 | 常见困难 |
|---|---|---|
| Prosody | pitch、duration、energy、停顿 | 局部与句级控制互相影响 |
| Timbre | speaker identity、音色描述、参考音频 | 与年龄、性别、口音、录音环境纠缠 |
| Emotion | 类别、强度、轨迹 | 标签主观,内容语义会诱导情感 |
| Style | 新闻、角色、耳语、演讲等 | 边界开放,描述词跨数据集不一致 |
| Language | 语言、口音、方言 | 内容正确与音色保持同时受挑战 |
| Environment | 房间、混响、背景声 | 容易与声纹和音质指标混淆 |
论文强调从全局 style token 走向多粒度控制:句级决定整体角色和情绪,词/音素级决定重音、时长与局部强弱。精确局部控制往往要求显式对齐或可解释的中间表示。
2. 架构与表示
Section titled “2. 架构与表示”NAR 路线以 FastSpeech、VAE、diffusion/flow 为代表,适合并行声学生成和显式属性注入;AR 路线以 codec LM 和语音 LLM 为代表,擅长上下文学习与开放式 instruction。越来越多系统采用混合方案:AR LM 先做离散或低频计划,Flow/DiT 再生成连续 latent 或 mel。
表示选择决定控制信号能保留多少细节:
- 连续 mel/latent:细腻,但序列长或采样成本高;
- 离散 semantic/acoustic token:便于 LM 建模,但量化可能压掉 pitch、强度或环境细节;
- 解耦表示:以对抗学习、信息瓶颈或分层 codebook 分离内容、说话人与风格,但“完全解耦”通常只是训练目标而非可验证事实。
3. 四类控制接口
Section titled “3. 四类控制接口”- 标签控制:稳定、便于监督,但词表封闭;
- 参考语音控制:保留真实细节,但难区分想复用的是音色、情绪还是环境;
- 自然语言描述:开放组合、面向用户,但需要高质量 audio caption;
- instruction-guided 控制/编辑:可以表达“更慢一点、保留音色、只改这一词”,对局部对齐和训练数据要求最高。
自然语言控制的难点不只是文本 encoder,而是数据中是否存在相同内容、相近音色、不同属性的可辨认反事实样本。
4. 数据与评测
Section titled “4. 数据与评测”标签型数据容易规模化,却受离散类别限制;描述型数据可通过人工、自动 caption 或 LLM 扩充,但生成标签可能继承代理模型偏差;对话型数据包含 turn-taking、上下文情绪和互动风格,更接近统一语音 LLM,却更难授权、切分和评测。
作者整理的客观指标包括 MCD、FDSD、WER、speaker cosine similarity 与 PESQ;主观指标包括 MOS、CMOS 与 ABX。论文还探索用 Gemini 类模型评估属性,但语音多模态 judge 的校准、公平性和对细粒度韵律的敏感度仍不成熟。
5. 开放问题
Section titled “5. 开放问题”- 细粒度与多尺度控制:局部改音高不能破坏词义或全局情绪;
- 属性解耦:文本、音色、情感、口音和环境天然相关;
- 数据与标注:缺少覆盖连续强度、组合属性和长对话的高质量数据;
- 长程一致性:角色、音色和情绪在分钟级内容中容易漂移;
- 多模态 expressive TTS:表情、视频、环境和对话状态如何共同条件化;
- instruction-guided editing:需要既能定位又能局部重生成的模型。
6. 批判性判断
Section titled “6. 批判性判断”- “首篇全面系统综述”是作者自述;论文的分类框架很有用,但覆盖仍受 2025 年检索边界影响。
- 论文承认没有深入研究属性交互、推理效率、相邻语音任务与更广泛社会风险;这些恰好是实际产品的重要维度。
- 使用 ChatGPT 辅助检索和语言润色已在伦理声明中披露;最终论文清单仍需回到原始论文核验。
- 可控 TTS 的核心验收应是“相同内容下控制量是否改变、非目标属性是否保持”,单一 MOS 或 speaker similarity 不能回答。
| 项目 | 信息 |
|---|---|
| 发表 | EMNLP 2025 Main Conference,pp. 764–791 |
| DOI | 10.18653/v1/2025.emnlp-main.40 |
| 控制轴 | prosody、timbre、emotion、style、language、environment |
| 表示轴 | 连续 / 离散 / 解耦与混合 |
| 评测轴 | 内容、音色、音质、自然度、属性符合度 |
| 论文清单 | awesome-controllabe-speech-synthesis |
- Wiki 目录
- 资料摘要:F5-TTS — 非自回归 flow 路线
- 资料摘要:Qwen3-TTS · 资料摘要:CosyVoice 3 — LLM/codec 与可控生成路线
- 资料摘要:Emilia — 大规模弱监督数据管线
- 资料摘要:CtrlSpeech · 资料摘要:InstructTTSEval — 细粒度控制与评测
- 神经音频编解码(RVQ) · DiT(Diffusion Transformer) — 表示与生成骨干