资料摘要:InstructTTSEval
复旦大学 OpenMOSS 提出的中英双语表现力 TTS 基准:它不再只问“念对了吗”或“像同一个人吗”,而是用 Acoustic-Parameter Specification、Descriptive-Style Directive 和 Role-Play 三层任务,测量模型能否把具体声学属性、自然风格描述与抽象情境指令落到真实可听的音高、语速、音量、音色、情绪和动态韵律上。
🔒 InstructTTSEval 原始论文
官方代码 · Hugging Face 数据集 · arXiv
- 评什么:不是一般的 WER/CER、speaker similarity 或自然度评测,而是“合成语音的说话风格是否符合自然语言指令”。
- 三层任务:APS 直接给全部 12 类声音属性;DSD 把属性改写成不完全、自然的风格描述;RP 只提供角色或场景,要求模型依靠世界知识反推说话方式。
- 数据规模:1,000 段英文参考音频 + 1,000 段中文参考音频;每段派生 APS、DSD、RP 三种指令,因而共 6,000 个评测任务,不是 6,000 段独立参考音频。
- 反向构造:先从电影、剧集、综艺和 NCSSD 中挖掘高表现力片段,再从音频反向生成风格标注与指令,避免先写指令却找不到真实表演的 top-down 落差。
- 12 个属性:覆盖 gender、pitch、speed、volume、age、clarity、fluency、accent、texture、emotion、tone 与 personality,并特别要求描述句内的动态变化。
- 自动评审:用 Gemini 同时听取合成音频和风格指令,逐条输出 True/False;每个子集是 1,000 条二元结果的 macro-average。
- 人机一致性:Gemini 与三名人类标注者多数票的平均一致率为 79.0%;APS 87%、DSD 79%、RP 71%,任务越抽象,评分边界越不稳定。
- 2025 论文快照:原文中商业模型整体强于当时的开源模型,但非语言发声、极端情绪、快速情绪转折、角色特定音色和歌唱仍是普遍短板。
为什么不能只看 WER 和音色相似度
Section titled “为什么不能只看 WER 和音色相似度”WER/CER 能回答内容有没有读对,SIM 能回答说话人特征是否接近,但它们都无法判断“同一句安慰的话是否用冷漠声音说了出来”。传统 MOS 能补充主观感受,却成本高、标准不易统一,也难以对大量模型迭代进行连续回归。
InstructTTSEval 把评测对象从“语音质量”改成“风格指令与可听表现的一致性”。这与 MCLP 的“多轮角色风格一致性”相邻,但本文聚焦单段音频是否执行一条复杂风格指令。
三层任务如何递进
Section titled “三层任务如何递进”| 任务 | Canonical name | 输入信息 | 主要测量 |
|---|---|---|---|
| APS | Acoustic-Parameter Specification | 12 个属性的显式、结构化自然语言描述 | 是否能把每个低层属性直接映射为声学表现 |
| DSD | Descriptive-Style Directive | 经改写且随机遗漏部分属性的 free-form 描述 | 是否能解析自然、不完全的风格提示 |
| RP | Role-Play | 角色、社交情境或叙事场景 | 是否能以世界知识推断合适的音高、音量、情绪、节奏和音色 |
这个难度梯度并不只是“指令变短”。APS 主要测属性接地,DSD 增加了缺失信息与语言多样性,RP 则把社会常识、角色理解和声学实现绑在一起。
12 个声音属性
Section titled “12 个声音属性”| 层级 | 属性 | 评测关注点 |
|---|---|---|
| 生理 | gender、pitch、texture | 性别相关发声特征、高低与变化、音色质感 |
| 语言 | clarity、fluency、speed | 清晰度、连续性、停顿与语速变化 |
| 社会 | accent、age、volume | 口音、年龄感、从耳语到喊叫的强度 |
| 心理/语用 | emotion、tone、personality | 情绪转折、态度/语调、稳定的人格印象 |
论文强调“时间内的变化”:例如先压低音量说秘密,再随情绪升级而逐渐提高音量。如果只给每段音频一个静态标签,这种动态 prosody 会被抹平。
数据构建流程
Section titled “数据构建流程”- 数据源:NCSSD 加上作者从电影、电视剧和综艺节目收集的片段。
- 切分与转写:pyannote speaker diarization 取得同一说话人、低于 30 秒的片段;Whisper large-v3 转写,ct-punc 与 BELLE 恢复标点,中间产物约 6,000 小时。
- 质量筛选:DNSMOS 阈值 2.8;定制 WhisperD 保留单说话人;音频需大于 3 秒,英文大于 10 词、中文大于 10 字。
- 表现力筛选:DVA 工具的 Dominance 和 Arousal 均需高于 0.8;不用 Valence,以避免偏向正面或负面情绪。
- 最终参考集:英文 1,000 段、3.04 小时;中文 1,000 段、2.54 小时。英文中 NCSSD/自采为 183/817,中文为 500/500。
从参考音频到三种指令
Section titled “从参考音频到三种指令”- Speech Caption:
gemini-2.5-pro-preview-05-06听参考音频,为 12 个属性生成精细 free-form caption;该 caption 直接作为 APS 指令。 - DSD:
gpt-4o-2024-08-06把 caption 改写成自然语言,并依三套概率随机删掉属性。未出现的属性被视为“不约束”,而不是被隐式评分。 - RP:用三种 prompt 和 Chain-of-Thought 从低层声学属性反推角色与场景,最终仅把简洁的导演式指令交给 TTS。
Gemini-as-a-Judge 评分
Section titled “Gemini-as-a-Judge 评分”对每个待评样本,裁判同时收到音频和风格描述。prompt 要求它先分析 12 个维度,然后输出一个二元的 consistency 结果:
- True:主要风格维度一致,且没有明显冲突。
- False:至少一个关键风格特征明显冲突,或整体听感偏离指令。
- 不评发音准确性、音质和自然度;未在指令中提及的属性不影响判断。
- 官方脚本使用
temperature=0,并对返回文本中的 JSON 和一致性字段做容错解析。
人机对照用每种任务、每种语言各 50 条,其中 25 条为真实配对,25 条随机换成其他指令。三名 TOEFL 高于 100 的研究生按同一 rubric 标注,以多数票为人类结果。
| 语言 | APS | DSD | RP | 平均 |
|---|---|---|---|---|
| EN | 86% | 78% | 66% | 76.7% |
| ZH | 88% | 80% | 76% | 81.3% |
| 总体 | 87% | 79% | 71% | 79.0% |
原论文的模型结果
Section titled “原论文的模型结果”| 系统 | APS | DSD | RP | 平均 |
|---|---|---|---|---|
| reference audio | 96.2 | 89.4 | 67.2 | 84.3 |
| Gemini Flash | 92.3 | 93.8 | 80.1 | 88.7 |
| Gemini Pro | 87.6 | 86.0 | 67.2 | 80.3 |
| Hume | 83.0 | 75.3 | 54.3 | 71.1 |
| GPT-4o mini TTS | 76.4 | 74.3 | 54.8 | 68.5 |
| VoxInstruct | 54.9 | 57.0 | 39.3 | 50.4 |
| PromptTTS | 64.3 | 47.2 | 31.4 | 47.6 |
| Parler-TTS mini | 63.4 | 48.7 | 28.6 | 46.9 |
| Parler-TTS large | 60.0 | 45.9 | 31.2 | 45.7 |
| PromptStyle | 57.4 | 46.4 | 30.9 | 38.2 |
| 系统 | APS | DSD | RP | 平均 |
|---|---|---|---|---|
| reference audio | 90.9 | 86.7 | 69.8 | 82.5 |
| Gemini Flash | 88.2 | 90.9 | 77.3 | 85.4 |
| Gemini Pro | 89.0 | 90.1 | 75.5 | 84.8 |
| GPT-4o mini TTS | 54.9 | 52.3 | 46.0 | 51.1 |
| VoxInstruct | 47.5 | 52.3 | 42.6 | 47.5 |
这些数字只是论文在 2025 年对当时可访问模型的快照。论文之后的 Qwen3-TTS、VoxCPM2 等系统已继续使用该基准,但后来者的分数不应回填到原论文表格中当成同一时点结论。
- 非语言发声:叹气、突然大笑、尖叫等与口语绑定的 vocal event 很难稳定生成。
- 极端与动态情绪:部分模型可以抬高音量或音高,却不能在一句内完成从平静到冲动的可信转折。
- 音色与情绪的正交性:一些开源模型能生成儿童或老年音色,却整体情绪控制较弱;某些商业模型情绪强,却受固定声线或 safety filter 限制。
- 歌唱化表达:“像唱歌一样说”同时考验韵律、旋律、节奏、音色和情绪,原论文中只有 Gemini 两个系统显示了初步能力。
复现成本与代码
Section titled “复现成本与代码”- 公开 Parquet 中嵌入 16 kHz WAV,
en与zh各 1,000 条,每条含id、text、APS、DSD、RP、reference_audio。 - 官方代码快照主要包含 Gemini 并发评分脚本、prompt、样例 JSONL 和运行脚本;不包含完整数据构建流水线。
- 使用 Gemini-as-a-Judge 完成 EN 三任务约 12.8 美元,ZH 约 11.9 美元;这是论文当时价格快照,会随 API 计价与模型版本漂移。
- 论文中三个缩写的 canonical name 应以正文为准;代码 README 将它们写成 Attribute-based Prompt Style、Direct Style Description 和 Role-based Prompt,字段名一致但展开名存在文档漂移。
- 标题:InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
- 作者:Kexin Huang, Qian Tu, Liwei Fan, Chenchen Yang, Dong Zhang, Shimin Li, Zhaoye Fei, Qinyuan Cheng, Xipeng Qiu(Fudan University)
- 版本:arXiv:2506.16381v1,2025-06-19,19 页;当前论文仅自称 arXiv preprint,不把后续匿名投稿当成已录用会议记录。
- 原文 PDF SHA-256:
b42a1fcd2d8374c75cfbc83cb7ee0ae01f6022e72846c5e3b1fbc46f74754c20 - 官方代码快照:
b7e4120c7cee179a3ce1b99819cf13d8e6f199ce,7 个文件,聚合 SHA-25635c5e7cc3467af52954fc5461278a3b5d2d3dd224ba777c31159bbc83a4ae8fa。 - Dataset Card 快照:
b12cdf288e78cfddb1d1975fd0e05d6fd61ac0d2,数据集页标注 MIT;论文的 Ethical Considerations 则写明仅用于学术研究。
- 参考音频不是满分上界:reference audio 的 EN/ZH 平均仅 84.3/82.5,反而低于 Gemini Flash 的 88.7/85.4。这并不证明合成音频比原始表演“更正确”,而是暴露 DSD/RP 指令由参考 caption 再次生成后可能与原音频偏离,以及裁判对同系模型输出的潜在偏好。
- 验证样本偏小:人机一致性只基于 3 任务 × 2 语言 × 50 对,且 RP 一致率仅 71%。用它支撑大规模排名可以,但不应把一两个分数差解读成稳定的显著胜负。
- 二元分数丢失程度信息:一个属性“稍微不够强”与“完全相反”都可能得到 False;且指标故意忽略发音、音质和自然度,不能单独代表一个 TTS 系统的整体实用性。
- 数据与版权边界不够清楚:参考音频来自电影、电视剧和综艺,Dataset Card 的 MIT 标记未必能覆盖所有底层视听片段的权利。研究使用与二次分发前应单独审查来源权利。
- 版本依赖强:Gemini、GPT-4o 与商业 TTS 都是可变 API,safety setting、固定声线、最大指令长度和计价都会改变结果;表中星号模型甚至有少量缺失样本。
- LLM-as-a-Judge — 本文把多模态大模型作为可听风格裁判器的典型案例。
- 资料摘要:Qwen3-TTS — 后续 TTS 技术报告将 InstructTTSEval 用于 Voice Design 与可控性评测。
- 资料摘要:VoxCPM — VoxCPM2 的 Voice Design 亦引用 APS/DSD/RP 分数。
- 资料摘要:MCLP(角色扮演 TTS) — 从单条复杂指令扩展到多轮角色风格一致性。
- 生成式奖励模型(Generative Reward Model) — 与直接调用通用大模型作裁判的方案对比。
- 自动语音识别(ASR) — 数据清洗与传统内容正确性评测的基础。
- Wiki 目录