跳转到内容

输入关键词开始搜索

    资料摘要:InstructTTSEval

    论文摘要更新 2026-08-06置信度 high待阅读原始来源 ↗#语音合成#模型评估#指令跟随#基准#深度

    复旦大学 OpenMOSS 提出的中英双语表现力 TTS 基准:它不再只问“念对了吗”或“像同一个人吗”,而是用 Acoustic-Parameter Specification、Descriptive-Style Directive 和 Role-Play 三层任务,测量模型能否把具体声学属性、自然风格描述与抽象情境指令落到真实可听的音高、语速、音量、音色、情绪和动态韵律上。

    🔒 InstructTTSEval 原始论文

    官方代码 · Hugging Face 数据集 · arXiv

    • 评什么:不是一般的 WER/CER、speaker similarity 或自然度评测,而是“合成语音的说话风格是否符合自然语言指令”。
    • 三层任务:APS 直接给全部 12 类声音属性;DSD 把属性改写成不完全、自然的风格描述;RP 只提供角色或场景,要求模型依靠世界知识反推说话方式。
    • 数据规模:1,000 段英文参考音频 + 1,000 段中文参考音频;每段派生 APS、DSD、RP 三种指令,因而共 6,000 个评测任务,不是 6,000 段独立参考音频。
    • 反向构造:先从电影、剧集、综艺和 NCSSD 中挖掘高表现力片段,再从音频反向生成风格标注与指令,避免先写指令却找不到真实表演的 top-down 落差。
    • 12 个属性:覆盖 gender、pitch、speed、volume、age、clarity、fluency、accent、texture、emotion、tone 与 personality,并特别要求描述句内的动态变化。
    • 自动评审:用 Gemini 同时听取合成音频和风格指令,逐条输出 True/False;每个子集是 1,000 条二元结果的 macro-average。
    • 人机一致性:Gemini 与三名人类标注者多数票的平均一致率为 79.0%;APS 87%、DSD 79%、RP 71%,任务越抽象,评分边界越不稳定。
    • 2025 论文快照:原文中商业模型整体强于当时的开源模型,但非语言发声、极端情绪、快速情绪转折、角色特定音色和歌唱仍是普遍短板。
    InstructTTSEval 基准构造与评测流程
    InstructTTSEval 基准构造与评测流程

    为什么不能只看 WER 和音色相似度

    Section titled “为什么不能只看 WER 和音色相似度”

    WER/CER 能回答内容有没有读对,SIM 能回答说话人特征是否接近,但它们都无法判断“同一句安慰的话是否用冷漠声音说了出来”。传统 MOS 能补充主观感受,却成本高、标准不易统一,也难以对大量模型迭代进行连续回归。

    InstructTTSEval 把评测对象从“语音质量”改成“风格指令与可听表现的一致性”。这与 MCLP 的“多轮角色风格一致性”相邻,但本文聚焦单段音频是否执行一条复杂风格指令。

    任务 Canonical name 输入信息 主要测量
    APS Acoustic-Parameter Specification 12 个属性的显式、结构化自然语言描述 是否能把每个低层属性直接映射为声学表现
    DSD Descriptive-Style Directive 经改写且随机遗漏部分属性的 free-form 描述 是否能解析自然、不完全的风格提示
    RP Role-Play 角色、社交情境或叙事场景 是否能以世界知识推断合适的音高、音量、情绪、节奏和音色

    这个难度梯度并不只是“指令变短”。APS 主要测属性接地,DSD 增加了缺失信息与语言多样性,RP 则把社会常识、角色理解和声学实现绑在一起。

    层级 属性 评测关注点
    生理 gender、pitch、texture 性别相关发声特征、高低与变化、音色质感
    语言 clarity、fluency、speed 清晰度、连续性、停顿与语速变化
    社会 accent、age、volume 口音、年龄感、从耳语到喊叫的强度
    心理/语用 emotion、tone、personality 情绪转折、态度/语调、稳定的人格印象

    论文强调“时间内的变化”:例如先压低音量说秘密,再随情绪升级而逐渐提高音量。如果只给每段音频一个静态标签,这种动态 prosody 会被抹平。

    1. 数据源:NCSSD 加上作者从电影、电视剧和综艺节目收集的片段。
    2. 切分与转写:pyannote speaker diarization 取得同一说话人、低于 30 秒的片段;Whisper large-v3 转写,ct-punc 与 BELLE 恢复标点,中间产物约 6,000 小时。
    3. 质量筛选:DNSMOS 阈值 2.8;定制 WhisperD 保留单说话人;音频需大于 3 秒,英文大于 10 词、中文大于 10 字。
    4. 表现力筛选:DVA 工具的 Dominance 和 Arousal 均需高于 0.8;不用 Valence,以避免偏向正面或负面情绪。
    5. 最终参考集:英文 1,000 段、3.04 小时;中文 1,000 段、2.54 小时。英文中 NCSSD/自采为 183/817,中文为 500/500。
    • Speech Captiongemini-2.5-pro-preview-05-06 听参考音频,为 12 个属性生成精细 free-form caption;该 caption 直接作为 APS 指令。
    • DSDgpt-4o-2024-08-06 把 caption 改写成自然语言,并依三套概率随机删掉属性。未出现的属性被视为“不约束”,而不是被隐式评分。
    • RP:用三种 prompt 和 Chain-of-Thought 从低层声学属性反推角色与场景,最终仅把简洁的导演式指令交给 TTS。

    对每个待评样本,裁判同时收到音频和风格描述。prompt 要求它先分析 12 个维度,然后输出一个二元的 consistency 结果:

    • True:主要风格维度一致,且没有明显冲突。
    • False:至少一个关键风格特征明显冲突,或整体听感偏离指令。
    • 不评发音准确性、音质和自然度;未在指令中提及的属性不影响判断。
    • 官方脚本使用 temperature=0,并对返回文本中的 JSON 和一致性字段做容错解析。

    人机对照用每种任务、每种语言各 50 条,其中 25 条为真实配对,25 条随机换成其他指令。三名 TOEFL 高于 100 的研究生按同一 rubric 标注,以多数票为人类结果。

    语言 APS DSD RP 平均
    EN 86% 78% 66% 76.7%
    ZH 88% 80% 76% 81.3%
    总体 87% 79% 71% 79.0%
    系统 APS DSD RP 平均
    reference audio 96.2 89.4 67.2 84.3
    Gemini Flash 92.3 93.8 80.1 88.7
    Gemini Pro 87.6 86.0 67.2 80.3
    Hume 83.0 75.3 54.3 71.1
    GPT-4o mini TTS 76.4 74.3 54.8 68.5
    VoxInstruct 54.9 57.0 39.3 50.4
    PromptTTS 64.3 47.2 31.4 47.6
    Parler-TTS mini 63.4 48.7 28.6 46.9
    Parler-TTS large 60.0 45.9 31.2 45.7
    PromptStyle 57.4 46.4 30.9 38.2
    系统 APS DSD RP 平均
    reference audio 90.9 86.7 69.8 82.5
    Gemini Flash 88.2 90.9 77.3 85.4
    Gemini Pro 89.0 90.1 75.5 84.8
    GPT-4o mini TTS 54.9 52.3 46.0 51.1
    VoxInstruct 47.5 52.3 42.6 47.5

    这些数字只是论文在 2025 年对当时可访问模型的快照。论文之后的 Qwen3-TTS、VoxCPM2 等系统已继续使用该基准,但后来者的分数不应回填到原论文表格中当成同一时点结论。

    • 非语言发声:叹气、突然大笑、尖叫等与口语绑定的 vocal event 很难稳定生成。
    • 极端与动态情绪:部分模型可以抬高音量或音高,却不能在一句内完成从平静到冲动的可信转折。
    • 音色与情绪的正交性:一些开源模型能生成儿童或老年音色,却整体情绪控制较弱;某些商业模型情绪强,却受固定声线或 safety filter 限制。
    • 歌唱化表达:“像唱歌一样说”同时考验韵律、旋律、节奏、音色和情绪,原论文中只有 Gemini 两个系统显示了初步能力。
    • 公开 Parquet 中嵌入 16 kHz WAV,enzh 各 1,000 条,每条含 idtextAPSDSDRPreference_audio
    • 官方代码快照主要包含 Gemini 并发评分脚本、prompt、样例 JSONL 和运行脚本;不包含完整数据构建流水线。
    • 使用 Gemini-as-a-Judge 完成 EN 三任务约 12.8 美元,ZH 约 11.9 美元;这是论文当时价格快照,会随 API 计价与模型版本漂移。
    • 论文中三个缩写的 canonical name 应以正文为准;代码 README 将它们写成 Attribute-based Prompt Style、Direct Style Description 和 Role-based Prompt,字段名一致但展开名存在文档漂移。
    • 标题:InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
    • 作者:Kexin Huang, Qian Tu, Liwei Fan, Chenchen Yang, Dong Zhang, Shimin Li, Zhaoye Fei, Qinyuan Cheng, Xipeng Qiu(Fudan University)
    • 版本:arXiv:2506.16381v1,2025-06-19,19 页;当前论文仅自称 arXiv preprint,不把后续匿名投稿当成已录用会议记录。
    • 原文 PDF SHA-256:b42a1fcd2d8374c75cfbc83cb7ee0ae01f6022e72846c5e3b1fbc46f74754c20
    • 官方代码快照:b7e4120c7cee179a3ce1b99819cf13d8e6f199ce,7 个文件,聚合 SHA-256 35c5e7cc3467af52954fc5461278a3b5d2d3dd224ba777c31159bbc83a4ae8fa
    • Dataset Card 快照:b12cdf288e78cfddb1d1975fd0e05d6fd61ac0d2,数据集页标注 MIT;论文的 Ethical Considerations 则写明仅用于学术研究。
    • 参考音频不是满分上界:reference audio 的 EN/ZH 平均仅 84.3/82.5,反而低于 Gemini Flash 的 88.7/85.4。这并不证明合成音频比原始表演“更正确”,而是暴露 DSD/RP 指令由参考 caption 再次生成后可能与原音频偏离,以及裁判对同系模型输出的潜在偏好。
    • 验证样本偏小:人机一致性只基于 3 任务 × 2 语言 × 50 对,且 RP 一致率仅 71%。用它支撑大规模排名可以,但不应把一两个分数差解读成稳定的显著胜负。
    • 二元分数丢失程度信息:一个属性“稍微不够强”与“完全相反”都可能得到 False;且指标故意忽略发音、音质和自然度,不能单独代表一个 TTS 系统的整体实用性。
    • 数据与版权边界不够清楚:参考音频来自电影、电视剧和综艺,Dataset Card 的 MIT 标记未必能覆盖所有底层视听片段的权利。研究使用与二次分发前应单独审查来源权利。
    • 版本依赖强:Gemini、GPT-4o 与商业 TTS 都是可变 API,safety setting、固定声线、最大指令长度和计价都会改变结果;表中星号模型甚至有少量缺失样本。