跳转到内容

输入关键词开始搜索

    资料摘要:Emilia

    论文摘要更新 2026-08-17置信度 high待阅读原始来源 ↗#语音数据#语音合成#数据管线#基准#易过时

    Emilia 是一套从互联网视频、播客等 in-the-wild 音频自动构建多语语音生成数据的管线与约 10.2 万小时数据集。其价值不仅是规模,还在于把人声分离、说话人切分、VAD、Whisper 转写与质量过滤组合成可复用流水线,并用 AR/NAR TTS 对比验证数据效用。

    • Emilia 共 101,654 小时、24 kHz,覆盖英语、中文、德语、法语、日语、韩语;英语约 46.8k 小时、中文约 49.9k 小时,占绝大多数。
    • Emilia-Pipe 依次进行音频标准化、人声分离、说话人 diarization、VAD 切段、Whisper 转写和多重过滤,将长视频/播客转成 3–30 秒训练片段。
    • 过滤条件包括目标语言、转写置信度至少 80%、DNSMOS P.835 OVRL 大于 3.0,以及基于平均音素时长 IQR 的异常值剔除。
    • 600 小时原始音频在 8×RTX 4090 上约 3.99 小时处理完,保留 176.22 小时,即 29.43%;平均 DNSMOS 从 2.50 提升到 3.26。
    • 在等规模英语数据比较中,Emilia 训练的 AR 与 NAR TTS 整体优于 MLS,尤其在 speaker similarity、FSD 与主观偏好上。
    • 数据高度不均衡、标注全自动,且论文对来源许可、说话人同意与可撤回机制讨论不足;“公开可下载”不能自动等同于无版权/隐私风险。
    LLM-based TTS 九篇参考论文系统位置 架构图
    LLM-based TTS 九篇参考论文系统位置 架构图
    语言 时长(千小时) 约占比
    英语 46.8 46%
    中文 49.9 49%
    德语 1.6 1.6%
    法语 1.4 1.4%
    日语 1.7 1.7%
    韩语 0.2 0.2%

    六语只是覆盖范围,不代表均衡多语训练条件。对低资源四语的结论必须结合小时数和说话人分布解读。

    标准化阶段统一为 24 kHz、单声道、16-bit,并把响度归到约 -20 dBFS 后加入 ±3 dB 扰动。人声分离减少背景音乐,diarization 与 VAD 控制单说话人段落,Whisper-Medium 负责文本与时间戳。最后以语言置信度、DNSMOS 和平均音素时长剔除低质或转写异常样本。

    600 小时评估集在 8 张 RTX 4090 上耗时 3.99 小时,吞吐约 2.5 小时音频/分钟。最终只保留 176.22 小时,说明近七成原始内容因重叠、噪声、语言、转写或质量门槛被丢弃。

    DNSMOS 平均值从 2.50 升到 3.26,作者还以 WavLM 说话人向量和 Sentence-BERT 文本向量的 PCA 分布展示其说话人与内容多样性。PCA 只能给出投影下覆盖感,不等同于完整人口统计或语义多样性审计。

    作者训练了 AR + SoundStorm 与 Voicebox 风格 NAR 两类模型,并将 Emilia 英语约 46k 小时与 MLS 约 44.5k 小时做近等规模比较。模型在 4 张 A100 上训练超过 80 万步。

    模型 / 数据 WER ↓ SIM ↑ FSD ↓ CMOS ↑ SMOS ↑
    AR / Emilia 6.6 0.618 12.73 0.19 3.73
    AR / MLS 7.7 0.587 20.76 0.09 3.71
    NAR / Emilia 7.4 0.601 14.07 0.28 3.76
    NAR / MLS 8.2 0.528 15.94 0.28 3.61

    这些数字来自 Emilia-Test,能支持同协议下的数据效用,却不能直接与其他论文的 WER 或 MOS 横向排名。

    • Emilia 的贡献是可扩展的弱监督数据工程,不是更精确的人工标注语料。
    • Whisper、pyannote、DNSMOS 和 G2P 的系统性偏差会串联进入数据;过滤提高平均质量,也可能减少口音、噪声场景和非标准发音的覆盖。
    • 中英占 95% 以上,所谓 multilingual 更准确地说是“中英大规模 + 四语长尾”。
    • 互联网来源数据的许可、声音权利、隐私和删除请求,应在真实训练项目中做论文之外的独立审计。
    项目 论文报告
    总时长 101,654 小时
    采样率 24 kHz
    语言 英、中、德、法、日、韩
    片段长度 3–30 秒
    DNSMOS 门槛 P.835 OVRL > 3.0
    600 小时处理保留率 29.43%
    官方数据/代码 Emilia Dataset · Emilia-Pipe