资料摘要:Emilia
Emilia 是一套从互联网视频、播客等 in-the-wild 音频自动构建多语语音生成数据的管线与约 10.2 万小时数据集。其价值不仅是规模,还在于把人声分离、说话人切分、VAD、Whisper 转写与质量过滤组合成可复用流水线,并用 AR/NAR TTS 对比验证数据效用。
- Emilia 共 101,654 小时、24 kHz,覆盖英语、中文、德语、法语、日语、韩语;英语约 46.8k 小时、中文约 49.9k 小时,占绝大多数。
- Emilia-Pipe 依次进行音频标准化、人声分离、说话人 diarization、VAD 切段、Whisper 转写和多重过滤,将长视频/播客转成 3–30 秒训练片段。
- 过滤条件包括目标语言、转写置信度至少 80%、DNSMOS P.835 OVRL 大于 3.0,以及基于平均音素时长 IQR 的异常值剔除。
- 600 小时原始音频在 8×RTX 4090 上约 3.99 小时处理完,保留 176.22 小时,即 29.43%;平均 DNSMOS 从 2.50 提升到 3.26。
- 在等规模英语数据比较中,Emilia 训练的 AR 与 NAR TTS 整体优于 MLS,尤其在 speaker similarity、FSD 与主观偏好上。
- 数据高度不均衡、标注全自动,且论文对来源许可、说话人同意与可撤回机制讨论不足;“公开可下载”不能自动等同于无版权/隐私风险。
1. 数据构成
Section titled “1. 数据构成”| 语言 | 时长(千小时) | 约占比 |
|---|---|---|
| 英语 | 46.8 | 46% |
| 中文 | 49.9 | 49% |
| 德语 | 1.6 | 1.6% |
| 法语 | 1.4 | 1.4% |
| 日语 | 1.7 | 1.7% |
| 韩语 | 0.2 | 0.2% |
六语只是覆盖范围,不代表均衡多语训练条件。对低资源四语的结论必须结合小时数和说话人分布解读。
2. Emilia-Pipe
Section titled “2. Emilia-Pipe”标准化阶段统一为 24 kHz、单声道、16-bit,并把响度归到约 -20 dBFS 后加入 ±3 dB 扰动。人声分离减少背景音乐,diarization 与 VAD 控制单说话人段落,Whisper-Medium 负责文本与时间戳。最后以语言置信度、DNSMOS 和平均音素时长剔除低质或转写异常样本。
3. 处理效率与质量门槛
Section titled “3. 处理效率与质量门槛”600 小时评估集在 8 张 RTX 4090 上耗时 3.99 小时,吞吐约 2.5 小时音频/分钟。最终只保留 176.22 小时,说明近七成原始内容因重叠、噪声、语言、转写或质量门槛被丢弃。
DNSMOS 平均值从 2.50 升到 3.26,作者还以 WavLM 说话人向量和 Sentence-BERT 文本向量的 PCA 分布展示其说话人与内容多样性。PCA 只能给出投影下覆盖感,不等同于完整人口统计或语义多样性审计。
4. TTS 验证
Section titled “4. TTS 验证”作者训练了 AR + SoundStorm 与 Voicebox 风格 NAR 两类模型,并将 Emilia 英语约 46k 小时与 MLS 约 44.5k 小时做近等规模比较。模型在 4 张 A100 上训练超过 80 万步。
| 模型 / 数据 | WER ↓ | SIM ↑ | FSD ↓ | CMOS ↑ | SMOS ↑ |
|---|---|---|---|---|---|
| AR / Emilia | 6.6 | 0.618 | 12.73 | 0.19 | 3.73 |
| AR / MLS | 7.7 | 0.587 | 20.76 | 0.09 | 3.71 |
| NAR / Emilia | 7.4 | 0.601 | 14.07 | 0.28 | 3.76 |
| NAR / MLS | 8.2 | 0.528 | 15.94 | 0.28 | 3.61 |
这些数字来自 Emilia-Test,能支持同协议下的数据效用,却不能直接与其他论文的 WER 或 MOS 横向排名。
5. 批判性判断
Section titled “5. 批判性判断”- Emilia 的贡献是可扩展的弱监督数据工程,不是更精确的人工标注语料。
- Whisper、pyannote、DNSMOS 和 G2P 的系统性偏差会串联进入数据;过滤提高平均质量,也可能减少口音、噪声场景和非标准发音的覆盖。
- 中英占 95% 以上,所谓 multilingual 更准确地说是“中英大规模 + 四语长尾”。
- 互联网来源数据的许可、声音权利、隐私和删除请求,应在真实训练项目中做论文之外的独立审计。
| 项目 | 论文报告 |
|---|---|
| 总时长 | 101,654 小时 |
| 采样率 | 24 kHz |
| 语言 | 英、中、德、法、日、韩 |
| 片段长度 | 3–30 秒 |
| DNSMOS 门槛 | P.835 OVRL > 3.0 |
| 600 小时处理保留率 | 29.43% |
| 官方数据/代码 | Emilia Dataset · Emilia-Pipe |
- Wiki 目录
- 资料摘要:F5-TTS — 直接使用 Emilia 训练的代表模型
- 资料摘要:LLMVoX — 合成单说话人训练集的对照
- 资料摘要:可控语音合成系统综述 — 可控 TTS 的数据与标注瓶颈
- 自动语音识别(ASR) — Whisper 转写与评测依赖