跳转到内容

输入关键词开始搜索

    资料摘要:CtrlSpeech

    论文摘要更新 2026-08-16置信度 high待阅读原始来源 ↗#语音合成#韵律#可控生成#流匹配#工具

    CtrlSpeech 在 DiTAR 连续 latent AR 主干上加入两级控制:说话人 embedding 与 prompt audio 提供粗粒度音色,phone-aligned 的基频、响度和时长 token 提供局部韵律;用户可在一次生成后修改特定词或音素的韵律再重合成。

    🔒 CtrlSpeech 原始论文

    论文 · 项目页 · 代码 · 权重

    ASR-TTS 论文周报 015 技术路线图
    ASR-TTS 论文周报 015 技术路线图
    • 控制变量显式解耦:global speaker condition 保持音色;局部 pitch、loudness、duration 与 phone 对齐,避免只用自然语言 style prompt 时控制边界模糊。
    • 连续 AR 主干:16 kHz VAE 输出 40 Hz、64 维 latent,4 帧成 patch;因果 LM 建模 patch 历史,LocDiT 用 conditional flow matching 生成下一个 patch。
    • 韵律离散化:WORLD 提取 F0F_0 并映射到 mel 标度后量化为 128 档;A-weighted RMS 响度在 -60–0 dB 内量化为 64 档;duration 用 phone frame count 表示。
    • 控制指标明显改善:0.6B 模型加入目标条件后,pitch RMSE 由 67.86 Hz 降至 38.39 Hz,loudness RMSE 由 6.35 dB 降至 4.56 dB,duration MAE 由 28.08 降至 11.86。
    • 音色条件的必要性:LibriSpeech-PC 上组合说话人条件优于单一路径;去掉 speaker condition 时 SIM 仅 0.07。
    • 代码和权重已公开:截至 2026-08-16,官方 GitHub 包含实现、脚本与测试,Hugging Face 提供 150M/600M base/control checkpoint;权重采用 CC-BY-NC-4.0 标签,不是无条件商用许可。

    CtrlSpeech 不从自然语言描述里“猜”局部韵律,而是要求 control sequence 与 phone 对齐。这样编辑对象明确,但也把前端对齐和声学特征提取误差带进推理链:用户真正控制的是 WORLD F0F_0、A-weighted loudness 与 frame duration 的离散表示,而不是抽象情绪。

    主干并未改写 DiTAR 的跨 patch AR/patch 内 flow 结构;创新集中在条件设计与迭代编辑工作流。因而它更适合看作可控性插件,而不是新的生成范式。

    • 版本:arXiv:2608.08362v1,2026-08-08;6 页。
    • 数据:Emilia-English 与 GigaSpeech 子集,共约 2 万小时英语;8 张 A100、5 个 epoch。
    • 推理:32 个 flow sampling steps,CFG 1.5。
    • 代表结果:0.6B 在 LibriSpeech-PC 上 WER 2.46/SIM 0.65,在 Seed-EN 上 WER 2.58/SIM 0.63;提升相对温和,主要贡献仍是控制误差。
    • 局限:仅英语;依赖 forced alignment 与声学特征提取;局部 pitch 的 text-only 预测仍难;尚未覆盖 emotion、非语言声与多说话人交互。