跳转到内容

输入关键词开始搜索

    资料摘要:SemBridge

    论文摘要更新 2026-08-16置信度 high待阅读原始来源 ↗#语音合成#连续表示#语义对齐#自回归#深度

    SemBridge 用“训练时离散、推理时连续”的方式补足连续潜变量 AR 语音生成的语义监督:同一冻结语义 tokenizer 一方面约束声学 VAE 的 latent 几何,另一方面在 LM 中间层增加下一语义 token 的辅助预测;推理历史仍完全由连续 latent 组成。

    🔒 SemBridge 原始论文

    论文 · 官方 Demo · 官方仓库

    ASR-TTS 论文周报 015 技术路线图
    ASR-TTS 论文周报 015 技术路线图
    • SA-VAE 先整理目标空间:44.1 kHz 语音被压成 25 Hz、64 维 latent,再两帧成 patch;VAE 同时重建声学信息,并对齐到 16,384 类冻结语义 tokenizer 的 embedding。
    • LM 内增加离散锚点:32 层因果 LM 的选定中间层预测下一语义 token,主路径仍把连续 patch 交给 8-block LocDiT。离散 token 是 training-only auxiliary target,不会进入生成历史。
    • 同一机制覆盖 TTS 与歌声:作者在 zero-shot TTS 和 score-conditioned singing voice synthesis 上测试,语义锚定普遍降低 WER/CER,同时保持说话人或歌手相似度。
    • 收敛更快而非免费提升:10 万小时设置下,Seed-EN WER 从无锚点的 4.63 降至 2.70,SIM 从 0.5941 升至 0.6310;4 万小时锚定模型的 WER 已接近无锚点 10 万小时模型。
    • 锚点位置与权重有折中:第 24 层、语义损失权重 0.1 是主配置;太深或太大的辅助损失会与连续声学生成目标竞争。
    • 开源边界:官方 Apache-2.0 仓库目前只有介绍与图,README 明确写明权重、tokenizer 和数据“待发布”,不能称为完整开源复现。

    第一条桥发生在表示层:SA-VAE 让连续 latent 围绕同一语义 embedding 组织,减少声学细节把音素结构淹没。第二条桥发生在动力学层:AR LM 必须从当前连续历史预测下一离散语义类别,迫使中间状态显式保留文本内容。两条桥共享 tokenizer,避免表示目标与状态监督指向不同语义空间。

    这篇论文最有价值的不是“连续与离散二选一”,而是把离散 token 降级成训练监督。它保留连续解码接口,却承认 AR 状态需要分类式语义约束。对连续 VQ-VAE/flow TTS 而言,这是比在推理时再串联一条语义 token 链更轻的改造点。

    • 版本:arXiv:2608.07462v1,2026-08-07;15 页。
    • 数据:SA-VAE 约 2.5 万小时;TTS 主要设置 10 万小时;完整系统 12 万小时,并含 2 万小时内部歌声数据。
    • 规模:约 8 亿参数;16 张 H20、30 万步;默认 10 NFE、CFG 2。
    • 代表结果:12 万小时设置 Seed-ZH CER 0.95/SIM 0.758,Seed-EN WER 1.81/SIM 0.699。
    • 局限:单一冻结 tokenizer;每个配置只训练一个 seed;大量自动指标;12 万小时结果同时改变数据量与任务组成,不能把全部增益归于锚定本身。