跳转到内容

输入关键词开始搜索

    资料摘要:ReLMCodec

    论文摘要更新 2026-08-16置信度 high待阅读原始来源 ↗#语音编码#语音合成#语义对齐#自回归#深度

    ReLMCodec 把语音 token 设计目标从“量化后能否重建”前移到“量化前表征是否具有稳定音素结构”。它先用统一 P-VQ/语言模型 probe 比较 24 种 codec 与 SSL 表征,再以冻结 SSL anchor、可学习声学残差和训练期结构蒸馏构造单码本 50 TPS token。

    🔒 ReLMCodec 原始论文

    论文 · 官方仓库

    ASR-TTS 论文周报 015 技术路线图
    ASR-TTS 论文周报 015 技术路线图
    • 先做受控 probe:24 种 codec/SSL pre-quantization representation 统一接到 8,192 项 P-VQ 与同一 LM,比较 phoneme accuracy、next-token predictability 和重建质量,避免不同 codec 架构干扰归因。
    • 论文假设:量化前音素结构与 AR 可预测性高度相关,但与波形重建并非同一目标;仅靠 reconstruction loss 会保留大量 LM 难以预测的局部声学变化。
    • Preserve–Control–Refine:冻结 w2v-BERT 2.0 第 17 层作 SSL anchor;trainable acoustic encoder 与 12 层 residual PAPA 学习校正量,形成 z=s+0.1Δz=s+0.1\Delta,控制偏离幅度。
    • JMAS 只在训练期使用:WavLM-Large 第 24 层同时提供 frame-level 与 structure-level teacher,帮助保持音素几何;推理时不增加 teacher 成本。
    • 单码本低码率:50 token/s,8K/64K 码本对应约 650/800 bps。8K 配置 reconstruction WER 4.16、SIM 0.749、UTMOS 4.03;64K 为 3.96/0.804/4.07。
    • 发布状态要降级描述:官方 GitHub 已建立且标 MIT,但截至 2026-08-16 根目录仅 LICENSE 与一句话 README,不能称为代码或权重已发布。

    一个对 tokenizer 研究很实用的评估顺序

    Section titled “一个对 tokenizer 研究很实用的评估顺序”

    ReLMCodec 建议先看 pre-quantization phoneme structure,再看统一量化后的 AR predictability,最后看 reconstruction 与真实下游。这样可以区分:encoder 没学到结构、VQ 破坏结构,还是 LM 难以利用结构。对 MOSS-Audio-Tokenizer 一类高维/低帧率 token,也可沿用同一拆解。

    在相同 EmoVoice 下游中,ReLMCodec-8K 为 WER 4.30/SIM 0.45/UTMOS 4.25,优于论文表中的 XCodec2 9.49/0.43/4.15。这个结果支持“可预测 token”价值,但训练/评测仅覆盖英语 LibriSpeech,不能直接外推到多语、歌声或嘈杂语音。

    • 版本:arXiv:2608.08286v1,2026-08-08;18 页。
    • 数据:LibriSpeech train-960;8 张 H20,base 与 continuation 各 20 万步。
    • 码率:50 TPS,单码本 8K/64K;Vocos 系 decoder。
    • 局限:结论主要是观察相关性;只测试 50 Hz 英语、两个 teacher 与对齐 SSL/acoustic 设置;噪声、多语和其他帧率尚未验证。