资料摘要:On-Policy Self-Distillation for Multi-Dialect ASR
这篇论文以 Qwen3-ASR-1.7B 为底座,用 CPT→方言 SFT→On-Policy Self-Distillation 三阶段适配中文多方言:学生在自己解码出的 prefix 上训练,冻结教师额外看到参考转写作为 privileged context 并给出软目标,从而减少 teacher forcing 的训练—推理错位,并抑制方言微调覆盖普通话能力。
🔒 Multi-Dialect ASR 原始论文
论文 · 官方代码与 Demo · 模型权重
- CPT 先扩覆盖:约 10 万小时普通话与方言混合数据继续预训练,先建立较稳的中文声学/语言基础,再提高方言采样权重做 SFT。
- 直接方言 SFT 会遗忘:从 Qwen3-ASR 直接做方言 SFT,方言平均 CER 15.37→14.70、内部方言 21.01→14.20,但普通话平均 CER 3.46→5.16。
- OPSD 用学生状态、教师软标签:学生以温度 0.8 采样自身 prefix;冻结教师从相同 SFT checkpoint 出发,但看到 reference transcript,以 token-level KL 监督学生;推理时只保留学生。
- 受控对比优于继续 SFT:相同约 5,000 小时 refinement data、相同 schedule 下,continued SFT 的普通话/方言/内部平均 CER 为 4.43/12.89/12.95,而 OPSD 为 3.27/12.79/12.42。
- 完整路径的平衡收益:相对 Qwen3-ASR,OPSD checkpoint 的普通话平均 CER 3.46→3.27,五个公开方言集平均 15.37→12.79,18 个内部方言平均 21.01→12.42。
- 模型已发布:官方仓库含代码、Demo 与调用说明,Hugging Face 提供兼容 qwen-asr 的 checkpoint;训练数据中的约 3.41 万小时内部语音并未随模型公开。
为什么 on-policy 对自回归 ASR 有用
Section titled “为什么 on-policy 对自回归 ASR 有用”普通交叉熵训练总在正确 prefix 后预测下一 token,实际解码却必须在自己的早期错误之后继续。方言长尾会放大这种 exposure bias。OPSD 让学生先进入真实可能出现的错误状态,再由看到参考答案的教师给出分布级修正;它不是单纯把 teacher 权重平均到 student,而是改变训练时访问的状态分布。
不应过度概括的部分
Section titled “不应过度概括的部分”所有公开集改善不代表每个 checkpoint 在每个集合都最好:例如 SpeechIO-1 的 OPSD CER 0.86,仍差于 CPT 的 0.71。内部 18 方言差异也大,Kejia/Chaoshan/Suzhou 等仍处于高 CER。论文证明的是总体 trade-off 改善,不是方言问题已经解决。
- 版本:arXiv:2608.11898v1,2026-08-12;15 页。
- 数据:公开普通话/粤语/四川话/吴语语料加约 3.41 万小时内部数据,总计约 10 万小时;OPSD 从方言训练分区筛约 5,000 小时难例。
- 训练:8 张 RTX A6000;CPT/SFT 各 1 epoch,global batch 1536;OPSD 1 epoch,batch 512,学习率 。
- 局限:内部方言测试不可完全复核;方言以汉字转写评分,未覆盖方言正字法;高 CER 筛样会改变数据分布;模型权重公开不等于训练数据可复现。