资料摘要:X2-Turn
X2-Turn 在同一 80 ms 流式帧上并行输出 ASR token 与话轮状态,把“识别内容”和“现在是否该接话”放进共享隐状态、独立 head;turn head 不回灌 ASR 解码历史,因此话轮误判不会直接污染文字生成。
🔒 X2-Turn 原始论文
arXiv · 基础模型 Voxtral-Mini-4B-Realtime
- 帧同步双头:基于 Voxtral-Mini-4B-Realtime,因果 audio encoder 与 temporal adapter 产生 12.5 Hz hidden;ASR head 和 turn-state head 每 80 ms 同步预测。
- 五种状态:idle、noidle、incomplete、complete、backchannel,把静音、继续说、未完成、可接话和附和分开,不再把 endpointing 简化为 VAD 停顿阈值。
- ASR-anchored supervision:词级话轮标签按 word onset 对齐到
[W]标记和对应 subword 位置,避免把语义完成度粗暴投到整段尾部。 - 可调延迟:通过 AdaRMSNorm 注入延迟 ,一个模型覆盖 80–2,400 ms;延迟越大通常状态更准,但接话更慢。
- 代表折中: ms 时,中文 complete/incomplete/backchannel 准确率为 91/93/96%,检测延迟 288 ms;英文为 92.1/84.6%,延迟 225 ms。 ms 时中文/英文平均状态准确率约 90.67/85.09%,延迟 120/65 ms。
- 开源边界:截至 2026-08-16 未确认 X2-Turn 官方代码或 checkpoint;论文使用的基础 Voxtral 模型公开不等于该双头系统已公开。
与传统 endpointing 的区别
Section titled “与传统 endpointing 的区别”VAD 只能回答“有没有人在说话”,X2-Turn 的 complete/incomplete 还要理解句法和语义是否完成;backchannel 又要求识别“嗯、对”等不应抢占主话轮的短响应。共享 hidden 让 ASR 内容为 turn head 提供语义,独立输出则控制故障传播。
Stage 1 使用约 2.6 万小时中英 ASR;Stage 2 使用 126 小时 EasyTurn 中文与 249 小时 Fisher 英文做联合训练,Qwen3.5-Plus 辅助标注 turn state。4B 主干全量微调,turn loss 权重 0.1。Stage 2 的多任务训练会让部分 ASR 指标相对 Stage 1 退化,说明共享表示并非无代价。
- 版本:arXiv:2608.10878v1,2026-08-11;5 页。
- 标签:EasyTurn/Fisher 加 LLM 辅助生成,状态定义与标注一致性仍需人工复核。
- 评价:turn accuracy 与 detection latency 应成对阅读,不能只报最高准确率。
- 局限:数据域较窄;LLM 标签可能带偏差;ASR 与 turn objective 存在 trade-off;多人重叠、噪声和真实打断尚缺系统验证。