跳转到内容

输入关键词开始搜索

    资料摘要:X2-Turn

    论文摘要更新 2026-08-16置信度 high待阅读原始来源 ↗#语音识别#流式#对话#多任务#深度

    X2-Turn 在同一 80 ms 流式帧上并行输出 ASR token 与话轮状态,把“识别内容”和“现在是否该接话”放进共享隐状态、独立 head;turn head 不回灌 ASR 解码历史,因此话轮误判不会直接污染文字生成。

    🔒 X2-Turn 原始论文

    arXiv · 基础模型 Voxtral-Mini-4B-Realtime

    ASR-TTS 论文周报 015 技术路线图
    ASR-TTS 论文周报 015 技术路线图
    • 帧同步双头:基于 Voxtral-Mini-4B-Realtime,因果 audio encoder 与 temporal adapter 产生 12.5 Hz hidden;ASR head 和 turn-state head 每 80 ms 同步预测。
    • 五种状态:idle、noidle、incomplete、complete、backchannel,把静音、继续说、未完成、可接话和附和分开,不再把 endpointing 简化为 VAD 停顿阈值。
    • ASR-anchored supervision:词级话轮标签按 word onset 对齐到 [W] 标记和对应 subword 位置,避免把语义完成度粗暴投到整段尾部。
    • 可调延迟:通过 AdaRMSNorm 注入延迟 τ\tau,一个模型覆盖 80–2,400 ms;延迟越大通常状态更准,但接话更慢。
    • 代表折中τ=480\tau=480 ms 时,中文 complete/incomplete/backchannel 准确率为 91/93/96%,检测延迟 288 ms;英文为 92.1/84.6%,延迟 225 ms。τ=320\tau=320 ms 时中文/英文平均状态准确率约 90.67/85.09%,延迟 120/65 ms。
    • 开源边界:截至 2026-08-16 未确认 X2-Turn 官方代码或 checkpoint;论文使用的基础 Voxtral 模型公开不等于该双头系统已公开。

    VAD 只能回答“有没有人在说话”,X2-Turn 的 complete/incomplete 还要理解句法和语义是否完成;backchannel 又要求识别“嗯、对”等不应抢占主话轮的短响应。共享 hidden 让 ASR 内容为 turn head 提供语义,独立输出则控制故障传播。

    Stage 1 使用约 2.6 万小时中英 ASR;Stage 2 使用 126 小时 EasyTurn 中文与 249 小时 Fisher 英文做联合训练,Qwen3.5-Plus 辅助标注 turn state。4B 主干全量微调,turn loss 权重 0.1。Stage 2 的多任务训练会让部分 ASR 指标相对 Stage 1 退化,说明共享表示并非无代价。

    • 版本:arXiv:2608.10878v1,2026-08-11;5 页。
    • 标签:EasyTurn/Fisher 加 LLM 辅助生成,状态定义与标注一致性仍需人工复核。
    • 评价:turn accuracy 与 detection latency 应成对阅读,不能只报最高准确率。
    • 局限:数据域较窄;LLM 标签可能带偏差;ASR 与 turn objective 存在 trade-off;多人重叠、噪声和真实打断尚缺系统验证。