资料摘要:SLT 2026 SmartGlasses Challenge
IEEE SLT 2026 SmartGlasses Challenge 建立了中文第一视角多说话人语音基准:同一四通道眼镜录音同时评估带时间戳、说话人归属的 ASR(TSA-ASR)与长音频问答(SLU),覆盖双人日常对话和 3–8 人会议;结果显示转写、说话人跟踪与声学证据推理是三个不能互相替代的能力。
🔒 SmartGlasses Challenge 原始论文
- 两个场景、两项任务:Track 1 是平均约 5.2 分钟的双人日常对话,Track 2 是平均约 19 分钟的 3–8 人会议;两者均做 TSA-ASR 和四选一 SLU。
- 真实第一视角声学条件:定制眼镜两侧镜腿布置四个 MEMS 麦克风;总计 714 会话、106.98 小时,其中 Track 1 为 44.95 小时,Track 2 为 62.03 小时。
- TSA-ASR 用 tcpCER:以 5 秒 temporal collar 匹配 reference turn,联合惩罚字符替换/删除/插入、说话人归属和时间错位;SLU 用 accuracy。
- 多人会议断崖式变难:最佳系统 hfchen 在 Track 1/2 的 tcpCER 为 5.23%/27.95%;其余 Track 2 提交均高于 48%。重叠率超过 20% 时,系统平均 tcpCER 达 69.2%。
- SLU 高分不等于声学理解稳健:最佳系统两轨 accuracy 为 0.888/0.930,但细分后 semantic question 最好,依赖音色、情绪、说话方式等 acoustic evidence 的问题最弱。
- 评测资产已公开:官方仓库提供 README、示例与 tcpCER 运行脚本;数据去标识化并使用 pseudonymous speaker ID,具体下载与挑战条款仍以官网为准。
所有语音用 TextGrid 人工标注 speaker ID、timestamp 与普通话转写,并做两轮交叉核验。Dev/Test 的 3,509 个 SLU QA 按 acoustic、semantic、acoustic-semantic joint 约 1:1:1 构造:先由 LLM 辅助起草,再人工核验;Test 额外做两轮 review。
最强系统透露出的路线
Section titled “最强系统透露出的路线”hfchen 使用 MOSS Transcribe Diarize 架构,将 Whisper-large-v3 encoder 接到 Qwen3-8B,一次预测 speaker label、timestamp 和 transcript,并继续做多说话人 audio-text pretraining。其他团队在四通道平均、beamforming、separation 与直接多通道输入间选择不一;论文明确提醒这些是系统描述,不是受控消融,不能据榜单推断因果。
- 版本:arXiv:2608.12034v1,2026-08-12;7 页。
- 数据总量:714 sessions、106.98 h、3,509 QA;Track 1 平均 overlap 7.5%,Track 2 为 13.6%,最高约 35%/45%。
- 说话人数:Track 2 的平均 tcpCER 随人数由 3 人的 15.5% 上升到 5 人的 49.3%,6–8 人均高于 63%。
- 局限:单一眼镜硬件与中文场景;QA 部分由 LLM 起草;提交系统资源规模不同;leaderboard 不能替代统一预算下的模型对比。