跳转到内容

输入关键词开始搜索

    资料摘要:SLT 2026 SmartGlasses Challenge

    论文摘要更新 2026-08-16置信度 high待阅读原始来源 ↗#语音识别#音频理解#多说话人#基准#易过时

    IEEE SLT 2026 SmartGlasses Challenge 建立了中文第一视角多说话人语音基准:同一四通道眼镜录音同时评估带时间戳、说话人归属的 ASR(TSA-ASR)与长音频问答(SLU),覆盖双人日常对话和 3–8 人会议;结果显示转写、说话人跟踪与声学证据推理是三个不能互相替代的能力。

    🔒 SmartGlasses Challenge 原始论文

    论文 · 官方挑战页 · 评测仓库

    ASR-TTS 论文周报 015 技术路线图
    ASR-TTS 论文周报 015 技术路线图
    • 两个场景、两项任务:Track 1 是平均约 5.2 分钟的双人日常对话,Track 2 是平均约 19 分钟的 3–8 人会议;两者均做 TSA-ASR 和四选一 SLU。
    • 真实第一视角声学条件:定制眼镜两侧镜腿布置四个 MEMS 麦克风;总计 714 会话、106.98 小时,其中 Track 1 为 44.95 小时,Track 2 为 62.03 小时。
    • TSA-ASR 用 tcpCER:以 5 秒 temporal collar 匹配 reference turn,联合惩罚字符替换/删除/插入、说话人归属和时间错位;SLU 用 accuracy。
    • 多人会议断崖式变难:最佳系统 hfchen 在 Track 1/2 的 tcpCER 为 5.23%/27.95%;其余 Track 2 提交均高于 48%。重叠率超过 20% 时,系统平均 tcpCER 达 69.2%。
    • SLU 高分不等于声学理解稳健:最佳系统两轨 accuracy 为 0.888/0.930,但细分后 semantic question 最好,依赖音色、情绪、说话方式等 acoustic evidence 的问题最弱。
    • 评测资产已公开:官方仓库提供 README、示例与 tcpCER 运行脚本;数据去标识化并使用 pseudonymous speaker ID,具体下载与挑战条款仍以官网为准。

    所有语音用 TextGrid 人工标注 speaker ID、timestamp 与普通话转写,并做两轮交叉核验。Dev/Test 的 3,509 个 SLU QA 按 acoustic、semantic、acoustic-semantic joint 约 1:1:1 构造:先由 LLM 辅助起草,再人工核验;Test 额外做两轮 review。

    hfchen 使用 MOSS Transcribe Diarize 架构,将 Whisper-large-v3 encoder 接到 Qwen3-8B,一次预测 speaker label、timestamp 和 transcript,并继续做多说话人 audio-text pretraining。其他团队在四通道平均、beamforming、separation 与直接多通道输入间选择不一;论文明确提醒这些是系统描述,不是受控消融,不能据榜单推断因果。

    • 版本:arXiv:2608.12034v1,2026-08-12;7 页。
    • 数据总量:714 sessions、106.98 h、3,509 QA;Track 1 平均 overlap 7.5%,Track 2 为 13.6%,最高约 35%/45%。
    • 说话人数:Track 2 的平均 tcpCER 随人数由 3 人的 15.5% 上升到 5 人的 49.3%,6–8 人均高于 63%。
    • 局限:单一眼镜硬件与中文场景;QA 部分由 LLM 起草;提交系统资源规模不同;leaderboard 不能替代统一预算下的模型对比。