跳转到内容

输入关键词开始搜索

    资料摘要:VoxZip

    论文摘要更新 2026-08-16置信度 high待阅读原始来源 ↗#音频理解#长上下文#推理优化#语音识别#工具

    VoxZip 是面向长音频大模型的 training-free 压缩方法:先用带时间戳 ASR 文本作为语义锚点,将同一时间区间内的音频表示压成少量语义对齐 token;再用时间衰减的累计 attention 分数淘汰低价值 KV cache,分别处理输入冗余和解码期缓存增长。

    🔒 VoxZip 原始论文

    论文 · MM 2026 DOI · 官方代码

    ASR-TTS 论文周报 015 技术路线图
    ASR-TTS 论文周报 015 技术路线图
    • 第一阶段压输入:外部 ASR 提供 transcript、timestamp 与置信度;文本 embedding 与对应音频时间段融合,低置信锚点被过滤,重复音频 token 被局部汇聚。
    • 第二阶段压 KV:解码时累计 token attention,再乘时间衰减,避免早期 token 因累计次数多而永久占优;缓存预算固定时保留近期且持续有贡献的 token。
    • 无需再训练主模型:论文在 Qwen3-Omni 上直接插入压缩,覆盖 Vox-Infinity、AudioMarathon、SPIRAL、MMAR、MMSU、MMAU 六个长音频/通用理解 benchmark。
    • 激进压缩仍保留主要能力:作者报告 20× 压缩(5% token budget)仍保持超过 90% 的未压缩基线性能;应理解为六基准的作者汇总,不是每个任务都严格超过 90%。
    • 工程收益:4× 压缩时吞吐约 1.93×,peak memory 从 235.93 GB 降至 70.68 GB,prefill 从 2.26 s 降至 1.30 s;测试使用 8×A100 80GB、64K context、最多 300 输出 token,并计入 ASR 成本。
    • 代码已公开但许可证不清晰:官方仓库包含核心 Python 实现、六类评测脚本与环境说明;根目录未见明确 license,复用前需单独核对。

    为什么语义锚点比纯 attention pruning 更适合音频

    Section titled “为什么语义锚点比纯 attention pruning 更适合音频”

    音频帧在局部高度冗余,但语义事件的时间跨度不规则。只按 attention 排名会偏向早期累计优势,也难保证关键词边界不被删。ASR timestamp 把压缩单元从固定窗口变成“词或短语对应的声学区间”,让保留预算更接近语义密度。

    VoxZip 没有消灭计算,而是用额外 ASR 换主模型的长上下文成本。噪声、口音、重叠语音会让 anchor 本身错位;对非语音事件、音色、情绪和环境声问题,文本锚点也可能主动丢掉答案所需声学证据。

    • 版本:arXiv:2608.08569v1,2026-08-09;10 页;ACM MM 2026,CC BY 4.0 论文许可。
    • 代表资源结果:4× 时 peak memory 约降低 3.34×,吞吐提升不与压缩率线性等同。
    • 局限:依赖 ASR 时间戳和置信度;audio-text element-wise fusion 较粗;对无文本声学信息可能失真;论文基于单一主干的外推有限。