资料摘要:VoxZip
VoxZip 是面向长音频大模型的 training-free 压缩方法:先用带时间戳 ASR 文本作为语义锚点,将同一时间区间内的音频表示压成少量语义对齐 token;再用时间衰减的累计 attention 分数淘汰低价值 KV cache,分别处理输入冗余和解码期缓存增长。
🔒 VoxZip 原始论文
论文 · MM 2026 DOI · 官方代码
- 第一阶段压输入:外部 ASR 提供 transcript、timestamp 与置信度;文本 embedding 与对应音频时间段融合,低置信锚点被过滤,重复音频 token 被局部汇聚。
- 第二阶段压 KV:解码时累计 token attention,再乘时间衰减,避免早期 token 因累计次数多而永久占优;缓存预算固定时保留近期且持续有贡献的 token。
- 无需再训练主模型:论文在 Qwen3-Omni 上直接插入压缩,覆盖 Vox-Infinity、AudioMarathon、SPIRAL、MMAR、MMSU、MMAU 六个长音频/通用理解 benchmark。
- 激进压缩仍保留主要能力:作者报告 20× 压缩(5% token budget)仍保持超过 90% 的未压缩基线性能;应理解为六基准的作者汇总,不是每个任务都严格超过 90%。
- 工程收益:4× 压缩时吞吐约 1.93×,peak memory 从 235.93 GB 降至 70.68 GB,prefill 从 2.26 s 降至 1.30 s;测试使用 8×A100 80GB、64K context、最多 300 输出 token,并计入 ASR 成本。
- 代码已公开但许可证不清晰:官方仓库包含核心 Python 实现、六类评测脚本与环境说明;根目录未见明确 license,复用前需单独核对。
为什么语义锚点比纯 attention pruning 更适合音频
Section titled “为什么语义锚点比纯 attention pruning 更适合音频”音频帧在局部高度冗余,但语义事件的时间跨度不规则。只按 attention 排名会偏向早期累计优势,也难保证关键词边界不被删。ASR timestamp 把压缩单元从固定窗口变成“词或短语对应的声学区间”,让保留预算更接近语义密度。
VoxZip 没有消灭计算,而是用额外 ASR 换主模型的长上下文成本。噪声、口音、重叠语音会让 anchor 本身错位;对非语音事件、音色、情绪和环境声问题,文本锚点也可能主动丢掉答案所需声学证据。
- 版本:arXiv:2608.08569v1,2026-08-09;10 页;ACM MM 2026,CC BY 4.0 论文许可。
- 代表资源结果:4× 时 peak memory 约降低 3.34×,吞吐提升不与压缩率线性等同。
- 局限:依赖 ASR 时间戳和置信度;audio-text element-wise fusion 较粗;对无文本声学信息可能失真;论文基于单一主干的外推有限。