ARXIV 2607.20166 · JUL 2026 · 中文全文译稿

Audio-Zero:
Label-Free Self-Evolution
for Fine-Grained Audio Reasoning

Siqian Tong · Xuan Li · Chaozhuo Li · Baolong Bi · Yiwei Wang · Yujun Cai · Shenghua Liu · Chengpeng Hao中国科学院声学研究所 · 中国科学院大学 · 北京智源人工智能研究院 · 中国科学院计算技术研究所 · University of California, Merced · The University of Queensland
01 / LISTEN私有音频四名玩家生成有依据的听觉线索
02 / COMPARE公开历史跨玩家核对事件、顺序与属性
03 / VERIFY找出异常者游戏结果提供无标签可验证奖励
PDF
16 页
Figures
4
Tables
5
Equations
11
References
完整

摘要

大型音频语言模型(LALM)在声学理解方面进展迅速,但在细粒度音频推理上仍有困难,例如识别事件顺序、重复次数与持续时间。现有后训练方法高度依赖昂贵的外部标签,或者只能提供粗粒度语义信号。为弥合这一差距,我们提出 Audio-Zero——LALM 领域首个无标签自进化框架,用于提升细粒度听觉感知与推理能力。Audio-Zero 从无标签音频对比对构造听觉 self-play 游戏:多数玩家听到参考音频,一名异常听者听到细微变体。模型先生成描述自己所听内容的线索,再根据线索间的不一致推断异常听者。由于异常听者由构造过程确定,游戏无需任何人工标注答案即可提供可验证奖励。在 Qwen2-Audio-7B-Instruct 与 Qwen2.5-Omni-7B 上,TREA、MMAU Test-mini 和 MMAR 的实验表明,Audio-Zero 在保留广泛音频理解能力的同时提升了细粒度音频推理。进化过程与诊断分析还显示,在游戏压力下,更细致的听觉描述会自然出现。

1 引言

大型音频语言模型(LALM)已经展现出理解多种音频输入的强大能力,因此成为通用音频理解与推理的一条有前景的路线。然而,高质量监督数据稀缺且难以扩展:音频是连续、跨时间展开的信号,关键声学线索分散在长序列之中,使细粒度标注天然困难。因此,常见的音频描述与音频问答数据集往往依赖匹配较松散的网络抓取描述或粗粒度合成文本,只能覆盖总体语义,却忽略瞬态声音事件、精确持续时间或细微音高变化等时间—声学结构。由此产生一个核心问题:不依赖真实标签、预定义问答对或显式推理轨迹,LALM 能否直接从无标签音频中自行提升细粒度听觉感知与推理?

无需密集人工监督即可提升 LLM 能力的自进化范式,已在文本和视觉领域得到广泛研究。此类方法通常利用环境内在约束或任务自身规则建立自主反馈回路,把模型自产生的输出转化为可验证的优化信号。例如,文本方法可依据符号正确性筛选自生成推理路径,或利用零和博弈动力学绕开人工标注;大型视觉语言模型也能利用具有空间结构的静态证据,在没有人工指导的情况下构造可验证视觉奖励。

图 1|图 1|从外部监督到自进化。现有音频—语言学习范式依赖外部监督或自生成监督;Audio-Zero 则把无标签音频对比对转化为可验证的听觉 self-play 游戏,从游戏结果中得到监督,从而在没有外部标签或推理轨迹的情况下实现自进化。

然而,这些范式无法直接迁移到听觉领域。文本依赖离散符号匹配,视觉允许对全局静态快照进行扫描;音频却天然是一条连续时间流。瞬态声音事件或细微顺序差异等关键声学证据会随时间动态展开,并与背景信号自然混合。因此,连续声学线索不能靠精确匹配或静态检查来验证;无标签音频自我提升框架需要专门面向音频设计的验证机制。

在音频领域内部,已有无监督或弱监督路线尝试缓解标注瓶颈,但面临两个根本问题。第一,自监督表征学习和伪标签驱动的自我提升在细粒度感知上先天不足:粗略事件标签或全局声学摘要已经足以优化常规目标,模型缺乏描述细节的动力。第二,感知不够精确会损害多步逻辑推断,形成结构性的“感知—推理鸿沟”。更关键的是,如果没有可验证的落地机制,用缺乏依据的描述训练会导致级联幻觉与误差累积,让策略递归强化自身的感知错误。强化学习与思维链蒸馏虽能缓解该问题,却仍受制于带标签问答对、教师推理过程或人工编写的任务特定奖励。上述局限共同说明,需要一个通过内生验证同时激励细粒度听觉感知与多步推理的统一无标签框架。

为弥合这一差距,我们提出专为 LALM 设计的首个无标签自进化框架 Audio-Zero。它把无标签成对音频转化为听觉 self-play 游戏:每局中,多数玩家听参考音频,一名异常听者听细微变体。在 Listening 阶段,每位玩家用简短线索描述自己的音频;在 Attribution 阶段,模型比较这些线索并找出异常听者。异常听者身份由游戏构造自动产生,无需人工标注即可提供可验证奖励。Audio-Zero 使用组相对策略优化(GRPO),在线索生成与异常听者识别之间交替训练:更好的线索改善判断,更强的判断压力又推动线索变得更具区分力。

我们在 TREA、MMAU Test-mini 与 MMAR 上评估 Audio-Zero,分别覆盖时间推理、通用音频理解与深层音频推理。在 Qwen2-Audio-7B-Instruct 和 Qwen2.5-Omni-7B 上,Audio-Zero 不仅提升时间推理,也改善声音、音乐和语音类别,表明它并未以牺牲广泛听觉能力为代价换取任务特定收益。本文贡献如下:

  • 提出 Audio-Zero:无需人工撰写的 caption、QA 标签或推理轨迹,即可提升 LALM 的细粒度听觉感知与推理。
  • 设计听觉 self-play 游戏,把无标签音频对比对转化为可验证训练信号,并耦合线索生成与异常听者识别。
  • 仅使用 2,000 对无标签音频,在两个基座、TREA、MMAU Test-mini 和 MMAR 上完成系统实验并取得显著提升。
图 2|图 2|Audio-Zero 总览。Audio-Zero 将无标签听觉学习表述为多轮 self-play 游戏。给定一对无标签对比音频,玩家从不同听觉视角生成线索,裁判则识别异常听者。已知的游戏结果提供可验证奖励,经 GRPO 交替优化 Listening 与 Attribution 策略,使听觉感知和推理逐步提升。

2 Audio-Zero:无标签自进化框架

Audio-Zero 是一种自进化训练框架,无需外部真实标签即可提升 LALM 的细粒度听觉感知与推理。核心思想是把无标签音频对比对变成多人识别游戏:模型先把所听内容转述为语言,再跨多条描述推理并找出异常听者。异常听者身份在构造游戏时由程序指定,充当内生真值,在游戏结构内部产生天然可验证的奖励。该方法不依赖静态标签,而是建立线索生成与逻辑归因相互强化的紧密反馈回路,形成图 2 所示的自主进化轨迹。

2.1 问题定义

πθ\pi_\theta 表示参数为 θ\theta 的预训练 LALM。假设训练集由无标签音频对比对组成:D={(akref,akvar)}k=1K\mathcal D=\{(a_k^{\mathrm{ref}},a_k^{\mathrm{var}})\}_{k=1}^{K}。每对音频共享高层语义,但在事件顺序、重复次数、持续时间、缺失声音或背景场景等方面存在细微声学差异。方法不需要人工转录、QA 标注或推理轨迹。

每个游戏实例都由同一个模型 πθ\pi_\theta 依次扮演 NN 个不同玩家。程序指定异常听者 s{1,,N}s\in\{1,\ldots,N\}:扮演玩家 ss 时,模型以变体音频 avara^{\mathrm{var}} 为私有输入;其余玩家 isi\ne s 都接收参考音频 arefa^{\mathrm{ref}}。在 RR 轮 Listening 中,模型根据各玩家的私有音频和公开历史 HrH^r 生成线索。进入 Attribution 阶段后,模型以裁判视角读取完整线索历史 HR+1H^{R+1} 与参考音频 arefa^{\mathrm{ref}},预测异常听者 s^{1,,N}\hat s\in\{1,\ldots,N\}。目标是通过 GRPO 最大化两个阶段的游戏表现来优化 θ\theta。双奖励设计一方面强化正确归因,另一方面惩罚无信息线索;在两个目标间交替优化,期望得到能在线索生成与逻辑识别之间建立协作反馈回路的最优参数 θ\theta^*

2.2 听觉 Self-play 游戏

每个训练步抽取一对 (amathrmref,amathrmvar)(a^{mathrm{ref}},a^{mathrm{var}}),并实例化一个包含 NN 名虚拟玩家的游戏。异常听者 ssimoperatornameUniform(1,ldots,N)ssimoperatorname{Uniform}({1,ldots,N}) 均匀采样,对模型隐藏、仅训练环境可知。玩家 ii 接收的音频为:

ai={avar,i=saref,is(1)a_i=\begin{cases}a^{\mathrm{var}},&i=s\\a^{\mathrm{ref}},&i\ne s\end{cases}\tag{1}

游戏由两个相互耦合的阶段组成。

Listening 阶段

在 Listening 阶段,每位玩家 iin1,ldots,Niin{1,ldots,N} 在每轮 rin1,ldots,Rrin{1,ldots,R} 中,根据自己的音频与共享公开历史生成自然语言线索 zirz_i^r

zirπθ ⁣(ai,Hir)(2)z_i^r\sim\pi_\theta\!\left(\cdot\mid a_i,H_i^r\right)\tag{2}

合格的描述应传达具体听觉观察,包括声音事件类型、时间顺序、重复次数、声学属性和场景上下文,同时不得直接透露说话者拿到的是参考还是变体音频。这一约束迫使模型从音频中提取细粒度感知细节,把它们组织成有信息量的自然语言,并结合公开历史策略性地判断应该透露什么。

生成全部 N×RN\times R 条描述后,将完整线索集合 Z={zir}i[N],r[R]Z=\{z_i^r\}_{i\in[N],r\in[R]} 汇总并交给 Attribution 阶段。

Attribution 阶段

在 Attribution 阶段,模型扮演裁判。给定参考音频 amathrmrefa^{mathrm{ref}} 和完整描述集合 ZZ,它预测异常听者:

s^πθ ⁣(aref,Z)(3)\hat{s}\sim\pi_\theta\!\left(\cdot\mid a^{\mathrm{ref}},Z\right)\tag{3}

这要求更高阶的推理:模型必须跨玩家比较描述,检测语义不一致,例如某位玩家说敲门发生在说话之前、而其他人说顺序相反;模型还要判断这种不一致究竟来自真实感知差异,还是仅仅因为措辞含糊。

两个阶段的耦合是 Audio-Zero 的结构核心:Listening 阶段产生证据,Attribution 阶段检验证据是否具有足够区分力来解开游戏。

2.3 无标签奖励与自进化目标

Audio-Zero 的两个阶段各有专用奖励信号;二者都完全来自游戏机制,不需要外部标注。

归因奖励

归因奖励衡量扮演裁判的模型能否根据完整描述历史正确识别异常听者,定义为二元游戏结果:

Ratt=I[s^=s](4)R_{\mathrm{att}}=\mathbb I[\hat{s}=s]\tag{4}

真值 ss 在构造游戏时由环境生成,从不作为输入提供给模型。识别正确得到奖励 1,错误预测得到 0。

Listening 奖励

Listening 奖励衡量模型是否捕捉准确、细粒度的听觉细节,并以在游戏中具有策略效果的描述表达出来。为此,奖励把内容分数与动态博弈惩罚结合起来。

  • 内容效用:奖励基于具体听觉证据(声音事件、时间关系、声学属性)、跨轮不重复且不泄露身份的线索。该项由规则评分器计算:检查音频描述词是否出现,并惩罚逐字重复和禁用短语。
  • 投票感知惩罚:根据裁判的归因结果调整奖励。令 viv_i 表示玩家 ii 获得的归因票数,VV 表示总票数。异常玩家若因轻易暴露身份而获得过多票数会受罚;普通玩家若因线索不当而引发无端怀疑,也受到相同惩罚。
Rlisti=Rutilityiλvimax(1,V1)(5)R_{\mathrm{list}}^i=R_{\mathrm{utility}}^i-\lambda\cdot\frac{v_i}{\max(1,V-1)}\tag{5}

其中 lambda>0lambda>0 控制惩罚强度。这使描述生成具有策略性:好的描述应有事实依据、信息充分并有助于揭示真正的异常听者,而不是让自己遭到无端怀疑。

在交替优化期间,当前激活的奖励定义为:

R={Rlisti,玩家 i 的 Listening 阶段Ratt,Attribution 阶段(6)R=\begin{cases}R_{\mathrm{list}}^i,&\text{玩家 }i\text{ 的 Listening 阶段}\\R_{\mathrm{att}},&\text{Attribution 阶段}\end{cases}\tag{6}

这种分离可防止非激活阶段的梯度干扰当前更新。

2.4 交互式优化

Audio-Zero 使用组相对策略优化(GRPO)作为底层强化学习算法。给定 prompt xx(音频输入与游戏上下文),GRPO 从旧策略 πθold(x)\pi_{\theta_{\mathrm{old}}}(\cdot\mid x) 采样一组 GG 个 completion {yj}j=1G\{y_j\}_{j=1}^{G},赋予奖励 {Rj}j=1G\{R_j\}_{j=1}^{G},再计算组归一化优势:

Aj=Rjmean({Rj}j=1G)std({Rj}j=1G)+ε(7)A_j=\frac{R_j-\operatorname{mean}(\{R_j\}_{j=1}^{G})}{\operatorname{std}(\{R_j\}_{j=1}^{G})+\varepsilon}\tag{7}

策略更新最大化带裁剪的替代目标,同时加入相对于冻结参考策略 pimathrmrefpi_{mathrm{ref}} 的 KL 散度惩罚:

L(θ)=E ⁣[1Gj=1Gmin ⁣(rj(θ)Aj,clip(rj(θ),1±ϵ)Aj)]βDKL(πθπref)(8)\mathcal L(\theta)=\mathbb E\!\left[\frac1G\sum_{j=1}^{G}\min\!\left(r_j(\theta)A_j,\operatorname{clip}(r_j(\theta),1\pm\epsilon)A_j\right)\right]-\beta D_{\mathrm{KL}}(\pi_\theta\|\pi_{\mathrm{ref}})\tag{8}

其中重要性采样比为:

rj(θ)=πθ(yjx)πθold(yjx)(9)r_j(\theta)=\frac{\pi_\theta(y_j\mid x)}{\pi_{\theta_{\mathrm{old}}}(y_j\mid x)}\tag{9}

这里,jj 是 GRPO 组内 completion 的索引,ii 是听觉 self-play 游戏中的玩家角色索引。两个阶段中的 prompt、completion 与奖励含义不同:

  • Listening phasex=(ai,Hir)x=(a_i,H_i^r)yjy_j 是玩家 ii 在当前上下文中的候选线索,Rj=Rmathrmlisti(yj)R_j=R_{mathrm{list}}^i(y_j)
  • Attribution phasex=(amathrmref,Z)x=(a^{mathrm{ref}},Z)yjy_j 是异常听者预测,Rj=Rmathrmatt(yj)R_j=R_{mathrm{att}}(y_j)

交替优化

训练在每个更新步交替执行两个阶段。Attribution phase 把当前策略生成的线索视为固定上下文,只针对 RmathrmattR_{mathrm{att}} 优化模型,使其学会从现有证据识别异常听者;Listening phase 只针对 RmathrmlistiR_{mathrm{list}}^i 优化,并把归因结果作为面向各玩家线索生成的投票感知反馈。

这种交替形成自增强回路。更强的归因能力提高线索质量门槛,因为只有真正有区分力的线索才能带来正确识别;更高质量的线索又提供更丰富的证据,让归因训练继续变强。两个阶段都不会单独到达固定点,而是在整个训练过程中共同进化。

3 实验与分析

3.1 实验设置

训练数据。 我们用成对音频偏好数据集 Audio-Alpaca 实例化 Audio-Zero。每条样本含语义层面相同、但可能在事件顺序、事件缺失、重复或声学质量上不同的 chosen 与 rejected 音频。我们从全集采样并筛选 2,000 对用于 post-training。该数据集只是无标签听觉对比的实用来源;选用这一数据集属于实验实例,并非方法要求。

模型。 我们把 Audio-Zero 应用于两个基座:强音频语言模型 Qwen2-Audio-7B-Instruct,以及统一 omni-modal 模型 Qwen2.5-Omni-7B。

评测基准。 我们用选择题(MCQ)准确率在两个通用音频推理基准和一个与训练任务密切相关的细粒度基准上评测。MMAU Test-mini 含 1,000 道题,覆盖声音、音乐与语音;MMAR 评估语音、音频、音乐及混合模态音频的深层推理;TREA 聚焦时间推理,含顺序、计数、时长三个子集,每个 200 题。

实现细节。 除非另有说明,每局使用 N=4N=4 名玩家、R=2R=2 轮 Listening。GRPO 每个 prompt 采样 G=6G=6 个 completion,学习率为 1×1051\times10^{-5},使用 bf16 精度,KL 正则系数 β=0.04\beta=0.04。更多超参数见附录 A。

3.2 主要结果:提升推理且不损害通用音频能力

表 1|跨多模态音频基准的综合评估。粗体表示每个基座的最佳表现;原文下划线表示所有基线中的最佳表现。
方法MMAU·声音MMAU·音乐MMAU·语音MMAU·平均MMAR·声音MMAR·音乐MMAR·语音MMAR·平均TREA·顺序TREA·计数TREA·时长TREA·平均
Qwen2-Audio|Base Policy60.9658.6852.8557.5046.6731.5540.8241.2059.0027.5035.5040.67
Qwen2-Audio|R1-AQA63.0659.2854.6559.0047.2734.9543.5444.5062.5028.5043.0044.67
Qwen2-Audio|Audio-Thinker63.6658.6956.4659.6047.8838.3546.2646.8064.5029.5045.0046.33
Qwen2-Audio|AQA-TTRL61.5658.9853.7558.1046.6733.0142.1842.2059.5028.0037.0041.50
Qwen2-Audio|Audio-CoT61.2658.3853.7557.8046.0631.5541.5041.5057.5026.0034.0039.17
Qwen2-Audio|Audio-Zero64.5658.6958.3660.5048.4841.2647.9649.1066.5030.0047.5048.00
Qwen2.5-Omni|Base Policy70.5768.2663.0668.3056.3647.0959.8656.2090.5058.5061.0070.00
Qwen2.5-Omni|R1-AQA76.5870.6670.2772.5063.6450.4960.5460.8092.0061.0063.5072.17
Qwen2.5-Omni|Audio-Thinker79.2871.5672.9774.6066.6753.4061.9063.7092.5063.0064.0073.17
Qwen2.5-Omni|AQA-TTRL72.6769.4666.6769.6059.3948.5460.2057.5091.0059.5062.0070.83
Qwen2.5-Omni|Audio-CoT71.4768.8666.3768.9057.5847.5759.8656.8089.0057.0059.0068.33
Qwen2.5-Omni|Audio-Zero81.6872.7574.4776.3069.7055.8360.5466.2093.0064.5064.5074.00

为全面评估 Audio-Zero,我们比较了不同学习范式下的代表性基线。依赖标签的组包括 R1-AQA 与 Audio-Thinker,它们分别代表通过真值答案优化的强强化学习与显式推理基线;无标签组包括 AQA-TTRL(利用多数共识伪标签反馈进行 test-time RL)和 Audio-CoT(用 prompt 鼓励中间推理、无需训练)。所有方法均在两个基座上评测。

如表 1 所示,Audio-Zero 在三个基准和两个基座上都取得最佳总体表现,不仅超过全部无标签 test-time 方法,也超过强依赖标签的训练基线。仅用 2,000 对无标签对比音频,Qwen2-Audio 的 MMAU 平均准确率达到 60.50%,MMAR 达到 49.10%,较基座分别提高 3.00 和 7.90 个百分点;在更强的 Qwen2.5-Omni 上,MMAU 与 MMAR 平均分分别提高 8.00 和 10.00 个百分点。这说明把无标签音频对转成互动 self-play 游戏可以释放潜在感知能力。

增益在明确考查细粒度、多步时间推理的 TREA 上尤其明显:Qwen2-Audio 在顺序与时长子集上分别达到 66.50% 和 47.50%。这同时体现双奖励框架的作用:普通无标签方法容易得到模糊反馈,而 Audio-Zero 在两个优化阶段之间建立动态博弈约束。Attribution 裁判依据游戏结果迫使 Listening 阶段生成更详细、有依据的线索,互动竞争因此驱动模型捕捉并处理更细粒度的声学信息。

3.3 消融实验

Audio-Zero 的核心设计旨在让声学感知与多步推理联合自进化。为验证这一循环是否需要所有组件协同,我们在两个基座上评测五种结构变体:(1)不含游戏的普通 GRPO;(2)仅 Listening;(3)仅 Attribution;(4)移除投票感知反馈;(5)按静态单向顺序优化两个阶段的顺序训练。

表 2|两个基座在下游基准上的消融实验。List.、Attr. 与 Inter. 分别表示 Listening 阶段、Attribution 阶段与投票感知交互反馈。
变体ListeningAttributionInteractionQwen2·TREAQwen2·MMAUQwen2·MMARQwen2.5·TREAQwen2.5·MMAUQwen2.5·MMAR
Vanilla GRPO(无游戏)44.6759.0044.5072.1772.5060.80
仅 Listening45.3359.4045.8072.5073.3061.90
仅 Attribution45.8359.1047.2072.8372.7063.10
无投票感知反馈45.5059.2046.8072.6772.9062.70
顺序训练46.8360.1047.9073.3374.8064.50
Audio-Zero(完整)48.0060.5049.1074.0076.3066.20

如表 2 所示,移除任一组件都会明显掉点。单独隔离 Listening 或 Attribution 只能带来微弱改进,说明单一角色更新无法维持持续自进化循环。尤其是关闭投票感知反馈后,TREA 从 Qwen2 上的 48.00% 降至 45.50%,在 Qwen2.5 上从 74.00% 降至 72.67%,表明集体投票能抑制零散幻觉并提供更可靠反馈。顺序训练与完整框架的差距进一步说明交替优化是核心:两个角色轮流更新、持续相互抬高标准,迫使 Listening 模型在推理中给出越来越精确、细粒度的声学事实。

3.4 自进化动态

我们进一步分析 Audio-Zero 在训练中是否呈现自进化。从第 0 到第 100 次迭代,以固定间隔让当前策略与冻结的初始策略进行 self-play,并交替分配普通听者与异常听者角色;同时跟踪游戏胜率、Listening 线索平均长度和外部音频推理基准表现。

图 3|训练迭代中的自进化动态。(a)不同角色分配下的不对称游戏胜率;(b)生成音频线索的平均长度;(c)向下游音频基准迁移的推理表现。

图 3 呈现三种趋势。第一,两种角色分配下的游戏胜率总体上升,虽有局部波动,说明模型识别细微听觉差异、根据生成证据推理的能力持续提高。第二,线索长度在早期上升后趋于稳定;波动说明策略在信息量与游戏有效性之间平衡,而非单纯写得更长。第三,TREA、MMAR 与 MMAU Test-mini 都总体上行,且细粒度基准增益更大。这些结果表明 self-play 游戏推动渐进式自进化,所得能力也能迁移到外部音频推理基准。

3.5 细粒度听觉描述的涌现

我们分析游戏压力是否真的促使模型捕捉细粒度听觉细节,而不只是提高最终准确率。训练过程中跟踪五项指标:不同事件计数、时间关系计数、数量表达频率、声学属性密度与模糊率。详细定义和匹配规则见附录 C。

图 4|训练迭代中所生成 Listening 描述的诊断分析。适用指标先按长度归一化,再各自 min-max 缩放到 [0,1][0,1]。除 Vagueness 越低越具体外,其余指标越高表示细粒度听觉证据越强。

如图 4 所示,所有细节相关指标总体上升,而 Vagueness 持续下降。Event Evidence 与 Temporal Relation 表明模型逐渐从泛泛的音频摘要转向提及具体声音事件并将其组织进时间结构的描述;Quantity Expression 的增长说明对重复和计数细节更敏感;Acoustic Attribute 的增长说明模型更关注响度、距离、清晰度与声学纹理等属性。与此同时,模型更少依赖“某些声音”“各种噪声”之类指代不足的表达。

由于各指标独立缩放,我们关注其训练中的演化轨迹,而不比较不同指标的绝对值。总体而言,Audio-Zero 的 self-play 并不只是鼓励更长输出;归因压力会推动模型生成事件更丰富、时间依据更明确、声学细节更多且跨玩家更有区分力的描述,说明细粒度听觉细节感知是在自进化过程中涌现的。

3.6 案例研究

表 3 展示 Audio-Zero 在一个时间推理案例上的自进化。阶段 1 的基座策略描述粗糙且信息不足,裁判只能依赖表层事件重合并判断错误;阶段 2 开始描述基本事件顺序,裁判能发现局部顺序不一致,但推理仍浅;阶段 3 生成包含事件顺序、重复次数、声学强度和背景上下文的更细粒度证据,并以多数时间线交叉核对每位玩家,定位不一致后正确识别异常听者。

表 3|复杂时间关系推理上的行为涌现。游戏压力使模型从被动语义累积器(阶段 1)转成把事件组织为严格因果和时间线的听觉侦探(阶段 3)。
阶段听觉证据与裁判推理
音频输入多数参考听者:[玻璃破碎 → 狗叫 → 关门];异常听者:[狗叫 → 玻璃破碎 → 关门]
阶段 1:Base Policy参考线索:“室内场景里有几种响亮声音,包括一只狗和某种东西破碎。” 异常线索:“我听到狗叫,背景里还有某种尖锐噪声。” 裁判:“两条描述都提到狗和尖锐破碎声,但都没有可靠顺序,不一致之处不清楚。” 猜测:玩家 1(错误)。
阶段 2:训练中期参考线索:“先有尖锐的玻璃破碎声,然后狗叫,接近结尾时门砰地关上。” 异常线索:“先有狗叫,然后玻璃破碎,门砰地关上。” 裁判:“多数描述把玻璃放在狗叫之前,一条描述相反,说明存在时间不匹配。” 猜测:玩家 2(正确)。
阶段 3:Audio-Zero参考线索:“嘈杂室内有人交谈;先听到尖锐玻璃破碎声,约 1 秒后两声短促狗叫,最后是沉重关门声。” 异常线索(伪装):“嘈杂室内有人交谈,同时尖锐玻璃破碎、响亮狗叫和沉重关门声接连出现。” 裁判:“玩家 2 加入背景并匹配核心事件词来混入多数,却完全省略相对时间线。多数描述明确给出 [玻璃 → 1 秒 → 狗],相同声学事实下的模糊对齐暴露了异常。” 结论:玩家 2(正确)。

该案例说明 Audio-Zero 通过自进化同时改善了 Listening 阶段的细节感知与 Attribution 阶段的推理。

4 相关工作

大型音频语言模型。 LALM 把声学编码器与语言模型连接起来,以支持以音频为中心的指令遵循、推理和语音交互。Qwen2-Audio 跨语音、声音和音乐任务训练统一音频语言模型;Qwen3-Omni、Qwen3.5-Omni 将其扩展到统一多模态交互;GLM-4-Voice、MiniCPM-o 4.5 也探索理解、生成与语音交互。这些模型虽奠定强基座,但训练或适配往往依赖音频—文本监督、任务标注或指令数据。细粒度听觉细节系统标注昂贵,因此时间顺序、计数、时长和深度音频推理仍有提升空间,需要减少内容标签依赖的 post-training 方法。

音频模型的 post-training 与 self-training。 SI-SDA 用自改进与伪标签过滤适配无标签语音;AQA-TTRL 用多数投票伪标签对音频问答做 test-time RL;合成 bootstrap 方法生成机器撰写的音频—文本对,以缓解幻觉并扩充数据。它们减少了监督需求,但通常仍模仿伪标签、利用合成监督或适配特定测试分布。Audio-Zero 改为构造可验证互动环境:模型无需把自己的伪答案当标签,成败由生成线索能否识别隐藏异常听者决定。

LLM 与 VLM 的 self-play 和自进化。 在文本领域,以 SPIN 为代表的框架通过迭代生成与判别让模型自我提升,随后被扩展到零数据 self-training,以及策略搜索、长上下文推理、多智能体等专用环境,智能体通过自导探索或相互反馈自主升级。Visual Self-Play、Vision-Zero 等视觉语言方法则表明,结构化视觉互动可把无标签多模态差异转成可验证学习信号。Audio-Zero 把这一思路带到音频的瞬态、时间性差异上。

5 结论

本文提出 Audio-Zero:一种用于提升大型音频语言模型细粒度听觉感知与推理的无标签自进化框架。它不依赖人工转写、问答标签或推理轨迹,而是把无标签音频对比对转成听觉 self-play 游戏,让模型在生成 Listening 描述与执行 Attribution 推理、识别异常听者之间交替。两个 7B 基座在通用和细粒度基准上均稳定提升:Qwen2-Audio 与 Qwen2.5-Omni 在 TREA 上分别提高 7.33 和 4.00 个百分点,MMAR 分别提高 7.90 和 10.00,MMAU Test-mini 分别提高 3.00 和 8.00。进一步分析表明,游戏反馈促成了事件更丰富、声学细节更多且区分力更强的描述。无标签音频对比上的 self-play 因而是规模化 post-training、增强 LALM 细粒度听觉推理的一条有前景路线。

影响声明

本文工作的目标是推动机器学习领域发展。我们的工作可能带来许多社会影响,但我们认为其中没有哪一项需要在此特别强调。

参考文献

Debarpan Bhattacharya, Apoorva Kulkarni, and Sriram Ganapathy. Benchmarking and confidence
evaluation of lalms for temporal reasoning. arXiv preprint arXiv:2505.13115, 2025.

Zixiang Chen, Yihe Deng, Huizhuo Yuan, Kaixuan Ji, and Quanquan Gu. Self-play fine-tuning
converts weak language models to strong language models. arXiv preprint arXiv:2401.01335,
2024.
Yunfei Chu, Jin Xu, Qian Yang, Haojie Wei, Xipin Wei, Zhifang Guo, Yichong Leng, Yuanjun Lv,
Jinzheng He, Junyang Lin, et al. Qwen2-audio technical report. arXiv preprint arXiv:2407.10759,
2024.
Junbo Cui, Bokai Xu, Chongyi Wang, Tianyu Yu, Weiyue Sun, Yingjing Xu, Tianran Wang, Zhihui
He, Wenshuo Ma, Tianchi Cai, et al. Minicpm-o 4.5: Towards real-time full-duplex omni-modal
interaction. arXiv preprint arXiv:2604.27393, 2026.
Soham Deshmukh, Benjamin Elizalde, Rita Singh, and Huaming Wang. Pengi: An audio language
model for audio tasks. Advances in Neural Information Processing Systems, 36:18090–18108,
2023.
Jiajun Fan, Roger Ren, Jingyuan Li, Rahul Pandey, Prashanth Gurunath Shivakumar, Ivan Bulyko,
Ankur Gandhe, Ge Liu, and Yile Gu. Incentivizing consistent, effective and scalable reasoning
capability in audio llms via reasoning process rewards. arXiv preprint arXiv:2510.20867, 2025.
Yicheng He, Chengsong Huang, Zongxia Li, Jiaxin Huang, and Yonghui Yang. Visplay: Self-evolving
vision-language models from images. arXiv preprint arXiv:2511.15661, 2025.
Chengsong Huang, Wenhao Yu, Xiaoyang Wang, Hongming Zhang, Zongxia Li, Ruosen Li, Jiaxin
Huang, Haitao Mi, and Dong Yu. R-zero: Self-evolving reasoning llm from zero data. arXiv
preprint arXiv:2508.05004, 2025.
Chun-Yi Kuan and Hung-yi Lee. From alignment to advancement: Bootstrapping audio-language
alignment with synthetic data. IEEE Transactions on Audio, Speech and Language Processing,
2025.
Sonal Kumar, Šimon Sedláˇcek, Vaibhavi Lokegaonkar, Fernando López, Wenyi Yu, Nishit Anand,
Hyeonggon Ryu, Lichang Chen, Maxim Pliˇcka, Miroslav Hlaváˇcek, et al. Mmau-pro: A chal-
lenging and comprehensive benchmark for holistic evaluation of audio general intelligence. arXiv
preprint arXiv:2508.13992, 2025.
Gang Li, Jizhong Liu, Heinrich Dinkel, Yadong Niu, Junbo Zhang, and Jian Luan. Reinforcement
learning outperforms supervised fine-tuning: A case study on audio question answering. arXiv
preprint arXiv:2503.11197, 2025.
Bo Liu, Leon Guertler, Simon Yu, Zichen Liu, Penghui Qi, Daniel Balcells, Mickel Liu, Cheston
Tan, Weiyan Shi, Min Lin, et al. Spiral: Self-play on zero-sum games incentivizes reasoning via
multi-agent multi-turn reinforcement learning. arXiv preprint arXiv:2506.24119, 2025a.
Bo Liu, Chuanyang Jin, Seungone Kim, Weizhe Yuan, Wenting Zhao, Ilia Kulikov, Xian Li, Sainbayar
Sukhbaatar, Jack Lanchantin, and Jason Weston. Spice: Self-play in corpus environments improves
reasoning. arXiv preprint arXiv:2510.24684, 2025b.
Ziyang Ma, Zhuo Chen, Yuping Wang, Eng-Siong Chng, and Xie Chen. Audio-cot: Exploring
chain-of-thought reasoning in large audio language model. In 2025 IEEE Automatic Speech
Recognition and Understanding Workshop (ASRU), pp. 1–6. IEEE, 2025a.
Ziyang Ma, Yinghao Ma, Yanqiao Zhu, Chen Yang, Yi-Wen Chao, Ruiyang Xu, Wenxi Chen,
Yuanzhe Chen, Zhuo Chen, Jian Cong, et al. Mmar: A challenging benchmark for deep reasoning
in speech, audio, music, and their mix. arXiv preprint arXiv:2505.13032, 2025b.
Navonil Majumder, Chia-Yu Hung, Deepanway Ghosal, Wei-Ning Hsu, Rada Mihalcea, and Soujanya
Poria. Tango 2: Aligning diffusion-based text-to-audio generations through direct preference
optimization. In Proceedings of the 32nd ACM International Conference on Multimedia, pp.
564–572, 2024.

Xinhao Mei, Chutong Meng, Haohe Liu, Qiuqiang Kong, Tom Ko, Chengqi Zhao, Mark D Plumbley,
Yuexian Zou, and Wenwu Wang. Wavcaps: A chatgpt-assisted weakly-labelled audio captioning
dataset for audio-language multimodal research. IEEE/ACM Transactions on Audio, Speech, and
Language Processing, 32:3339–3354, 2024.
S Sakshi, Utkarsh Tyagi, Sonal Kumar, Ashish Seth, Ramaneswaran Selvakumar, Oriol Nieto,
Ramani Duraiswami, Sreyan Ghosh, and Dinesh Manocha. Mmau: A massive multi-task audio
understanding and reasoning benchmark. arXiv preprint arXiv:2410.19168, 2024.
Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang,
Mingchuan Zhang, YK Li, Yang Wu, et al. Deepseekmath: Pushing the limits of mathemat-
ical reasoning in open language models. arXiv preprint arXiv:2402.03300, 2024.
Yi-Jen Shih, Desh Raj, Chunyang Wu, Wei Zhou, SK Bong, Yashesh Gaur, Jay Mahadeokar, Ozlem
Kalinli, and Mike Seltzer. Can speech llms think while listening? arXiv preprint arXiv:2510.07497,
2025.
Changli Tang, Wenyi Yu, Guangzhi Sun, Xianzhao Chen, Tian Tan, Wei Li, Lu Lu, Zejun Ma,
and Chao Zhang. Salmonn: Towards generic hearing abilities for large language models. In
International Conference on Learning Representations, volume 2024, pp. 16607–16629, 2024.
Qwen Team. Qwen3. 5-omni technical report. arXiv preprint arXiv:2604.15804, 2026.
Jingqi Tong, Jixin Tang, Hangcheng Li, Yurong Mou, Ming Zhang, Jun Zhao, Yanbo Wen, Fan Song,
Jiahao Zhan, Yuyang Lu, et al. Game-rl: Synthesizing multimodal verifiable game data to boost
vlms’ general reasoning. arXiv preprint arXiv:2505.13886, 2025.
Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, and Helen Meng. Emotion-
thinker: Prosody-aware reinforcement learning for explainable speech emotion reasoning. arXiv
preprint arXiv:2601.15668, 2026.
Qinsi Wang, Bo Liu, Tianyi Zhou, Jing Shi, Yueqian Lin, Yiran Chen, Hai Helen Li, Kun Wan, and
Wentian Zhao. Vision-zero: Scalable vlm self-improvement via strategic gamified self-play. arXiv
preprint arXiv:2509.25541, 2025a.
Shaobo Wang, Zhengbo Jiao, Zifan Zhang, Yilang Peng, Xu Ze, Boyu Yang, Wei Wang, Hu Wei, and
Linfeng Zhang. Socratic-zero: Bootstrapping reasoning via data-free agent co-evolution. arXiv
preprint arXiv:2509.24726, 2025b.
Shaowen Wang, Xinyuan Chen, and Yao Xu. Self-improvement for audio large language model using
unlabeled speech. arXiv preprint arXiv:2507.20169, 2025c.
Shu Wu, Chenxing Li, Wenfu Wang, Hao Zhang, Hualei Wang, Meng Yu, and Dong Yu. Audio-
thinker: Guiding large audio language model when and how to think via reinforcement learning. In
Proceedings of the AAAI Conference on Artificial Intelligence, volume 40, pp. 33962–33970, 2026.
Fangzhi Xu, Hang Yan, Chang Ma, Haiteng Zhao, Qiushi Sun, Kanzhi Cheng, Junxian He, Jun
Liu, and Zhiyong Wu. Genius: A generalizable and purely unsupervised self-training framework
for advanced reasoning. In Proceedings of the 63rd Annual Meeting of the Association for
Computational Linguistics (Volume 1: Long Papers), pp. 13153–13167, 2025a.
Jin Xu, Zhifang Guo, Jinzheng He, Hangrui Hu, Ting He, Shuai Bai, Keqin Chen, Jialin Wang, Yang
Fan, Kai Dang, Bin Zhang, Xiong Wang, Yunfei Chu, and Junyang Lin. Qwen2.5-omni technical
report, 2025b.
Jin Xu, Zhifang Guo, Hangrui Hu, Yunfei Chu, Xiong Wang, Jinzheng He, Yuxuan Wang, Xian Shi,
Ting He, Xinfa Zhu, et al. Qwen3-omni technical report. arXiv preprint arXiv:2509.17765, 2025c.
Chih-Kai Yang, Neo Ho, Yen-Ting Piao, and Hung-yi Lee. Sakura: On the multi-hop reason-
ing of large audio-language models based on speech and audio information. arXiv preprint
arXiv:2505.13237, 2025a.

Runyan Yang, Yuke Si, Yingying Gao, Junlan Feng, Chao Deng, and Shilei Zhang. Teaching audio
models to reason: A unified framework for source-and layer-wise distillation. In ICASSP 2026-
2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp.
15357–15361. IEEE, 2026.
Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, and Fei
Huang. Spell: Self-play reinforcement learning for evolving long-context language models. arXiv
preprint arXiv:2509.23863, 2025b.
Eric Zelikman, Yuhuai Wu, Jesse Mu, and Noah Goodman. Star: Bootstrapping reasoning with
reasoning. Advances in Neural Information Processing Systems, 35:15476–15488, 2022.
Aohan Zeng, Zhengxiao Du, Mingdao Liu, Kedong Wang, Shengmin Jiang, Lei Zhao, Yuxiao Dong,
and Jie Tang. Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot. arXiv
preprint arXiv:2412.02612, 2024.
Haoyu Zhang, Jiaxian Guo, Yusuke Iwasawa, and Yutaka Matsuo. Aqa-ttrl: Self-adaptation in audio
question answering with test-time reinforcement learning. arXiv preprint arXiv:2510.05478, 2025.
Andrew Zhao, Yiran Wu, Tong Wu, Quentin Xu, Yang Yue, Matthieu Lin, Shenzhi Wang, Qingyun
Wu, Zilong Zheng, and Gao Huang. Absolute zero: Reinforced self-play reasoning with zero data.
Advances in Neural Information Processing Systems, 38:105816–105879, 2026.

附录

A 更多实现细节

A.1 训练数据构造

我们使用 Audio-Alpaca 实例化 Audio-Zero。该成对音频偏好数据集的每条样本都包含一个 prompt、一段 chosen audio 和一段 rejected audio。我们把后两者视为音频对比对 (amathrmref,amathrmvar)(a^{mathrm{ref}},a^{mathrm{var}});两段音频在 prompt 层面语义相同,但可能在事件顺序、事件增减、重复、声学质量或背景场景上不同。

我们从全集采样并筛选 2,000 对用于 post-training。音频无法加载、时长过短或过长而不利于稳定 batching、或者经人工或自动检查后近乎重复的样本会被移除。所有选中音频重采样至 16 kHz,并在训练时截断或填充至固定时长。该数据仅作为无标签听觉对比来源;caption、问答标签和推理轨迹均不作为监督。

A.2 游戏配置

除非另有说明,每局使用 N=4N=4 名玩家和 R=2R=2 轮 Listening。每局均匀采样一名异常听者,使其接收 amathrmvara^{mathrm{var}},其余玩家接收 amathrmrefa^{mathrm{ref}}。模型依次扮演全部玩家,每轮为每位玩家生成一条线索;全部线索生成后,再扮演裁判,根据完整历史预测异常听者。

异常听者身份从不作为输入提供给模型,只由环境用于计算归因奖励。因此,训练信号在构造上可验证,同时独立于人工内容标签。

A.3 奖励实现

归因奖励实现为二元正确性信号:

Ratt=I[s^=s](10)R_{\mathrm{att}}=\mathbb I[\hat{s}=s]\tag{10}

Listening 描述的奖励把内容效用与投票感知惩罚结合起来。分配给玩家 ii 的总奖励形式化为:

Rlisti=Rutilityiλvimax(1,V1)(11)R_{\mathrm{list}}^i=R_{\mathrm{utility}}^i-\lambda\cdot\frac{v_i}{\max(1,V-1)}\tag{11}

其中 viv_i 是玩家 ii 获得的归因票数,V=G×NV=G\times N 是总投票数,λ\lambda 为投票惩罚系数,实验设为 0.6。自动规则评分器计算 RutilityiR_{\mathrm{utility}}^i:奖励具体听觉事件、时间关系、数量表达、声学属性与场景上下文,惩罚过度模糊、身份泄露和跨轮重复。投票感知惩罚抑制让某玩家显得可疑的线索,鼓励信息充分且有区分力、又不直接泄露隐藏角色的描述。

A.4 GRPO 超参数

表 4|Audio-Zero post-training 的主要超参数。
超参数取值
玩家数 N4
Listening 轮数 R2
GRPO completions G6
训练音频对2,000
学习率1×10⁻⁵
KL 系数 βKL0.04
投票惩罚 λ0.6
精度bfloat16
优化器 / TrainerGRPO

B 评测协议

所有模型均以选择题准确率评测。MMAU Test-mini 报告 Sound、Music、Speech 子集及总体平均;TREA 报告 Order、Count、Duration;MMAR 报告 Sound、Music、Speech,并对包含混合模态样本在内的完整基准计算总分。

每道题要求模型只输出选项字母或基准格式规定的完整选项文本。生成采用 greedy decoding,不进行采样。所有方法使用相同评测脚本与答案提取规则,以保证公平比较。

C 诊断指标

为分析训练中是否涌现细粒度听觉描述,我们在 Listening 线索上计算五项诊断指标。适用的特征指标先按长度归一化,再 min-max 缩放到 [0,1][0,1] 供图 4 展示。

表 5|分析 Listening 阶段描述的诊断指标。
指标定义目标示例
不同事件计数一条线索中提到的不同听觉事件词数量;衡量是否描述具体事件,而非泛泛音频内容。speech、footsteps、knock、music、glass shattering
时间关系计数事件之间明确顺序关系的数量;衡量是否把事件组织进时间结构。after、before、followed by、then、first
数量表达频率数量或重复表达的频率;衡量是否捕捉计数相关听觉细节。twice、repeated、several、multiple、two barks
声学属性密度声学或听觉属性词的密度;衡量是否描述音质和感知属性。loud、faint、muffled、distant、clear、sharp、heavy
模糊率含模糊或指代不足短语的线索占比;越低表示越具体。some sounds、various noises、something happens

D Prompt 模板

下面以结构化形式给出训练时使用的精确输入模板 wrapper。

D.1 Listening 阶段指令模板

模型被要求描述当前玩家听到的内容,但不得泄露隐藏角色;prompt 强调事件、顺序、重复、声学属性和背景场景等具体听觉证据。

[系统指令]
你是音频 self-play 游戏中的玩家 i。请聆听你的私有音频,并用一条简洁线索描述你听到了什么。在相关时提及具体声音事件、时间顺序、重复、声学属性与场景上下文。不要说明自己是否为异常听者。

输入音频:
公开线索历史:

D.2 Attribution 阶段指令模板

模型被要求扮演裁判,根据完整线索历史识别异常听者。

[系统指令]
你是音频 self-play 游戏中的裁判。多数玩家听到相同的参考音频,只有一名异常听者听到细微变体。给定全部玩家线索,请比较他们的描述,识别最可能听到变体音频的玩家。返回玩家编号。

参考音频输入:
汇总后的玩家线索:

E 可复现性补充说明

除非另有说明,所有实验在数据采样和角色分配上使用相同随机种子。checkpoint 评测对全部方法使用相同基准切分与答案提取规则;诊断分析在每个训练迭代上使用同一组生成的 Listening 线索计算全部指标。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭