TECHNICAL REPORT · ARXIV 2026 · 中文全文译稿

Qwen-Audio-3.0-Gen-Preview
Technical Report

Junyu Dai、Xiaoyue Duan、Xinyue Fan、Yihan Feng、Jingbei Li、Xiangang Li、Yunjia Li、Lejun Min、Yufei Shi、Xingchen Song、Yiran Wang、Cheng Wen、Menglin Wu、Bajian Xiang、Huaicheng Zhang、Han Zhao、Ruichen ZhengAlibaba Token Foundry同等贡献;按英文姓氏字母顺序排列
PDF
20 页
Figure
1
Tables
11
Equations
6
References
65

摘要

现有的单领域与多任务音频系统,在把异构音频成分、环境声和多个角色直接组织成长时序场景方面仍有局限。我们提出 Qwen-Audio-3.0-Gen-Preview:一个统一的 non-autoregressive 框架,利用 Diffusion Transformer(DiT)与 shared VAE 生成完整的混合波形。Prompt Enhancement 会把自由形式的请求转换成结构化时序记录,再渲染为 text-conditioned;两阶段 Data Curriculum 与 Semantic Conditional Views 则训练所提出的模型,使其能在独立音频和混合场景音频中使用这些条件。shared continuous VAE 将 48 kHz 立体声波形压缩成 25 Hz 的 latent sequence,并引入 semantic supervision,为异构音频提供同一种 representation。在公开的 reference-conditioned benchmark 上,所提出模型在三个子集中的最突出优势都是 speaker similarity。在 multi-speaker 与 rich-timeline benchmark 上,其最突出的相对优势分别是两种语言中的跨轮次一致性和 temporal localization 能力。在 AudioCaps 上,它的优势集中在采用 Large Audio-Language Model 与 AudioBox 的评估中。这些结果表明,不依赖任务专用分支的统一生成有望处理具有时序结构的音频。

1 引言

现有 audio generation 模型已经能够在彼此分离的设定下,生成高质量的语言内容 [4, 18, 47, 34, 3]、环境事件 [21, 22, 11] 和长程结构化音频 [6, 1]。然而,现实中的内容创作往往需要不止一种声音。电影、游戏或播客中的一个场景,可能同时包含角色对白、背景环境声、与动作有关的事件以及结构化背景音频。制作这类场景通常需要针对不同音频成分使用不同模型,随后再通过人工编辑,把生成的片段放到时间线上、进行对齐、调整相对电平,并混合成最终音轨。这种多阶段流程耗时很长,也很难同时维持整体连贯性和对各个音频成分的精确控制。

近期的 Unified Audio Generation 研究开始尝试在单一框架内支持异构 audio generation [61, 45]。这些模型大幅扩展了一个模型所能处理的任务范围。不过,支持多种生成任务并不等同于生成一个统一的音频场景。现有模型常常针对彼此分开的指令生成不同音频成分,却较少关注这些成分应当如何在一条连续音轨中共同出现、相互作用并随时间发展。

Complex Audio Scene Generation 的关键挑战,不只是扩大模型能够生成的声音种类,而是把异构声音组织成连贯场景。模型必须控制哪些声音出现、何时开始和结束、如何重叠与衔接,以及如何平衡相对电平;还必须在共同的时序组织中协调角色、对白、环境声、前景事件和长程背景结构。对于长篇叙事,模型还要在多轮对白之间保持角色音色,并维持声学环境随时间的连续性。

本报告提出 Qwen-Audio-3.0-Gen-Preview:一个统一的 non-autoregressive(NAR)框架,其中 Diffusion Transformer(DiT)工作在 shared VAE 的 continuous latent space 中。所提出的模型通过一条生成路径,同时支持异构独立音频、multi-speaker 对白和按时间组织的混合场景。自由形式的用户请求会被转换为结构化时序条件;two-stage Data Curriculum 先建立广泛的 audio generation 能力和文本—音频对应关系,再教会模型把异构声音组织成长时场景。为了评估现有 benchmark 难以充分覆盖的能力,我们还引入两个内部 benchmark,分别用于 reference-conditioned 的 multi-speaker audio generation 和 rich-timeline audio generation。在公开 reference-conditioned benchmark 上,所提出模型在参评系统中取得最高 speaker similarity;在两个内部 benchmark 上,其最突出的相对优势分别是跨轮次 speaker consistency 和 temporal localization 能力。在 AudioCaps 上,它最明显的优势出现在 Large Audio-Language Model 和 AudioBox 评估中。总体而言,这些结果说明,统一模型可以在保留强大 audio generation 能力的同时,把生成拓展到长时、多角色且具有时序结构的场景。

2 相关工作

2.1 从 Domain-Specific Generation 到 Unified Audio Generation

传统上,audio generation 被划分为不同的领域专用任务。面向语言内容的系统关注可懂度、自然度、speaker similarity 与表现力控制 [4, 47, 18, 34, 3]。近期系统又把这一方向扩展到长时和 multi-speaker 生成:VibeVoice 借助超低帧率连续 tokenizer 与 next-token diffusion 支持长时 multi-speaker 对话合成 [30];Any2Speech 则用分层标注建模场景上下文、speaker 画像、话语级表达和发音 [35]。其他领域专用系统依据自然语言描述及相关控制信号生成环境声、声学事件或长程结构化音频 [21, 22, 11, 6, 1]。尽管这些模型在各自任务上取得了很高的生成质量,它们往往依赖不同的音频 representation、模型架构与条件接口。当应用需要同时包含多种音频成分时,仍然必须组合多个独立系统。

Unified Audio Generation 旨在用共享 representation 或共享模型支持多个音频领域。UniAudio 使用统一的离散音频 representation 处理广泛的生成任务 [61],Audiobox 则把 Flow Matching 同时用于语言音频和通用 audio generation [45]。AudioX [41]、UniFlow-Audio [59]、UniSonate [31] 与 Audio-Omni [42] 进一步扩展了支持的输入模态、生成任务、理解能力与编辑功能。UNISON 还支持对白与声音生成、voice cloning、时序编排和场景级编辑 [20]。这些模型证明,不同音频领域能够共享 representation 和模型参数。不过,它们的主要重点仍是扩大单一模型覆盖的任务范围:模型可以依据不同指令生成不同音频成分,却未必会把它们组织成同一场景中相互关联的部分。

2.2 Complex Audio Scene Generation

Complex Audio Scene Generation 关注的是产出一条完整混合音轨,其中包含异构音频成分、持续环境声和时序结构。现有方法主要沿两条路线展开:外部协调,以及由单一模型直接生成混合音轨。

外部协调方法先把用户描述转换成脚本或时间线,再调用多个专用模型生成不同音频成分,最后通过后期处理把它们组合起来。WavJourney 使用结构化脚本组织 audio generation [23];Audio-Oscar 进一步引入多个智能体,分别负责声音设计、时间线规划、模型选择、生成和后期制作 [9]。这些方法模块化程度高,也允许直接编辑脚本和时间线。然而,不同成分是独立生成的,整体一致性和跨成分交互高度依赖外部混音;多阶段管线还会增加系统复杂度和推理成本。

另一条路线是由单一模型直接生成最终混合音轨。Bagpiper 能以自回归音频基础模型生成异构音频混合物 [40];Foley-Omni 专注于依据视频生成完整声轨 [37];Dasheng AudioGen 用结构化场景描述表示多样的音频成分与声学环境,并在共享的连续语义—声学 latent space 中直接生成混合音频 [26]。由于所有成分都在同一个生成过程中建模,这类方法能够学习不同声音之间的相互作用,也避免逐轨生成和装配。不过,现有单模型方法仍主要面向较短片段或较简单的声音组合。长时场景还需要更强的能力,以维持角色音色一致、多轮对白,以及对白、环境声、前景事件与长程背景结构之间协调的时序关系。

2.3 temporal control 与 Compositional Instruction Following

为了提升多事件 audio generation 的可控性,一些研究开始建模声音事件的发生时间。Make-An-Audio 2 用 Large Language Model 把自然语言描述转换成结构化事件序列,并支持可变时长生成 [13]。PicoAudio 和 PicoAudio2 使用时间对齐监督,控制事件何时发生以及出现多少次 [56, 64]。ControlAudio 结合文本、时间和音素条件,同时提升时间精度和语音可懂度 [15]。

与之互补的工作关注数据构建、基于反馈的训练,以及对 temporal instruction following 的评估。AudioTime [55] 与 T2A-Feedback [48] 评估多事件 audio generation 中的事件顺序、时长、频次、时间关系和内容完整性。这些工作共同把 temporal instruction following 从孤立事件的定时问题,拓展到多个事件上的组合约束。

然而,现有 temporal control 研究主要关注一般声音事件,以及事件是否在指定时间发生。复杂音频场景涉及更广的问题:模型还必须处理角色身份、多轮对白、持续环境声,以及不同成分之间的长程关系。

我们的工作并非再引入一个 Domain-Specific Generation 器,也不只是扩大统一模型的任务覆盖范围,而是把重点放在场景级音频组织上。异构音频成分连同它们的时间关系,被建模为同一场景中相互作用的部分,并在共享 continuous latent space 中联合渲染为完整混合音轨。

3 系统概览

所提出模型为异构独立音频和混合场景音频提供统一的 non-autoregressive 生成路径。如图 1 所示,caption token 与文本 token 共同作为 Diffusion Transformer(DiT)的条件;DiT 将一段噪声 latent 序列转换成目标音频的连续 VAE latent。为重建波形,共享 VAE 把 DiT 生成的连续 latent sequence 解码为完整输出波形。所有支持的音频成分共享同一个条件接口、DiT、latent space 和 VAE,而不依赖任务专用生成分支。

两阶段训练过程始终使用同一架构。预训练期间,独立音频样本用于建立基础声学生成质量和文本—音频对应关系。rich-timeline Supervised Fine-Tuning (SFT) 期间,所提出模型从多角色对白、持续环境声、局部事件、长程结构化音频和异构混合物中学习,同时回放基础样本,以减轻独立音频能力的损失。最终系统用同一套文本接口、DiT 和 VAE,处理独立音频、multi-speaker 会话,以及同时包含对白、环境声、长程背景结构和按时间组织事件的完整场景。

图 1:统一 non-autoregressiveaudio generation 系统概览。caption token 与文本 token 共同作为 DiT 的条件,DiT 把噪声 latent 序列转换为连续 VAE latent。共享 VAE 再把得到的连续 latent sequence 解码成完整输出波形。同一套文本接口、DiT、latent space 和 VAE 同时支持异构独立音频与混合场景音频。

4 数据

4.1 Data Curriculum

两阶段 Data Curriculum 把广泛的声学学习,与在时间上编排异构声源的监督分离开来。预训练通过独立音频建立广泛的 audio generation 质量和文本—音频对应关系。后训练——即第 3 节引入的 rich-timeline Supervised Fine-Tuning (SFT) 阶段——教会所提出模型如何把多个声源组织到共享时间线上,并在一段完整波形中进行渲染。

预训练阶段涵盖语言内容音频、长程结构化音频和声音事件音频。语言内容音频构成占主导的监督量,支持可懂度、speaker 属性、副语言变化和背景声学特征;长程结构化音频提供时序形式,包括节奏、乐句、配器和风格连续性;声音事件音频为局部事件、声学场景、物体交互与环境线索提供密集监督。除了平衡各数据族,我们还在数据进入训练集时监控时长分桶和语义覆盖:语言内容音频按语言及 speaker 相关属性跟踪,声音事件音频按事件类型和声学场景跟踪,长程结构化音频则按流派、情绪、能量、配器及是否有人声跟踪。

后训练阶段聚焦于把多个声源组织进同一个声学场景。其混合配比侧重长时对白、环境声丰富的混合音频、长程连续性和明确的局部事件。长时对话音频为 speaker consistency 与轮流发言提供监督;混合场景音频在真实声学条件下提供前景/背景监督;长程结构化音频用于保持风格连续性和背景底音生成能力;局部声音事件音频则为定时和瞬态事件控制提供监督。表 1 概括了相对混合设计。为减轻对嘈杂或经过后期制作媒体的过拟合,我们在后训练中回放干净的独立音频样本,意在保留独立音频质量,同时维持后训练对组合控制的侧重。

表 1:Data Curriculum 的定性构成及各数据族作用。相对规模用于概括数据族之间的配比,不披露确切混合值。
数据族相对规模主要作用
预训练
语言内容音频主导语言内容、speaker 属性、副语言特征与背景声学
长程结构化音频较大长程形式、节奏、风格、配器与人声/乐器属性
声音事件音频较小事件类别、声学场景、事件来源与环境上下文
后训练
长时对话音频最大长上下文对白、speaker consistency 与轮流发言
混合场景音频较大场景真实感、环境声与前景/背景组织
长程结构化音频较大长程连续性、风格控制、过渡与背景底音
局部声音事件音频较小拟音、瞬态事件与局部声学动作

总体而言,这套课程从学习“每种声音是什么”逐步过渡到学习“声音如何共存”。本节定义训练数据的构成,下一节说明如何把异构样本转换成结构化标注。

4.2 Data Annotation Pipeline

上述数据池携带的音频监督形式各不相同。现有标注可能提供对齐文本、来源标识、语言元数据、caption、目录级描述符、事件标签或声学场景标签;相比之下,长时媒体通常包含多个重叠成分,却只有部分来源侧标注。我们的 annotation pipeline 把已有监督与从音频中得到的标注加以整合,而不是把每个样本都压缩成一句扁平的 caption。它生成结构化记录,分别表示持续场景属性、声源级属性、时间局部化内容和主要可听内容;第 4.4 节将进一步说明如何把这份记录渲染为所提出模型的 text-conditioned。

来源归一化与时间分解。

我们首先把来源侧标注归一化为一套共享语义字段清单,同时保留“观察到的内容”与“描述性属性”之间的区别。主要可听文本被视为观察内容;语言、声音或声学特征、环境、风格和制作属性则表示为属性。便于人类阅读的语义标注、符号 representation 与学习得到的声学 representation 分别存储。离散音频 token、连续 VAE latent 等学习 representation 会保留声学细节,但并不假定它们要被序列化到自然语言模板中。对于长时音频,标注在共享时间轴上进行。声源活动、持续声景片段、对白轮次与候选局部事件被彼此独立地识别,因此各自区间可以重叠。这对混合媒体非常重要,因为一轮对白可以同时伴随持续环境声、背景声源活动和短暂的前景事件。

对白与角色关联。

对白活动首先被切分为话语,可用的主要可听文本再与相应区间对齐。随后,speaker 日志化把话语分配给局部 speaker 轨道;归属于同一来源的轨道会跨对白轮次连接起来,形成稳定的角色标识。声音属性在角色层级聚合,而不是对每句话独立预测。角色画像可以包含身份信息、性别或声线类别、可靠情况下的年龄、口音或方言,以及音色描述。这样的聚合减少了轮次间的不一致,并提供必要锚点,使长上下文中的每句对白都能关联到正确声音。

声景标注。

持续声学条件与局部事件分开标注。在片段或场景层级,标注描述环境、房间底噪、背景活动,以及跨多个时间区间仍有意义的空间或制作特征。对于混合媒体,当声源进入、退出和过渡区域构成场景时序组织的一部分时,也可进一步对其进行定位。这些条目描述了持续声源活动如何被放置到混合声景中。

局部声音事件。

瞬态且具有独立意义的声音会被保留为时间局部化事件,即使它们与对白、环境声或其他持续声源活动重叠。每个事件都关联一个时间区间或时间锚点;若音频证据充分,还会附上事件描述、声学来源和底层动作。事件标注不会被吸收到对白 caption 或全局场景描述中。对同一声学事件的重复检测会被合并,而彼此不同的重叠事件仍作为共享时间线上的独立条目保留。

分层装配与一致性检查。

最后,各成分标注被协调成一份结构化记录:

R=(G,P,E,U),(1)R=(G,\mathcal{P},\mathcal{E},U),\tag{1}

其中,GG 表示全局场景与声景,P\mathcal{P} 是可选的声源或角色画像集合,E={ei}i=1N\mathcal{E}=\{e_{i}\}_{i=1}^{N} 是按时间排序的局部事件序列,UU 是主要可听内容。这个装配阶段会消解重复或冲突的描述,把对白轮次绑定到角色画像,并判断某个声音属于持续上下文还是局部事件。在把样本纳入 rich-timeline 数据池之前,我们会进行结构一致性检查:每个可见角色标识都必须解析到唯一画像;对白、主要可听内容和局部事件必须与其实际可听区间保持对齐;事件顺序必须与波形一致;重叠成分不能仅仅因为另一声源更占主导就被删除。无法可靠归属到某个主体或时间范围的属性会被省略,而不会被推测性地附加。

因此,真实录音会产生结构化记录 RR。第 4.3 节的合成配方会映射为兼容记录,第 4.4 节再把这些记录组织成所提出模型使用的 text-conditioned。

4.3 合成音频数据构建

虽然上述 annotation pipeline 能从真实录音中恢复结构化监督,但此类数据很少能独立控制事件数量、起始时间、时长、重叠、相对电平和空间属性。因此,我们使用配方驱动的声景合成框架构建互补的合成语料。该设计建立在 Scaper [33] 提出的可控前景/背景组合范式之上;这一范式后来被 DESED 用于创建带强标注的合成声景 [44],也被 FUSS 用于结合模拟房间响应构造保留声源的混合音频 [50]。我们不把场景渲染为不可分割的一段波形,而是把它表示成一组能够独立寻址的声源。配方显式开放声学内容、时序组织、空间渲染和信号劣化参数。

声源清单。

声源池由经过筛选的异构人声、前景、背景和环境声源组成。这些信号被当作创作组件:前景与背景描述的是某个声源在特定配方中的角色,而非录音的固有属性。参数化程序合成还提供正弦波、扫频、点击声、节拍器、蜂鸣、脉冲和带限噪声等额外基元。对于虚构机器或魔法事件等罕见或设计型声音,我们把物理含义可解释的录音与程序组件分层叠加;必要时还会加入由 audio generation 模型产生、且通过质量筛选的候选音频。

场景规格与时间调度。

每个样本都由一份场景规格实例化;该规格为每个声源指定语义角色、声源标识、起始时刻、时长和相对电平。在场景层级,规格会定义事件数量、顺序与重叠约束,以及目标相对于背景的信噪比。给定配方和随机种子后,确定性调度器会实现精确的重复模式、静音区间、速度约束、因果事件链和长时状态转移。同一 representation 既支持“物体—材质—动作”对照、密集复调场景和多阶段叙事,也不会把其中各个事件压缩进单一且不可控的生成步骤。

声学与通道渲染。

声学变化独立施加到每个声源上。视配方而定,声源可以结合房间脉冲响应或双耳脉冲响应进行渲染,并以方向、距离、运动轨迹、遮挡和传播效应为条件。我们的参数化空间模拟遵循 SpatialScaper [32] 的总体设计原则。设备与通道条件被实现为有序处理链,其中可包括带宽限制、均衡、静态噪声或背景噪声、非线性失真、重采样、编解码处理和丢包效应。只要条件允许,除完整混合波形外,我们还会保留干净输入与每一条处理后的声源轨道。

受控反事实。

我们通过复制一份有效场景配方、只修改一个因素并冻结其余所有因素,构造配对反事实样本。一次干预可以改变事件数量、交换顺序、移除目标、插入额外事件,或改变材质、方向、距离与通道条件。每次干预都先更新配方及其条件,再渲染相应目标波形,由此产生新的有效“条件—目标”对。这样的配对减少干扰变化,并支持针对单个控制维度的受控正样本、负样本与困难负样本比较。这种构造不同于第 5.1 节的条件 dropout:后者只隐藏条件内容,并不改变当前样本真实的事件顺序或目标音频。

标注、质量控制与局限。

对于每段渲染出的混合音频,我们保留实例化配方、随机种子、成分轨道或处理后的声源信号,以及构建时事件标注。配方和构建时事件标注会映射到第 4.2 节定义的结构化记录。我们把其中的时间边界称为“构建时强标签”,因为配方指定的边界未必与相应声源录音中感知上真正可听的活动完全重合。质量控制包括检查语义内容、适用时的对齐文本、事件是否存在及其数量、时间顺序、频谱、响度、真峰值、削波、混叠、不连续和渲染伪影,之后还会对抽样输出进行听审。响度与真峰值测量遵循 ITU-R BS.1770-5 [14]。合成场景用于补充而不是替代真实录音:声源片段中的残留上下文,以及模拟声学与真实声学之间的不匹配,仍是重要局限;合成数据对下游的任何收益都必须用实验证明。真实标注与合成配方共同为训练侧条件提供兼容的结构化记录。第 4.4 节还会先把推理侧的用户输入转换成这种共享格式,再为所提出模型渲染 text-conditioned。

4.4 Prompt Enhancement 与 Condition Rendering

现实中的用户提示通常采用自由形式,可能描述独立音频、角色对白、环境声、前景事件、长程结构化内容或混合场景。每个请求还可能包含细致要求,例如声源身份、声学属性、表演提示、空间设定与时间关系。直接使用这类提示,可能导致所提出模型遗漏重要细节或误解音频成分之间的关系。因此,我们开发了 Prompt Enhancement(PE)模块,在保留用户明确要求及声音事件之间既定关系的同时,把自由形式用户输入映射到 Condition Renderer 所需的结构化字段。

Condition Rendering。

annotation pipeline、合成构建过程与 PE 模块都会产生和公式 1 中 RR 兼容的记录。为了形成所提出模型的输入,我们先从一个有限模板族中选择表层模板,再应用渲染器 T\mathcal{T}

Cfull=T(R).(2)C_{\mathrm{full}}=\mathcal{T}(R).\tag{2}

我们采用一个 Large Language Model,把每条用户请求组织成统一的条件字段集合。PE 模块提取全局场景、环境声和制作上下文;识别声源或角色画像,以及相应的声音或声学属性与表演提示;逐字保留用户提供的主要可听文本,例如明确给出的台词或歌词;提取局部声音事件、空间属性和声音演变;并估计开始时间、结束时间、顺序、中断和重叠关系。它不会添加用户未要求的角色、对白、声源或事件。

给定结构化记录与选定模板后,渲染器是确定性的。其稳定提示语法先放置全局场景与环境声,再放置声源或角色画像,随后是按时间排序的主要可听内容和局部事件。主要可听文本始终显式存在,并与风格、制作属性彼此区分。CfullC_{\mathrm{full}} 表示完整 text-conditioned,其中可以同时包含场景 caption 与主要可听内容字段。

渲染器还会执行 token 预算:它按照规则省略低优先级细节,而不是任意截断提示尾部。有限模板族内部的变化只改变表层措辞,不会凭空添加条件,也不会改变底层记录。

验证与修复。

PE 输出会依据所提出模型要求的模板规则进行验证。验证项包括:用户要求是否得到保留、输出格式是否完整、角色与声源是否正确绑定到对应可听内容、用户提供的可听文本是否逐字保留、局部事件是否遵循预期顺序,以及时间线与时长约束是否满足。如果改写结果未通过检查,模块会利用报告的验证错误进行定向修复。验证完成后,渲染器把包含估计时间线的增强 text-conditioned 作为所提出模型的输入。

因此,训练标注、合成记录与 PE 输出使用彼此兼容的条件格式。第 5 节说明训练期间如何从这种格式构造不同的 condition view。

5 面向 rich-timeline audio 的条件训练

5.1 Semantic Conditional Views

rich-timeline 训练使用从公式 1 的结构化记录和第 4.4 节渲染器派生出的多种 condition view。本节规定每种视图中保持可见的 semantic unit。

在 rich-timeline audio 中,独立丢弃各个字段可能使对白成为解释目标音频的主导因素,并削弱场景条件所提供的对照。因此,我们在渲染之前对结构化 semantic unit 执行 dropout:

CM=T(DM(R)),M{full,dialogue,scene,}.(3)C_{M}=\mathcal{T}(\mathcal{D}_{M}(R)),\qquad M\in\{\mathrm{full},\mathrm{dialogue},\mathrm{scene},\varnothing\}.\tag{3}

这里,DM\mathcal{D}_{M}T\mathcal{T} 渲染条件之前隐藏 RR 中的 semantic unit。完整视图保留所有可用条件;对白视图保留对白、角色身份以及解释它们所需的属性;场景视图保留持续声景和独立声音事件,同时把对白与角色一并移除;空视图则是不带条件的条件。各视图的混合比例可以配置,但被选中的每一种视图,都必须仍然是对目标音频可解释的请求。

细粒度 dropout 遵循同一原则。一个独立事件只有在剩余行仍能给出可解释的事件描述或定位时,才可以丢失描述或时间戳;否则整行事件都会被移除。发生任何删除后,关系都不能再引用已移除的事件或声源。语义无法安全拆分的字段仍保留在完整视图中。条件 dropout 只隐藏条件内容:它不会改写主要可听文本、打乱真实事件顺序,也不会改变目标波形。

5.2 Attribute Contrast 与 Role-Bundle Integrity

Attribute Contrast 和长上下文角色绑定对条件 dropout 施加了不同约束。我们只在剩余条件仍具有语义可解释性时应用相应规则。

Attribute Contrast。

年龄、性别或声线类别、口音和方言使用规范化属性块;相较装饰性细节,这些字段采用更高且可配置的缺失概率。在重复采样中,同一目标音频对应的、可独立解释的属性可能出现,也可能缺失。这种对照旨在向 CFG 暴露特定于该属性的条件差异。只要属性可见,就会保持规范、显式且无歧义;采样分布经过配置,既保留属性存在的样本,也保留属性缺失的抽样。

Role-Bundle Integrity。

被可见对白引用的 rich-timeline role bundle 不能被部分删除。只要一个可见轮次被标记为 roleX,其 role card 就要保留所有可用的核心锚点:身份、性别或声线类别、已标注时的年龄、已标注时的口音或方言,以及至少一个音色锚点。可选人格或冗长描述可以丢弃。role card 与其对白轮次始终以原子方式绑定,因此删除一个 role bundle 时,也会移除其关联轮次。存在 reference audio 时,reference audio、其文本标签与目标对白中相匹配的标签也会保持绑定。

因此,可以独立解释的属性能够参与 Attribute Contrast;而已经被对白引用的 role bundle,只能连同关联轮次一起移除。

第 4.3 节的反事实构造会创建新的有效“条件—目标”对;条件 dropout 则让固定样本对的可听内容保持不变。

5.3 Classifier-Free Guidance

第 5.1 节的 semantic views 提供 Classifier-Free Guidance(CFG)使用的可见条件与空条件。推理时,CFG 按如下方式组合相应的 conditional Vector Field 与 unconditional Vector Field:

vcfg=vu+s(vcvu),(4)v_{\mathrm{cfg}}=v_{u}+s\bigl(v_{c}-v_{u}\bigr),\tag{4}

其中,vcv_{c} 是从可见条件预测的结果,vuv_{u} 是从空条件预测的结果,ss 是 guidance scale。差值 vcvuv_{c}-v_{u} 表示所提出模型对可见条件中信息所学得的响应,而 ss 对这个差值加权。在这种形式下,guidance 依赖从一致视图中学得的对照,本身并不会补充可见条件中缺失的角色或声景信息。

5.4 shared continuous audio VAE

上述条件机制工作在 continuous audio latent space 中;这里介绍的共享 VAE 为所有支持领域定义了这一空间。

设计动机。

Qwen-Audio-3.0-Gen-Preview 覆盖异构独立音频和混合场景音频,因此需要一种共享 latent representation,能够在这些音频设定下支持高保真重建。我们把 48 kHz 立体声波形压缩为 25 Hz 的连续 latent sequence,从而缩短 DiT 需要处理的序列。首先训练 VAE 以获得高质量重建,随后再引入辅助 semantic supervision,使 latent representation 包含语义信息,以期更好地支持下游 audio generation。

latent representation。

遵循 Stable Audio Open [10] 的 convolutional waveform Autoencoder 设计,我们的 VAE 把每段波形映射为 128 维连续 latent sequence。编码器参数化一个 diagonal Gaussian posterior,解码器则从采样得到的 latent 重建波形:

qϕ(zx)=N ⁣(μϕ(x),diagσϕ2(x)),x^=Dθ(z),zqϕ(zx).(5)\begin{aligned}q_{\phi}(\mathbf{z}\mid\mathbf{x})&=\mathcal{N}\!\left(\boldsymbol{\mu}_{\phi}(\mathbf{x}),\operatorname{diag}\boldsymbol{\sigma}_{\phi}^{2}(\mathbf{x})\right),\\\widehat{\mathbf{x}}&=D_{\theta}(\mathbf{z}),\qquad \mathbf{z}\sim q_{\phi}(\mathbf{z}\mid\mathbf{x}).\end{aligned}\tag{5}

latent 样本 z\mathbf{z} 用于波形重建,后验均值 μϕ(x)\boldsymbol{\mu}_{\phi}(\mathbf{x}) 则用于 semantic supervision。

semantic supervision。

后验均值经由一个轻量投影模块,映射到冻结的 Qwen2.5-3B base 语言模型的 embedding 空间。投影后的音频 representation 与指令提示相结合,冻结语言模型针对目标响应提供 next-token prediction 目标。梯度会更新 VAE 编码器和投影模块,语言模型参数保持不变。语言模型只在 VAE 训练中充当辅助监督器,不参与下游 audio generation。

训练目标。

VAE 生成器目标由重建、变分、对抗、特征匹配和语义项共同组成:

LG=Lrec+λKLLKL+Iadv(λadvLadv+λfmLfm)+IsemλsemLsem,(6)\mathcal{L}_{G}=\mathcal{L}_{\mathrm{rec}}+\lambda_{\mathrm{KL}}\mathcal{L}_{\mathrm{KL}}+\mathbb{I}_{\mathrm{adv}}\left(\lambda_{\mathrm{adv}}\mathcal{L}_{\mathrm{adv}}+\lambda_{\mathrm{fm}}\mathcal{L}_{\mathrm{fm}}\right)+\mathbb{I}_{\mathrm{sem}}\lambda_{\mathrm{sem}}\mathcal{L}_{\mathrm{sem}},\tag{6}

其中,Lrec\mathcal{L}_{\mathrm{rec}} 包含在立体声波形 representation 上评估的多分辨率频谱重建项,LKL\mathcal{L}_{\mathrm{KL}} 用于正则化变分后验,Ladv\mathcal{L}_{\mathrm{adv}}Lfm\mathcal{L}_{\mathrm{fm}} 分别表示对抗目标和判别器特征匹配目标。指示量 Iadv\mathbb{I}_{\mathrm{adv}}Isem\mathbb{I}_{\mathrm{sem}} 表明相应目标对当前训练阶段与样本是否启用。

VAE 训练阶段。

我们采用一种渐进式训练策略,它不同于第 4.1 节所提出模型的预训练/后训练课程。VAE 在大规模内部音频语料上训练。首先,我们用重建、KL、对抗和特征匹配目标优化波形 VAE,获得高保真的声学 representation。以该检查点为起点,Semantic Continuation 加入冻结语言模型与投影模块。续训早期暂时禁用判别器;只含重建监督的样本与带语义标注的样本联合使用,语义目标只施加到后者。随后重新引入判别器,同时优化重建目标与语义目标。这一训练安排旨在引入语义信息,同时限制重建训练所学声学 representation 的退化。

第 6 节先在音频 benchmark 上评估完整系统,再通过重建测量和受控下游探针对 VAE 进行单独分析。

6 评估

我们在两大类评估设定下评测所提出模型:reference-conditioned 生成与 text-conditioned audio generation。前者涵盖 zero-shot 生成和 multi-speaker consistency,后者涵盖 caption 满足度、感知质量、rich-timeline control 和长程结构。存在公开 benchmark 时优先使用公开 benchmark;对于它们无法直接覆盖的 multi-speaker 与时间能力,则使用内部 benchmark。Seed-TTS-Eval [2] 是 reference-conditioned 测试的公开基础,内部 multi-speaker 样例取自其英文和中文测试数据。在每个 zero-shot 实例中,所提出模型会接收一段参考话语与目标文本,并需要在保留参考声音的同时合成目标内容。

表 2:Seed-TTS-Eval benchmark 结果。WER/CER(%)衡量内容可懂度,SIM 表示 [0,1][0,1] 范围内的 WavLM speaker similarity。粗体与下划线分别表示各列参评模型中的最佳与次佳结果。破折号表示结果不可用或不适用。Beyond TTS 表示支持传统语音合成以外的 audio generation、交互、理解或编辑。
模型ENZHHard-ZHBeyond TTS
WER (%) \downarrowSIM \uparrowCER (%) \downarrowSIM \uparrowCER (%) \downarrowSIM \uparrow
人类录音2.140.7341.260.755
自回归模型
Seed-TTS [2]2.250.7621.120.7967.590.776
Ming-UniAudio [60]1.850.5800.950.700\checkmark
MiMo-Audio-7B-Instruct [38]5.371.9614.14\checkmark
UniMoE-Audio [24]1.900.5600.800.650\checkmark
Step-Audio-2-Mini [51]3.182.1316.31\checkmark
Qwen3.5-Omni-Plus [39]1.260.99\checkmark
VibeVoice-1.5B [30]3.040.6891.160.744
FireRedTTS-2 [54]1.950.6651.140.736
Qwen3-TTS-12Hz-1.7B-Base [12]1.240.77
MiniMax-Speech [62]1.900.7380.990.799
VoxCPM2 [65]1.840.7530.970.7958.130.753
CosyVoice3-1.5B [8]2.210.7201.120.7815.830.758
Qwen-Audio-3.0-TTS [53]1.540.7620.840.7927.000.768
non-autoregressive 模型
F5-TTS (32 NFE) [4]1.830.6471.560.7418.670.713
F5R-TTS [36]1.370.7548.790.718
LongCat-AudioDiT-3.5B [57]1.500.7861.090.8186.040.797
Qwen-Audio-3.0-Gen-Preview1.610.8051.060.8198.250.808\checkmark

Qwen-Audio-3.0-Gen-Preview 在 EN、ZH 与 Hard-ZH 三个子集上都取得最高 SIM,因此 speaker 保持是这项评估中最明确的数值优势。它的 WER/CER 并非各列最小值,所以结果不能证明其在语言准确率上具有全面优势。所提出模型还支持更广泛的 Beyond TTS 任务范围,表明统一生成范围可以与强大的 zero-shotspeaker similarity 兼容,但这并不意味着它在每项 TTS 指标上都领先。

公开 benchmark 的每个实例只评估一个 target speaker。为了评估对多个 speaker 的联合控制,我们构建了一个 reference-conditioned multi-speaker audio generation 内部 benchmark。

该 benchmark 在英文和中文上包含数百个实例,每种语言各有约一百名不同的参考 speaker。每个实例包含来自不同 speaker 的 KK 段参考话语,以及一份带 speaker 归属的目标脚本 {(si,ti)}i=1N\{(s_{i},t_{i})\}_{i=1}^{N};其中 sis_{i} 表示预期参考 speaker,tit_{i} 是第 ii 轮的文本。所提出模型需要把整段对白渲染成一条波形,同时为每一轮分配正确的参考声音,并跨轮次保持 speaker identity。

表 3:内部 reference-conditioned multi-speaker benchmark 结果。WER 与 CER(%)衡量完整对白波形的内容可懂度。SIM 表示每个生成片段与其 reference audio 之间的 WavLM speaker similarity。一致性(CONS)表示同一 speaker 在不同对白轮次片段之间的 WavLM speaker similarity,反映多轮生成中的声音保持能力。两个相似度指标均采用 [0,1][0,1] 范围。粗体与下划线分别表示各列最佳与次佳结果。
模型ENZH
WER (%) \downarrowSIM \uparrowCONS \uparrowCER (%) \downarrowSIM \uparrowCONS \uparrow
Seed-Audio-1.01.200.5750.6591.350.6610.704
Qwen-Audio-3.0-Gen-Preview1.320.5140.7021.990.6820.740

与 Seed-Audio-1.01相比,Qwen-Audio-3.0-Gen-Preview 在两种语言上都取得更高 CONS,在中文上也取得更高 SIM。基线的英文 WER 与中文 CER 更低,英文 SIM 也更高。因此,所提出模型在两种语言上都保持的优势是跨轮次 speaker consistency,而不是在可懂度或 speaker 保真度上全面领先。

接下来,我们从 reference-conditioned 生成转向更广泛的 text-conditioned audio generation。在 AudioCaps 上,我们使用公开可访问的 OpenSound 版本,在测试集 [16] 上评估 audio generation;该版本包含 4,411 个测试 caption 实例2。由于同一 caption 可以对应多种合理的音频实现,我们使用互补的自动对齐指标,而不是直接比较波形参考。所有系统均用同一组 caption 提示进行评估。我们在完整测试集上报告 LAION-CLAP 与 MS-CLAP,以保持和既有 AudioCaps 评估的可比性;另外还在全量数据上采用 Qwen3-Omni-30B-A3B-Instruct [58] 作为音频语言 judge model。

为了提供互补的跨模型评估,我们使用固定随机种子、无放回地均匀采样一个规模约百条提示的固定子集。同一批提示和生成音频同时接受 CLAP 指标与三个相互独立的 Large Audio-Language Model (LALM) 评审:Qwen3-Omni-30B-A3B-Instruct、Qwen3.5-Omni-Plus3和 Gemini-3.1-Pro-Preview4。judge model 判断生成音频是否满足输入 caption 指定的事件、属性与时间关系。所有基线系统都按照其原论文描述的设定复现,复现得到的 CLAP 结果与各自报告的性能一致。

表 4 中,Qwen-Audio-3.0-Gen-Preview 在全量 Qwen3 列以及子集的 Qwen3、Qwen3.5 列领先,在 Gemini 下排名第二,但没有在任何 CLAP 列领先。它在三个子集 judge model 上的均值为 0.8373,次高的 UniFlow-Audio 为 0.8177;其全量与子集 Qwen3 分数相差 0.0018。

表 4:AudioCaps benchmark 结果。全量评估包含 4,411 条 caption 提示;固定随机子集约含百条提示,使用固定种子无放回均匀采样。Qwen3 指 Qwen3-Omni-30B-A3B-Instruct,Qwen3.5 指 Qwen3.5-Omni-Plus,Gemini 指 Gemini-3.1-Pro-Preview。所有 LALM 列均报告音频—文本语义对齐分数的均值。粗体与下划线分别表示各列最佳与次佳结果。
模型全量测试集(n=4,411n=4{,}411固定随机子集
CLAP \uparrowLALM \uparrowCLAP \uparrowLALM \uparrow
LAIONMSQwen3LAIONMSQwen3Qwen3.5Gemini
AudioX [41]0.32080.40420.78320.31370.39800.79950.70000.8400
UniFlow-Audio [59]0.37120.39240.74670.37650.38520.72450.81000.9185
Dasheng-AudioGen [26]0.19690.50860.73270.20030.50530.73250.67900.7625
MMAudio [5]0.36120.43170.70950.36180.44160.67750.72150.8375
Qwen-Audio-3.0-Gen-Preview0.31780.37320.83930.30020.35490.83750.82050.8540
表 5:使用 AudioBox 的 PQ、PC、CE 与 CU 指标在 AudioCaps benchmark 上评估感知质量。所有系统均用相同测试提示。粗体与下划线分别表示各列最佳与次佳结果。
模型PQ \uparrowPC \uparrowCE \uparrowCU \uparrow
AudioX [41]5.7113.1963.5284.969
UniFlow-Audio [59]5.6473.1253.4354.923
Dasheng-AudioGen [26]5.9422.9483.4935.180
MMAudio [5]5.4932.9893.3094.867
Qwen-Audio-3.0-Gen-Preview6.2563.6163.9605.389

CLAP 与 LALM 结果给出了不同的系统级排序,反映出两者评估机制的区别。在单个样例层面,三个 LALM 评审与 LAION-CLAP 的 Spearman 相关系数介于 0.136 至 0.254,与 MS-CLAP 的相关系数介于 0.037 至 0.091。这些较低相关性说明,应当把 LALM 判断视为对既有 embedding 式 CLAP 指标的补充,而不是替代:前者会直接评估 caption 中事件、属性与时间关系是否得到满足。

表 5 进一步使用 AudioBox [43] 评估感知质量。Qwen-Audio-3.0-Gen-Preview 在四个维度上均取得最高值。综合来看,其最明确的数值优势出现在 LALM 与 AudioBox 评估中,而不是 CLAP;这些结果并不能证明它在所有评估机制下都全面领先。

在内部 rich-timeline audiobenchmark 上,我们评估 compositional and temporal instruction following。AudioCaps 等 benchmark 中的全局 embedding 指标能够提供汇总的音频—文本对齐度量,却不会明确评估所要求的事件是否在指定时间发生。因此,我们构建了一个内部 benchmark,其中包含约百个 rich-timeline audio 场景、时长为数十秒量级,用于评估事件覆盖与时间遵循。每条提示都会指定多个音频事件及其开始、结束时间。

对于每个生成样本,Gemini-3.1-Pro-Preview 与 Qwen3.5-Omni-Plus 会独立判断每个要求的事件是否可听,并估计其时间区间。表 6 报告被判断为可听的要求事件比例(事件召回率)、每个参考事件与其最佳匹配预测区间之间的平均交并比(mIoU),以及达到 0.3 与 0.5 两个 IoU 阈值的事件比例。

表 6:内部 rich-timeline audiobenchmark 结果,评估在 Gemini-3.1-Pro-Preview 与 Qwen3.5-Omni-Plus 评审下的 compositional and temporal instruction following。所有数值均为百分比。粗体与下划线分别表示每个 judge model 下的最佳与次佳结果。
模型召回率 \uparrowmIoU \uparrowIoU@.3 \uparrowIoU@.5 \uparrow
Gemini-3.1-Pro-Preview 作为评审
Seed-Audio-1.098.7738.4856.1738.27
Qwen-Audio-3.0-Gen-Preview88.5843.7366.3650.00
Qwen3.5-Omni-Plus 作为评审
Seed-Audio-1.097.8437.3656.7936.73
Qwen-Audio-3.0-Gen-Preview87.3543.1265.7443.83

两个 judge model 给出了相同的排序模式。Qwen-Audio-3.0-Gen-Preview 在 Gemini-3.1-Pro-Preview 与 Qwen3.5-Omni-Plus 下的 mIoU 分别为 43.73 和 43.12;Seed-Audio-1.0 则为 38.48 和 37.36。所提出模型在两个 IoU 阈值上的达标率也更高,但基线的事件召回率更高;这是一种描述性的“覆盖—定位”权衡,报告没有给出不确定性估计。

作为最后一项任务级评估,我们使用 SongBench [52],从七个互补维度把分析扩展到长程结构与渲染质量:旋律、编曲、音乐性、人声质量、乐器质量、混音和结构。

表 7:在同一小规模评估集上评测基础预训练检查点的 SongBench [52] 分项得分。所提出模型在该 benchmark 数据族上使用的数据量约比内部模型少一个数量级。括号中是文献 [7] 在规模大得多的独立 benchmark 上,对经过包括 RL 在内的基于奖励后训练的最终内部系统所报告的分数;这些斜体数值不可直接比较,也不计入基础检查点排名。粗体与下划线分别表示各分项中最佳与次佳的基础检查点分数。Arr.、Mus.、Instr. 与 Struct. 分别是编曲、音乐性、乐器质量与结构的缩写。
模型SongBench \uparrow
旋律编曲音乐性人声质量乐器质量混音结构
专用内部 AR 模型5.750(7.200)6.467(7.388)4.548(6.368)5.208(7.623)6.448(7.352)5.820(7.305)5.425(6.965)
Qwen-Audio-3.0-Gen-Preview5.6086.3314.8135.1546.5595.8845.322

这项比较使用统一的 Qwen-Audio-3.0-Gen-Preview 检查点,以及一个专用内部 AR 基线 [7]。所提出模型在该 benchmark 数据族上使用的数据量约少一个数量级,但在七个维度上仍与基线数值接近,并在音乐性、乐器质量和混音上领先。这不是一项受控比较:两个系统的训练数据、representation、目标与模型范围均不相同,而且基础检查点评估只使用了小规模样本,也没有不确定性估计。

6.1 VAE 组件评估

完成上述任务级评估后,我们通过波形重建与受控下游探针评估第 5.4 节的 VAE。该探针针对不同目标 representation 训练任务专用生成器;它评估的不是前面各小节所用的完整 Qwen-Audio-3.0-Gen-Preview 系统。

评估设置。

在重建实验中,我们比较 DAC [17]、EAR-VAE [46]、SAME-L [29]、Stable Audio Open [10]、Semantic-VAE [27]、LoSATok [63] 与 HoliTok [19]。重建评估覆盖 Seed-TTS EN 与 ZH [2]、Song Describer Dataset [25]、MuChin [49] 和 AudioCaps [16]。我们按照潜在帧率把 representation 分成 High-Rate(40\geq 40 Hz)与 Low-Rate(<40<40 Hz)系统。在重建表中,SR 和 LR 分别表示波形采样率与潜在帧率。

下游探针在 LibriSpeech-PC-200 [28] 上使用 F5 风格的条件 Flow Matching 生成器 [4],并把 LoSATok [63] 纳入作为语义 latent 基线。所有目标 representation 均使用相同的生成器架构、训练数据与优化预算。只做重建训练的检查点记为 Qwen-Audio-Gen-VAE (Acoustic),经过 Semantic Continuation 的版本记为 Qwen-Audio-Gen-VAE;Sem. 表示目标 representation 是否使用 semantic supervision。

重建质量。

我们使用 ViSQOL 衡量感知质量;用 Mel 与 STFT 距离衡量频谱保真度;用 SI-SDR 衡量信号级重建;用 PESQ 与 STOI 衡量语音质量和可懂度;用 CCPC 与 ICPC 衡量立体声相位一致性。

表 8:Seed-TTS EN 与 ZH 上的重建结果。粗体与下划线分别表示每项指标中 Low-Rate 系统的最佳与次佳结果。
模型Seed-TTS EN
SRLRViSQOL \uparrowMel \downarrowSTFT \downarrowSI-SDR \uparrowPESQ \uparrowSTOI \uparrow
高帧率
DAC44.1 kHz86 Hz4.39190.46931.023311.23063.77120.9691
EAR-VAE44.1 kHz43 Hz4.22530.55321.059913.25843.47650.9660
SAME-L44.1 kHz43 Hz3.92080.69181.248713.42372.73750.9535
Semantic-VAE16 kHz40 Hz3.21710.78181.70319.69773.60970.9738
低帧率
HoliTok48 kHz25 Hz4.39050.42481.00509.39013.92080.9783
Stable Audio Open44.1 kHz21.5 Hz4.25870.65871.15946.74212.53710.9264
Qwen-Audio-Gen-VAE (Acoustic)48 kHz25 Hz4.22820.56831.066912.02363.61420.9687
Qwen-Audio-Gen-VAE48 kHz25 Hz4.39270.57881.079612.12953.64550.9708
模型Seed-TTS ZH
SRLRViSQOL \uparrowMel \downarrowSTFT \downarrowSI-SDR \uparrowPESQ \uparrowSTOI \uparrow
高帧率
DAC44.1 kHz86 Hz4.31890.43700.946612.38673.81130.9654
EAR-VAE44.1 kHz43 Hz4.22150.46240.886414.88753.69550.9643
SAME-L44.1 kHz43 Hz3.89820.54600.972414.94203.08090.9488
Semantic-VAE16 kHz40 Hz2.94060.83061.879310.35113.60860.9695
低帧率
HoliTok48 kHz25 Hz4.34360.37350.859110.75903.99510.9759
Stable Audio Open44.1 kHz21.5 Hz4.19530.60671.03258.40222.61920.9246
Qwen-Audio-Gen-VAE (Acoustic)48 kHz25 Hz4.24600.49170.923513.42523.85540.9676
Qwen-Audio-Gen-VAE48 kHz25 Hz4.35350.51050.927413.41693.85330.9684

Qwen-Audio-Gen-VAE (Acoustic) 在 Song Describer Dataset、MuChin 与 AudioCaps 上取得 Low-Rate 系统中最佳的 Mel 和 STFT 距离;尽管潜在帧率只有 25 Hz,它在 Seed-TTS EN 与 ZH 上仍具竞争力。HoliTok 在若干 Seed-TTS 指标上表现更好。

Semantic Continuation 提高了 Seed-TTS EN、ZH、MuChin 与 AudioCaps 上的 ViSQOL,而 Song Describer Dataset 的结果几乎没有变化。它使频谱指标与立体声一致性指标小幅退化,但总体重建质量大体得到保留。

受控下游探针。

在 LibriSpeech-PC-200 上,我们在训练数十万步后测量 WER、speaker similarity(SIM)和 UTMOS。

表 9:Song Describer Dataset 与 MuChin 上的重建结果。原生单声道 LoSATok 不提供相位一致性数值。粗体与下划线分别表示每项指标中 Low-Rate 系统的最佳与次佳结果。
模型Song Describer Dataset
SRLRViSQOL \uparrowMel \downarrowSTFT \downarrowSI-SDR \uparrowCCPC \uparrowICPC \uparrow
高帧率
DAC44.1 kHz86 Hz4.19810.87181.392110.86950.72120.7256
EAR-VAE44.1 kHz43 Hz4.05760.45890.972511.93680.79090.7231
SAME-L44.1 kHz43 Hz4.01210.50381.184311.78720.78480.7151
低帧率
LoSATok16 kHz25 Hz2.22831.93733.4818-31.7331
Stable Audio Open44.1 kHz21.5 Hz4.06530.60091.20626.05690.70470.5708
Qwen-Audio-Gen-VAE (Acoustic)48 kHz25 Hz4.30100.45341.075211.43100.79000.6922
Qwen-Audio-Gen-VAE48 kHz25 Hz4.29250.51841.161510.81450.77870.6812
模型MuChin
SRLRViSQOL \uparrowMel \downarrowSTFT \downarrowSI-SDR \uparrowCCPC \uparrowICPC \uparrow
高帧率
DAC44.1 kHz86 Hz4.14300.96241.65749.91170.69470.7033
EAR-VAE44.1 kHz43 Hz4.00650.58291.251010.70520.78210.7024
SAME-L44.1 kHz43 Hz4.02890.69711.774510.26890.76540.6880
低帧率
LoSATok16 kHz25 Hz2.20511.67152.8214-32.1244
Stable Audio Open44.1 kHz21.5 Hz4.00090.69421.40575.14730.69050.5428
Qwen-Audio-Gen-VAE (Acoustic)48 kHz25 Hz4.28280.47781.131510.23560.77850.6729
Qwen-Audio-Gen-VAE48 kHz25 Hz4.30640.53351.22689.94250.77340.6641
表 10:AudioCaps 上的重建结果。粗体与下划线分别表示每项指标中 Low-Rate 系统的最佳与次佳结果。
模型AudioCaps
SRLRViSQOL \uparrowMel \downarrowSTFT \downarrowSI-SDR \uparrow
高帧率
DAC44.1 kHz86 Hz4.28540.53461.14505.9002
EAR-VAE44.1 kHz43 Hz4.17890.60781.14027.2334
SAME-L44.1 kHz43 Hz3.95160.70121.30157.6653
低帧率
LoSATok16 kHz25 Hz3.12081.24952.5070-34.7308
Stable Audio Open44.1 kHz21.5 Hz4.16640.67311.17960.4401
Qwen-Audio-Gen-VAE (Acoustic)48 kHz25 Hz4.25380.60751.17086.5950
Qwen-Audio-Gen-VAE48 kHz25 Hz4.34500.64111.18496.4642
表 11:训练数十万步后,在 LibriSpeech-PC-200 上进行的受控生成探针。粗体与下划线分别表示各列最佳与次佳结果。
目标 representationSem.WER (%) \downarrowSIM \uparrowUTMOS \uparrow
Mel spectrogram19.690.4661.769
Stable Audio Open12.330.5041.892
Qwen-Audio-Gen-VAE (Acoustic)7.710.5073.015
Semantic-VAE2.960.5943.034
LoSATok3.300.6223.411
Qwen-Audio-Gen-VAE4.080.4883.367

Qwen-Audio-Gen-VAE (Acoustic) 的 WER、SIM 与 UTMOS 均优于 Mel spectrogram 和 Stable Audio Open 两种目标。相较 Qwen-Audio-Gen-VAE (Acoustic),Semantic Continuation 降低 WER、提高 UTMOS,但会降低 SIM;Semantic-VAE 与 LoSATok 的 WER 低于 Qwen-Audio-Gen-VAE,SIM 则高于后者。由于生成器架构、训练数据与优化预算保持不变,这些差异反映的是目标 representation,而不是整个所提出模型。

7 结论

Qwen-Audio-3.0-Gen-Preview 通过单一 non-autoregressive 生成路径,统一处理异构独立音频与混合场景音频。共享文本接口为工作在同一 VAE continuous latent space 中的 DiT 提供条件;该 VAE 的 48 kHz 立体声 representation 以 25 Hz 运行,并在重建训练后加入 Semantic Continuation。VAE 把生成的 latent sequence 直接解码为完整混合波形。真实标注、合成配方与经 Prompt Enhancement 的请求,都采用彼此兼容的结构化记录并被渲染为 text-conditioned;semantic views、Role-Bundle Integrity 与 Classifier-Free Guidance 在不破坏声源—对白关系的前提下,暴露互补信息。

所提出模型在公开 reference-conditioned benchmark 上展现出很强的 speaker similarity;在 multi-speaker 与 rich-timeline benchmark 上,其最突出的相对优势分别是跨轮次一致性与 temporal localization。在 AudioCaps 上,它最明确的优势出现在 LALM 与 AudioBox 评估中。重建测量与 LibriSpeech-PC-200 受控探针支持低帧率 VAE representation 的实用性。总体而言,这些结果展现了无需任务专用分支即可进行时间可控 audio generation 的潜力。

致谢

感谢 Zhifu Gao、Yiping Peng、Shiming Wang、Yang Xiang、Jianwei Yu、Jixing Yu、Peiyun Zeng 与 Nan Zhao 在数据整理、系统开发、评估和基础设施支持方面所做的贡献。

(姓名按英文姓氏字母顺序排列。)

参考文献

参考文献保留原始书目信息与编号。

  1. [1] Andrea Agostinelli, Timo I Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, et al. MusicLM: Generating music from text. arXiv preprint arXiv:2301.11325, 2023.
  2. [2] Philip Anastassiou, Jiawei Chen, Jitong Chen, Yuanzhe Chen, Zhuo Chen, Ziyi Chen, Jian Cong, Lelai Deng, Chuang Ding, Lu Gao, Mingqing Gong, Peisong Huang, Qingqing Huang, Zhiying Huang, Yuanyuan Huo, Dongya Jia, Chumin Li, Feiya Li, Hui Li, Jiaxin Li, Xiaoyang Li, Xingxing Li, Lin Liu, Shouda Liu, Sichao Liu, Xudong Liu, Yuchen Liu, Zhengxi Liu, Lu Lu, Junjie Pan, Xin Wang, Yuping Wang, Yuxuan Wang, Zhen Wei, Jian Wu, Chao Yao, Yifeng Yang, Yuanhao Yi, Junteng Zhang, Qidi Zhang, Shuo Zhang, Wenjie Zhang, Yang Zhang, Zilin Zhao, Dejian Zhong, and Xiaobin Zhuang. Seed-TTS: A family of high-quality versatile speech generation models, 2024.
  3. [3] Sanyuan Chen, Chengyi Wang, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, et al. Neural codec language models are zero-shot text to speech synthesizers. IEEE Transactions on Audio, Speech and Language Processing, 33:705–718, 2025.
  4. [4] Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Chunhui Wang, Jian Zhao, Kai Yu, and Xie Chen. F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 6255–6271, 2025.
  5. [5] Ho Kei Cheng, Masato Ishii, Akio Hayakawa, Takashi Shibuya, Alexander Schwing, and Yuki Mitsufuji. MMAudio: Taming multimodal joint training for high-quality video-to-audio synthesis, 2025.
  6. [6] Jade Copet, Felix Kreuk, Itai Gat, Tal Remez, David Kant, Gabriel Synnaeve, Yossi Adi, and Alexandre Défossez. Simple and controllable music generation. In Proceedings of the 37th International Conference on Neural Information Processing Systems, pages 47704–47720, 2023.
  7. [7] Junyu Dai, Xinyue Fan, Weiqin Li, Xiangang Li, Yunjia Li, Bin Ma, Yukun Ma, Chongjia Ni, Yufei Shi, Biao Tian, Haoxu Wang, Menglin Wu, Jianwei Yu, Huaicheng Zhang, Han Zhao, Shengkui Zhao, and Haina Zhu. Pushing the frontier of full-song generation: Hierarchical autoregressive planning meets flow-matching rendering, 2026.
  8. [8] Zhihao Du, Changfeng Gao, Yuxuan Wang, Fan Yu, Tianyu Zhao, Hao Wang, Xiang Lv, Hui Wang, Chongjia Ni, Xian Shi, Keyu An, Guanrou Yang, Yabin Li, Yanni Chen, Zhifu Gao, Qian Chen, Yue Gu, Mengzhe Chen, Yafeng Chen, Shiliang Zhang, Wen Wang, and Jieping Ye. CosyVoice 3: Towards in-the-wild speech generation via scaling-up and post-training, 2025.
  9. [9] Yifan Duan, Qixiang Xu, Hengtao Wu, Zhanxun Liu, Wenhao Guan, Junxi Liu, Ziyang Ma, Kelu Xu, and Xie Chen. Audio-Oscar: A multi-agent system for complex audio scene generation, orchestration, and refinement. arXiv preprint arXiv:2606.07397, 2026.
  10. [10] Zach Evans, Julian D Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons. Stable Audio Open. In ICASSP 2025–2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 1–5. IEEE, 2025.
  11. [11] Deepanway Ghosal, Navonil Majumder, Ambuj Mehrish, and Soujanya Poria. Text-to-audio generation using instruction guided latent diffusion model. In Proceedings of the 31st ACM International Conference on Multimedia, pages 3590–3598, 2023.
  12. [12] Hangrui Hu, Xinfa Zhu, Ting He, Dake Guo, Bin Zhang, Xiong Wang, Zhifang Guo, Ziyue Jiang, Hongkun Hao, Zishan Guo, Xinyu Zhang, Pei Zhang, Baosong Yang, Jin Xu, Jingren Zhou, and Junyang Lin. Qwen3-TTS technical report, 2026.
  13. [13] Jiawei Huang, Yi Ren, Rongjie Huang, Dongchao Yang, Zhenhui Ye, Chen Zhang, Jinglin Liu, Xiang Yin, Zejun Ma, and Zhou Zhao. Make-An-Audio 2: Temporal-enhanced text-to-audio generation. arXiv preprint arXiv:2305.18474, 2023.
  14. [14] International Telecommunication Union. Algorithms to measure audio programme loudness and true-peak audio level. Technical Report Recommendation ITU-R BS.1770-5, International Telecommunication Union, November 2023.
  15. [15] Yuxuan Jiang, Zehua Chen, Zeqian Ju, Yusheng Dai, Weibei Dou, and Jun Zhu. ControlAudio: Tackling text-guided, timing-indicated and intelligible audio generation via progressive diffusion modeling. In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 1394–1413, 2026.
  16. [16] Chris Dongjoo Kim, Byeongchang Kim, Hyunmin Lee, and Gunhee Kim. AudioCaps: Generating captions for audios in the wild. In Jill Burstein, Christy Doran, and Thamar Solorio, editors, Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers), pages 119–132, Minneapolis, Minnesota, June 2019. Association for Computational Linguistics.
  17. [17] Rithesh Kumar, Prem Seetharaman, Alejandro Luebs, Ishaan Kumar, and Kundan Kumar. High-fidelity audio compression with improved RVQGAN. Advances in Neural Information Processing Systems, 36:27980–27993, 2023.
  18. [18] Matthew Le, Apoorv Vyas, Bowen Shi, Brian Karrer, Leda Sari, Rashel Moritz, Mary Williamson, Vimal Manohar, Yossi Adi, Jay Mahadeokar, et al. Voicebox: Text-guided multilingual universal speech generation at scale. Advances in Neural Information Processing Systems, 36:14005–14034, 2023.
  19. [19] Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, and Kai Yu. HoliTok: A coutinuous holistic tokenization with robust dual capabilities of speech generation and understanding. arXiv preprint arXiv:2605.29948, 2026.
  20. [20] Zhaoqing Li, Haoning Xu, Jingran Su, Yaofang Liu, Zhefan Rao, Huimeng Wang, Jiajun Deng, Tianzi Wang, Zengrui Jin, Rui Liu, Haoxuan Che, and Xunying Liu. UNISON: A unified sound generation and editing framework via deep LLM fusion. arXiv preprint arXiv:2605.31530, 2026.
  21. [21] Haohe Liu, Zehua Chen, Yi Yuan, Xinhao Mei, Xubo Liu, Danilo Mandic, Wenwu Wang, and Mark D Plumbley. AudioLDM: text-to-audio generation with latent diffusion models. In Proceedings of the 40th International Conference on Machine Learning, pages 21450–21474, 2023.
  22. [22] Haohe Liu, Yi Yuan, Xubo Liu, Xinhao Mei, Qiuqiang Kong, Qiao Tian, Yuping Wang, Wenwu Wang, Yuxuan Wang, and Mark D Plumbley. AudioLDM 2: Learning holistic audio generation with self- supervised pretraining. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 32:2871– 2883, 2024.
  23. [23] Xubo Liu, Zhongkai Zhu, Haohe Liu, Yi Yuan, Qiushi Huang, Meng Cui, Jinhua Liang, Yin Cao, Qiuqiang Kong, Mark D Plumbley, et al. WavJourney: Compositional audio creation with large language models. IEEE Transactions on Audio, Speech and Language Processing, 2025.
  24. [24] Zhenyu Liu, Yunxin Li, Xuanyu Zhang, Qixun Teng, Shenyuan Jiang, Xinyu Chen, Haoyuan Shi, Jinchao Li, Qi Wang, Haolan Chen, Fanbo Meng, Mingjun Zhao, Yu Xu, Yancheng He, Baotian Hu, and Min Zhang. UniMoE-Audio: Unified speech and music generation with dynamic-capacity MoE, 2025.
  25. [25] Ilaria Manco, Benno Weck, Seungheon Doh, Minz Won, Yixiao Zhang, Dmitry Bogdanov, Yusong Wu, Ke Chen, Philip Tovstogan, Emmanouil Benetos, et al. The Song Describer Dataset: A corpus of audio captions for music-and-language evaluation. arXiv preprint arXiv:2311.10057, 2023.
  26. [26] Jiahao Mei, Heinrich Dinkel, Yadong Niu, Xingwei Sun, Gang Li, Yifan Liao, Jiahao Zhou, Junbo Zhang, Jian Luan, and Mengyue Wu. Dasheng AudioGen: A unified model for generating coherent audio scenes from text. arXiv preprint arXiv:2605.27838, 2026.
  27. [27] Zhikang Niu, Shujie Hu, Jeongsoo Choi, Yushen Chen, Peining Chen, Pengcheng Zhu, Yunting Yang, Bowen Zhang, Jian Zhao, Chunhui Wang, et al. Semantic-VAE: Semantic-alignment latent representation for better speech synthesis. arXiv preprint arXiv:2509.22167, 2025.
  28. [28] Vassil Panayotov, Guoguo Chen, Daniel Povey, and Sanjeev Khudanpur. LibriSpeech: An ASR corpus based on public domain audio books. In 2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 5206–5210. IEEE, 2015.
  29. [29] Julian D Parker, Zach Evans, CJ Carr, Zachary Zukowski, Josiah Taylor, Matthew Rice, and Jordi Pons. SAME: A semantically-aligned music autoencoder. arXiv preprint arXiv:2605.18613, 2026.
  30. [30] Zhiliang Peng, Jianwei Yu, Wenhui Wang, Yaoyao Chang, Yutao Sun, Li Dong, Yi Zhu, Weijiang Xu, Hangbo Bao, Zehua Wang, Shaohan Huang, Yan Xia, and Furu Wei. VibeVoice: Expressive podcast generation with next-token diffusion. In ICLR 2026, February 2026.
  31. [31] Chunyu Qiang, Xiaopeng Wang, Kang Yin, Yuzhe Liang, Yuxin Guo, Teng Ma, Ziyu Zhang, Tianrui Wang, Cheng Gong, Yushen Chen, et al. UniSonate: A unified model for speech, music, and sound effect generation with text instructions. In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 28043–28054, 2026.
  32. [32] Iran R. Roman, Christopher Ick, Sivan Ding, Adrian S. Roman, Brian McFee, and Juan P. Bello. Spatial Scaper: A library to simulate and augment soundscapes for sound event localization and detection in realistic rooms. In ICASSP 2024–2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 1221–1225. IEEE, 2024.
  33. [33] Justin Salamon, Duncan MacConnell, Mark Cartwright, Peter Li, and Juan Pablo Bello. Scaper: A library for soundscape synthesis and augmentation. In 2017 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA), pages 344–348. IEEE, 2017.
  34. [34] Kai Shen, Zeqian Ju, Xu Tan, Eric Liu, Yichong Leng, Lei He, Tao Qin, Jiang Bian, et al. NaturalSpeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers. In International Conference on Learning Representations, volume 2024, pages 698–722, 2024.
  35. [35] Xingchen Song, Di Wu, Dinghao Zhou, Pengyu Cheng, Hongwu Ding, Yunchao He, Jie Wang, Shengfan Shen, Sixiang Lv, Lichun Fan, Hang Su, Yifeng Wang, Shuai Wang, Meng Meng, and Jian Luan. Borderless long speech synthesis. arXiv preprint arXiv:2603.19798, 2026.
  36. [36] Xiaohui Sun, Ruitong Xiao, Jianye Mo, Bowen Wu, Qun Yu, and Baoxun Wang. F5R-TTS: Improving flow-matching based text-to-speech with group relative policy optimization, 2025.
  37. [37] Ye Tao, Lupeng Liu, Xuenan Xu, Jiasun Feng, Jiarui Wang, Ying Qin, Shuiyang Mao, Wei Liu, and Shuai Wang. Foley-Omni: A unified multimodal generation model from task-level audio synthesis to complete video soundtrack generation. arXiv preprint arXiv:2606.03672, 2026.
  38. [38] Core Team, Dong Zhang, Gang Wang, Jinlong Xue, Kai Fang, Liang Zhao, Rui Ma, Shuhuai Ren, Shuo Liu, Tao Guo, Weiji Zhuang, Xin Zhang, Xingchen Song, Yihan Yan, Yongzhe He, Cici, Bowen Shen, Chengxuan Zhu, Chong Ma, Chun Chen, Heyu Chen, Jiawei Li, Lei Li, Menghang Zhu, Peidian Li, Qiying Wang, Sirui Deng, Weimin Xiong, Wenshan Huang, Wenyu Yang, Yilin Jiang, Yixin Yang, Yuanyuan Tian, Yue Ma, Yue Yu, Zihan Zhang, Zihao Yue, Bangjun Xiao, Bingquan Xia, Bofei Gao, Bowen Ye, Can Cai, Chang Liu, Chenhong He, Chunan Li, Dawei Zhu, Duo Zhang, Fengyuan Shi, Guoan Wang, Hailin Zhang, Hanglong Lv, Hanyu Li, Hao Tian, Heng Qu, Hongshen Xu, Houbin Zhang, Huaqiu Liu, Jiangshan Duo, Jianguang Zuo, Jianyu Wei, Jiebao Xiao, Jinhao Dong, Jun Shi, Junhao Hu, Kainan Bao, Kang Zhou, Linghao Zhang, Meng Chen, Nuo Chen, Peng Zhang, Qianli Chen, Qiantong Wang, Rang Li, Shaohui Liu, Shengfan Wang, Shicheng Li, Shihua Yu, Shijie Cao, Shimao Chen, Shuhao Gu, Weikun Wang, Wenhan Ma, Xiangwei Deng, Xing Yong, Xing Zhang, Xu Wang, Yifan Song, Yihao Zhao, Yingbo Zhao, Yizhao Gao, Yu Cheng, Yu Tu, Yudong Wang, Zhaojun Huang, Zhengju Tang, Zhenru Lin, Zhichao Song, Zhipeng Xu, Zhixian Zheng, and Zihan Jiang. MiMo-Audio: Audio language models are few-shot learners, 2025.
  39. [39] Qwen Team. Qwen3.5-Omni technical report, 2026.
  40. [40] Jinchuan Tian, Haoran Wang, Bo-Hao Su, Chien-yu Huang, Qingzheng Wang, Jiatong Shi, William Chen, Xun Gong, Siddhant Arora, Chin-Jou Li, et al. Bagpiper: Solving open-ended audio tasks via rich captions. arXiv preprint arXiv:2602.05220, 2026.
  41. [41] Zeyue Tian, Yizhu Jin, Zhaoyang Liu, Ruibin Yuan, Xu Tan, Qifeng Chen, Wei Xue, and Yike Guo. AudioX: Diffusion transformer for anything-to-audio generation. arXiv preprint arXiv:2503.10522, 2025.
  42. [42] Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery Yin, Qifeng Chen, Chen Li, Jing Lyu, Wei Xue, et al. Audio-Omni: Extending multi-modal understanding to versatile audio generation and editing. In Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers, pages 1–10, 2026.
  43. [43] Andros Tjandra, Yi-Chiao Wu, Baishan Guo, John Hoffman, Brian Ellis, Apoorv Vyas, Bowen Shi, Sanyuan Chen, Matt Le, Nick Zacharov, Carleigh Wood, Ann Lee, and Wei-Ning Hsu. Meta Au- diobox Aesthetics: Unified automatic quality assessment for speech, music, and sound. arXiv preprint arXiv:2502.05139, 2025.
  44. [44] Nicolas Turpault, Romain Serizel, Ankit Parag Shah, and Justin Salamon. Sound event detection in domestic environments with weakly labeled data and soundscape synthesis. In Proceedings of the Detection and Classification of Acoustic Scenes and Events 2019 Workshop (DCASE2019), pages 253–257, New York, NY, USA, 2019.
  45. [45] Apoorv Vyas, Bowen Shi, Matthew Le, Andros Tjandra, Yi-Chiao Wu, Baishan Guo, Jiemin Zhang, Xinyue Zhang, Robert Adkins, William Ngan, et al. Audiobox: Unified audio generation with natural language prompts. arXiv preprint arXiv:2312.15821, 2023.
  46. [46] Kangdi Wang, Zhiyue Wu, Dinghao Zhou, Rui Lin, Junyu Dai, and Tao Jiang. Back to ear: Perceptually driven high fidelity music reconstruction. arXiv preprint arXiv:2509.14912, 2025.
  47. [47] Yuancheng Wang, Haoyue Zhan, Liwei Liu, Ruihong Zeng, Haotian Guo, Jiachen Zheng, Qiang Zhang, Xueyao Zhang, Shunsi Zhang, and Zhizheng Wu. MaskGCT: Zero-shot text-to-speech with masked generative codec transformer. In International Conference on Learning Representations, volume 2025, pages 47127–47150, 2025.
  48. [48] Zehan Wang, Ke Lei, Chen Zhu, Jiawei Huang, Sashuai Zhou, Luping Liu, Xize Cheng, Shengpeng Ji, Zhenhui Ye, Tao Jin, et al. T2A-Feedback: Improving basic capabilities of text-to-audio generation via fine-grained AI feedback. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 23535–23547, 2025.
  49. [49] Zihao Wang, Shuyu Li, Tao Zhang, Qi Wang, Pengfei Yu, Jinyang Luo, Yan Liu, Ming Xi, and Kejun Zhang. MuChin: A Chinese colloquial description benchmark for evaluating language models in the field of music. arXiv preprint arXiv:2402.09871, 2024.
  50. [50] Scott Wisdom, Hakan Erdogan, Daniel P. W. Ellis, Romain Serizel, Nicolas Turpault, Eduardo Fonseca, Justin Salamon, Prem Seetharaman, and John R. Hershey. What’s all the FUSS about free universal sound separation data? In ICASSP 2021–2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 186–190. IEEE, 2021.
  51. [51] Boyong Wu, Chao Yan, Chen Hu, Cheng Yi, Chengli Feng, Fei Tian, Feiyu Shen, Gang Yu, Haoyang Zhang, Jingbei Li, Mingrui Chen, Peng Liu, Wang You, Xiangyu Tony Zhang, Xingyuan Li, Xuerui Yang, Yayue Deng, Yechang Huang, Yuxin Li, Yuxin Zhang, Zhao You, Brian Li, Changyi Wan, Hanpeng Hu, Jiangjie Zhen, Siyu Chen, Song Yuan, Xuelin Zhang, Yimin Jiang, Yu Zhou, Yuxiang Yang, Bingxin Li, Buyun Ma, Changhe Song, Dongqing Pang, Guoqiang Hu, Haiyang Sun, Kang An, Na Wang, Shuli Gao, Wei Ji, Wen Li, Wen Sun, Xuan Wen, Yong Ren, Yuankai Ma, Yufan Lu, Bin Wang, Bo Li, Changxin Miao, Che Liu, Chen Xu, Dapeng Shi, Dingyuan Hu, Donghang Wu, Enle Liu, Guanzhe Huang, Gulin Yan, Han Zhang, Hao Nie, Haonan Jia, Hongyu Zhou, Jianjian Sun, Jiaoren Wu, Jie Wu, Jie Yang, Jin Yang, Junzhe Lin, Kaixiang Li, Lei Yang, Liying Shi, Li Zhou, Longlong Gu, Ming Li, Mingliang Li, Mingxiao Li, Nan Wu, Qi Han, Qinyuan Tan, Shaoliang Pang, Shengjie Fan, Siqi Liu, Tiancheng Cao, Wanying Lu, Wenqing He, Wuxun Xie, Xu Zhao, Xueqi Li, Yanbo Yu, Yang Yang, Yi Liu, Yifan Lu, Yilei Wang, Yuanhao Ding, Yuanwei Liang, Yuanwei Lu, Yuchu Luo, Yuhe Yin, Yumeng Zhan, Yuxiang Zhang, Zidong Yang, Zixin Zhang, Binxing Jiao, Daxin Jiang, Heung-Yeung Shum, Jiansheng Chen, Jing Li, Xiangyu Zhang, and Yibo Zhu. Step-Audio 2 technical report, 2025.
  52. [52] Dapeng Wu, Shun Lei, Wei Tan, Guangzheng Li, Yunzhe Wang, Huaicheng Zhang, Lishi Zuo, and Zhiyong Wu. SongBench: A fine-grained multi-aspect benchmark for song quality assessment. arXiv preprint arXiv:2604.25937, 2026.
  53. [53] Bajian Xiang, Cheng Wen, Han Zhao, Hao Wang, Haoxu Wang, Jiawei Jin, Jiayan Cui, Jie Chen, Mengxi Nie, Tianyu Zhao, Weiqin Li, Xiang Lv, Xiangang Li, Yang Xiang, and Yang Zhou. Qwen-Audio-3.0-TTS: Freely controllable and highly robust speech synthesis with multi-stage training paradigm, 2026.
  54. [54] Kun Xie, Feiyu Shen, Junjie Li, Fenglong Xie, Xu Tang, and Yao Hu. FireRedTTS-2: Towards long conversational speech generation for podcast and chatbot, 2025.
  55. [55] Zeyu Xie, Xuenan Xu, Zhizheng Wu, and Mengyue Wu. AudioTime: A temporally-aligned audio-text benchmark dataset. In ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 1–5. IEEE, 2025.
  56. [56] Zeyu Xie, Xuenan Xu, Zhizheng Wu, and Mengyue Wu. PicoAudio: Enabling precise temporal control- lability in text-to-audio generation. In ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 1–5. IEEE, 2025.
  57. [57] Detai Xin, Shujie Hu, Chengzuo Yang, Chen Huang, Guoqiao Yu, Guanglu Wan, and Xunliang Cai. LongCat-AudioDiT: High-fidelity diffusion text-to-speech in the waveform latent space, 2026.
  58. [58] Jin Xu, Zhifang Guo, Hangrui Hu, Yunfei Chu, Xiong Wang, Jinzheng He, Yuxuan Wang, Xian Shi, Ting He, Xinfa Zhu, Yuanjun Lv, Yongqi Wang, Dake Guo, He Wang, Linhan Ma, Pei Zhang, Xinyu Zhang, Hongkun Hao, Zishan Guo, Baosong Yang, Bin Zhang, Ziyang Ma, Xipin Wei, Shuai Bai, Keqin Chen, Xuejing Liu, Peng Wang, Mingkun Yang, Dayiheng Liu, Xingzhang Ren, Bo Zheng, Rui Men, Fan Zhou, Bowen Yu, Jianxin Yang, Le Yu, Jingren Zhou, and Junyang Lin. Qwen3-Omni technical report, 2025.
  59. [59] Xuenan Xu, Jiahao Mei, Zihao Zheng, Ye Tao, Zeyu Xie, Yaoyun Zhang, Haohe Liu, Yuning Wu, Ming Yan, Wen Wu, et al. UniFlow-Audio: Unified flow matching for audio generation from omni-modalities. arXiv preprint arXiv:2509.24391, 2025.
  60. [60] Canxiang Yan, Chunxiang Jin, Dawei Huang, Haibing Yu, Han Peng, Hui Zhan, Jie Gao, Jing Peng, Jingdong Chen, Jun Zhou, Kaimeng Ren, Ming Yang, Mingxue Yang, Qiang Xu, Qin Zhao, Ruijie Xiong, Shaoxiong Lin, Xuezhi Wang, Yi Yuan, Yifei Wu, Yongjie Lyu, Zhengyu He, Zhihao Qiu, Zhiqiang Fang, and Ziyuan Huang. Ming-UniAudio: Speech LLM for joint understanding, generation and editing with unified representation, 2025.
  61. [61] Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Zhou Zhao, Xixin Wu, and Helen Meng. UniAudio: An audio foundation model toward universal audio generation. arXiv preprint arXiv:2310.00704, 2023.
  62. [62] Bowen Zhang, Congchao Guo, Geng Yang, Hang Yu, Haozhe Zhang, Heidi Lei, Jialong Mai, Junjie Yan, Kaiyue Yang, Mingqi Yang, Peikai Huang, Ruiyang Jin, Sitan Jiang, Weihua Cheng, Yawei Li, Yichen Xiao, Yiying Zhou, Yongmao Zhang, Yuan Lu, and Yucen He. MiniMax-Speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder, 2025.
  63. [63] Zhisheng Zhang, Xiang Li, Yixuan Zhou, Jing Peng, Guoyang Zeng, and Zhiyong Wu. LoSATok: Low- dimensional semantic-acoustic tokenizer for cross-domain audio understanding and generation. arXiv preprint arXiv:2605.27840, 2026.
  64. [64] Zihao Zheng, Zeyu Xie, Xuenan Xu, Wen Wu, Chao Zhang, and Mengyue Wu. PicoAudio2: Temporal controllable text-to-audio generation with natural language description. In ICASSP 2026-2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 14507–14511. IEEE, 2026.
  65. [65] Yixuan Zhou, Guoyang Zeng, Xin Liu, Xiang Li, Renjie Yu, Jiancheng Gui, Jiaheng Wu, Ziyang Wang, Xudong Shen, Runchuan Ye, Zhisheng Zhang, Jiuyang Zhou, Bingsong Bai, Weiyue Sun, Mengyuan Deng, Qundong Shi, Zhiyong Wu, and Zhiyuan Liu. VoxCPM2 technical report, 2026.

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭