BYTEDANCE SEED · ARXIV 2607.29363 · 中文全文译稿

Stable Autoregressive
Speech Generation with
Low-Frame-Rate
High-Dimensional
Continuous Tokens

Yi Luo · Rongzhi Gu · Jixun YaoByteDance SeedDate: August 3, 2026Correspondence: Yi Luo at yl3364@columbia.edu
32 DCORE MANIFOLD
768 DSPHERICAL TOKEN
8 HzAR HORIZON
LCSCACRESIDUAL CFG
PDF
45 页
Equations
66
Figures
8
Tables
5
References
128

平衡序列长度、表征容量与长时稳定性,是自回归(AR)语音和音频生成的核心问题。更高帧率或更大容量的表征能保留更多信号细节,却也会让流式生成更容易受到分布漂移和 AR 误差累积的影响;更短、更压缩的表征虽简化了 AR 建模,有限带宽却可能丢失重要成分,并限制重建保真度与生成质量的上界。本文考察:能否把低帧率、高维、高带宽的连续表征与流式生成框架协同设计,同时获得稳健的高保真重建、较强的单 token 可预测性和优异的长时稳定性。我们把目标拆成两个相互耦合的问题:高维表征空间应具备怎样的几何与统计性质,以及 AR 连续 token 生成器应如何组织以抵抗误差累积。为此,我们提出 Locodec:一种局部编码 codec,通过塑造表征空间,提高低维核心流形的可插值性和原生高维坐标的可辨识性,从而提升高维、高带宽 token 的可预测性。我们还提出 MP-ELD:一种单 token AR Flow Matching 框架,通过多路径信息路由与 residual classifier-free guidance 缓解误差累积。使用 88 Hz、768768 维 token 的实验表明,该设计保持了重建质量,改善了单 token 可预测性,取得有竞争力的 WER,并能维持稳定的长时合成;整个系统不依赖外部 SSL/ASR 模型、预训练文本 LM 或 post-training。

1 引言

音频是人机交互最自然的接口之一,稳定的流式理解与生成能力对现代音频及多模态 foundation model 愈发重要 [51, 98, 109]。从输入侧看,保留更多信息的表征通常能抬高下游理解的上限:若与任务有关的线索已被激进的有损压缩丢弃,后续模型便无法可靠恢复。丰富或近乎完整的表征让模型自行学习哪些因素对任务有用,而不必在先天缺失这些因素的空间中工作。输出侧却面临另一种困难:带宽越高、维度越大的目标空间通常越难预测;AR 系统又会把预测误差反馈为未来上下文,因此微小的局部误差会随时间累积,造成响度、音色、语速或频谱质量漂移,严重时甚至导致输出失稳或坍塌。由此形成基本矛盾:有利于通用理解和高保真重建的表征,未必适合作为稳定的生成目标。如何平衡表征容量、AR 稳定性与计算效率,因而成为流式音频系统的核心设计问题。

随着文本语言模型与音频–文本数据集持续进步,大型音频模型在转写、描述生成等偏理解的能力上稳步提升 [28, 34, 36, 42, 108, 112, 114, 122]。相比之下,稳定、高效且高保真的流式生成仍是瓶颈:它既直接决定面向用户交互的感知质量,也会影响闭环系统后续的机器侧理解。当交互从秒级响应延伸到分钟乃至小时级会话,而可用上下文长度与计算预算依然有限时,这个问题会更加突出。理想的表征应同时满足三点:信息足够丰富,能够支持高保真重建;序列足够短,能够缩短 AR 预测跨度;结构足够简单,无需昂贵的局部预测器或后处理模块即可建模。然而,高信息容量、低 AR 误差累积与低模型复杂度很难同时满足,三者形成了一个不利的三角。

本文探索能否通过联合设计表征空间与 AR 生成模型,缓解上述三难困境。受 raw signal space 预测 [63, 103]、表征空间分析 [117, 124] 与 AR Flow Matching 系统 [53, 64] 的启发,我们研究低帧率、高维连续 token 及其配套的 AR 生成框架。我们不借助外部预训练 SSL 或 ASR 模型定义所谓“语义”空间并作为表征塑形的监督,而是训练一个重建优先、直接塑造 latent geometry 的 tokenizer。所得 Locodec 输出球面连续 token:其高维空间围绕一个更低维、可插值的核心流形组织,同时让原生坐标形成能量层级,以提高逐 token 可辨识性。目标是在保留高容量表征的带宽与重建上限的同时,显著降低生成模型预测单个高维 token 的难度。

为处理高信息量 AR 生成仍然存在的长时不稳定,本文进一步分析 guided streaming synthesis 中误差如何累积。经验观察表明,累积漂移的重要来源是 classifier-free guidance(CFG)不稳定,尤其当不同 guidance path 携带部分重叠的声学线索并对其不一致地放大时。我们的做法不是整体压低 guidance,而是鼓励不同信息沿功能不同的路径传递,以减少路径冲突。由此提出 MP-ELD:面向 AR Flow Matching 的多路径 encoder–LM–decoder 框架。显式信息路由与训练期 path dropout 让音频状态的不同方面分别进入不同 conditioning path,使 guidance 能作为结构化 residual correction 使用,并分别增强声学一致性与外部条件对齐。即使没有预训练文本 LM 的强语义归纳偏置,从头训练的模型也能形成可区分的声学状态路径与对齐路径;两类 CFG scale 因而可以独立调节,缓解声学漂移累积并提升长时合成稳定性。

下文安排如下:第 2 节讨论模型设计背后的主要假设与原则,包括比特率、表征空间几何和 AR 稳定性的作用;第 3 节介绍 tokenizer latent 空间的塑形方法,以及 Flow Matching bridge 与训练目标;第 4 节给出 tokenizer 和 AR 生成模型的具体架构;第 5 节报告 Seed-TTS-eval 上的 tokenizer 重建质量与生成性能;第 6 节总结全文。

2 主要假设与设计原则

本节重新审视 tokenizer 与生成模型中的若干既有设计选择,分析其优点和局限,并由此引出本文整体设计所遵循的原则。

2.1 帧率、比特率与重建保真度

由于音频信号的性质,音频处理长期以来面临着对极长序列进行建模的挑战[12, 35, 40, 46, 50, 70, 73, 75, 81, 83, 88, 93, 100, 119]。对于固定的音频持续时间,token序列长度由token帧率决定,token帧率直接控制每个token覆盖的时间跨度和粒度。与每个token的信息容量一起,还决定了单位时间内可以分配的信息量,即带宽。虽然tokenizer和生成模型设计已针对中等比特率配置进行了广泛探索[21, 33, 34, 52, 58, 66, 102, 123],但近年来的主要研究方向集中在大幅降低帧率和比特率设置下实现尽可能高的重建保真度[37, 44, 54, 55, 84, 105]。降低帧率是降低下游序列模型复杂度最直接的方法之一,同时降低码率可以进一步简化生成建模问题,降低计算成本。例如,用单级矢量量化(VQ)[101]替换残差矢量量化(RVQ)[121]就不需要对残差层次结构进行建模,从而减少所需的计算和有效参数预算。

然而,从无损压缩的角度来看,低比特率和高重建保真度从根本上来说很难,而且往往不可能同时实现。因此,现有的tokenizer通常仅保留最重要信号属性的子集,例如内容、音色或音高,同时(有意或无意)丢弃更难以忠实保留的其他因素。在这样的训练目标下,许多低比特率tokenizer通常更接近于重新合成系统,而不是严格的codec。因此,在某些机制或任务中,例如高保真生成或局部编辑,性能上界可能直接受到tokenizer比特率和相应训练范例的约束。

相反,当为了提高离散token的信息容量而增加比特率时,例如通过更深的 RVQ 层次结构或更大的有限标量量化 (FSQ) 比特率 [77],所得的latent 空间逐渐变得更接近连续空间。从建模的角度来看,当诸如 RVQ 之类的离散 token化方案使用许多残差级别,并且生成模型必须在预测期间分层展开这些级别,例如通过延迟模式建模[29]或残差量化变换器(RQTransformer)[59],模型复杂性会大大增加。因此,最近的工作越来越多地探索连续表示作为实现更高带宽建模的手段[25, 39, 68, 76, 86, 111]。一方面,在相同的模型架构、帧率和token维度下,只需完全删除量化步骤,通常就可以显著提高重建保真度。另一方面,从迭代预测的角度来看,高比特率离散 token化中的残差层次在某种程度上类似于基于流的连续生成中的迭代去噪或函数评估过程。从这个意义上说,一旦比特率充分提高,连续 token化就成为自然的建模方向。

与此同时,高比特率离散token和连续token都比低比特率token具有更大的目标空间自由度,这在实践中可能使 AR 系统更容易受到累积预测误差和曝光偏差的影响 [90]。此外,当tokenizer帧率较高并且AR序列相应较长时,可以进一步放大这种累积。因此,对于高带宽tokenization,降低帧率,或者更普遍地降低AR模型所看到的有效帧率,成为控制AR误差积累的必要手段。

2.2 单一高维空间与乘积结构空间

当讨论低帧率、高带宽的连续token时,一个自然的设计问题就会出现:是否应该直接构造原生帧率较低但维度较高的token,以便 AR 模型直接以token率运行?或者应该构建帧率较高但维度较低的token,然后对附近的token进行分组,以便 AR 模型有效地以分组的帧率运行?

假设这两个选择的总体tokenizer压缩比是固定的。那么,从AR模型的角度来看,主要区别在于模型看到的是单个高维空间还是由多个低维空间组成的乘积结构空间。在大多数现有方法中,后者更为常见:每个低维 token的局部组被视为一个短局部序列,在进入语言模型之前首先被压缩为单个嵌入,然后在预测时被解码回下一个局部token序列[53, 54, 126, 127]。该策略与先前关于高效语音增强和分离的工作(称为上下文codec)相关,即旨在缩短序列模型的有效输入长度的局部压缩/解压缩机制[71]。相比之下,在尝试以原生低帧率运行的系统中,很少观察到同时具有非常高维度(例如,256256 维度或更高)且带宽足够高以支持高重建保真度的连续token配置。一个可能的原因是对如此高维空间进行建模的几何和统计难度,以及众所周知的“维数灾难”[3]。因此,至少从表面上看,分组的低维乘积结构表示似乎是构建高容量token的更实用的方法。

然而,这一观察立即引发了另一个问题。如果必须引入一个额外的encoder来将一组低维 token压缩为语言模型的单个表示,然后引入一个相应的decoder来从语言模型输出中重建下一个token组,那么为什么要将此压缩-解压缩过程放置在生成模型内部而不是token生成器本身内部?换句话说,如果生成模型必须将高帧率、低维 token序列重塑为低帧率、高维latent 空间,然后在预测过程中反转该重塑,这是否表明人们可以训练一个直接生成这种原生低帧率、高维 token空间的tokenizer?理想情况下,这样的tokenizer将保留足够的带宽以维持强大的重建保真度,同时消除生成模型内对额外局部编码和解码模块的需求,特别是诸如local DiT 之类的预测时间模块,这些模块会大大增加计算成本和架构复杂性。

从生成模型输入的角度来看,压缩一组低维 token可以在tokenizer内部实现,也可以在生成模型内部实现,这两种选择并没有本质上的不同。然而,从生成模型输出的角度来看,差异是巨大的。局部token组本身就是一个短序列,可以通过局部序列模型进行处理,该局部序列模型具有足够的能力来逐步提升和重塑局部表示,从而使相应的乘积结构表示更容易建模。相比之下,单个高维 token本身并不是序列,因此无法从这种顺序提升中受益;它在模型内部的表征扩展更加有限,因为过大的隐藏维度会直接增加模型大小、训练难度和计算成本。因此,关键的挑战不是简单地使用高维空间,而是构建这样一个空间,使生成模型能够执行稳定、高效的单个高维 token预测,理想情况下达到与分组低维 token的序列式预测相当或更好的性能,并且计算成本显著降低。

2.3 解耦的表征空间

先前工作中降低生成建模难度的最常见策略之一(适用于离散和连续 token)是显式构建从粗到细的表示空间,最常见的是语义声学解耦的形式[10, 14, 24, 37, 67, 80, 104, 115]。在此类表示中,语义组件通常充当紧凑的核心表示,保留信号的主要属性,并且可能来自预训练的 SSL 模型 [9, 20, 27, 49] 或 ASR 模型 [18, 87] 的隐藏空间。然后,声学组件通常通过残留或分层结构提供额外的细节来补充这种语义表示。通过向语言模型提供更聚类、更受约束或自由度较低的语义表示,可以在输入端有效减少 AR 错误累积;在输出方面,语义嵌入本身可以简化和稳定预测。类似的趋势也越来越多地出现在图像生成中,其中大规模预训练的 SSL 嵌入要么用作tokenizer训练期间的对齐监督,要么直接用作token本身,从而提高了连续表示(尤其是高维连续表示)的生成性能[62, 99, 124]。

然而,依赖这种预定义或外部训练的语义嵌入并不是免费的午餐。一方面,从针对特定领域或属性训练的模型(例如 ASR 模型)派生的语义嵌入不可避免地继承了对相应目标属性的强烈偏差,例如单词或音素结构,甚至依赖于语言的偏差。这种偏差可能会降低tokenizer对其他类型信息(例如非语义或非语音内容)进行编码的能力,从而迫使这些属性仅在声学成分中表示。如果生成模型严重依赖语义组件来减少 AR 错误累积,则其他类型的信息可能在其输入中代表性不足,从而限制了模型的理解和生成能力。另一方面,从 SSL 模型派生的语义嵌入在很大程度上受到 SSL 训练数据、模型规模和预训练目标的影响。不同的生成任务,例如语音合成与音乐生成,可能更喜欢不同的表示空间属性。如果希望构建单个任务通用表示空间,训练一个足够大且足够通用的 SSL 模型的成本甚至可能超过训练生成模型本身的成本。

因此,从简单性和通用性的角度来看,我们宁愿不依赖于明确解开的语义-声学表示,也不依赖于外部大规模SSL训练来塑造或约束高维token空间。相反,我们的目标是让tokenizer主要针对高保真重建进行优化,同时使其decoder足够鲁棒,以覆盖生成模型产生的预测错误类型,并使用较低成本的机制来诱导生成模型更容易预测的高维空间。

2.4 原始输入空间建模与流形假设

最近引起越来越多关注的另一项工作是直接在高维raw signal space中执行生成建模,而不需要任何单独训练的tokenizer。此类方法通常受到流形假设的推动,即假设许多现实世界的高维信号实际上位于较低维的潜在流形附近 [16, 43]。根据这种观点,直接对此类信号进行建模可能比对不继承此类结构的任意高维向量(例如自由学习的高维 token)进行建模更容易。这一系列工作在图像生成中表现出了强大的潜力[48, 63, 118],并且也开始出现在音频生成中[23, 41, 125]。

然而,与图像 pixel空间中的直接建模不同,波形空间中的直接建模不一定是音频的自然选择。在波形空间中,当在正交时频变换下观察时,各向同性高斯corruption过程对应于频域中的广泛全带白噪声。相比之下,现实世界的音频信号往往在中频和高频频段表现出明显较低的自然能量。因此,如果生成模型无法完全消除注入的噪声,这些频带中的残余误差在人类听觉感知下可能会变得明显[79, 128]。这可能与图像情况不同,在图像情况下,人类对此类噪声的敏感性和耐受性可能具有不同的机制[11, 15, 22],并且加性噪声的掩蔽效应也可能与音频中的掩蔽效应有质的不同[106]。因此,相同类型的预测误差可能在音频和图像生成中产生显著不同的感知结果。此外,尽管图像生成中的pixel 空间建模已被经验证明可以实现与latent 空间建模相当的性能,并且在某些情况下优于latent 空间建模,但由于缺乏可以细化或补偿预测误差的抗noisy tokenizer decoder,它仍然可能表现出伪影或噪声。因此,我们寻求的是一个仍然受益于流形假设的高维空间,但同时拥有有意义程度的重建鲁棒性,使得生成模型可以由于结构化和可插值的低维流形的存在而更容易地学习它,同时还保留足够的鲁棒性以防止生成预测误差直接变成感知上的严重扭曲。

2.5 表征的可插值性与可辨识性

影响表征空间能否被生成模型有效建模的另一个属性是其可插值性 [6, 107]。可插值空间通常对应更平滑的流形和更好的聚类结构;既有研究也观察到,这类空间更可能带来更好的生成性能 [7, 30, 32, 96, 113, 120]。然而,试图让整个高维空间都具有强可插值性在数学上并不现实:高维容量增长太快,有限训练数据和局部噪声增强都不可能以有意义的密度覆盖它。

我们使用简化的球冠覆盖问题来说明这一点。我们考虑一个高维球体和位于其上的球面token。我们通过假设一个“重建稳定盆地”来考虑tokenizer的噪声鲁棒性,其中每个token都存在一个球冠,允许tokenizer decoder从帽内的任何token重建几乎相同的原始信号。由此我们要问:球体SN1\mathbb{S}^{N-1}可以包含多少个不重叠的盆地?在可插值空间中,人们期望重建稳定盆地以适度的盆地密度充分连接或重叠,以便在附近的有效区域之间移动不会频繁地经过球体上的无效区域。另一方面,如果不重叠盆地的数量非常大,并且远远超过训练样本的数量,则意味着空间有足够的容量让训练样本占据相互隔离的盆地,而不会强迫盆地大量重叠。因此,球体上的有效区域仅覆盖总容量的一小部分,在这种情况下全局插值几乎是不可能的。

我们通过数学论证来表述这个问题。考虑单位球面

SN1={xRN:x2=1}.\mathbb{S}^{N-1} = \{x\in\mathbb{R}^{N}:\|x\|_2=1\}.

对于参考点 e1=(1,0,,0)e_1=(1,0,\dots,0),将geodesic半角 θ(0,π/2)\theta\in(0,\pi/2) 的球冠定义为

Cθ={xSN1:arccos(x,e1)θ}.\mathcal{C}_{\theta} = \left\{ x\in\mathbb{S}^{N-1}: \arccos(\langle x,e_1\rangle)\le \theta \right\}.

μN(θ)\mu_N(\theta)

表示该盖的标准化表面尺寸。等价地,如果xx均匀分布在SN1\mathbb{S}^{N-1}上,则

μN(θ)=Pr(x,e1cosθ).\mu_N(\theta) = \Pr\big(\langle x,e_1\rangle\ge \cos\theta\big).

准确的表达是

μN(θ)=0θsinN2ϕdϕ0πsinN2ϕdϕ.(1)\mu_N(\theta) = \frac{\int_0^\theta \sin^{N-2}\phi\,d\phi} {\int_0^\pi \sin^{N-2}\phi\,d\phi}.\tag{1}

等价地,球体上均匀采样点的第一个坐标具有密度

pN(u)=Γ(N/2)πΓ((N1)/2)(1u2)(N3)/2,u[1,1],p_N(u) = \frac{\Gamma(N/2)} {\sqrt{\pi}\Gamma((N-1)/2)} (1-u^2)^{(N-3)/2}, \qquad u\in[-1,1],

因此

μN(θ)=cosθ1Γ(N/2)πΓ((N1)/2)(1u2)(N3)/2du.(2)\mu_N(\theta) = \int_{\cos\theta}^{1} \frac{\Gamma(N/2)} {\sqrt{\pi}\Gamma((N-1)/2)} (1-u^2)^{(N-3)/2}\,du .\tag{2}

应用标准端点拉普拉斯近似,对于任何固定的 θ(0,π/2)\theta\in(0,\pi/2),我们获得

μN(θ)(sinθ)N1cosθ2πN,N.(3)\mu_N(\theta) \sim \frac{(\sin\theta)^{N-1}} {\cos\theta\sqrt{2\pi N}}, \qquad N\to\infty.\tag{3}

因此,球冠测度的倒数满足

Karea(N,θ):=1μN(θ)cosθ2πN(sinθ)(N1).(4)K_{\mathrm{area}}(N,\theta) := \frac{1}{\mu_N(\theta)} \sim \cos\theta\sqrt{2\pi N}\, (\sin\theta)^{-(N-1)}.\tag{4}

要点是,对于每个固定的 θ<90\theta<90^\circ,该数量在 NN 中呈指数增长。让Ncov(N,θ)\mathcal{N}_{\mathrm{cov}}(N,\theta)表示覆盖SN1\mathbb{S}^{N-1}所需的半径为θ\theta的球盖的最小数量。由于每个盖都占据表面分数 μN(θ)\mu_N(\theta),因此必然有

Ncov(N,θ)1μN(θ)=Karea(N,θ).(5)\mathcal{N}_{\mathrm{cov}}(N,\theta) \ge \frac{1}{\mu_N(\theta)} = K_{\mathrm{area}}(N,\theta).\tag{5}

因此,如果希望高维球面上的每个点都位于某个重建稳定区域的角度θ\theta内,则所需的此类区域的数量至少已经是NN的指数。对于非重叠盆地,令 Npack(N,θ)\mathcal{N}_{\mathrm{pack}}(N,\theta) 表示半径为 θ\theta 的不相交球盖的最大数量。简单的体积论证给出

Npack(N,θ)1μN(θ).\mathcal{N}_{\mathrm{pack}}(N,\theta) \le \frac{1}{\mu_N(\theta)}.

相反,标准最大填充参数给出了面积尺度下界。对于 θ<π/4\theta<\pi/4,选择不相交的 θ\theta 电容的最大集合。最大程度地,具有双倍半径 2θ2\theta 的帽必须覆盖球体。如果选择的上界数量为MM,则

MμN(2θ)1.M\,\mu_N(2\theta)\ge 1.

由于 Npack(N,θ)\mathcal{N}_{\mathrm{pack}}(N,\theta) 是不相交的 θ\theta-caps 的最大数量,我们得到

Npack(N,θ)1μN(2θ).(6)\mathcal{N}_{\mathrm{pack}}(N,\theta) \ge \frac{1}{\mu_N(2\theta)}.\tag{6}

因此,即使是保守的堆积下界,维度也可能是指数级的。例如,尺度 Karea(N,60)K_{\mathrm{area}}(N,60^\circ) 给出了通过这种最大填充参数可获得的不相交 3030^\circ 盆地数量的下界尺度。

SN1\mathbb{S}^{N-1} 上球盖的面积比例 Karea(N,θ)=1/μN(θ)K_{\mathrm{area}}(N,\theta)=1/\mu_N(\theta)。该数量是覆盖球体所需的 θ\theta 帽数量的下界,并且还表示与角区域相关的指数面积比例。数值为近似值。
NNθ=30\theta=30^\circθ=45\theta=45^\circθ=60\theta=60^\circ
443.5×101\approx 3.5\times 10^{1}1.1×101\approx 1.1\times 10^{1}5.1\approx 5.1
887.9×102\approx 7.9\times 10^{2}6.0×101\approx 6.0\times 10^{1}1.2×101\approx 1.2\times 10^{1}
16162.5×105\approx 2.5\times 10^{5}1.3×103\approx 1.3\times 10^{3}4.9×101\approx 4.9\times 10^{1}
32322.6×1010\approx 2.6\times 10^{10}4.6×105\approx 4.6\times 10^{5}6.1×102\approx 6.1\times 10^{2}
64641.6×1020\approx 1.6\times 10^{20}4.3×1010\approx 4.3\times 10^{10}8.6×104\approx 8.6\times 10^{4}
1281284.2×1039\approx 4.2\times 10^{39}2.6×1020\approx 2.6\times 10^{20}1.2×109\approx 1.2\times 10^{9}
2562562.0×1078\approx 2.0\times 10^{78}6.8×1039\approx 6.8\times 10^{39}1.7×1017\approx 1.7\times 10^{17}
5125123.3×10155\approx 3.3\times 10^{155}3.3×1078\approx 3.3\times 10^{78}2.4×1033\approx 2.4\times 10^{33}

为了使比例具体化,表 1 报告了 Karea(N,θ)=1/μN(θ)K_{\mathrm{area}}(N,\theta) = 1/\mu_N(\theta) 的代表性尺寸和角度。这些值应解释为面积/covering,而不是精确的packing 数。当数值方便时,它们是根据精确的cap measure表达式计算的,并且是根据大 NN 体系中等式 (4) 中的渐近表达式计算的。以下是一些观察结果。首先,即使对于相对较大的角度公差,例如6060^\circ,面积比例在N=64N=64处大致达到10510^5,在N=256N=256处大致达到101710^{17}。对于较小的角度公差,数字会更早变得巨大。其次,这些估计已经足以表明高维球面token空间中的直接密集插值性不是一个实际目标。训练样本周围的局部噪声注入可以提高数据流形附近的decoder鲁棒性,但它不能使整个高维球体在任何全局意义上都紧密连接。因此,如果希望引入可插值性,那么更合理的做法是在嵌入高维空间的低维流形上构建它,然后使用该低维流形的几何形状来塑造高维token空间。

同时,低维流形的维数不应该太小,因为只有当低维空间本身包含足够的粗粒度重建信息时,可插值才是有效的目标。表示空间可以高度插值,因为它已经折叠了大多数信息:如果decoder无法有意义地重建信号,那么在该空间中平滑移动就没有什么价值。更正式地说,让 XX 表示数据信号,并让encoder–decoder对与token维度 dd 的潜在表示(由 Md\mathcal{M}_d 表示)诱导重建

X^=D(E(X)),E(X)Md.\widehat X = D(E(X)), \qquad E(X)\in \mathcal{M}_d .

对于重建损失 \ell,将维度 dd 处可实现的最佳失真定义为

D(d)=infE,DE[(X,D(E(X)))],(7)\mathcal{D}^{\star}(d) = \inf_{E,D} \mathbb{E}\big[\ell(X,D(E(X)))\big],\tag{7}

在感兴趣的架构、平滑度、正则化和带宽约束下。一个有意义的低维流形必须满足

D(d)εrec\mathcal{D}^{\star}(d) \le \varepsilon_{\mathrm{rec}}

与目标任务相关的重建容差 εrec\varepsilon_{\mathrm{rec}}。如果 dd 太小,则无论latent 空间看起来多么平滑或可插值,此条件都会失败。

同样的问题可以用过度聚类来表达。假设latent 空间近似球面,token尺寸为 dd。在角分辨率 ρ\rho 下,不相交的稳定区域的数量以帽面积尺度为上界

Karea(d,ρ)=1μd(ρ).K_{\mathrm{area}}(d,\rho)=\frac{1}{\mu_d(\rho)}.

Mdata(ε)M_{\mathrm{data}}(\varepsilon) 表示容差 ε\varepsilon 下可感知区分的信号状态的有效数量。如果

Karea(d,ρ)Mdata(ε),K_{\mathrm{area}}(d,\rho) \ll M_{\mathrm{data}}(\varepsilon),

那么即使这个乐观的上界也不足以将不同的稳定区域分配给所有感知上可区分的信号状态,因此许多不同的信号必须映射到相同或附近的潜在区域。在平滑或抗噪声decoder下,附近的潜在点倾向于解码为附近的重建,并且过度的聚类可能进一步导致平均或过度平滑的输出。因此,过低维的流形可能会迫使不相关或仅弱相关的信号聚集在一起,导致过度平滑、多样性损失或模式合并。此外,如果高维 token空间与该低维流形明确对齐,这种过度聚类也会使高维空间的信息布局产生偏差,并使生成模型继承相同的平滑或多样性损失趋势。在实践中,这建议选择一个适中的维度:足够大以支持有意义的重建和足够的潜在容量,但又足够小以使诱导的几何形状比原始高维token球体保持更大的可插值性。

除了可插值性之外,可辨识性是影响建模难度的另一个因素。在许多音频处理系统中,时频表示起着核心作用,部分原因是它们引入了基于能量的归纳偏差:感知上重要或结构上占主导地位的组件通常占据较高能量的区域,而更精细的细节则占据较低能量的区域。在加性各向同性corruption模型下

yi=xi+ϵi,ϵiN(0,σ2),y_i = x_i + \epsilon_i, \qquad \epsilon_i \sim \mathcal{N}(0,\sigma^2),

具有能量 ei=E[xi2]e_i=\mathbb{E}[x_i^2] 的特征坐标具有有效的坐标SNR,其比例为

SNRieiσ2.\mathrm{SNR}_i \propto \frac{e_i}{\sigma^2}.

因此,在更严重的corruption情况下,高能量成分仍然是可识别的。受这一观察的启发,我们将当前上下文中的可辨识性定义为一种归纳偏差,通过特征空间中的能量分配来突出核心内容。如果可以塑造高维token空间,以便更多的重建关键信息往往占据更高能量的成分,那么即使在预测噪声下,生成模型也可以更容易地推断和保留每个token的核心内容。

总之,可插值性和可辨识性提出了互补的要求。可插值性表明高维 token空间应受到低维流形的约束,而可辨识性表明高维坐标应形成一个能量层次结构,使重要信息更加鲁棒且更容易恢复。这两个属性一起可以使生成模型更容易学习和预测高维空间。

2.6 Tokenizer 设计的核心目标

上面的讨论提出了我们想要构建的低帧率、高维token空间类型的一组核心目标:

  • 它应由嵌入高维空间的低维流形约束或组织;该流形应可插值、具有良好聚类结构,同时维度仍足以支持有意义的重建,避免过度聚类或过度平滑;
  • 在噪声下应具有足够强的重建鲁棒性;
  • 它不应该依赖于外部模型定义的语义或 SSL 空间;
  • 它应该具有足够强的每个token的可辨识性。

3 方法

本节沿用上述假设与设计原则,给出 tokenizer 和生成模型的具体设计方法。

3.1 高维空间中的统计量集中

标准变分自编码器(VAE)通过 KL 项,把近似后验正则化到标准高斯先验。令

gN(0,IN),gRN.g\sim\mathcal{N}(0,I_N), \qquad g\in\mathbb{R}^N.

那么它的平方范数满足

g22=i=1Ngi2χN2,\|g\|_2^2=\sum_{i=1}^N g_i^2\sim\chi_N^2,

并且

E[g22]=N,Var(g22)=2N.\mathbb{E}\big[\|g\|_2^2\big] = N, \qquad \mathrm{Var}\big(\|g\|_2^2\big) = 2N.

因此,

g2N1in probability as N,\frac{\|g\|_2}{\sqrt{N}} \to 1 \quad\text{in probability as } N \to \infty,

这说明高维高斯向量会集中在半径为 N\sqrt{N} 的球面附近。因此,当维度足够高时,可以把标准高斯 latent 近似看作分布在一层很薄的球壳上。这自然引出球面 token 空间,也就是范数近似固定的 token 空间。从预测角度看,对任意目标 token xRNx\in\mathbb{R}^N 与预测 x^RN\hat{x}\in\mathbb{R}^N,误差可在极坐标下分解为径向分量和角向分量。若二者都被约束或归一化到同一球面,径向自由度便被消除,剩余误差只由角度偏差决定。这样做有两个好处:第一,tokenizer decoder 只需学习对角向扰动的鲁棒性;第二,生成模型可在固定范数空间内预测,原则上能去掉 exposure bias 的一个来源,而不必同时建模 token 的范数与方向。

由于这些原因,在本文的其余部分中,我们假设高维球面token空间作为默认设置。

3.2 塑造 decoder 的噪声鲁棒性

以往的 hyperspherical VAE 常采用 von Mises–Fisher(vMF)分布作为球面 latent variable 的先验 [31]。但 vMF 的 KL 项与重参数化在实现上较繁琐,通常还需要额外近似或专用 estimator [56]。本文采用更简单的替代方案:不通过 KL 项施加显式先验,而是直接向 token 空间注入较强噪声,在不约束 token 先验分布的前提下,塑造信息瓶颈与 decoder 的鲁棒性。

对于球面 token 空间,最自然的 corruption 机制是球面上的随机旋转。令

xSN1(R)={uRN:u2=R}x \in \mathbb{S}^{N-1}(R) = \{u \in \mathbb{R}^{N} : \|u\|_2 = R\}

为一个 clean token。为了在同一球面上构造 noisy token,我们先采样一个随机切向方向。具体而言,令

ξN(0,IN),\xi \sim \mathcal{N}(0, I_N),

并把它投影到球面在 xx 处的 tangent space:

u=ξξ,xx22x.(8)u = \xi - \frac{\langle \xi, x\rangle}{\|x\|_2^2} x.\tag{8}

然后

uTxSN1(R),u,x=0.u \in T_x \mathbb{S}^{N-1}(R), \qquad \langle u, x\rangle = 0.

我们通过归一化获得 xx 处的单位切线方向

uˉ=uu2.\bar{u}=\frac{u}{\|u\|_2}.

随后采样旋转角 θ[0,π/2]\theta \in [0, \pi/2],并通过球面 exponential map 定义旋转后的 noisy token:

xrot=cosθx+sinθRuˉ.(9)x^{\mathrm{rot}} = \cos\theta \, x + \sin\theta \, R \bar{u}.\tag{9}

由于 xxuˉ\bar{u} 是正交的,因此直接得出

xrot22=cos2θx22+sin2θR2=R2,\|x^{\mathrm{rot}}\|_2^2 = \cos^2\theta \, \|x\|_2^2 + \sin^2\theta \, R^2 = R^2,

所以 xrotx^{\mathrm{rot}} 完全保持在同一个球体上。而且,xxxrotx^{\mathrm{rot}}之间的测地角正是θ\theta

在实践中,我们对标量进行采样

sBeta(1,2)s\sim\mathrm{Beta}(1,2)

并设置

θ=π2s.\theta=\frac{\pi}{2}s.

这样得到的旋转角分布偏向小扰动,但仍允许最大 9090^\circ 的大角度 corruption;后者对应球面上的正交 token。其动机有两点。第一,小角度附近更高的概率质量,使 decoder 能把更多容量用于与生成期预测误差最相关的局部鲁棒性。第二,偶发的大角度扰动仍会形成有意义的信息瓶颈,并防止 decoder 只拟合 clean token 周围过窄的邻域。在这种 corruption 方案下,tokenizer decoder 从随机旋转后的 noisy token 重建信号,从而被明确鼓励学习球面 token 空间中的角向鲁棒性,而无须施加显式球面先验。因此,这里的噪声注入既是训练期鲁棒性机制,也是塑造 token 空间几何的隐式瓶颈。

3.3 塑造单 token 可辨识性

如上所述,可辨识性的核心思想,是让更重要的内容落在能量更高的分量上。为在高维 token 空间中诱导这种结构,我们显式引入各 token 维度之间的可用性偏置,并把它与足够强的球面 corruption 结合。由此产生的训练动力学会鼓励更常可用的维度承载更多能量,提高它们在 corruption 下的有效 SNR,从而使 token 更易辨识。

具体而言,受 RVQ 系统常用的残差 dropout 策略启发 [58],我们在 token 维度上引入 postfix dimension dropout(后缀维度丢弃,PDD)。令

x=(x1,,xN)SN1(R)RNx=(x_1,\dots,x_N)\in\mathbb{S}^{N-1}(R)\subset\mathbb{R}^N

是旋转的噪声球面token。对于每个token,我们以 pp 的概率保持所有维度不变。否则,我们采样一个整数

KUnif{1,2,,N1},K \sim \mathrm{Unif}\{1,2,\dots,N-1\},

并仅保留前缀维度 1,,K1,\dots,K,同时删除后缀维度 K+1,,NK+1,\dots,N。同样,如果我们定义一个随机的有效前缀长度

Keff={N,with probability p,K,with probability 1p,K_{\mathrm{eff}} = \begin{cases} N, & \text{with probability } p,\\ K, & \text{with probability } 1-p, \end{cases}

那么dropout mask m{0,1}Nm \in \{0,1\}^N

mi=1[iKeff],i=1,,N,m_i = \mathbf{1}[i \le K_{\mathrm{eff}}], \qquad i=1,\dots,N,

corrupted token 为

xdrop=xm,(10)x^{\mathrm{drop}} = x \odot m,\tag{10}

其中 \odot 表示元素乘法。

在此采样规则下,当 p<1p<1 时,索引较低的维度具有严格较高的保留概率。对于任何 i{1,,N}i\in\{1,\dots,N\},我们有

Pr(mi=1)=p+(1p)Pr(Ki)=p+(1p)NiN1,(11)\Pr(m_i=1) = p+(1-p)\Pr(K\ge i) = p+(1-p)\frac{N-i}{N-1},\tag{11}

其中最后一个表达式还给出 Pr(m1=1)=1\Pr(m_1=1)=1Pr(mN=1)=p\Pr(m_N=1)=p。因此,此操作会在所有维度上产生清晰的前缀到后缀可用性排序。请注意,生成的token不再位于高维球体上,因为我们在将其发送到decoder之前没有对其进行重新规范化。我们默认设置p=0.5p=0.5

训练动力学的直觉很简单。由于前缀维度更有可能被保留,因此模型需要反复从部分观察到的和corrupted token中重建信号,其中只有一个前缀(有时是一个短前缀)仍然可用。同时,由于球面token几何形状,clean token具有固定的总能量预算。在此预算下,如果模型要在这种corruption下最大化重建鲁棒性,一个自然的优化方向是将更大的能量分配给更频繁可用的维度。换句话说,可用性偏差通过训练转化为能量偏差:

higher availability    higher learned energy    higher corruption-time identifiability.\text{higher availability} \;\Longrightarrow\; \text{higher learned energy} \;\Longrightarrow\; \text{higher corruption-time identifiability}.

3.4 塑造低维流形

我们希望以较低成本,在高维 token 空间中构造一个既具有良好聚类结构、又具备强可插值性的低维流形。由于高维 token 位于球面上,一个自然选择是引入低维球面空间,并用正交投影与提升操作对齐两个空间。如前所述,受球冠覆盖规律影响,在低维空间中施加大角度旋转扰动时,不同 token 的邻域重叠远强于高维空间。因此,对低维球面施加强扰动,会自然形成更强的信息瓶颈;更大的重叠区域又会促进跨 token 的插值性。这也类似于更强瓶颈带来的特征解耦与聚类效应,例如 β\beta-VAE [47]。

为了尽可能保留几何结构,我们使用可学习的行正交线性投影将干净的高维球面token映射到低维球面空间。让

xSDtok1(RH)x \in \mathbb{S}^{D_{\mathrm{tok}}-1}(R_H)

是一个原生高维 token,并让 dcoreDtokd_{\mathrm{core}}\ll D_{\mathrm{tok}} 表示核心流形的维度。我们使用可学习的行正交投影矩阵

WRdcore×Dtok,WW=Idcore,W_{\downarrow} \in \mathbb{R}^{d_{\mathrm{core}} \times D_{\mathrm{tok}}}, \qquad W_{\downarrow} W_{\downarrow}^{\top} = I_{d_{\mathrm{core}}},

将高维token映射到低维球面空间。在实现中,我们维护一个无约束矩阵

ARDtok×dcore,A_{\downarrow}\in\mathbb{R}^{D_{\mathrm{tok}}\times d_{\mathrm{core}}},

计算其薄 QR 分解

A=QR,QQ=Idcore,A_{\downarrow}=Q_{\downarrow}R_{\downarrow}, \qquad Q_{\downarrow}^{\top}Q_{\downarrow}=I_{d_{\mathrm{core}}},

并设置

W=Q.W_{\downarrow}=Q_{\downarrow}^{\top}.

我们将低维 token定义为

z=RLWxWx2,zSdcore1(RL).(12)z = R_L \frac{W_{\downarrow}x}{\|W_{\downarrow}x\|_2}, \qquad z \in \mathbb{S}^{d_{\mathrm{core}}-1}(R_L).\tag{12}

提升图由相同的基于 QR 的正交化和重整化模板定义,但方向相反。具体来说,我们维护一个无约束矩阵

ARDtok×dcore,A_{\uparrow}\in\mathbb{R}^{D_{\mathrm{tok}}\times d_{\mathrm{core}}},

计算其薄 QR 分解

A=QR,QQ=Idcore,A_{\uparrow}=Q_{\uparrow}R_{\uparrow}, \qquad Q_{\uparrow}^{\top}Q_{\uparrow}=I_{d_{\mathrm{core}}},

并设置

W=Q.W_{\uparrow}=Q_{\uparrow}.

提升后的高维token定义为

xlift=RHWzWz2,xliftSDtok1(RH).(13)x^{\mathrm{lift}} = R_H \frac{W_{\uparrow}z}{\|W_{\uparrow}z\|_2}, \qquad x^{\mathrm{lift}}\in\mathbb{S}^{D_{\mathrm{tok}}-1}(R_H).\tag{13}

由于 WW_{\uparrow} 的列正交,在精确算术下有 Wz2=z2=RL\|W_{\uparrow}z\|_2=\|z\|_2=R_L,所以上式等价于

xlift=RHRLWz.x^{\mathrm{lift}}=\frac{R_H}{R_L}W_{\uparrow}z.

为了数值一致性,我们在方程(13)中保留显式重整化。

使用正交映射的动机是几何的。行正交投影 WW_{\downarrow} 具有正交行,因此充当其保留子空间上的部分等距;特别是,它不会在保留方向之间引入各向异性缩放。随后的归一化将投影矢量映射回低维球体。对于提升步骤,映射在低维球体上严格保持角度:对于任意两个低维 token z1,z2Sd1(RL)z_1,z_2 \in \mathbb{S}^{d-1}(R_L)

Wz1,Wz2Wz12Wz22=z1,z2z12z22.(14)\frac{\langle W_{\uparrow} z_1, W_{\uparrow} z_2\rangle} {\|W_{\uparrow} z_1\|_2 \, \|W_{\uparrow} z_2\|_2} = \frac{\langle z_1, z_2\rangle}{\|z_1\|_2 \, \|z_2\|_2}.\tag{14}

因此,低维 token之间的角度相似性在提升后得以准确保留。

为了对齐两个球面空间,我们本着基于 VQ 的离散tokenizer的精神采用了双向承诺损失。让 xx 表示干净的原生高维token,xliftx^{\mathrm{lift}} 表示提升的低维token。我们使用余弦相似度来惩罚它们在两个方向上的角度差异。用 sg[]\operatorname{sg}[\cdot] 表示停止梯度,我们使用以下双向余弦承诺损失:

Lcommit=(1cos(x,sg[xlift]))+(1cos(sg[x],xlift)).(15)\mathcal{L}_{\mathrm{commit}} = \bigl(1-\cos(x,\operatorname{sg}[x^{\mathrm{lift}}])\bigr) + \bigl(1-\cos(\operatorname{sg}[x],x^{\mathrm{lift}})\bigr).\tag{15}

这鼓励低维token与高维token保持几何对齐,同时还鼓励提升的低维表示占据接近原始高维token的方向。

我们通过构建噪声低维重建路径将强信息瓶颈和corruption应用于低维领域。也就是说,我们对低维token zz 应用相同的球面corruption过程,将噪声低维token提升回高维球体,并要求decoder也从该提升的噪声低维表示中重建信号。如果 zrotz^{\mathrm{rot}} 表示球面corruption的低维token,xlowx^{\mathrm{low}} 表示其提升的高维版本,则decoder在两个重建路径上进行训练:

corrupted native high-dimensional token    decoder    signal,\text{corrupted native high-dimensional token} \;\to\; \text{decoder} \;\to\; \text{signal},

lifted corrupted low-dimensional token    decoder    signal.\text{lifted corrupted low-dimensional token} \;\to\; \text{decoder} \;\to\; \text{signal}.

因此,低维空间不仅仅是高维token的辅助投影,而且明确要求支持corruption下的信号重建,从而鼓励它编码最关键的重建信息。与双向承诺损失相结合,这种双路径噪声重建目标形成了具有强信息瓶颈的低维流形,并鼓励高维token空间围绕由正交映射对引起的提升的低维几何结构进行组织。

3.5 生成模型中的 bridge 构造与训练目标

对球面 token 而言,最自然的演化轨迹是球面上的 geodesic,相应的 bridge 是球面 Flow Matching(SFM),也就是 Riemannian Flow Matching 在球面上的特例 [19]。近期已有多项工作用 SFM 改进球面 token 空间中的生成建模 [60, 78]。因此,本文默认采用 SFM bridge,并讨论促成这一选择的若干性质。

与 VP-path flow 的联系

在高维度中,SFM 与方差保持 (VP) 路径中使用的标准三角插值桥密切相关 [1, 2, 94]。让 x1SDtok1(R)x_1\in\mathbb{S}^{D_{\mathrm{tok}}-1}(R) 表示从tokenizer分布中采样的数据token。对于源端点,我们对各向同性高斯向量 gN(0,IDtok)g\sim\mathcal{N}(0,I_{D_{\mathrm{tok}}}) 进行采样并将其投影到同一球体上:

x0=Rgg2,x0SDtok1(R).(16)x_0 = R\frac{g}{\|g\|_2}, \qquad x_0\in\mathbb{S}^{D_{\mathrm{tok}}-1}(R).\tag{16}

源样本 x0x_0 和目标数据token x1x_1 之间的 VP 式三角插值为

xtVP=cos ⁣(πt2)x0+sin ⁣(πt2)x1,t[0,1].(17)x_t^{\mathrm{VP}} = \cos\!\left(\frac{\pi t}{2}\right)x_0 + \sin\!\left(\frac{\pi t}{2}\right)x_1, \qquad t\in[0,1].\tag{17}

它的平方范数是

xtVP22=R2cos2 ⁣(πt2)+R2sin2 ⁣(πt2)+2cos ⁣(πt2)sin ⁣(πt2)x0,x1.(18)\|x_t^{\mathrm{VP}}\|_2^2 = R^2\cos^2\!\left(\frac{\pi t}{2}\right) + R^2\sin^2\!\left(\frac{\pi t}{2}\right) + 2\cos\!\left(\frac{\pi t}{2}\right)\sin\!\left(\frac{\pi t}{2}\right) \langle x_0,x_1\rangle .\tag{18}

等价地,

xtVP22=R2+2cos ⁣(πt2)sin ⁣(πt2)x0,x1.\|x_t^{\mathrm{VP}}\|_2^2 = R^2 + 2\cos\!\left(\frac{\pi t}{2}\right)\sin\!\left(\frac{\pi t}{2}\right) \langle x_0,x_1\rangle .

以任意固定数据token x1x_1 为条件,源方向 x0/Rx_0/R 均匀分布在单位球面上。因此,

E[x0,x1R2|x1]=0,x0,x1R2=Op ⁣(Dtok1/2).\mathbb{E}\left[ \frac{\langle x_0,x_1\rangle}{R^2} \,\middle|\,x_1 \right] =0, \qquad \frac{\langle x_0,x_1\rangle}{R^2} = O_p\!\left(D_{\mathrm{tok}}^{-1/2}\right).

因此,在高维空间中,

x0,x1R20.\frac{\langle x_0,x_1\rangle}{R^2}\approx 0.

由此可见

xtVP22R2,\|x_t^{\mathrm{VP}}\|_2^2 \approx R^2,

这表明 VP 三角路径近似保范。在相同高维近正交条件下,测地角

Ω=arccos ⁣(x0,x1R2)\Omega = \arccos\!\left(\frac{\langle x_0,x_1\rangle}{R^2}\right)

集中在 π/2\pi/2 附近,SFM geodesic插值

xtSFM=sin((1t)Ω)sinΩx0+sin(tΩ)sinΩx1(19)x_t^{\mathrm{SFM}} = \frac{\sin((1-t)\Omega)}{\sin\Omega}x_0 + \frac{\sin(t\Omega)}{\sin\Omega}x_1\tag{19}

大约减少到

xtSFMcos ⁣(πt2)x0+sin ⁣(πt2)x1.(20)x_t^{\mathrm{SFM}} \approx \cos\!\left(\frac{\pi t}{2}\right)x_0 + \sin\!\left(\frac{\pi t}{2}\right)x_1.\tag{20}

因此,在高维近正交区域,SFM几乎等同于相同半径RR球面上的VP型三角插值。

xtx_t 的范数稳定性

SFM 的另一个特性是 xtx_t 的范数沿桥保持不变。相比之下,在线性插值bridgext=(1t)x0+tx1x_t=(1-t)x_0+t x_1下,xtx_t的范数随tt变化。例如,在高维近正交情况下,我们有 xt22R2((1t)2+t2)\|x_t\|_2^2 \approx R^2\big((1-t)^2+t^2\big),它与bridge time强耦合。由于模型通常接收显式时间嵌入,因此这种桥在时间和径向尺度之间引入了额外的、不必要的耦合。在推理时,一旦生成的轨迹偏离理想桥,当前状态的径向尺度可能会与显式时间嵌入不一致,从而增加exposure bias的风险。

xx-pred 与 vv-pred 的等价性

如上所述,在raw signal space生成建模中,流形假设通常会激发直接目标预测,这比在某些情况下预测噪声或速度更有效。首先对比端点预测在欧几里得Rectified Flow和球面Flow Matching中的作用是有用的。对于标准欧氏整流桥

xt=(1t)x0+tx1,t[0,1],x_t=(1-t)x_0+t x_1, \qquad t\in[0,1],

oracle速度是 vt=x1x0v_t=x_1-x_0,它存在于完整的环境欧几里得空间中并且不受约束。因此,直接的 vv-pred 参数化需要模型输出头来预测包含高熵源项 x0x_0 的向量。相比之下,xx-pred 参数化让模型预测 x^1\hat x_1 并将其转换为速度:

v^tRF=x^1xt1t.(21)\hat v_t^{\mathrm{RF}} = \frac{\hat x_1-x_t}{1-t}.\tag{21}

在代数上,xx-pred 和 vv-pred 可以在欧氏桥中相互转换。然而,正如最近的工作[63]中所讨论的,它们并不等同于输出层参数化:xx-pred要求模型预测数据端点,这可能受益于数据分布的流形结构,而vv-pred直接要求模型预测无约束位移x1x0x_1-x_0

对于球面Flow Matching,情况有所不同。桥状态 xtSDtok1(R)x_t\in\mathbb{S}^{D_{\mathrm{tok}}-1}(R) 的有效速度必须位于tangent space内

TxtSDtok1(R)={uRDtok:u,xt=0}.T_{x_t}\mathbb{S}^{D_{\mathrm{tok}}-1}(R) = \left\{ u\in\mathbb{R}^{D_{\mathrm{tok}}}: \langle u,x_t\rangle=0 \right\}.

因此,与欧几里得Rectified Flow不同,速度不是不受约束的环境矢量,并且任何直接速度参数化必须显式预测切线矢量或将环境预测投影到tangent space上。对于任何 ySDtok1(R)y\in\mathbb{S}^{D_{\mathrm{tok}}-1}(R),将 xtx_tyy 之间的测地角定义为

αt(y)=arccos ⁣(xt,yR2).\alpha_t(y) = \arccos\!\left( \frac{\langle x_t,y\rangle}{R^2} \right).

yyxtx_t 的切线投影为

Πxt(y)=yy,xtR2xt=ycos ⁣(αt(y))xt.(22)\Pi_{x_t}^{\perp}(y) = y - \frac{\langle y,x_t\rangle}{R^2}x_t = y-\cos\!\big(\alpha_t(y)\big)x_t .\tag{22}

xtx_tyy 的Riemannian对数映射为

logxt(y)=αt(y)sinαt(y)Πxt(y),logxt(y)TxtSDtok1(R),(23)\log_{x_t}(y) = \frac{\alpha_t(y)}{\sin\alpha_t(y)} \Pi_{x_t}^{\perp}(y), \qquad \log_{x_t}(y)\in T_{x_t}\mathbb{S}^{D_{\mathrm{tok}}-1}(R),\tag{23}

logxt(y)2=Rαt(y).\|\log_{x_t}(y)\|_2 = R\,\alpha_t(y).

因此,如果模型预测球面端点 x^1\hat x_1,则剩余间隔 [t,1][t,1] 上相应的有效 SFM 速度为

v^tfull=11tlogxt(x^1).(24)\hat v_t^{\mathrm{full}} = \frac{1}{1-t}\log_{x_t}(\hat x_1).\tag{24}

oracle SFM速度是通过设置y=x1y=x_1获得的。让

Ω=arccos ⁣(x0,x1R2),\Omega = \arccos\!\left( \frac{\langle x_0,x_1\rangle}{R^2} \right),

并让 SFM 桥为

xt=sin((1t)Ω)sinΩx0+sin(tΩ)sinΩx1.(25)x_t = \frac{\sin((1-t)\Omega)}{\sin\Omega}x_0 + \frac{\sin(t\Omega)}{\sin\Omega}x_1 .\tag{25}

那么oracle切线速度是

vt=x˙t=ΩsinΩ(cos((1t)Ω)x0+cos(tΩ)x1),(26)v_t = \dot{x}_t = \frac{\Omega}{\sin\Omega} \left( -\cos((1-t)\Omega)x_0 + \cos(t\Omega)x_1 \right),\tag{26}

或同等地

vt=11tlogxt(x1).v_t=\frac{1}{1-t}\log_{x_t}(x_1).

因此,对于 SFM,估计几何上有效的速度本质上相当于估计球面端点及其引起的切线方向和比例。从这个意义上说,xx-pred 和 vv-pred 之间的区别比欧几里得Rectified Flow中的区别弱:tangent space约束自然地将有效的速度参数化转变为端点引起的参数化。

欠步进与仅方向建模

传统的速度目标将最小化全速度 MSE,

Lv=v^tvt22.(27)\mathcal{L}_{\mathrm{v}} = \left\| \hat v_t - v_t \right\|_2^2 .\tag{27}

然而,在目前的高维球面环境中,全速 MSE 引入了潜在的欠步效应。为了看到这一点,假设oracle速度可以写成

vt=stdt,st=vt2,dt2=1,v_t=s_t d_t, \qquad s_t=\|v_t\|_2, \qquad \|d_t\|_2=1,

并假设模型预测切线速度,但存在方向误差。将其预测写为

v^t=atd^t,d^t2=1,\hat v_t=a_t \hat d_t, \qquad \|\hat d_t\|_2=1,

其中 at0a_t\ge 0 是预测速度。让 ψt\psi_t 表示预测方向和oracle direction之间的角度:

cosψt=d^t,dt.\cos\psi_t = \langle \hat d_t,d_t\rangle .

对于固定的预测方向 d^t\hat d_t,速度 MSE 作为预测幅度 ata_t 的函数为

atd^tstdt22=at22atstd^t,dt+st2=at22atstcosψt+st2.(28)\begin{aligned}\left\| a_t\hat d_t-s_t d_t \right\|_2^2 &= a_t^2 - 2a_t s_t\langle \hat d_t,d_t\rangle + s_t^2 \\ &= a_t^2 - 2a_t s_t\cos\psi_t + s_t^2 .\end{aligned}\tag{28}

最小化 ata_t 的二次方可得到

at=stcosψt,(29)a_t^{\star} = s_t\cos\psi_t,\tag{29}

因此,除非预测方向与oracle direction完全一致,否则非负 MSE 最优速度幅度小于预言幅度。换句话说,全速 MSE 允许模型通过减小步长来解释方向不确定性。

对于 SFM geodesic,oracle velocity 沿整个 bridge 保持恒定,并且严格满足

vt2=RΩ.(30)\|v_t\|_2 = R\Omega .\tag{30}

在高维中,当 x0/Rx_0/Rx1/Rx_1/R 是弱相关随机单元方向时,它们的归一化内积集中在零附近,因此

Ωπ2.\Omega\approx \frac{\pi}{2}.

因此,oracle速度范数集中在附近

vt2π2R.(31)\|v_t\|_2 \approx \frac{\pi}{2}R .\tag{31}

然而,在全速度 MSE 下,如果模型在端点或方向估计方面具有较高的不确定性,则方程(29)鼓励较小的预测速度。在推理过程中,这可能会导致轨迹的累积路径长度系统地短于典型的 SFM geodesic长度。在高维范围中,目标端点通常距离源端点接近 9090^\circ,这种欠步会产生风险,即生成的端点与源样本的角度远小于 9090^\circ。为了避免这种故障模式,我们使用仅方向参数化:模型仍然预测球面端点 x^1\hat x_1,但该端点仅用于定义当前桥状态下的切线方向。具体来说,我们将预测和oracle unit切线方向定义为

d^t=logxt(x^1)logxt(x^1)2,dt=vtvt2=logxt(x1)logxt(x1)2.(32)\hat d_t = \frac{\log_{x_t}(\hat x_1)} {\|\log_{x_t}(\hat x_1)\|_2}, \qquad d_t = \frac{v_t}{\|v_t\|_2} = \frac{\log_{x_t}(x_1)} {\|\log_{x_t}(x_1)\|_2}.\tag{32}

然后,我们使用cosine direction loss仅监督切线方向

Ldir=1d^t,dt.(33)\mathcal{L}_{\mathrm{dir}} = 1-\langle \hat d_t,d_t\rangle .\tag{33}

在推理时,在任何附加制导组合之前,我们将预测的速度大小固定为其高维 SFM 限制:

v^t=πR2d^t.(34)\hat v_t = \frac{\pi R}{2}\hat d_t .\tag{34}

通过这种方式,模型预测的端点用作方向参数化,而不是用作精确的端点估计或完整的速度估计。这消除了模型预测速度范数的需要,避免了 MSE 引起的欠步,并保持生成的轨迹长度与典型的高维 SFM 几何结构兼容。

4 模型架构设计

本节给出极简 tokenizer 与极简 AR Flow Matching 模型的具体架构。tokenizer 有意只使用简单、标准的基本组件,以说明一旦 token 空间经过适当塑形,模型整体与基本单元都无须过度复杂,也能兼顾保真度和可预测性。AR Flow Matching 模型则采用针对误差累积与 exposure bias 的模块化设计:通过显式功能解耦,训练动力学可自动优化不同的信息提取路径;推理时再用恰当的多路径 CFG 选择性增强各功能分量,从而缓解 AR 生成中的序列误差累积。

4.1 Locodec:极简的局部编码 tokenizer 架构

Locodec tokenizer架构的图示,包括 MDCT 系数提取、完全局部encoder、token网格细化器、系数网格预测器和用于波形重建的逆 MDCT 阶段。

我们提出 Locodec,即 locally encoded codec。设计有意保持极简:架构仅由简单、标准的组件构成,使研究重点落在 token 空间塑形,而非架构复杂度。虽然实验主要针对单声道 TTS,本文给出的 tokenizer 设计与训练损失仍以统一形式支持单声道和立体声音频。图 1 展示了 Locodec 的完整流水线。

中/侧声道输入形式与 MDCT 前端

我们在波形级别采用中/侧公式。对于左、右通道 xLx_LxRx_R,我们定义

xmid=xL+xR2,xside=xLxR2.(35)x_{\mathrm{mid}} = \frac{x_L + x_R}{2}, \qquad x_{\mathrm{side}} = \frac{x_L - x_R}{2}.\tag{35}

对于单声道输入,我们只需将 xL=xRx_L = x_R 设置为 xside=0x_{\mathrm{side}} = 0。这允许单声道和立体声样本在训练期间自然混合,同时共享相同的tokenizer架构和损失函数。

受传统音频 codec [8, 13, 91] 启发,我们对 mid 与 side 波形施加 MDCT,得到实值时频表征,即 MDCT 系数。若 MDCT 窗长为 kk,对应 hop size 为 k/2k/2;它决定 tokenizer encoder 所见的原生系数帧率。在送入 encoder 前,我们还对 mid 与 side 系数序列施加一种简单的带符号动态范围压缩:

c    sign(c)c1/3.(36)c \;\leftarrow\; \operatorname{sign}(c)\,|c|^{1/3}.\tag{36}

这种变换在压缩幅值动态范围的同时保留系数符号,避免模型过度偏重大幅低频系数,而忽视幅值更小但仍具有感知重要性的高频分量。随后,压缩后的 mid 与 side 系数序列沿特征维拼接,作为 tokenizer encoder 的输入。

完全局部的 encoder

在 MDCT 系数序列之上,我们用完全局部的 encoder 把系数映射到 hidden space。encoder 先以原生 MDCT 帧率堆叠若干帧级局部 FFN,再用一次线性下采样把相邻的 ss 个帧级 embedding 分组:沿特征维拼接后,直接投影到目标 token 维度。更精确地说,若帧级 embedding 维度为 DencD_{\mathrm{enc}}、时间下采样因子为 ss,则该下采样层实现为线性映射

RDencsRDtok.\mathbb{R}^{D_{\mathrm{enc}} \cdot s} \rightarrow \mathbb{R}^{D_{\mathrm{tok}}}.

该 token 序列具有严格局部性:每个 token 只由对应的局部系数帧形成,不发生跨 token 信息交换。我们有意让 encoder 保持完全局部,使 tokenization 更接近采用非重叠分块或 patchification 的 raw input space 建模:每个 token 对应输入信号的一块局部区域,流形假设也施加在局部信号块层面。这种局部性还能降低生成期的重建冲突风险。若 encoder 引入强跨 token 交互,重建某段信号所需的信息可能分散在多个相邻 token 中;tokenizer decoder 在重建训练时固然可利用这些分布式信息,但 AR 生成模型在推理时分别预测各 token,相邻 token 的误差或不一致便可能为同一底层信号段提供相互冲突的证据,使重建变得不稳定。因此,我们在 encoder 端隔离每个 token 的信息作用域,让它主要负责自身对应的局部信号区域。

然后将每个token标准化到高维球体上。如上一节所述,所有token空间整形机制,包括球面corruption、postfix dimension dropout、低维投影和提升以及双路径噪声重建,都应用于此token序列之上。

堆叠式因果卷积 decoder

decoder 的输入可以是 noisy 高维 token 序列,也可以是由 noisy 低维 token 提升得到的序列。它先用堆叠的因果 ConvNeXt1D block [69] 实现 token-grid refinement,直接处理低帧率 token,并在重建系数帧之前校正 corrupted token 表征。随后,一次线性上采样把细化后的 token 序列映射回原生 MDCT 系数帧率,与 encoder 端的一次线性下采样相对应;另一组因果 ConvNeXt1D block 再以该帧率预测 coefficient grid,恢复帧级细节。最后通过 channel-separation layer 解码 mid/side 表征。令 hRTcoef×Dh \in \mathbb{R}^{T_{\mathrm{coef}} \times D} 表示 coefficient-grid ConvNeXt1D predictor 输出的细化 hidden sequence,其中 TcoefT_{\mathrm{coef}} 是原生 MDCT 系数帧长度,DD 是 hidden dimension。我们分别用两个 FFN 处理 hh,得到 mid-channel 与 side-channel hidden sequence:

hmid=FFNmid(h),hside=FFNside(h).(37)h_{\mathrm{mid}} = \mathrm{FFN}_{\mathrm{mid}}(h), \qquad h_{\mathrm{side}} = \mathrm{FFN}_{\mathrm{side}}(h).\tag{37}

然后使用共享门控输出层将这两个隐藏序列映射到系数预测:让 Ocoef:RDR2F\mathcal{O}_{\mathrm{coef}}:\mathbb{R}^{D}\rightarrow \mathbb{R}^{2F} 表示共享系数输出层,其中 FF 是每帧的 MDCT frequency bin的数量。将 Ocoef\mathcal{O}_{\mathrm{coef}} 应用于 hmidh_{\mathrm{mid}}hsideh_{\mathrm{side}} 会生成两个张量,对应于幅度分支和符号门分支。写作

(hamp(b),hsgn(b))=Ocoef(hb),b{mid,side},(38)(h_{\mathrm{amp}}^{(b)},\,h_{\mathrm{sgn}}^{(b)}) = \mathcal{O}_{\mathrm{coef}}(h_b), \qquad b\in\{\mathrm{mid},\mathrm{side}\},\tag{38}

分支 bb 的预测 MDCT 系数参数化为

c^b  =  exp ⁣(hamp(b))tanh ⁣(hsgn(b)),b{mid,side}.(39)\widehat{c}_b \;=\; \exp\!\big(h_{\mathrm{amp}}^{(b)}\big) \cdot \tanh\!\big(h_{\mathrm{sgn}}^{(b)}\big), \qquad b\in\{\mathrm{mid},\mathrm{side}\}.\tag{39}

这里 exp(hamp(b))\exp(h_{\mathrm{amp}}^{(b)}) 控制非负幅度尺度,而 tanh(hsgn(b))\tanh(h_{\mathrm{sgn}}^{(b)}) 充当有界符号门。左、右 MDCT 系数通过以下方式恢复

c^L=c^mid+c^side,c^R=c^midc^side.(40)\widehat{c}_L = \widehat{c}_{\mathrm{mid}} + \widehat{c}_{\mathrm{side}}, \qquad \widehat{c}_R = \widehat{c}_{\mathrm{mid}} - \widehat{c}_{\mathrm{side}}.\tag{40}

最后,对c^L\widehat{c}_Lc^R\widehat{c}_R应用逆MDCT以重建原始时域中的左右波形x^L\hat{x}_Lx^R\hat{x}_R

训练目标

训练目标由三部分组成:噪声重建损失、感知损失和高低维承诺损失。

噪声重建损失应用于高维和低维重建路径。继之前的工作 [58, 72] 之后,我们计算窗口大小下的 STFT 幅度

WSTFT={25,26,,212}.\mathcal{W}_{\mathrm{STFT}} = \{2^5,2^6,\dots,2^{12}\}.

对于每个 wWSTFTw\in\mathcal{W}_{\mathrm{STFT}},定义

Aw(y)=STFTw(y).A_w(y)=\left|\mathrm{STFT}_w(y)\right|.

此处及下文中,yy 表示波形,y^\hat y 表示其重建。归一化幅度损失是按通道定义的。对于左、右、中通道,我们使用同一通道的目标幅度作为归一化因子:

rwb(y)=mean ⁣(Aw(yb)),b{L,R,mid}.(41)r_w^{b}(y) = \operatorname{mean}\!\left(A_w(y_b)\right), \qquad b\in\{L,R,\mathrm{mid}\}.\tag{41}

这里 mean()\operatorname{mean}(\cdot) 对单个示例的时频区间进行平均。然而,对于侧通道,我们通过目标中通道幅度进行标准化:

rwside(y)=mean ⁣(Aw(ymid)).(42)r_w^{\mathrm{side}}(y) = \operatorname{mean}\!\left(A_w(y_{\mathrm{mid}})\right).\tag{42}

这避免了单声道情况下的病态归一化,其中目标侧通道完全为零。通道方面的归一化幅度损失是

wmag,b(y^,y)=E[mean ⁣(Aw(y^b)Aw(yb))rwb(y)+ε],b{L,R,mid,side},(43)\ell_{w}^{\mathrm{mag},b}(\hat y,y) = \mathbb{E} \left[ \frac{ \operatorname{mean}\!\left( \left|A_w(\hat y_b)-A_w(y_b)\right| \right) }{ r_w^{b}(y)+\varepsilon } \right], \qquad b\in\{L,R,\mathrm{mid},\mathrm{side}\},\tag{43}

其中 E[]\mathbb{E}[\cdot] 表示训练批次的经验平均值。对数幅度损失仅应用于左通道和右通道:

wlmag,b(y^,y)=E[mean ⁣(log10 ⁣(Aw(y^b)+ε)log10 ⁣(Aw(yb)+ε))],b{L,R}.(44)\ell_{w}^{\mathrm{lmag},b}(\hat y,y) = \mathbb{E} \left[ \operatorname{mean}\!\left( \left| \log_{10}\!\big(A_w(\hat y_b)+\varepsilon\big) - \log_{10}\!\big(A_w(y_b)+\varepsilon\big) \right| \right) \right], \qquad b\in\{L,R\}.\tag{44}

对于重建的立体声波形,我们定义

y^mid=y^L+y^R2,y^side=y^Ly^R2,\hat y_{\mathrm{mid}} = \frac{\hat y_L+\hat y_R}{2}, \qquad \hat y_{\mathrm{side}} = \frac{\hat y_L-\hat y_R}{2},

对于目标波形 yy 也类似。让 y^(H)\hat y^{(H)}y^(L)\hat y^{(L)} 分别表示来自高维和低维路径的重建。我们将每条路径的重建损失定义为

Lrec(m)=wWSTFT[b{L,R}(wmag,b(y^(m),y)+λlmagwlmag,b(y^(m),y))+wmag,mid(y^(m),y)+wmag,side(y^(m),y)],m{H,L}.(45)\begin{aligned}\mathcal{L}_{\mathrm{rec}}^{(m)} = \sum_{w\in\mathcal{W}_{\mathrm{STFT}}} \Bigg[ & \sum_{b\in\{L,R\}} \left( \ell_w^{\mathrm{mag},b}(\hat y^{(m)},y) + \lambda_{\mathrm{lmag}}\ell_w^{\mathrm{lmag},b}(\hat y^{(m)},y) \right) \\ & + \ell_w^{\mathrm{mag},\mathrm{mid}}(\hat y^{(m)},y) + \ell_w^{\mathrm{mag},\mathrm{side}}(\hat y^{(m)},y) \Bigg], \qquad m\in\{H,L\}.\end{aligned}\tag{45}

在当前的实现中,我们对两条路径使用相同的重建损失形式,而低维路径在最终目标中分配较小的权重。

用于训练tokenizer decoder的感知损失由对抗生成器损失和feature matching损失组成。 GAN 判别器对直接从波形计算的多分辨率未压缩 MDCT 系数进行操作,并由堆叠的 Conv1d 块构建而成 [72]。我们使用通过四种窗口大小 256, 512, 1024, 2048256,\ 512,\ 1024,\ 2048 计算的 MDCT 系数矩阵,并且对于每个分辨率,我们实例化全带判别器和子带判别器。全频带判别器将整个系数矩阵作为输入,子带判别器将频谱均匀划分为44-kHz带宽的子带。在实现中,子带判别器通过分组卷积来实现:每个频谱子带由其自己的卷积组处理,而具有相同MDCT分辨率的所有子带被视为一个判别器模块。因此,每个分辨率贡献一个全带判别器和一个分组子带判别器,在四个分辨率中总共产生八个判别器模块。

我们使用最小二乘 GAN (LSGAN) 目标 [74]。让 J\mathcal{J} 表示所有判别器的集合。对于每个 jJj\in\mathcal{J},让 Cj()C_j(\cdot) 表示与判别器 DjD_j 关联的 MDCT 表示。判别器损失为

LD(j)=Ey[(Dj(Cj(y))1)2]+Ey^(H)[Dj ⁣(Cj(sg[y^(H)]))2],(46)\mathcal{L}_{D}^{(j)} = \mathbb{E}_{y} \left[ \left(D_j(C_j(y))-1\right)^2 \right] + \mathbb{E}_{\hat{y}^{(H)}} \left[ D_j\!\left(C_j(\operatorname{sg}[\hat{y}^{(H)}])\right)^2 \right],\tag{46}

tokenizer的对抗生成器损失是

Ladv(m,j)=Ey^(m)[(Dj(Cj(y^(m)))1)2],m{H,L}.(47)\mathcal{L}_{\mathrm{adv}}^{(m, j)} = \mathbb{E}_{\hat{y}^{(m)}} \left[ \left(D_j(C_j(\hat{y}^{(m)}))-1\right)^2 \right], \quad m\in\{H, L\}.\tag{47}

请注意,仅使用高维重建作为负样本来训练判别器。

feature matching损失也被计算为重建波形和目标波形的判别器隐藏激活之间的逐层归一化 MAE。令 Dj()()D_j^{(\ell)}(\cdot) 表示判别器 DjD_j 的第 \ell 层的隐藏激活,并令 LjL_j 为用于feature matching的隐藏层的数量。我们定义

LFM(m,j)=1Lj=1LjE[mean ⁣(Dj()(Cj(y^(m)))sg ⁣[Dj()(Cj(y))])mean ⁣(sg ⁣[Dj()(Cj(y))])+ϵ],m{H,L}.(48)\mathcal{L}_{\mathrm{FM}}^{(m,j)} = \frac{1}{L_j} \sum_{\ell=1}^{L_j} \mathbb{E} \left[ \frac{ \operatorname{mean}\!\left( \left| D_j^{(\ell)}(C_j(\hat{y}^{(m)})) - \operatorname{sg}\!\left[D_j^{(\ell)}(C_j(y))\right] \right| \right) }{ \operatorname{mean}\!\left( \left| \operatorname{sg}\!\left[D_j^{(\ell)}(C_j(y))\right] \right| \right) +\epsilon } \right], \quad m\in\{H, L\}.\tag{48}

用于训练tokenizer的总体感知损失是

Lperc(m)=jJ(Ladv(m,j)+LFM(m,j)),m{H,L},(49)\mathcal{L}_{\mathrm{perc}}^{(m)} = \sum_{j\in\mathcal{J}} \left( \mathcal{L}_{\mathrm{adv}}^{(m,j)} + \mathcal{L}_{\mathrm{FM}}^{(m,j)} \right), \quad m\in\{H, L\},\tag{49}

判别器的目标是

LD=jJLD(j).(50)\mathcal{L}_{D} = \sum_{j\in\mathcal{J}} \mathcal{L}_{D}^{(j)}.\tag{50}

将所有内容放在一起,整体tokenizer目标采用以下形式

Ltok=Lrec(H)+Lperc(H)+λlow(Lrec(L)+Lperc(L))+λcommitLcommit,(51)\mathcal{L}_{\mathrm{tok}} = \mathcal{L}_{\mathrm{rec}}^{(H)} + \mathcal{L}_{\mathrm{perc}}^{(H)} + \lambda_{\mathrm{low}}\left(\mathcal{L}_{\mathrm{rec}}^{(L)} + \mathcal{L}_{\mathrm{perc}}^{(L)} \right) + \lambda_{\mathrm{commit}} \mathcal{L}_{\mathrm{commit}},\tag{51}

其中 Lcommit\mathcal{L}_{\mathrm{commit}} 是之前定义的双向高低维承诺损失。我们默认设置 λlmag=0.2\lambda_{\mathrm{lmag}}=0.2λlow=0.2\lambda_{\mathrm{low}}=0.2λcommit=0.1\lambda_{\mathrm{commit}}=0.1

4.2 MP-ELD:多路径信息路由的 encoder–LM–decoder 架构

我们发现,把 token 约束在高维球面上,或显式学习低维流形,都不会自动解决 AR 误差累积。根据经验观察,我们推测剩余的重要来源之一是 CFG 下的信息路径冲突:功能部分重叠的 conditioning signal 可能同时出现在多条 CFG 路径中,却以不一致的方式组合;冲突经 AR 循环反馈后,就表现为相应属性的渐进漂移。TTS 系统的退化往往先体现为声学属性漂移,例如频谱失真、响度逐渐偏移或语速变化;内容一致性通常稳定得多。这种不对称表明,误差累积的主要模式是声学状态漂移,而非内容不一致。我们认为其原因是多条 CFG 路径携带部分重叠或冗余的声学线索,guidance 放大后这些线索可能彼此不一致,进而在 AR 推理中造成系统性漂移。基于这一假设,我们把条件信息路由到功能不同的通道,并把多路径 CFG 写成结构化 residual correction,使每个 guidance 分量只针对一种明确职责,避免在路径间隐式纠缠重叠信息。

ELD 框架

我们从 ELD(encoder–LM–decoder)框架出发;这是 in-context 条件 AR 生成的常见范式 [53, 54, 61, 89, 116]。给定用户指定或任务提供的控制信号 cc(如文本、标签或参考输入),ELD 把 cc 与原生 token 前缀 x1:ix_{1:i} 聚合为逐步 conditioning signal cic'_i,decoder 再以 cic'_i 为条件预测下一个原生高维 token:

pθ(xi+1x1:i,c)=pθ(xi+1ci),ci=fθ(x1:i,c).(52)p_\theta(x_{i+1}\mid x_{1:i},c) = p_\theta(x_{i+1}\mid c'_i), \qquad c'_i=f_\theta(x_{1:i},c).\tag{52}

ELD 使用encoder、序列建模模块 (LM) 和Flow Matching decoder构建 cic'_i。token encoder EE 将干净的原生token映射到隐藏表示:

hi=E(xi),hiRDmodel.(53)h_i = E(x_i), \qquad h_i \in \mathbb{R}^{D_{\mathrm{model}}}.\tag{53}

它充当token适配器,将token映射到与序列建模和conditioning更好地保持一致的隐藏空间。控制信号 cc 作为序列 ϕ(c)\phi(c) 嵌入到同一隐藏空间中,并与编码前缀连接:

si=[ϕ(c);h1:i],(54)s_i = [\,\phi(c)\,;\, h_{1:i}\,],\tag{54}

随后,LM 生成逐步 condition vector

c1:i=LM(si),cjRDmodel.(55)c'_{1:i} = \mathrm{LM}(s_i), \qquad c'_j \in \mathbb{R}^{D_{\mathrm{model}}}.\tag{55}

给定 cic'_i 与位置 i+1i+1 的 bridge state,decoder 预测球面端点估计 x^i+1\hat{x}_{i+1}。随后利用上一节的 logarithm-map 构造,在执行 CFG 前把端点估计转换为逐路径、固定范数的 tangent velocity 估计。除逐步 condition vector 外,decoder 还接收 bridge time τ[0,1]\tau \in [0, 1] 及其 time embedding。

为缓解 exposure bias,训练时先给 ground-truth prefix token 加入少量噪声,再送入 encoder。记所得 noisy teacher-forced 原生 token 为

xictx=Corrupt(xi).x_i^{\mathrm{ctx}}=\operatorname{Corrupt}(x_i).

这种做法在局部重建稳定邻域内模拟轻微的推理期分布漂移,是一项标准技术 [17, 82]。推理时,xictxx_i^{\mathrm{ctx}} 表示第 ii 步已生成的原生 token。CFG 只作用在 decoder 端;encoder 与 LM 各计算一次,产生逐步 condition vector。相比让 LM 或 backbone 也参与 CFG 的方案,这样计算量更低,因为 guidance 不需要多次前向运行 encoder 或 LM。

实践中我们发现,当 decoder 使用较强 CFG 时,原始 ELD 框架可能变得脆弱。失效模式主要与两处含混有关:(i)逐步 conditioning signal 应保留哪些信息,以及 decoder 应如何利用或放大它;(ii)CFG 中 decoder 的“有条件”与“无条件”路径应如何定义。完全空的 unconditional path 尤其有问题:它不提供 local-continuity 锚点,还可能产生高方差的早期 velocity 估计,使训练在统计上更困难。基于这些观察,我们提出 ELD 的多路径版本 MP-ELD,使 conditioning signal 的职责显式化。核心是信息路由:构造多条刻意接收不同信息的 conditioning path,使其自然分工。图 2 展示了 MP-ELD 框架。

MP-ELD 框架示意。多个局部 encoder 将同一输入 token 映射到彼此不同的 hidden space,各空间的功能角色由训练动力学与不同 AR 信息路径共同塑造。Flow Matching decoder 在相应路径 embedding 的条件下预测逐路径的下一 token velocity field;推理时,多路径 residual CFG 将这些预测组合起来。

在第 ii 个 AR step,MP-ELD 构造三个逐步条件向量:

  • local-continuity条件 cilcc^{\mathrm{lc}}_i:从当前token派生的local-continuity锚,主要负责强制短程连续性。
  • 自一致性conditioningciscc^{\mathrm{sc}}_i:前缀上模态内部演化的上下文总结,主要负责长时稳定性和内部属性一致性。
  • 对齐一致性条件 ciacc_i^{\mathrm{ac}}:一种感知外部条件的信号,主要负责让生成结果与外部控制信号保持对齐。

三类条件都表示在共享的 DmodelD_{\mathrm{model}} 维条件空间中。为使符号更清楚,我们用 cˉi()\bar c_i^{(\cdot)} 表示各条件向量在解码器一侧的版本;路径配置写成元组,只用于标明其中包含哪些条件分量。

信息建模路径

我们使用三个轻量级token encoder和两个 LM 构建三个条件源:

  • 局部encoder ElcE_{\mathrm{lc}} 从当前token生成local-continuity信号:
cilc=Elc(xictx)RDmodel.(56)c^{\mathrm{lc}}_i = E_{\mathrm{lc}}(x_i^{\mathrm{ctx}}) \in \mathbb{R}^{D_{\mathrm{model}}}.\tag{56}
  • 这可以被视为具有最小自我conditioning的局部延续路径。
  • 自一致性encoder EscE_{\mathrm{sc}} 和自一致性 LM LMsc\mathrm{LM}_{\mathrm{sc}} 从历史token中产生自一致性信号:
hisc=Esc(xictx),c1:isc=LMsc(h1:isc),ciscRDmodel.(57)h^{\mathrm{sc}}_{i}=E_{\mathrm{sc}}(x_i^{\mathrm{ctx}}), \qquad c^{\mathrm{sc}}_{1:i}=\mathrm{LM}_{\mathrm{sc}}(h^{\mathrm{sc}}_{1:i}), \qquad c^{\mathrm{sc}}_i\in\mathbb{R}^{D_{\mathrm{model}}}.\tag{57}
  • 这可以被视为对token历史进行完全自我conditioning的全局延续路径。
  • alignment-consistencyencoder EacE_{\mathrm{ac}} 和alignment-consistency LM LMac\mathrm{LM}_{\mathrm{ac}} 通过将外部条件与历史token相结合来产生对齐信号:
hiac=Eac(xictx),c1:iac=LMac([ϕ(c);h1:iac]),ciacRDmodel.(58)h^{\mathrm{ac}}_{i} = E_{\mathrm{ac}}(x_i^{\mathrm{ctx}}), \qquad c^{\mathrm{ac}}_{1:i} = \mathrm{LM}_{\mathrm{ac}}\big([\phi(c);\, h^{\mathrm{ac}}_{1:i}]\big), \qquad c^{\mathrm{ac}}_i\in\mathbb{R}^{D_{\mathrm{model}}}.\tag{58}
  • 这可以被视为跨模式、外部条件的全局延续路径。

这三个路径可以直观地解释如下:

  • cilcc^{\mathrm{lc}}_i 鼓励短程声学属性(例如音调、相位和能量)的平滑局部连续,并有助于防止突然中断。
  • ciscc^{\mathrm{sc}}_i 捕获缓慢变化的声学属性,这些属性应在语句中保持稳定,例如音色、整体能量分布以及口音或风格。
  • ciacc^{\mathrm{ac}}_i 指示模型在条件内容中的位置,以及接下来应生成的内容,例如,当前步骤应说出文本的哪一部分。

我们使用额外的标量头来增强alignment-consistency LM,用于停止检测。具体来说,除了逐步对齐向量 ciacc^{\mathrm{ac}}_i 之外,alignment-consistency LM 还输出标量

πi[0,1]\pi_i\in[0,1]

表示在步骤ii之后继续生成的概率。在训练过程中,我们使用二元交叉熵损失来监督 πi\pi_i,该损失针对从序列长度导出的真实连续标签。在推理过程中,当 πi<0.5\pi_i<0.5 时,我们终止解码。

正交残差条件化

为了鼓励条件信息的残差、非重叠分解,我们通过 Gram-Schmidt 变换对三个condition vector进行正交化,并将每个分量标准化为固定半径。对于目标半径 r=Dmodelr=\sqrt{D_{\mathrm{model}}},令

Normr(u)=ruu2+ϵ.\operatorname{Norm}_{r}(u) = r\frac{u}{\|u\|_2+\epsilon}.

在 AR 步骤 ii,我们将decoder端conditioning组件构造为

cˉilc=NormDmodel(cilc),(59)\begin{aligned}\bar c^{\mathrm{lc}}_i &= \operatorname{Norm}_{\sqrt{D_{\mathrm{model}}}} \left(c^{\mathrm{lc}}_i\right),\end{aligned}\tag{59}
cˉisc=NormDmodel(cisccisc,cˉilccˉilc22+ϵcˉilc),(60)\begin{aligned}\bar c^{\mathrm{sc}}_i &= \operatorname{Norm}_{\sqrt{D_{\mathrm{model}}}} \left( c^{\mathrm{sc}}_i - \frac{ \langle c^{\mathrm{sc}}_i,\bar c^{\mathrm{lc}}_i\rangle }{ \|\bar c^{\mathrm{lc}}_i\|_2^2+\epsilon } \bar c^{\mathrm{lc}}_i \right),\end{aligned}\tag{60}
cˉiac=NormDmodel(ciacciac,cˉilccˉilc22+ϵcˉilcciac,cˉisccˉisc22+ϵcˉisc).(61)\begin{aligned}\bar c^{\mathrm{ac}}_i &= \operatorname{Norm}_{\sqrt{D_{\mathrm{model}}}} \left( c^{\mathrm{ac}}_i - \frac{ \langle c^{\mathrm{ac}}_i,\bar c^{\mathrm{lc}}_i\rangle }{ \|\bar c^{\mathrm{lc}}_i\|_2^2+\epsilon } \bar c^{\mathrm{lc}}_i - \frac{ \langle c^{\mathrm{ac}}_i,\bar c^{\mathrm{sc}}_i\rangle }{ \|\bar c^{\mathrm{sc}}_i\|_2^2+\epsilon } \bar c^{\mathrm{sc}}_i \right).\end{aligned}\tag{61}

直观上,这种正交化操作鼓励每个condition vector对前面的condition vector不包含的残差信息进行编码。这允许我们将全路径条件定义为正交分量的总和,而不是原始向量的串联,这还可以在 DmodelD_{\mathrm{model}} 较大时控制整体条件维度和相关模型复杂性。

多路径 residual CFG

使用上述正交化分量后,CFG dropout 只施加在非局部分支,而 local-continuity 锚点 cˉilc\bar c_i^{\mathrm{lc}} 始终保留。这样训练期间一直存在可用的局部延续信号。给定一组路径开关后,加法式路径条件写为

c~i=cˉilc+δisccˉisc+δiaccˉiac,δisc,δiac{0,1}.(62)\tilde c_i = \bar c_i^{\mathrm{lc}} + \delta_i^{\mathrm{sc}}\bar c_i^{\mathrm{sc}} + \delta_i^{\mathrm{ac}}\bar c_i^{\mathrm{ac}}, \qquad \delta_i^{\mathrm{sc}},\delta_i^{\mathrm{ac}}\in\{0,1\}.\tag{62}

decoder 接收 additive path condition 与 bridge-time embedding etime(τ)e_{\mathrm{time}}(\tau) 的拼接,记作 qi(τ)q_i(\tau)。本文采用三种路径配置:

  • LL:仅local-continuity,
c~iL=cˉilc,qiL(τ)=[c~iL ; etime(τ)];\tilde c_i^{L} = \bar c_i^{\mathrm{lc}}, \qquad q_i^{L}(\tau) = \left[ \tilde c_i^{L}\ ;\ e_{\mathrm{time}}(\tau) \right];
  • LSLS:local-continuity和self-consistency,
c~iLS=cˉilc+cˉisc,qiLS(τ)=[c~iLS ; etime(τ)];\tilde c_i^{LS} = \bar c_i^{\mathrm{lc}} + \bar c_i^{\mathrm{sc}}, \qquad q_i^{LS}(\tau) = \left[ \tilde c_i^{LS}\ ;\ e_{\mathrm{time}}(\tau) \right];
  • LSALSA:local-continuity、自一致性和alignment-consistency,
c~iLSA=cˉilc+cˉisc+cˉiac,qiLSA(τ)=[c~iLSA ; etime(τ)].\tilde c_i^{LSA} = \bar c_i^{\mathrm{lc}} + \bar c_i^{\mathrm{sc}} + \bar c_i^{\mathrm{ac}}, \qquad q_i^{LSA}(\tau) = \left[ \tilde c_i^{LSA}\ ;\ e_{\mathrm{time}}(\tau) \right].

在训练过程中,我们用概率对三个路径进行采样

Pr(L)=0.1,Pr(LS)=0.1,Pr(LSA)=0.8.\Pr(L)=0.1,\qquad \Pr(LS)=0.1,\qquad \Pr(LSA)=0.8.

在推理时,对于每个conditioning path,我们使用相应的串联条件 qiL(τ)q_i^{L}(\tau)qiLS(τ)q_i^{LS}(\tau)qiLSA(τ)q_i^{LSA}(\tau) 运行decoder,使用前面描述的端点到速度结构将其端点预测转换为切线速度估计,然后线性组合这些切线速度估计。对这三个conditioning path进行残差分解后,我们执行多路径残差 CFG:

vτ=vτL+λsc(vτLSvτL)+λac(vτLSAvτLS),(63)v_{\tau} = v_{\tau}^{L} + \lambda_{\mathrm{sc}}\big(v_{\tau}^{LS}-v_{\tau}^{L}\big) + \lambda_{\mathrm{ac}}\big(v_{\tau}^{LSA}-v_{\tau}^{LS}\big),\tag{63}

其中,vτLSvτLv_{\tau}^{LS}-v_{\tau}^{L} 是相对于 local-continuity 路径的 self-consistency residual,vτLSAvτLSv_{\tau}^{LSA}-v_{\tau}^{LS} 是相对于 self-consistency 路径的 alignment residual。当 λsc=λac=1\lambda_{\mathrm{sc}}=\lambda_{\mathrm{ac}}=1 时,推理退化为无 guidance 的 vτ=vτLSAv_{\tau}=v_{\tau}^{LSA},与标准 full-condition path 一致。

虽然每个路径速度是从前面描述的端点参数化仅方向构造获得的,但我们没有将 CFG 组合速度 vτv_\tau 重新归一化回固定大小 πR/2\pi R/2。由于所有路径速度都是相同桥状态 xτx_\tau 的tangent vector,因此它们的线性组合保持在相同的切空间中:

vτL,vτLS,vτLSATxτSDtok1(R)vτTxτSDtok1(R).v_{\tau}^{L},\,v_{\tau}^{LS},\,v_{\tau}^{LSA} \in T_{x_\tau}\mathbb{S}^{D_{\mathrm{tok}}-1}(R) \quad\Longrightarrow\quad v_\tau\in T_{x_\tau}\mathbb{S}^{D_{\mathrm{tok}}-1}(R).

因此,保持 CFG 组合幅度不会违反球面几何形状。 CFG 之后不固定大小的原因是固定的速度范数也固定了总路径长度。如果将所有 τ[0,1]\tau\in[0, 1] 的速度重新归一化为 vτ2=πR/2\|v_\tau\|_2=\pi R/2,则生成的轨迹具有总长度

01vτ2dτ=πR2.\int_0^1 \|v_\tau\|_2\,d\tau = \frac{\pi R}{2}.

当轨迹接近高维 SFM geodesic时,这是合适的,其典型端点距离约为 πR/2\pi R/2。然而,在CFG之后,引导矢量场可能不再完全遵循geodesic方向;由此产生的轨迹可以是弯曲的。连接相同概念端点的弯曲轨迹通常需要不同的路径长度,通常大于geodesic长度。在这种情况下强制使用固定的总长度可能会不必要地限制引导 ODE,并且可能会阻止轨迹在学习的向量场下到达所需的端点。通过允许 CFG 残差改变速度大小,制导不仅可以调整切线方向,还可以调整有效积分速度。这为引导轨迹提供了额外的灵活性,同时仍然保持与球体的相切。

随 bridge time 变化的 CFG guidance

经验上,外推 self-consistency residual,即令 λsc>1\lambda_{\mathrm{sc}}>1,对提高 in-context 与 in-domain 一致性(例如说话人音色一致性)很重要;但它同时也是分布漂移和长时误差累积的主要来源。相较之下,外推 alignment residual,即令 λac>1\lambda_{\mathrm{ac}}>1,主要增强条件可控性,我们没有观察到它造成同等程度的漂移。我们进一步推测,self-consistency 外推的不稳定主要源于小 τ\tau 区域内 vτLv_{\tau}^{L} 的估计不可靠:LL 路径只包含局部延续信息,在 bridge 早期估计 flow output 时,信息量显著少于 LSLS 路径。因此,把 vτLv_{\tau}^{L} 作为 self-consistency 外推的基点可能并不可靠,外推后会产生偏离流形的中间状态,并在 AR 迭代中放大误差。alignment residual 则以 vτLSv_{\tau}^{LS} 而非 vτLv_{\tau}^{L} 为基准,沿 vτLSAvτLSv_{\tau}^{LSA}-v_{\tau}^{LS} 的外推通常能在整个 bridge-time 范围内保持稳定。基于这一观察,我们让 self-consistency guidance weight λsc(τ)\lambda_{\mathrm{sc}}(\tau) 随时间变化,避免在早期从不可靠基点外推。具体而言,从 λsc(0)=1\lambda_{\mathrm{sc}}(0)=1 开始,再逐渐增大到预设上限 λscmax\lambda_{\mathrm{sc}}^{\max}

λsc(τ)=1+(λscmax1)s(τ),s(0)=0,s(1)=1,(64)\lambda_{\mathrm{sc}}(\tau) = 1+\big(\lambda_{\mathrm{sc}}^{\max}-1\big)s(\tau), \qquad s(0)=0,\quad s(1)=1,\tag{64}

其中 s(τ)s(\tau) 是非递减时间表,例如,

s(τ)=τγ,γ>0.s(\tau)=\tau^\gamma,\qquad \gamma>0.

默认情况下,我们保持 λac\lambda_{\mathrm{ac}} 不变。

球面上的黎曼积分

执行 CFG 后,组合速度仍是当前 bridge state 处的 tangent vector:

vτTxτSDtok1(R).v_{\tau} \in T_{x_\tau}\mathbb{S}^{D_{\mathrm{tok}}-1}(R).

为在数值积分时保持球面约束,我们用 Riemannian exponential map 更新 bridge state。对步长 Δτ\Delta\tau,更新为

xτ+Δτ=Expxτ ⁣(Δτvτ),(65)x_{\tau+\Delta\tau} = \operatorname{Exp}_{x_\tau}\!\left(\Delta\tau\,v_\tau\right),\tag{65}

其中,对于任何tangent vector uTxSDtok1(R)u\in T_x\mathbb{S}^{D_{\mathrm{tok}}-1}(R)

Expx(u)=cos ⁣(u2R)x+Rsin ⁣(u2R)uu2.(66)\operatorname{Exp}_{x}(u) = \cos\!\left(\frac{\|u\|_2}{R}\right)x + R\sin\!\left(\frac{\|u\|_2}{R}\right) \frac{u}{\|u\|_2}.\tag{66}

Bridge-time 采样

在训练期间,bridge time是从简单的混合分布中采样的。以概率 0.750.75,我们采样

aN(1,1),τ=σ(a)=11+exp(a),a \sim \mathcal{N}(-1,1), \qquad \tau = \sigma(a)=\frac{1}{1+\exp(-a)},

也就是说,τ\tau 服从一个偏向 bridge 早期高噪声区间的 logit-normal 分布。以剩余的 0.250.25 概率,我们采样

τUnif(0,1).\tau \sim \mathrm{Unif}(0,1).

此采样规则将更多的训练概率分配给小 τ\tau 状态,其中桥状态更接近noise source,并且降噪问题更加模糊,而均匀组件保证整个bridge 区间的非零覆盖,包括中等和大 τ\tau 低噪声区域。

5 实验与结果

本节从两个互补角度评估 Locodec 与 MP-ELD。第一,考察 token 空间塑形机制在改变 latent space 几何与统计特性的同时,能否保持重建质量;第二,检验塑形后的表征是否更易预测,以及 MP-ELD 能否在维持短时生成质量的同时改善长时稳定性。

5.1 实验设置

这项工作的核心动机是研究在相对于大型工业系统的适度模型大小和有限预算的情况下,可以从表示空间和生成框架设计中获得多少收益。我们并不试图建立通用的缩放法则或声称设计选择普遍主导数据规模或模型规模。相反,通过使用相对有限的数据和模型大小,并通过避免外部预训练组件和post-training阶段,我们的目标是使token空间整形和信息路由的影响更容易隔离。此设置使我们能够测试是否可以获得强大的重建质量和稳定的 AR 生成,而无需仅依赖更大的数据集、更大的模型或额外的预训练归纳偏差。

数据集与评测

Locodec 在内部双语秒级语音数据集上训练;MP-ELD 则使用同时包含秒级和分钟级语句的内部双语数据集,两者的数据都来自真实录音。tokenizer 重建与生成合成都在 Seed-TTS-eval [4] 上评测:ZH 子集含来自 DiDiSpeech 2 [45] 的 20202020 条语句,EN 子集含来自 Common Voice [5] 的 10881088 条语句。此外,我们从真实录音中构建了一个较小的中文中等时长测试集,用于高效搜索 CFG 网格;还构建了一个中文长时测试集,用于分析不同 CFG 配置下的长程 AR 误差累积。

对 tokenizer 重建,我们报告面向保真度的指标,包括 Mel-cepstral distortion(MCD)1[57]、STOI2[97] 和 ViSQOL3[26]。对重建和生成,我们还报告面向任务的 word error rate(WER)与 speaker similarity(SIM);评测模型和配置沿用 DiTAR [53]。在长时测试集上,我们把每条生成语句额外切成互不重叠的 1010 秒片段,并报告 segment-level SIM;同时给出频谱可视化,展示 AR 误差累积在声学上的具体表现。

Locodec 配置

对于2424-kHz立体声音频,Locodec使用512512点MDCT窗口作为信号前端,我们将1111相邻MDCT帧分组并将它们映射到一个token中。生成的帧率约为 8.58.5 Hz,为简单起见,我们将其称为 88-Hz token。原生高维token维度固定为 Dtok=768D_{\mathrm{tok}}=768。该encoder由 66 FFN 块组成,后跟单步线性下采样层。decoder由token网格上的 66 因果 ConvNeXt1D 块和 MDCT 系数网格上的 1212 因果 ConvNeXt1D 块组成。所有 ConvNeXt1D 块都使用内核大小 77 和因果左零填充,并且encoder和decoder中的所有 FFN 都是 SwiGLU FFN [92]。在此配置下,encoder具有用于一秒输入的 59.559.5M 参数和 5.15.1G MAC,而decoder具有用于一秒输入的 180.9180.9M 参数和 12.312.3G MAC。对于更高的采样率或非语音音频(例如立体声音乐),可以相应地调整 MDCT 窗口大小、token率和模型大小。我们将此类扩展排除在本文的讨论范围之外。

我们评估五个核心流形维度 dcore{768,256,64,32,16}d_{\mathrm{core}}\in\{768,256,64,32,16\},其中 dcore=768d_{\mathrm{core}}=768 相当于不施加较低维度的瓶颈。对于 dcore{64,32,16}d_{\mathrm{core}}\in\{64,32,16\},我们还训练了具有postfix dimension dropout 的变体,以下简称 PDD。这总共提供了八种 Locodec 配置。所有tokenizer均在 11 秒音频剪辑上进行训练,250250k 迭代的全局批量大小为 256256 秒。

MP-ELD 配置

对每个 Locodec 配置,我们都训练一个对应的 MP-ELD。MP-ELD 包含三个 token encoder,每个 encoder 由 33 个 FFN block 组成,分别对应 local-continuity、self-consistency 和 alignment-consistency 路径。alignment-consistency LM 是 1212 层 RoFormer [95],self-consistency LM 是 33 层 RoFormer;Flow Matching decoder 是带 adaLN-Zero conditioning 的 33 block FFN 网络 [85]。所有 FFN 均采用 SwiGLU。encoder 与 LM 的 hidden size 为 15361536,decoder hidden size 为 20482048,time embedding 维度为 256256。完整模型有 0.740.74B 参数。三个 token encoder 合计 180.6180.6M 参数,处理一秒输入(88 个 token)需要 1.41.4G MAC;decoder 有 127.7127.7M 参数,一秒输入需要 1.01.0G MAC。所有模型训练 400400k 步,每步使用 200200k token 的全局预算(包括音素与音频 embedding)。推理采用模型的 EMA 版本,默认衰减率为 0.99950.9995;使用 2020 NFE,并通过 token 球面上的 Riemannian exponential map 积分。

沿用 DiTAR,我们以音素作为文本前端,并采用相同的 in-context learning(ICL)形式。训练时,每个样本被序列化为音素序列及其对应的音频 token 序列,即 (phoneme,audio)(\text{phoneme}, \text{audio});Flow Matching 的下一 token 预测损失只施加在音频 token 上。推理时,模型输入为 (prompt phoneme,target phoneme,prompt audio)(\text{prompt phoneme}, \text{target phoneme}, \text{prompt audio}),并从 prompt audio token 开始,自回归生成目标音频 token。

在实际系统中,可以在 MP-ELD 管道的多个阶段引入预训练组件。例如,alignment-consistency路径可以使用预训练的文本 LM 或预训练的跨模式对齐模型,而token encoder或条件encoder可以从强 SSL 或 ASR 模型初始化,以提供额外的语义或声学归纳偏差。这些扩展与 MP-ELD 配方兼容,可以进一步提高性能。然而,在这项工作中,我们故意避免在任何 MP-ELD 组件中使用预训练模型,并从头开始训练所有encoder、LM 和decoder。这可以防止外部预训练表示主导信息布局,并允许我们测试所提出的local-continuity、self-consistency和alignment-consistency路由行为是否可以仅从训练目标和架构中出现。

5.2 重建结果

我们首先评估所提出的token 空间整形机制是否影响tokenizer重建质量。表 2 报告了 Seed-TTS-eval 上的全维token重建质量,其中使用原生 768768 维高维token执行重建。在我们的训练配置下,施加低维核心流形不会降低全维token重建质量。在没有 PDD 的 dcore{768,256,64,32,16}d_{\mathrm{core}}\in\{768,256,64,32,16\} 中,所有指标几乎保持不变。事实上,核心维度上的微小变化与正常训练变化相当,并且随着核心维度的减小,没有观察到重建保真度的一致损失。这表明低维重建路径可以重塑高维token空间的几何形状,而不会显著减少完整原生token保留的信息。

PDD 的效果略有不同。与相应的非 PDD 配置相比,PDD 导致 MCD 轻度退化,表明光谱失配略有增加。然而,它对其余指标的影响很小:STOI 和 ViSQOL 几乎保持不变,面向任务的 WER 和 SIM 分数仅显示出可以忽略不计的差异。由于除了 MCD 之外的所有指标都是在 1616 kHz 下计算的,PDD 主要影响 MCD,而 STOI、ViSQOL、WER 和 SIM 基本不变,这一事实表明,诱导的坐标能量层次结构主要在不太关键的频谱细节中引入了轻微的不匹配,特别是在中频和高频区域,同时保留了清晰度、感知质量和说话人身份所需的核心低频和中频信息。

为了提供 PDD 引起的能量偏差的直观视图,图 3 可视化了平均坐标token能量。如果没有 PDD,原生高维token能量在各个维度上几乎是均匀的。使用PDD,前缀维度获得更大的能量,后缀维度获得更小的能量,并且每维度能量的对数与维度索引近似线性衰减。这表明噪声注入和 PDD 的组合通过训练动态有效地诱导稳定的坐标能量偏差,而无需明确规定目标能量分布。

Seed-TTS-eval 上不同 Locodec 配置的全维token重建质量。使用原生 768768 维高维token执行重建。
dcored_{\mathrm{core}}PDDZHEN
MCD \downarrowSTOI \uparrowViSQOL \uparrowWER (\%) \downarrowSIM \uparrowMCD \downarrowSTOI \uparrowViSQOL \uparrowWER (\%) \downarrowSIM \uparrow
768×\times2.320.984.651.340.7402.560.984.652.180.714
256×\times2.380.984.641.320.7402.640.984.642.160.713
64×\times2.270.984.681.330.7402.510.984.682.200.715
\checkmark2.620.974.611.370.7362.850.984.632.260.711
32×\times2.220.984.681.320.7412.440.984.672.150.716
\checkmark2.600.974.631.360.7372.840.984.632.140.712
16×\times2.210.984.681.330.7422.420.984.682.130.717
\checkmark2.510.984.631.340.7382.720.984.642.190.713
Locodec token的坐标能量分布。当与旋转噪声注入相结合时,PDD 自动产生稳定的前缀到后缀能量层次结构,而没有后缀 dropout 的模型在各个维度上保持几乎均匀的能量分布。
从启用 PDD 的 Locodec 模型的受限表示进行重建。 “核心”表示从提升的低维 token进行重建。 “Prefix-KK”表示仅保留原生高维 token的前 KK 维度并将剩余维度归零后的重建。
dcored_{\mathrm{core}}表征ZHEN
MCD \downarrowSTOI \uparrowViSQOL \uparrowWER (\%) \downarrowSIM \uparrowMCD \downarrowSTOI \uparrowViSQOL \uparrowWER (\%) \downarrowSIM \uparrow
16Core6.530.833.1515.810.3966.630.833.2923.000.284
Prefix-167.930.752.7862.900.3348.090.762.8672.370.164
Prefix-326.450.843.2318.630.4116.620.843.3624.650.295
Prefix-645.110.903.713.860.5405.350.903.836.460.482
Full2.510.984.631.340.7382.720.984.642.190.713
32Core5.240.893.604.920.4845.470.893.747.690.417
Prefix-168.030.742.7260.580.3358.170.752.8572.110.160
Prefix-326.350.833.2618.300.4266.470.843.4124.420.304
Prefix-645.090.893.704.140.5405.300.903.826.210.477
Full2.600.974.631.360.7372.840.984.632.140.712
64Core4.500.923.962.470.5954.770.924.063.870.553
Prefix-167.930.742.7761.940.3447.960.752.9168.410.187
Prefix-326.310.833.2716.920.4266.440.843.4226.250.306
Prefix-645.000.903.734.100.5485.210.903.855.980.483
Full2.620.974.611.370.7362.850.984.632.260.711

我们进一步检查显式学习的低维核心与 PDD 引入的前缀子空间之间的关系。此分析仅对启用 PDD 的tokenizer有意义,因为如果没有 PDD,则不会训练坐标顺序来承载前缀到后缀的可用性层次结构。因此,我们使用 dcore{16,32,64}d_{\mathrm{core}}\in\{16,32,64\} 评估三种启用 PDD 的配置。对于每种配置,我们比较来自三种受限表示的重建:提升的低维核心token、原生高维token的前缀 KK 子空间以及完整的原生token。对于前缀 KK 重建,我们仅保留原生token的第一个 KK 坐标,并将所有剩余坐标设置为零,然后将token馈送到decoder,而不进行重新归一化。这与训练时后缀丢失corruption的形式相匹配。

结果如表 3 所示。它们表明,前缀子空间确实形成了一个功能层次结构:在每个启用 PDD 的tokenizer中,重建质量从 Prefix-1616 到 Prefix-3232,然后到 Prefix-6464 持续提高。这证实了 PDD 引起的能量分布不仅仅是统计伪影,而且对应于可解码信息的实际排序,其方式大致类似于 RVQ 中从粗到细的信息层次结构。同时,核心维度并不等于前缀维度:对于相同的标称维度,Core-dd 始终优于 Prefix-dd,即使低维重建路径在训练期间被降低权重。这表明低维路径对token空间保持着有效的整形压力。我们还观察到,固定前缀长度的重建质量在 dcored_{\mathrm{core}} 的不同选择中基本稳定。例如,Prefix-6464dcore=16,32,d_{\mathrm{core}}=16,32,6464 提供非常相似的重建指标。这表明原生坐标层次结构主要由 PDD 可用性偏差决定,而 dcored_{\mathrm{core}} 的选择主要影响显式核心表示的质量。最后,Prefix-KK 不限于在其活动 KK 维子空间内具有固定范数:掩蔽后,其范数发生变化,并且其坐标能量高度不均匀。从这个意义上说,它在几何上比固定半径核心表示受到的约束更少,并且原则上具有额外的径向自由度。尽管如此,在相同标称尺寸(包括 K=64K=64)下,Prefix-KK 仍然弱于 Core-KK。不同的退出计划或更长的训练可能会改善固定前缀重建,但我们将这个方向排除在本研究的范围之外。总而言之,这些结果表明低维约束和 PDD 发挥着互补作用,并且它们不会引入会损害全维token重建质量的严重冲突。

Locodec 在不同 token 旋转角与保留前缀维度下的重建频谱。各列对应不同旋转角,各行对应不同的保留前缀维度。

正如第 3 节中所讨论的,PDD 不用作孤立的掩蔽技巧:它的可用性偏差与球面噪声注入相结合,因此更频繁地保持可用的维度也被鼓励在角度corruption下变得更容易识别。为了提供这种联合训练方案引起的重建行为的直观视图,图 4 可视化了在不同旋转角度和保留的前缀维度下使用 dcore=16d_{\mathrm{core}}=16 启用 PDD 的tokenizer的重建。我们将高维 token旋转角度 θ{0,15,30,45,60,75}\theta\in\{0^\circ,15^\circ,30^\circ,45^\circ,60^\circ,75^\circ\},并从前缀维度 K{8,16,64,256,768}K\in\{8,16,64,256,768\} 进行解码。可视化显示了随着角度corruption变得更强以及保留的前缀维度越来越少,重建质量如何变化,从而提供了decoder鲁棒性和 PDD 引起的信息层次结构的定性视图。值得注意的是,即使在大角度扰动下,全维token仍然保持相当好的频谱质量,例如可视化中的 6060^\circ。这种行为受到训练时球面corruption的鼓励,其最大旋转角度为 9090^\circ,并且表明decoder在每个token周围学习相对较大的重建稳定盆地。然而,如前所述,在无约束的高维空间中学习如此大的盆地可能会促使不同的token变得广泛分离,甚至接近正交,从而削弱可插值性。因此,低维核心约束对于防止鲁棒性纯粹依赖于高维角距非常重要。我们在下面的生成结果中回到这一点。

5.3 生成结果

八种 Locodec 配置对应的 MP-ELD cosine direction loss 训练曲线。记号 d/PDDd/\mathrm{PDD} 表示 core dimension 及是否使用 PDD。所有 MP-ELD 模型采用相同架构与训练设置;收敛越快、最终 loss 越低,说明在固定生成器条件下,对应 token 表征越易预测。

接下来我们评估不同的 Locodec 表示如何影响 AR 连续token生成。对于八个tokenizer配置中的每一个,我们都使用相同的架构、训练数据、优化设置和训练预算来训练 MP-ELD 模型。在这种受控设置下,生成模型训练损失的收敛行为和绝对值为token可预测性提供了经验代理:如果同一生成器在一个token表示上收敛得更快并且达到比在另一个token表示上更低的训练损失,则可以认为前一种表示在固定生成器配置下更容易建模。

图 5 给出八种 Locodec 配置对应的 MP-ELD cosine direction loss。第一个明显趋势是,加入低维 core manifold 会显著提高可预测性:无 bottleneck 的 768/×768/\times 收敛最慢、最终 loss 最高;把 core dimension 降至 256256 已能明显降低 loss,继续降至 646432321616 还会进一步改善。不过,这种收益不会无限单调增长。core dimension 足够小时,增益基本饱和:dcore{64,32,16}d_{\mathrm{core}}\in\{64,32,16\} 的无 PDD 配置收敛到相近 loss。这说明低维约束能把高维 token 空间组织成更易预测的几何结构,但任意缩小 core dimension 并不会持续带来成比例收益。

第二个也是更明显的趋势是 PDD 的效果。对于所有核心维度,支持 PDD 的模型收敛速度更快,并且比非 PDD 模型的损耗显著降低。这表明 PDD 引起的坐标能量偏差在单token可预测性方面提供了超出低维流形约束的额外且强大的改进。在启用PDD的配置中,dcore=32d_{\mathrm{core}}=32实现了最低的最终损耗,而dcore=16d_{\mathrm{core}}=166464稍差。因此,从生成器侧可预测性的角度来看,非PDD和PDD的比较共同为我们的假设提供了经验支持,即适度的低维核心流形可以使高维token空间更容易建模,并且PDD引起的额外可辨识性可以进一步提高这种可预测性。

内部 CFG 选择集上不同 CFG 配置下的 WER/SIM 权衡。每个点对应于 (λscmax,λac,γ)(\lambda_{\mathrm{sc}}^{\max}, \lambda_{\mathrm{ac}}, \gamma) 扫描的一个设置。散点图显示alignment-consistency指导主要影响 WER,而自一致性指导主要影响 SIM,并且bridge time调度控制由自一致性外推引起的权衡。较暗的点表示配置更接近首选的低 WER、高 SIM 区域。

由于支持 PDD 的 dcore=32d_{\mathrm{core}}=32 tokenizer在所有测试配置中实现了最低的训练损失,因此我们使用它作为默认表示来研究 CFG 配置对 WER 和 SIM 之间平衡的影响。我们在预定义网格上的较小内部评估集上扫描 CFG 超参数:

λscmax{1,1.5,2,2.5},λac{1,1.5,2,2.5},γ{0,1,2}.\lambda_{\mathrm{sc}}^{\max}\in\{1,1.5,2,2.5\}, \qquad \lambda_{\mathrm{ac}}\in\{1,1.5,2,2.5\}, \qquad \gamma\in\{0,1,2\}.

这里 γ=0\gamma=0 表示恒定 self-consistency guidance,即 s(τ)1s(\tau)\equiv 1γ>0\gamma>0 则使用延迟调度 s(τ)=τγs(\tau)=\tau^\gammaλscmax=λac=1\lambda_{\mathrm{sc}}^{\max}=\lambda_{\mathrm{ac}}=1 对应不使用 CFG 的标准全条件路径 vτ=vτLSAv_\tau=v_\tau^{LSA}。当 λscmax=1\lambda_{\mathrm{sc}}^{\max}=1 时,γ\gamma 的取值不起作用。组合后共有 4040 种配置。

图 6 展示 WER/SIM 权衡。最明显的趋势是,alignment-consistency guidance scale 决定模型能否进入内容对齐的生成区间。当 λscmax=1\lambda_{\mathrm{sc}}^{\max}=1 时,把 λac\lambda_{\mathrm{ac}}11 依次提高到 1.51.5222.52.5,会把模型从高 WER 区推向明显更低的 WER 区,WER 由 10%10\% 以上降至约 2.62.62.9%2.9\%。在此过程中,SIM 先升后降,说明更强的 alignment guidance 主要改善内容跟随,但过度外推会开始牺牲声学相似度。这与 alignment-consistency residual vτLSAvτLSv_\tau^{LSA}-v_\tau^{LS} 的预期职责一致:它主要承担外部条件对齐校正,而非一般性的声学一致性校正。

self-consistency guidance 呈现出不同作用。在有效的低 WER 区域内,增大 λscmax\lambda_{\mathrm{sc}}^{\max} 对 SIM 的改善通常比对 WER 更直接。例如,在对齐强度相近时,把 self-consistency scale 从 1.51.5 增至 222.52.5,可把 SIM 从 0.740.74 区间中部提高到约 0.760.76,而 WER 变化较小,仍落在同一低 WER 区域。这支持如下解释:self-consistency residual vτLSvτLv_\tau^{LS}-v_\tau^{L} 主要增强模态内部的声学一致性,包括说话人身份和缓慢变化的声学状态。

然而,更强的self-consistency指导并不意味着单调的 SIM 改进。当alignment-consistency比例不足时(例如 λac=1\lambda_{\mathrm{ac}}=1),增加 λscmax\lambda_{\mathrm{sc}}^{\max} 并不能挽救高 WER。此外,SIM 也变得非单调,并且在某些配置下可能会大幅下降。这表明,如果模型没有与外部条件正确对齐,则放大self-consistency residual可能反而会强化不稳定的声学轨迹。在这种情况下,累积的声学失真不仅会降低清晰度,还会降低说话人相似度度量本身。

调度参数 γ\gamma 进一步控制 self-consistency guidance 在 bridge time 上的激进程度。在相同 (λscmax,λac)(\lambda_{\mathrm{sc}}^{\max},\lambda_{\mathrm{ac}}) 下,γ=0\gamma=0 的恒定 guidance 通常带来更高 SIM,却也会让结果远离最佳 WER 区域。例如,当 (λscmax,λac)=(2.5,2.5)(\lambda_{\mathrm{sc}}^{\max},\lambda_{\mathrm{ac}})=(2.5,2.5) 时,γ=0\gamma=0 得到很高的 SIM,但 WER 也更高;γ=1\gamma=1γ=2\gamma=2 的延迟调度会减少早期 self-consistency 外推,获得更平衡的 WER/SIM 权衡。这与时变 guidance schedule 的动机一致:self-consistency guidance 有用,但在 bridge 早期高噪声区间施加过强,会使 residual extrapolation 变得不可靠。

总而言之,这次扫描提供了经验证据,表明 MP-ELD 从头开始学习了有意义的信息路由程度。然而,更改 λac\lambda_{\mathrm{ac}}λscmax\lambda_{\mathrm{sc}}^{\max} 会在 WER/SIM 平面中产生不同且可解释的移动:alignment-consistency残差主要影响内容对齐,而self-consistency residual主要影响声学和说话人一致性。网格搜索还确定了一组帕累托竞争的 CFG 配置,我们从中选择最佳的整体 WER/SIM 权衡,以便与之前的系统进行比较。

在不同 CFG 配置下生成的相同语句的声谱图。每个标题都会报告生成的示例的 (λscmax,λac,γ)(\lambda_{\mathrm{sc}}^{\max},\lambda_{\mathrm{ac}},\gamma)、WER 和 SIM。这六个示例按照 SIM 递增的顺序从左上到右下排序。可视化结果显示,不同的 CFG 配置会导致不同形式的 AR 误差累积,包括早期崩溃、延迟频谱漂移、谐波重复和频带能量漂移。

为理解 WER/SIM 差异对应怎样的声学现象,图 7 展示同一代表性语句在不同 CFG 配置下的生成声谱图。六个结果来自同一模型、同一 tokenizer 与同一输入,仅 CFG 配置不同,并按该语句的 SIM 从左上到右下递增排列:第一行是最低 SIM 的两个配置,第二行是中等 SIM,第三行是最高 SIM。与单独的 WER/SIM 散点图相比,这一可视化更直接地揭示 guidance 选择如何改变生成信号的声学结构。

首先可以看到,严重的 AR 误差累积会明确反映在指标上:一旦出现明显漂移或坍塌,WER 与 SIM 至少有一项会显著恶化。同时,误差开始累积的时刻并不固定。第一行中,退化很早便出现并主导了大部分生成波形;在中右、左下等其他配置中,开头尚属合理,几秒后才开始漂移。漂移的声学表现也不止一种:可能出现被拉长或局部重复的谐波结构、逐渐增强的类噪声能量,或能量随时间缓慢升降的频带。实践中还观察到语速持续加快、整体响度漂移等失效模式,但受篇幅限制未在图中展示。

第一行说明足够强的 alignment-consistency guidance 至关重要。两个样例都采用 λac=1\lambda_{\mathrm{ac}}=1γ=0\gamma=0,并都出现严重误差累积。无外推的 (1,1,0)(1,1,0) 已无法在该样本上维持有效的内容对齐轨迹,WER 达到 100%100\%。只增大 self-consistency guidance(如 (2.5,1,0)(2.5,1,0))也不能挽救这一失败;生成反而陷入漫长、声学上自我强化的轨迹,SIM 甚至更低。这与 CFG 扫描的解释一致:self-consistency residual 不能替代 alignment-consistency residual。若对齐 guidance 不足,放大 self-consistency 只会强化错误的声学延续,而不会恢复目标内容。

第二行单独考察调度参数 γ\gamma。两种配置具有相同的 guidance scale (λscmax,λac)=(2.5,2.5)(\lambda_{\mathrm{sc}}^{\max},\lambda_{\mathrm{ac}})=(2.5,2.5),区别只在 self-consistency schedule。采用恒定 guidance(γ=0\gamma=0)时,声谱图约在 77 秒后出现明显漂移:4455 kHz 附近能量逐渐升高,相邻频带也出现不同程度的放大或衰减。采用延迟 guidance(γ=2\gamma=2)后,整句频谱更稳定。值得注意的是,尽管 γ=0\gamma=0 的 WER 更高、频谱失真更明显,它的 utterance-level SIM 反而略高。这说明只看 utterance-level SIM,无法可靠判断实际音质与稳定性。

第三行进一步表明,即使 WER 和 SIM 值相似也不一定意味着相同的声学行为。这两种配置获得几乎相同的语句级指标,但左下角的示例在大约 77 秒后仍然显示出轻微的频带漂移,特别是在 33 kHz 和 66 kHz 区域附近,而右下角的示例在整个语句中保持更稳定。这表明 WER 和 SIM 等自动指标很有用,但对生成质量的总结并不完整,因为即使最终的语句级别分数相似,它们也可能无法捕获微妙的频谱漂移或缓慢积累的声学伪影。

为进一步考察这一局限,我们在长时评测集上同时使用 global-level 与 segment-level 指标。根据上述 CFG 扫描,从核心工作区间选取 1818 个代表性配置,

λscmax{2,2.5},λac{1.5,2,2.5},γ{0,1,2}.\lambda_{\mathrm{sc}}^{\max}\in\{2,2.5\}, \qquad \lambda_{\mathrm{ac}}\in\{1.5,2,2.5\}, \qquad \gamma\in\{0,1,2\}.

对于每个生成的语句,我们保留前一个 5050 秒,将其分成五个不重叠的 1010 秒段,并计算每个段的 SIM。图 8 报告了数据集级平均段 SIM 以及 95%95\% 置信区间。每个子图都会修复 (λscmax,λac)(\lambda_{\mathrm{sc}}^{\max},\lambda_{\mathrm{ac}}) 并比较不同的 γ\gamma 值。我们还在图例中报告了全局 WER 和全局 SIM (global SIM)。为了便于阅读,在每个子图中,我们注释了具有最佳整体稳定性与质量权衡的配置的分段平均 SIM 值。

代表性 CFG 配置的长时 segment-level SIM。每条生成语句被切成五个互不重叠的 1010 秒片段。每个子图固定 (λscmax,λac)(\lambda_{\mathrm{sc}}^{\max},\lambda_{\mathrm{ac}}),比较不同 γ\gamma;曲线是数据集平均 segment SIM,误差线为 95%95\% 置信区间,图例给出 global WER 与 global SIM。标注值对应各子图中稳定性–质量综合权衡最佳的配置。

第一个观察是:恒定 self-consistency guidance(γ=0\gamma=0)会显著降低长时生成的稳定性,尤其当 λscmax\lambda_{\mathrm{sc}}^{\max} 较大时。例如,配置 (λscmax,λac,γ)=(2.5,1.5,0)(\lambda_{\mathrm{sc}}^{\max},\lambda_{\mathrm{ac}},\gamma)=(2.5,1.5,0) 的 segment SIM 从第一段 0.7420.742 降至最后一段 0.4020.402,global WER 升至 31.42%31.42\%(2.5,2,0)(2.5,2,0)(2.5,2.5,0)(2.5,2.5,0) 也有类似但较轻的退化。γ>0\gamma>0 的延迟调度则显著减弱这种长时衰减:在同一 (2.5,1.5)(2.5,1.5) 下,把 γ\gamma00 改为 11,最后一段 SIM 从 0.4020.402 提高到 0.6790.679,WER 从 31.42%31.42\% 降至 4.97%4.97\%。这说明 bridge-time schedule 是防止 self-consistency guidance 成为累积漂移源的关键。更大的 γ\gamma 通常会改善长时稳定性,特别是频谱质量,但也会更强地延后 self-consistency 外推,可能降低整体说话人相似度。六个子图中有四个在 γ=1\gamma=1 取得最佳稳定性–质量折中:它避开早期高噪声区间的强外推,同时仍在 bridge 后期提供足够的 self-consistency guidance。这与中等时长声谱图的观察一致——延迟 guidance 减少了频谱漂移,又没有完全抑制 self-consistency 的收益。

这些曲线进一步区分了 λscmax\lambda_{\mathrm{sc}}^{\max}λac\lambda_{\mathrm{ac}} 的作用。更强的 self-consistency guidance 可在语句开头带来更高相似度,却也增加后期漂移风险。例如,(2.5,2,0)(2.5,2,0) 的第 1 段 SIM 高达 0.7580.758,最后一段却降至 0.5780.578;更均衡的 (2,2,1)(2,2,1) 从略低的 0.7400.740 开始,衰减更慢,最后一段仍有 0.6720.672。因此,最高的初始相似度并不是长时稳定性的可靠指标,global SIM 也可能掩盖完全不同的时间行为:(2.5,2.5,0)(2.5,2.5,0)(2.5,2,1)(2.5,2,1) 的 global SIM 几乎相同(0.7350.7350.7360.736),最后一段 SIM 却分别为 0.6060.606(2.5,2.5,0)(2.5,2.5,0))与 0.6710.671(2.5,2,1)(2.5,2,1))。此外,图 8 虽只报告 WER 与 segment-level SIM,定性检查还发现:segment-level SIM 相近的配置也可能具有明显不同的频谱质量。因此,长时音频生成不应只依赖少量自动指标,而应结合信号级分析、主观听测与任务相关指标。经验上,λacλscmax\lambda_{\mathrm{ac}}\ge \lambda_{\mathrm{sc}}^{\max} 对长时生成通常更安全,尤其有利于频谱与时间稳定性,但可能牺牲一部分 global 或 segment-level SIM;反之,λscmax>λac\lambda_{\mathrm{sc}}^{\max}>\lambda_{\mathrm{ac}} 可获得更强的短程或早期段说话人相似度,却更依赖 guidance schedule,也更易累积漂移。这表明最佳 CFG 工作点会随目标生成长度变化:短语句可能偏好更强的 self-consistency guidance,长时生成则可能需要更保守、或更偏向 alignment 的 guidance。一个自然扩展,是让 CFG schedule 不仅随 bridge time τ\tau 变化,也随 AR 生成时间变化;例如随着生成推进,逐渐调整 self-consistency 与 alignment-consistency guidance 的相对强度。我们把这一方向留作未来工作。

三种代表性 CFG 设置下不同 Locodec token配置的生成性能。 CFG-L 表示最稳定的长时配置 (λscmax,λac,γ)=(2,2,1)(\lambda_{\mathrm{sc}}^{\max},\lambda_{\mathrm{ac}},\gamma)=(2,2,1)。 CFG-M 表示在中等时长 CFG 搜索集 (λscmax,λac,γ)=(2.5,2.5,1)(\lambda_{\mathrm{sc}}^{\max},\lambda_{\mathrm{ac}},\gamma)=(2.5,2.5,1) 上选择的最佳整体配置。 CFG-S 表示长时集 (λscmax,λac,γ)=(2.5,2,0)(\lambda_{\mathrm{sc}}^{\max},\lambda_{\mathrm{ac}},\gamma)=(2.5,2,0) 上具有最高第 1 段(短视野)SIM 的配置。
TokenCFGSeed-TTS-eval长时评测集
ZHENWER (\%) \downarrowgSIM \uparrowSegSIM
WER (\%) \downarrowSIM \uparrowWER (\%) \downarrowSIM \uparrowSeg1 \uparrowSeg2 \uparrowSeg3 \uparrowSeg4 \uparrowSeg5 \uparrow
768/×768/\timesL1.310.6831.900.6227.820.7160.7320.6940.6700.6440.639
M1.120.6831.850.6248.360.7100.7310.6960.6690.6280.624
S2.040.6912.150.62525.350.6870.7430.6770.6230.5220.448
256/×256/\timesL1.110.6821.860.6145.810.7290.7370.7050.6870.6750.680
M1.040.6861.880.6184.840.7250.7420.7010.6870.6770.667
S1.460.6925.230.62015.940.7140.7470.6960.6430.5680.512
64/×64/\timesL1.090.6831.940.6204.910.7170.7260.7020.6880.6690.660
M1.500.6861.820.6274.690.7160.7280.6970.6760.6620.666
S1.560.6912.260.6259.680.7130.7380.6900.6540.6110.566
32/×32/\timesL1.070.6752.080.6084.640.7080.7210.6830.6710.6560.642
M1.120.6792.160.6155.440.7050.7230.6880.6560.6300.621
S1.520.6832.470.61520.800.6740.7340.6640.5830.4870.419
16/×16/\timesL1.250.6721.950.6036.230.7140.7260.6960.6800.6480.646
M1.300.6781.930.6099.490.7020.7290.6860.6580.6330.594
S2.580.6772.980.60734.770.6300.7400.6610.5100.4130.273
64/64/\checkmarkL1.110.6802.000.6164.960.7260.7340.7050.6900.6730.668
M1.120.6831.870.6204.780.7200.7290.6970.6840.6670.663
S1.540.6952.050.6309.630.7480.7620.7200.6830.6280.574
32/32/\checkmarkL0.950.6871.870.6154.610.7310.7400.7070.6940.6730.672
M0.990.6911.800.6224.790.7270.7400.7120.6840.6700.659
S1.240.6972.090.6289.730.7240.7580.7160.6670.6270.578
16/16/\checkmarkL1.660.6881.940.6194.800.7260.7320.7000.6860.6740.676
M1.290.6911.750.6244.550.7180.7340.7020.6840.6660.670
S1.810.6982.470.63010.180.7250.7460.7080.6800.6490.601
Seed-TTS-eval 的生成结果。对于 MP-ELD,我们在表 4 中报告其最佳 CFG 配置下的结果。所有基准系统都是 AR 模型,并且我们在适用时选择没有post-training的版本。 “Tok./LM rate”列分别表示原生token帧率和 LM 看到的有效帧率。
模型Tok./LM rate(Hz)ZHEN
WER (\%) \downarrowSIM \uparrowWER (\%) \downarrowSIM \uparrow
人类语音1.250.7552.140.734
CosyVoice 2~[37]25/251.450.7482.570.652
CosyVoice 3-1.5B~[38]25/251.120.7812.210.720
FireRedTTS~[44]25/251.510.6353.820.460
FireRedTTS-2~[110]12.5/12.51.140.7361.950.665
Spark TTS~[104]50/501.200.6721.980.584
VibeVoice~[86]7.5/7.51.160.7443.040.689
DiTAR~[53]40/101.020.7531.690.735
VoxCPM2~[127]25/6.250.970.7951.840.753
dots. tts~[65]25/6.250.960.8051.340.768
MP-ELD, 64/64/\checkmark8/88/81.540.6952.050.630
MP-ELD, 32/32/\checkmark8/88/80.950.6871.870.615
MP-ELD, 16/16/\checkmark8/88/81.290.6911.750.624

前述 CFG 分析基于 32/32/\checkmark tokenizer。这里把比较扩展到另外七种 token 配置,检验观察是否仍然成立。表 4 比较八种 Locodec token 在三种代表性 CFG 设置下的表现:CFG-L 是相对最稳定的长时配置;CFG-M 是在中等时长 CFG sweep 集上选出的总体最佳配置;CFG-S 偏向短时 SIM。

以下是一些观察结果。首先,没有非常低维核心的高维配置仍然是可以学习的。特别是,768/×768/\times256/×256/\times tokenizer已经在 Seed-TTS-eval 上获得了有竞争力的短时 WER,并且 256/×256/\times 配置在 CFG-L 和 CFG-M 下的长时集上保持相当稳定。这表明 Locodec 设计本身,包括球面归一化、强角度corruption和decoder鲁棒性训练,已经在高维token空间上施加了有用的结构。低维核心和PDD进一步提高了可预测性和稳定性,但它们并不是可学习性的唯一来源。

其次,所有token配置在 Seed-TTS-eval 上都实现了相对较强的 WER,这可能部分是由 Locodec 的原生低帧率来解释的。在 88 Hz 处,每个token大约覆盖 125125 毫秒的音频,这接近音素级内容的持续时间范围。因此,即使没有外部 SSL 或 ASR 监督,低帧率token似乎也会自然地在内容相关的时间跨度上聚合信息。这与表 3 中的受限重建结果一致,其中 6464 维核心已经可以支持低 WER,而其 SIM 仍然远低于全维token重建。这表明核心表征相对更偏内容,并且在声学上不太完整。从这个角度来看,原生低帧率本身可以充当语义归纳偏差,减少外部施加的语义对齐损失的需要。

第三,短时和长时的结果存在很大差异。 Seed-TTS-eval 上的有效生成持续时间对于 ZH 仅为 5.28±0.965.28\pm0.96 秒,对于 EN 为 4.18±1.164.18\pm1.16 秒,而长时集的有效持续时间为 52.14±3.0452.14\pm3.04 秒。因此,Seed-TTS-eval 结果主要衡量短时质量,并没有完全暴露 AR 错误累积。如图 7 所示,除了几乎从一开始就表现出严重错误累积的两个示例之外,其余故障案例在出现可见漂移之前仍然可以在至少前 66 秒(大致相当于 5050 token)内保持稳定的合成。这种延迟故障模式也反映在表 4 中,其中许多token和 CFG 配置在 Seed-TTS-eval 上获得类似的 WER,但它们的长时行为却截然不同。此外,绝对 SIM 值似乎还存在数据集效应:长时集上的第 1 段 SIM 通常比 Seed-TTS-eval 上的 ZH SIM 高出约 0.050.05,并且在图 6 中的中等时长 CFG 选择集上观察到的最佳 SIM 几乎高出 0.070.07。这可能部分反映了域不匹配,而不仅仅是持续时间效应。由于我们的训练数据以真实世界的录音为主,而 Seed-TTS-eval 是根据精选的基准数据集构建的,因此录音条件、说话人特征、内容风格和参考音频分布的差异可能会影响 SIM 评估。这为为什么该模型在内部现实世界评估集上显得更强,而在标准基准上显示出更大的 SIM 差距提供了一种可能的解释。

第四,适度的核心尺寸可以提供最佳的整体平衡。非常小的核心尺寸提供了更强的约束,可以帮助 WER,但可能会降低声学能力;较大的核心尺寸可以保留更多信息,但受到的限制较少。在训练损失、短时生成和长时稳定性方面,32/32/\checkmark 是最平衡的配置:它在 Seed-TTS-eval、0.95%0.95\% 上实现了最佳 ZH WER,并在 CFG-L 下实现了强大的长时性能,其中 WER 4.61%4.61\%、global SIM 0.7310.731 和稳定的segment-level SIM 曲线结束于0.6720.672。这与图 5 中的预测损失曲线一致,其中 32/32/\checkmark 也达到最低的最终方向损失。

最后,PDD 一贯改善生成表现,尤其是长时稳定性与 SIM;在更激进的 CFG-S 设置下最为明显。例如,从 32/×32/\times 改为 32/32/\checkmark 后,长时 WER 从 20.80%20.80\% 降至 9.73%9.73\%,global SIM 从 0.6740.674 升至 0.7240.724,第 5 段 SIM 从 0.4190.419 升至 0.5780.578。类似地,在 CFG-S 下从 16/×16/\times 改为 16/16/\checkmark,第 5 段 SIM 由 0.2730.273 提升到 0.6010.601。这些结果说明,PDD 诱导的坐标层级不仅降低了优化损失,也增强了 AR rollout 的鲁棒性,从而支持本文提出的可辨识性机制。

表 5 进一步比较了 MP-ELD 与既有 AR TTS 系统在 Seed-TTS-eval 上的表现。MP-ELD 的 WER 很有竞争力,但 SIM 仍低于最强基线。一种可能解释是:token 帧率不仅是效率参数,也是一枚时间分辨率旋钮,近似于时频分析中的分析窗长度。帧率越低,每个 token 汇总的音频跨度越长;这类似于更大的 FFT 窗能提供更长的分析上下文和更高的频率分辨率,却对快速时间变化不那么敏感。更长跨度的聚合可以稳定音素或内容层结构,并缩短 AR 预测跨度,从而有利于 WER 与长程稳定性;但它也可能削弱对微韵律、瞬态频谱细节、短时说话人线索等细粒度局部声学变化的敏感性,而这些因素恰恰关系到说话人相似度。相反,更高帧率的 token,或在每个 LM step 内保留多个短程子 token 的乘积结构局部表征,通常能保留更多局部声学细节并取得更高 SIM,但代价是更长的原生序列,或额外的局部预测模块。

然而,VibeVoice 表明这种时间分辨率解释可能不完整,因为它使用甚至更低的原生token帧率 7.57.5 Hz,但实现了比 MP-ELD 更强的 SIM。我们假设这种差异可能来自其明确的语义-声学tokenizer设计。在这种分解表示中,低速率语义组件仍然可以提供与低帧率相关的长跨度内容聚合和 AR 稳定性优势,而更独立的声学组件可以保留特定于说话人的细粒度声学信息。相比之下,Locodec 使用单个重建优先的连续token空间,因此内容、说话人身份和局部声学细节必须在同一低速率高维token内组织。在 AR 预测下,这种统一的空间自然可能有利于内容稳定的组件,有助于 WER,同时使细粒度的声学相似性更难建模。这表明了未来tokenizer设计的潜在方向:将语义声学分解引入低速率连续 token空间,可能仍然不依赖于显式 SSL 或 ASR 监督,可以保留原生低帧率token的内容聚类和稳定性优势,同时提高声学保真度和说话人相似性。

6 结论与未来工作

本文研究低帧率、高维连续 token 能否作为自回归语音生成的稳定目标。核心结论是:只要表征空间与生成框架协同设计,这类 token 就是可行的。我们提出 Locodec,以低维核心流形组织球面高维 token 空间,并通过 PDD 形成逐坐标能量层级,在不显著损害全维 token 重建质量的情况下提高可预测性;进一步提出 MP-ELD,把 local-continuity、self-consistency 与 alignment-consistency 信息分到不同路径,使 residual CFG 能更明确地控制声学一致性和内容对齐。实验说明,重建质量不足以单独刻画生成表征:token 空间几何会显著影响生成器训练损失、CFG 行为与长时稳定性。适中的核心维度配合 PDD 达到最佳综合平衡,所得 88 Hz、768768 维连续 token 在不使用外部 SSL/ASR、预训练文本 LM 或 post-training 的情况下取得有竞争力的 WER。与最强既有系统仍存在的 SIM 差距则提示了语义–声学权衡:低帧率有利于内容聚合与 AR 稳定,却可能增加细粒度声学和说话人相似度建模的难度。因此,token 帧率不仅是效率参数,也是一枚语义–声学分辨率旋钮。

接下来有几个自然扩展。第一,Locodec 虽被设计为通用的立体声音频 tokenizer,也可实例化到更高采样率(如 4848 kHz),但本文实验主要集中在 2424 kHz 语音重建与 TTS。未来需要在更广泛的音频理解、生成任务乃至多模态场景中评估 Locodec。同样原则也可能推广到音频之外:经过 latent geometry 塑形的低帧率、高维连续 token,或可用于图像、视频及其他需要平衡重建能力与 AR 稳定性的序列生成问题。

其次,我们故意避免预训练的 SSL、ASR 和语言模型是一种隔离token空间整形和信息路由影响的设计选择,而不是对方法的限制。 Locodec 和 MP-ELD 天然兼容预训练组件。例如,alignment-consistency LM 可以由预训练的文本 LM 初始化或替换,这可能会加强对齐路径的语义偏差,从而改变自一致性路径的作用。类似地,不同 MP-ELD 路径的token encoder可以进行不同的初始化,或者一个路径可以由预训练的 SSL 或 ASR 表示来引导。更一般地说,信息路由可以从训练动态中产生,如本文所示,但它也可以通过架构和初始化先验来加强。在tokenizer内部和生成器内部设计更好的信息路径可能是进一步减轻甚至消除 AR 错误累积的重要方向。

第三,提高说话人的相似度和声音保真度仍然是一个核心挑战。目前的结果表明,低帧率token自然有利于内容聚合,这有助于 WER,但可能会使细粒度声学建模变得更加困难。一种可能的方向是将语义声学分解引入token空间,但仍然不依赖显式的 SSL 或 ASR 监督。更广泛地说,对于一般音频生成,相关因素可能超出语义和声学范围,包括空间属性、源身份或时间事件动态。开发能够以可控方式组织这些因素的tokenizer,同时保持重建保真度和 AR 可预测性,是一个关键的开放问题。

第四,所提框架的各个组件都值得继续扩展。decoder 是实际估计逐路径 velocity field 的下一 token 预测模块,因此研究其 scaling behavior 尤为重要。相比 product-structured token 方法——每个 LM 步都可能需要额外的 local DiT 解码一小组短程 token——MP-ELD 的 FFN decoder 预测一个原生高维 token 所需的 MAC 明显更少。这为扩大 decoder,或换用更具表达力的架构,留下了很大的计算余量,同时仍能保持有竞争力的总体推理成本。

最后,本文的长时实验相较真正的长流式场景仍然有限。分钟级生成已经暴露出明显的 AR 误差累积,但小时级流式生成、多说话人交互、播客级合成与复杂声学场景还可能引入新的失效模式。因此,未来应在更长、更多样的生成条件下研究 MP-ELD。实验还显示,最佳 CFG 配置取决于语句长度、token 表征,以及 WER、SIM 与稳定性之间的目标权衡。这意味着 AR 生成中的 CFG 未必应保持时不变;同时依赖 bridge time τ\tau 与 AR 生成时间的动态 guidance schedule,或许能更灵活地兼顾短时质量和长时稳定性。

参考文献

参考文献按原论文顺序保留英文书目信息。

  1. Michael Albergo, Nicholas M Boffi, and Eric Vanden-Eijnden. Stochastic interpolants: A unifying framework for flows and diffusions. Journal of Machine Learning Research, 26(209):1–80, 2025.
  2. Michael S Albergo and Eric Vanden-Eijnden. Building normalizing flows with stochastic interpolants. arXiv preprint arXiv:2209.15571, 2022.
  3. Naomi Altman and Martin Krzywinski. The curse (s) of dimensionality. Nat Methods, 15(6):399–400, 2018.
  4. Philip Anastassiou, Jiawei Chen, Jitong Chen, Yuanzhe Chen, Zhuo Chen, Ziyi Chen, Jian Cong, Lelai Deng, Chuang Ding, Lu Gao, et al. Seed-TTS: A family of high-quality versatile speech generation models. arXiv preprint arXiv:2406.02430, 2024.
  5. Rosana Ardila, Megan Branson, Kelly Davis, Michael Kohler, Josh Meyer, Michael Henretty, Reuben Morais, Lindsay Saunders, Francis Tyers, and Gregor Weber. Common voice: A massively-multilingual speech corpus. In Proceedings of the twelfth language resources and evaluation conference, pages 4218–4222, 2020.
  6. Georgios Arvanitidis, Lars Kai Hansen, and Søren Hauberg. Latent space oddity: on the curvature of deep generative models. arXiv preprint arXiv:1710.11379, 2017.
  7. Georgios Arvanitidis, Søren Hauberg, and Bernhard Schölkopf. Geometrically enriched latent spaces. arXiv preprint arXiv:2008.00565, 2020.
  8. Bishnu S Atal and Manfred R Schroeder. Adaptive predictive coding of speech signals. Bell System Technical Journal, 49(8):1973–1986, 1970.
  9. Alexei Baevski, Yuhao Zhou, Abdelrahman Mohamed, and Michael Auli. wav2vec 2.0: A framework for self-supervised learning of speech representations. Advances in neural information processing systems, 33: 12449–12460, 2020.
  10. Ye Bai, Haonan Chen, Jitong Chen, Zhuo Chen, Yi Deng, Xiaohong Dong, Lamtharn Hantrakul, Weituo Hao, Qingqing Huang, Zhongyi Huang, et al. Seed-music: A unified framework for high quality and controlled music generation. arXiv preprint arXiv:2409.09214, 2024.
  11. Peter GJ Barten. Contrast sensitivity of the human eye and its effects on image quality. SPIE press, 1999.
  12. Eric Battenberg, RJ Skerry-Ryan, Soroosh Mariooryad, Daisy Stanton, David Kao, Matt Shannon, and Tom Bagby. Location-relative attention mechanisms for robust long-form speech synthesis. In ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 6194–6198. IEEE, 2020.
  13. Bruno Bessette, Redwan Salami, Roch Lefebvre, Milan Jelinek, Jani Rotola-Pukkila, Janne Vainio, Hannu Mikkola, and Kari Jarvinen. The adaptive multirate wideband speech codec (AMR-WB). IEEE transactions on speech and audio processing, 10(8):620–636, 2002.
  14. Zalán Borsos, Raphaël Marinier, Damien Vincent, Eugene Kharitonov, Olivier Pietquin, Matt Sharifi, Dominik Roblek, Olivier Teboul, David Grangier, Marco Tagliasacchi, et al. Audiolm: a language modeling approach to audio generation. IEEE/ACM transactions on audio, speech, and language processing, 31:2523–2533, 2023.
  15. Fergus W Campbell and John G Robson. Application of fourier analysis to the visibility of gratings. The Journal of physiology, 197(3):551, 1968.
  16. Olivier Chapelle, Bernhard Schölkopf, and Alexander Zien. A discussion of semi-supervised learning and transduction. In Semi-supervised learning, pages 473–478. MIT Press, 2006.
  17. Boyuan Chen, Diego Martí Monsó, Yilun Du, Max Simchowitz, Russ Tedrake, and Vincent Sitzmann. Diffusion forcing: Next-token prediction meets full-sequence diffusion. Advances in Neural Information Processing Systems, 37:24081–24125, 2024.
  18. Qian Chen, Yafeng Chen, Yanni Chen, Mengzhe Chen, Yingda Chen, Chong Deng, Zhihao Du, Ruize Gao, Changfeng Gao, Zhifu Gao, et al. Minmo: A multimodal large language model for seamless voice interaction. arXiv preprint arXiv:2501.06282, 2025.
  19. Ricky TQ Chen and Yaron Lipman. Flow matching on general geometries. arXiv preprint arXiv:2302.03660, 2023.
  20. Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, et al. Wavlm: Large-scale self-supervised pre-training for full stack speech processing. IEEE Journal of Selected Topics in Signal Processing, 16(6):1505–1518, 2022.
  21. Sanyuan Chen, Shujie Liu, Long Zhou, Yanqing Liu, Xu Tan, Jinyu Li, Sheng Zhao, Yao Qian, and Furu Wei. Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers. arXiv preprint arXiv:2406.05370, 2024.
  22. Ting Chen. On the importance of noise scheduling for diffusion models. arXiv preprint arXiv:2301.10972, 2023.
  23. Wenxi Chen, Dongya Jia, Yushen Chen, Zhikang Niu, Yuzhe Liang, Xiquan Li, Ruiqi Yan, Ziyang Ma, Guanrou Yang, Sanyuan Chen, et al. Wavtts: Towards high-quality zero-shot tts via direct raw waveform modeling. arXiv preprint arXiv:2606.03455, 2026.
  24. Wenxi Chen, Ruiqi Yan, Yushen Chen, Zhikang Niu, Ziyang Ma, Xiquan Li, Yuzhe Liang, Shunshun Yin, Ming Tao, Xinsheng Wang, et al. Sac: Neural speech codec with semantic-acoustic dual-stream quantization. In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 3030–3048, 2026.
  25. Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Chunhui Wang, JianZhao JianZhao, Kai Yu, and Xie Chen. F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 6255–6271, 2025.
  26. Michael Chinen, Felicia SC Lim, Jan Skoglund, Nikita Gureev, Feargus O’Gorman, and Andrew Hines. Visqol v3: An open source production ready objective speech and audio metric. In 2020 twelfth international conference on quality of multimedia experience (QoMEX), pages 1–6. IEEE, 2020.
  27. Chung-Cheng Chiu, James Qin, Yu Zhang, Jiahui Yu, and Yonghui Wu. Self-supervised learning with random- projection quantizer for speech recognition. In International Conference on Machine Learning, pages 3915–3924. PMLR, 2022.
  28. Yunfei Chu, Jin Xu, Xiaohuan Zhou, Qian Yang, Shiliang Zhang, Zhijie Yan, Chang Zhou, and Jingren Zhou. Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models. arXiv preprint arXiv:2311.07919, 2023.
  29. Jade Copet, Felix Kreuk, Itai Gat, Tal Remez, David Kant, Gabriel Synnaeve, Yossi Adi, and Alexandre Défossez. Simple and controllable music generation. Advances in neural information processing systems, 36:47704–47720, 2023.
  30. Gregory A Daly, Jonathan E Fieldsend, and Gavin Tabor. Variational autoencoders without the variation. arXiv preprint arXiv:2203.00645, 2022.
  31. Tim R Davidson, Luca Falorsi, Nicola De Cao, Thomas Kipf, and Jakub M Tomczak. Hyperspherical variational auto-encoders. arXiv preprint arXiv:1804.00891, 2018.
  32. Friso de Kruiff, Erik Bekkers, Ozan Öktem, Carola-Bibiane Schönlieb, and Willem Diepeveen. Pullback flow matching on data manifolds. arXiv preprint arXiv:2410.04543, 2024.
  33. Alexandre Défossez, Jade Copet, Gabriel Synnaeve, and Yossi Adi. High fidelity neural audio compression. arXiv preprint arXiv:2210.13438, 2022.
  34. Alexandre Défossez, Laurent Mazaré, Manu Orsini, Amélie Royer, Patrick Pérez, Hervé Jégou, Edouard Grave, and Neil Zeghidour. Moshi: a speech-text foundation model for real-time dialogue. arXiv preprint arXiv:2410.00037, 2024.
  35. Prafulla Dhariwal, Heewoo Jun, Christine Payne, Jong Wook Kim, Alec Radford, and Ilya Sutskever. Jukebox: A generative model for music. arXiv preprint arXiv:2005.00341, 2020.
  36. Ding Ding, Zeqian Ju, Yichong Leng, Songxiang Liu, Tong Liu, Zeyu Shang, Kai Shen, Wei Song, Xu Tan, Heyi Tang, et al. Kimi-audio technical report. arXiv preprint arXiv:2504.18425, 2025.
  37. Zhihao Du, Qian Chen, Shiliang Zhang, Kai Hu, Heng Lu, Yexin Yang, Hangrui Hu, Siqi Zheng, Yue Gu, Ziyang Ma, et al. Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens. arXiv preprint arXiv:2407.05407, 2024.
  38. Zhihao Du, Changfeng Gao, Yuxuan Wang, Fan Yu, Tianyu Zhao, Hao Wang, Xiang Lv, Hui Wang, Chongjia Ni, Xian Shi, et al. Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training. arXiv preprint arXiv:2505.17589, 2025.
  39. Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Canrun Li, Chung-Hsien Tsai, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Xu Tan, et al. E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts. In 2024 IEEE spoken language technology workshop (SLT), pages 682–689. IEEE, 2024.
  40. Zach Evans, Julian D Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons. Long-form music generation with latent diffusion. arXiv preprint arXiv:2404.10301, 2024.
  41. Wei Fan, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li, Kejiang Chen, Weiming Zhang, and Nenghai Yu. Barewave: Waveform-native flow-matching text-to-speech. arXiv preprint arXiv:2606.09048, 2026.
  42. Sreyan Ghosh, Arushi Goel, Jaehyeon Kim, Sonal Kumar, Zhifeng Kong, Sang-gil Lee, Chao-Han Yang, Ramani Duraiswami, Dinesh Manocha, Rafael Valle, et al. Audio flamingo 3: Advancing audio intelligence with fully open large audio language models. Advances in Neural Information Processing Systems, 38:41819–41886, 2026.
  43. Alexander N Gorban and Ivan Yu Tyukin. Blessing of dimensionality: mathematical foundations of the statistical physics of data. Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences, 376(2118):20170237, 2018.
  44. Hao-Han Guo, Yao Hu, Kun Liu, Fei-Yu Shen, Xu Tang, Yi-Chen Wu, Feng-Long Xie, Kun Xie, and Kai-Tuo Xu. Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications. arXiv preprint arXiv:2409.03283, 2024.
  45. Tingwei Guo, Cheng Wen, Dongwei Jiang, Ne Luo, Ruixiong Zhang, Shuaijiang Zhao, Wubo Li, Cheng Gong, Wei Zou, Kun Han, et al. Didispeech: A large scale mandarin speech corpus. In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 6968–6972. IEEE, 2021.
  46. Cong Han, Yi Luo, Chenda Li, Tianyan Zhou, Keisuke Kinoshita, Shinji Watanabe, Marc Delcroix, Hakan Erdogan, John R Hershey, Nima Mesgarani, et al. Continuous speech separation using speaker inventory for long recording. In Interspeech, pages 3036–3040, 2021.
  47. Irina Higgins, Loic Matthey, Arka Pal, Christopher Burgess, Xavier Glorot, Matthew Botvinick, Shakir Mohamed, and Alexander Lerchner. beta-VAE: Learning basic visual concepts with a constrained variational framework. In International Conference on Learning Representations, 2017. URL https://openreview.net/forum?id=Sy2fzU9gl.
  48. Emiel Hoogeboom, Thomas Mensink, Jonathan Heek, Kay Lamerigts, Ruiqi Gao, and Tim Salimans. Simpler diffusion: 1.5 fid on imagenet512 with pixel-space diffusion. In Proceedings of the Computer Vision and Pattern Recognition Conference, pages 18062–18071, 2025.
  49. Wei-Ning Hsu, Benjamin Bolte, Yao-Hung Hubert Tsai, Kushal Lakhotia, Ruslan Salakhutdinov, and Abdelrah- man Mohamed. Hubert: Self-supervised speech representation learning by masked prediction of hidden units. IEEE/ACM transactions on audio, speech, and language processing, 29:3451–3460, 2021.
  50. Cheng-Zhi Anna Huang, Ashish Vaswani, Jakob Uszkoreit, Noam Shazeer, Ian Simon, Curtis Hawthorne, Andrew M Dai, Matthew D Hoffman, Monica Dinculescu, and Douglas Eck. Music transformer. arXiv preprint arXiv:1809.04281, 2018.
  51. Aaron Hurst, Adam Lerer, Adam P Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, AJ Ostrow, Akila Welihinda, Alan Hayes, Alec Radford, et al. Gpt-4o system card. arXiv preprint arXiv:2410.21276, 2024.
  52. Shengpeng Ji, Ziyue Jiang, Wen Wang, Yifu Chen, Minghui Fang, Jialong Zuo, Qian Yang, Xize Cheng, Ruiqi Li, Ziang Zhang, et al. Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling. In International Conference on Learning Representations, volume 2025, pages 93809–93826, 2025.
  53. Dongya Jia, Zhuo Chen, Jiawei Chen, Chenpeng Du, Jian Wu, Jian Cong, Xiaobin Zhuang, Chumin Li, Zhen Wei, Yuping Wang, et al. Ditar: Diffusion transformer autoregressive modeling for speech generation. arXiv preprint arXiv:2502.03930, 2025.
  54. Yuepeng Jiang, Huakang Chen, Ziqian Ning, Jixun Yao, Zerui Han, Di Wu, Meng Meng, Jian Luan, Zhonghua Fu, and Lei Xie. Diffrhythm 2: Efficient and high fidelity song generation via block flow matching. arXiv preprint arXiv:2510.22950, 2025.
  55. Zeqian Ju, Yuancheng Wang, Kai Shen, Xu Tan, Detai Xin, Dongchao Yang, Yanqing Liu, Yichong Leng, Kaitao Song, Siliang Tang, et al. Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models. arXiv preprint arXiv:2403.03100, 2024.
  56. Guolin Ke and Hui Xue. Hyperspherical latents improve continuous-token autoregressive generation. arXiv preprint arXiv:2509.24335, 2025.
  57. Robert Kubichek. Mel-cepstral distance measure for objective speech quality assessment. In Proceedings of IEEE pacific rim conference on communications computers and signal processing, volume 1, pages 125–128. IEEE, 1993.
  58. Rithesh Kumar, Prem Seetharaman, Alejandro Luebs, Ishaan Kumar, and Kundan Kumar. High-fidelity audio compression with improved RVQGAN. Advances in Neural Information Processing Systems, 36:27980–27993, 2023.
  59. Doyup Lee, Chiheon Kim, Saehoon Kim, Minsu Cho, and Wook-Shin Han. Autoregressive image generation using residual quantization. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 11523–11532, 2022.
  60. Junho Lee, Kwanseok Kim, and Joonseok Lee. Geometry-aware image flow matching. arXiv preprint arXiv:2605.25294, 2026.
  61. Sangyun Lee, Gayoung Lee, Hyunsu Kim, Junho Kim, and Youngjung Uh. Sequential data generation with groupwise diffusion process. arXiv preprint arXiv:2310.01400, 2023.
  62. Xingjian Leng, Jaskirat Singh, Yunzhong Hou, Zhenchang Xing, Saining Xie, and Liang Zheng. REPA-E: Unlocking VAE for end-to-end tuning of latent diffusion transformers. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 18262–18272, 2025.
  63. Tianhong Li and Kaiming He. Back to basics: Let denoising generative models denoise. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 36115–36125, 2026.
  64. Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, and Kaiming He. Autoregressive image generation without vector quantization. Advances in Neural Information Processing Systems, 37:56424–56445, 2024.
  65. Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, and Kai Yu. dots. tts technical report. arXiv preprint arXiv:2606.07080, 2026.
  66. Shijia Liao, Yuxuan Wang, Songting Liu, Yifan Cheng, Ruoyi Zhang, Tianyu Li, Shidong Li, Yisheng Zheng, Xingwei Liu, Qingzheng Wang, et al. Fish audio s2 technical report. arXiv preprint arXiv:2603.08823, 2026.
  67. Haohe Liu, Xuenan Xu, Yi Yuan, Mengyue Wu, Wenwu Wang, and Mark D Plumbley. Semanticodec: An ultra low bitrate semantic audio codec for general sound. IEEE Journal of Selected Topics in Signal Processing, 18 (8):1448–1461, 2024.
  68. Zhijun Liu, Shuai Wang, Sho Inoue, Qibing Bai, and Haizhou Li. Autoregressive diffusion transformer for text-to-speech synthesis. arXiv preprint arXiv:2406.05551, 2024.
  69. Zhuang Liu, Hanzi Mao, Chao-Yuan Wu, Christoph Feichtenhofer, Trevor Darrell, and Saining Xie. A convnet for the 2020s. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 11976–11986, 2022.
  70. Yi Luo, Zhuo Chen, and Takuya Yoshioka. Dual-path RNN: Efficient long sequence modeling for time-domain single-channel speech separation. In ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 46–50. IEEE, 2020.
  71. Yi Luo, Cong Han, and Nima Mesgarani. Group communication with context codec for lightweight source separation. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 29:1752–1761, 2021.
  72. Yi Luo, Jianwei Yu, Hangting Chen, Rongzhi Gu, and Chao Weng. Gull: A generative multifunctional audio codec. arXiv preprint arXiv:2404.04947, 2024.
  73. Huanru Henry Mao, Shuyang Li, Julian McAuley, and Garrison Cottrell. Speech recognition and multi-speaker diarization of long conversations. arXiv preprint arXiv:2005.08072, 2020.
  74. Xudong Mao, Qing Li, Haoran Xie, Raymond YK Lau, Zhen Wang, and Stephen Paul Smolley. Least squares generative adversarial networks. In Proceedings of the IEEE international conference on computer vision, pages 2794–2802, 2017.
  75. Soroush Mehri, Kundan Kumar, Ishaan Gulrajani, Rithesh Kumar, Shubham Jain, Jose Sotelo, Aaron Courville, and Yoshua Bengio. SampleRNN: An unconditional end-to-end neural audio generation model. arXiv preprint arXiv:1612.07837, 2016.
  76. Lingwei Meng, Long Zhou, Shujie Liu, Sanyuan Chen, Bing Han, Shujie Hu, Yanqing Liu, Jinyu Li, Sheng Zhao, Xixin Wu, et al. Autoregressive speech synthesis without vector quantization. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 1287–1300, 2025.
  77. Fabian Mentzer, David Minnen, Eirikur Agustsson, and Michael Tschannen. Finite scalar quantization: VQ-VAE made simple. In International Conference on Learning Representations, volume 2024, pages 51772–51783, 2024.
  78. Tuna Han Salih Meral, Kaan Oktay, Hidir Yesiltepe, Adil Kaan Akan, and Pinar Yanardag. Aligning latent geometry for spherical flow matching in image generation. arXiv preprint arXiv:2605.15193, 2026.
  79. George A Miller. Sensitivity to changes in the intensity of white noise and its relation to masking and loudness. The Journal of the Acoustical Society of America, 19(4):609–619, 1947.
  80. Pooneh Mousavi, Jarod Duret, Salah Zaiem, Luca Della Libera, Artem Ploujnikov, Cem Subakan, and Mirco Ravanelli. How should we extract discrete audio tokens from self-supervised models? arXiv preprint arXiv:2406.10735, 2024.
  81. Arun Narayanan, Rohit Prabhavalkar, Chung-Cheng Chiu, David Rybach, Tara N Sainath, and Trevor Strohman. Recognizing long-form speech using streaming end-to-end models. In 2019 IEEE automatic speech recognition and understanding workshop (ASRU), pages 920–927. IEEE, 2019.
  82. Mang Ning, Enver Sangineto, Angelo Porrello, Simone Calderara, and Rita Cucchiara. Input perturbation reduces exposure bias in diffusion models. arXiv preprint arXiv:2301.11706, 2023.
  83. Ziqian Ning, Huakang Chen, Yuepeng Jiang, Chunbo Hao, Guobin Ma, Shuai Wang, Jixun Yao, and Lei Xie. Diffrhythm: Blazingly fast and embarrassingly simple end-to-end full-length song generation with latent diffusion. arXiv preprint arXiv:2503.01183, 2025.
  84. Julian Parker, Anton Smirnov, Jordi Pons, CJ Carr, Zack Zukowski, Zach Evans, and Xubo Liu. Scaling transformers for low-bitrate high-quality speech coding. In International Conference on Learning Representations, volume 2025, pages 51997–52021, 2025.
  85. William Peebles and Saining Xie. Scalable diffusion models with transformers. In Proceedings of the IEEE/CVF international conference on computer vision, pages 4195–4205, 2023.
  86. Zhiliang Peng, Jianwei Yu, Wenhui Wang, Yaoyao Chang, Yutao Sun, Li Dong, Yi Zhu, Weijiang Xu, Hangbo Bao, Zehua Wang, et al. Vibevoice technical report. arXiv preprint arXiv:2508.19205, 2025.
  87. Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, and Ilya Sutskever. Robust speech recognition via large-scale weak supervision. In International conference on machine learning, pages 28492–28518. PMLR, 2023.
  88. Desh Raj, Pavel Denisov, Zhuo Chen, Hakan Erdogan, Zili Huang, Maokui He, Shinji Watanabe, Jun Du, Takuya Yoshioka, Yi Luo, et al. Integration of speech separation, diarization, and recognition for multi-speaker meetings: System description, comparison, and analysis. In 2021 IEEE spoken language technology workshop (SLT), pages 897–904. IEEE, 2021.
  89. David Ruhe, Jonathan Heek, Tim Salimans, and Emiel Hoogeboom. Rolling diffusion models. arXiv preprint arXiv:2402.09470, 2024.
  90. Florian Schmidt. Generalization in generation: A closer look at exposure bias. In Proceedings of the 3rd Workshop on Neural Generation and Translation, pages 157–167, 2019.
  91. Manfred Schroeder and B Atal. Code-excited linear prediction (CELP): High-quality speech at very low bit rates. In ICASSP’85. IEEE International Conference on Acoustics, Speech, and Signal Processing, volume 10, pages 937–940. IEEE, 1985.
  92. Noam Shazeer. Glu variants improve transformer. arXiv preprint arXiv:2002.05202, 2020.
  93. Yangyang Shi, Yongqiang Wang, Chunyang Wu, Ching-Feng Yeh, Julian Chan, Frank Zhang, Duc Le, and Mike Seltzer. Emformer: Efficient memory transformer based acoustic model for low latency streaming speech recognition. In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 6783–6787. IEEE, 2021.
  94. Yang Song, Jascha Sohl-Dickstein, Diederik P Kingma, Abhishek Kumar, Stefano Ermon, and Ben Poole. Score-based generative modeling through stochastic differential equations. arXiv preprint arXiv:2011.13456, 2020.
  95. Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, and Yunfeng Liu. Roformer: Enhanced transformer with rotary position embedding. Neurocomputing, 568:127063, 2024.
  96. Xingzhi Sun, Danqi Liao, Kincaid MacDonald, Yanlei Zhang, Guillaume Huguet, Guy Wolf, Ian Adelstein, Tim GJ Rudner, and Smita Krishnaswamy. Geometry-aware autoencoders for metric learning and generative modeling on data manifolds. In ICML 2024 Workshop on Geometry-grounded Representation Learning and Generative Modeling, 2024.
  97. Cees H Taal, Richard C Hendriks, Richard Heusdens, and Jesper Jensen. An algorithm for intelligibility prediction of time–frequency weighted noisy speech. IEEE Transactions on audio, speech, and language processing, 19(7): 2125–2136, 2011.
  98. Gemma Team. Gemma 4 technical report, 2026. URL https://arxiv.org/abs/2607.02770.
  99. Shengbang Tong, Boyang Zheng, Ziteng Wang, Bingda Tang, Nanye Ma, Ellis Brown, Jihan Yang, Rob Fergus, Yann LeCun, and Saining Xie. Scaling text-to-image diffusion transformers with representation autoencoders. arXiv preprint arXiv:2601.16208, 2026.
  100. Aaron Van Den Oord, Sander Dieleman, Heiga Zen, Karen Simonyan, Oriol Vinyals, Alex Graves, Nal Kalch- brenner, Andrew Senior, Koray Kavukcuoglu, et al. Wavenet: A generative model for raw audio. arXiv preprint arXiv:1609.03499, 12(1), 2016.
  101. Aaron Van Den Oord, Oriol Vinyals, et al. Neural discrete representation learning. Advances in neural information processing systems, 30, 2017.
  102. Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, et al. Neural codec language models are zero-shot text to speech synthesizers. arXiv preprint arXiv:2301.02111, 2023.
  103. Shuai Wang, Ziteng Gao, Chenhui Zhu, Weilin Huang, and Limin Wang. Pixnerd: Pixel neural field diffusion. arXiv preprint arXiv:2507.23268, 2025.
  104. Xinsheng Wang, Mingqi Jiang, Ziyang Ma, Ziyu Zhang, Songxiang Liu, Linqin Li, Zheng Liang, Qixi Zheng, Rui Wang, Xiaoqin Feng, et al. Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens. arXiv preprint arXiv:2503.01710, 2025.
  105. Yuancheng Wang, Zhenyu Tang, Yun Wang, Arthur Hinsvark, Yingru Liu, Yinghao Li, Kainan Peng, Junyi Ao, Mingbo Ma, Mike Seltzer, et al. Scaling speech tokenizers with diffusion autoencoders. arXiv preprint arXiv:2602.06602, 2026.
  106. Andrew B Watson and Joshua A Solomon. Model of visual contrast gain control and pattern masking. Journal of the optical society of America A, 14(9):2379–2391, 1997.
  107. David Wessels, David Knigge, Riccardo Valperga, Samuele Papa, Sharvaree Vadgama, Efstratios Gavves, and Erik Bekkers. Grounding continuous representations in geometry: Equivariant neural fields. In International Conference on Learning Representations, volume 2025, pages 59774–59794, 2025.
  108. Boyong Wu, Chao Yan, Chen Hu, Cheng Yi, Chengli Feng, Fei Tian, Feiyu Shen, Gang Yu, Haoyang Zhang, Jingbei Li, et al. Step-audio 2 technical report. arXiv preprint arXiv:2507.16632, 2025.
  109. Shengqiong Wu, Hao Fei, Leigang Qu, Wei Ji, and Tat-Seng Chua. Next-gpt: Any-to-any multimodal llm. arXiv preprint arXiv:2309.05519, 2023.
  110. Kun Xie, Feiyu Shen, Junjie Li, Fenglong Xie, Xu Tang, and Yao Hu. Fireredtts-2: Towards long conversational speech generation for podcast and chatbot. arXiv preprint arXiv:2509.02020, 2025.
  111. Detai Xin, Shujie Hu, Chengzuo Yang, Chen Huang, Guoqiao Yu, Guanglu Wan, and Xunliang Cai. Longcat- audiodit: High-fidelity diffusion text-to-speech in the waveform latent space. arXiv preprint arXiv:2603.29339, 2026.
  112. Jin Xu, Zhifang Guo, Hangrui Hu, Yunfei Chu, Xiong Wang, Jinzheng He, Yuxuan Wang, Xian Shi, Ting He, Xinfa Zhu, et al. Qwen3-omni technical report. arXiv preprint arXiv:2509.17765, 2025.
  113. Tongda Xu, Mingwei He, Shady Abu-Hussein, Jose Miguel Hernandez-Lobato, Chunhang Zheng, Kai Zhao, Chao Zhou, Ya-Qin Zhang, and Yan Wang. Making reconstruction FID predictive of diffusion generation FID. arXiv preprint arXiv:2603.05630, 2026.
  114. Chen Yang, Chufan Yu, Hanfu Chen, Jie Zhu, Jingqi Chen, Ke Chen, Wenxuan Wang, Yang Wang, Yaozhou Jiang, Yi Jiang, et al. Moss-audio technical report. arXiv preprint arXiv:2606.01802, 2026.
  115. Zhen Ye, Peiwen Sun, Jiahe Lei, Hongzhan Lin, Xu Tan, Zheqi Dai, Qiuqiang Kong, Jianyi Chen, Jiahao Pan, Qifeng Liu, et al. Codec does matter: Exploring the semantic shortcoming of codec for audio language model. In Proceedings of the AAAI Conference on Artificial Intelligence, volume 39, pages 25697–25705, 2025.
  116. Tianwei Yin, Qiang Zhang, Richard Zhang, William T Freeman, Fredo Durand, Eli Shechtman, and Xun Huang. From slow bidirectional to fast autoregressive video diffusion models. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 22963–22974, 2025.
  117. Sihyun Yu, Sangkyung Kwak, Huiwon Jang, Jongheon Jeong, Jonathan Huang, Jinwoo Shin, and Saining Xie. Representation alignment for generation: Training diffusion transformers is easier than you think. arXiv preprint arXiv:2410.06940, 2024.
  118. Yongsheng Yu, Wei Xiong, Weili Nie, Yichen Sheng, Shiqiu Liu, and Jiebo Luo. Pixeldit: Pixel diffusion transformers for image generation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 14273–14282, 2026.
  119. Ruibin Yuan, Hanfeng Lin, Shuyue Guo, Ge Zhang, Jiahao Pan, Yongyi Zang, Haohe Liu, Yiming Liang, Wenye Ma, Xingjian Du, et al. Yue: Scaling open foundation models for long-form music generation. arXiv preprint arXiv:2503.08638, 2025.
  120. Zhengrong Yue, Taihang Hu, Mengting Chen, Haiyu Zhang, Zihao Pan, Tao Liu, Zikang Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, et al. What matters for diffusion-friendly latent manifold? prior-aligned autoencoders for latent diffusion. arXiv preprint arXiv:2605.07915, 2026.
  121. Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, and Marco Tagliasacchi. Soundstream: An end-to-end neural audio codec. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30: 495–507, 2021.
  122. Dong Zhang, Gang Wang, Jinlong Xue, Kai Fang, Liang Zhao, Rui Ma, Shuhuai Ren, Shuo Liu, Tao Guo, Weiji Zhuang, et al. Mimo-audio: Audio language models are few-shot learners. arXiv preprint arXiv:2512.23808, 2025.
  123. Xin Zhang, Dong Zhang, Shimin Li, Yaqian Zhou, and Xipeng Qiu. Speechtokenizer: Unified speech tokenizer for speech language models. In International Conference on Learning Representations, volume 2024, pages 31798–31818, 2024.
  124. Boyang Zheng, Nanye Ma, Shengbang Tong, and Saining Xie. Diffusion transformers with representation autoencoders. arXiv preprint arXiv:2510.11690, 2025.
  125. Feiyan Zhou, Luyuan Wang, Shoufa Chen, Zhe Wang, Zhiheng Liu, Yuren Cong, Xiaohui Zhang, Fanny Yang, and Belinda Zeng. Wavflow: Audio generation in waveform space. arXiv preprint arXiv:2605.18749, 2026.
  126. Yixuan Zhou, Guoyang Zeng, Xin Liu, Xiang Li, Renjie Yu, Ziyang Wang, Runchuan Ye, Weiyue Sun, Jiancheng Gui, Kehan Li, et al. Voxcpm: Tokenizer-free tts for context-aware speech generation and true-to-life voice cloning. arXiv preprint arXiv:2509.24650, 2025.
  127. Yixuan Zhou, Guoyang Zeng, Xin Liu, Xiang Li, Renjie Yu, Jiancheng Gui, Jiaheng Wu, Ziyang Wang, Xudong Shen, Runchuan Ye, et al. Voxcpm2 technical report. arXiv preprint arXiv:2606.06928, 2026.
  128. Eberhard Zwicker and Hugo Fastl. Psychoacoustics: Facts and models, volume 22. Springer Science & Business Media, 2013.

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭