近期已有一些工作尝试把 diffusion model 与 autoregressive model 结合起来,在不使用离散 speech token 的前提下自回归生成连续语音表示,但它们往往面临计算负担过重或效果不理想的问题。本文提出 Diffusion Transformer Autoregressive Modeling(DiTAR):一种把 language model 与 diffusion transformer 结合起来的 patch-based 自回归框架。该方法显著提升了自回归模型处理连续 token 的有效性,同时降低计算需求。
DiTAR 采用分而治之的 patch 生成策略:language model 处理聚合后的 patch embedding,diffusion transformer 再依据 language model 的输出生成下一个 patch。推理时,作者把 temperature 定义为反向 diffusion ODE 中引入噪声的时间点,以平衡多样性与确定性。大规模 scaling 分析还表明 DiTAR 具有很强的可扩展性。在 zero-shot 语音生成上,DiTAR 在稳健性、说话人相似度和自然度方面取得了当时的 SOTA 表现。[32]
1 引言
近年来,autoregressive language model(LM)展现出很强的生成能力和 scaling 性质 [1, 55, 56, 60],其中通常采用离散 tokenization。离散化对文本而言很自然,但对图像、视频和音频等其他模态却没那么直接。受码率限制,离散表示往往无法高保真重建复杂模态;相比之下,连续 token 更能保留原始信息 [15, 47]。为缓解这一问题,autoregressive 多媒体生成通常采用两阶段策略:先由 LM 生成有损离散 token,再用基于 token 的 diffusion 补充细节。然而,这种级联设计会累积误差,也限制 language model 的可扩展性。因此,对连续表示进行 autoregressive modeling 很有意义。
Diffusion model 已被证明能够有效建模连续表示 [2, 45, 47],将它与 autoregressive model 结合也成为重要研究方向。[34] 首次提出在 language model 上附加 diffusion head 进行图像生成,开辟了一条新路线。然而,当骨干网络采用 causal-attention language model 时,其性能明显落后。
另一类方法如 ARDiT [38] 或 Transfusion [62],把 language model 的参数复用于 diffusion,因此带来可观的计算开销。由此产生一个问题:能否在保证高质量生成的同时,以合理计算量 autoregressively 预测连续 token?
为解决这一问题,本文提出 Diffusion Transformer AutoRegressive(DiTAR)建模框架,把 transformer diffusion 与 language model 无缝结合。作者认为,language model 加 diffusion head 效果不佳的原因,在于 causal attention 强加的单向依赖与连续 token 特有的强帧间相关性相冲突。
DiTAR 采用分而治之策略,把连续 token 划分为多个 patch:language model 负责 patch 间预测,diffusion transformer 负责 patch 内预测。具体来说,系统使用在多个生成领域都表现领先的 bidirectional-attention diffusion transformer(DiT)[2, 37, 45] 预测局部 patch,并将其称为 LocDiT。作者还提出一种通用 guidance 方法,并向 LocDiT 引入历史上下文,以进一步增强生成能力。Patchification 之后,负责长上下文的 causal language model 接收到更短的序列,计算量也随之降低。
推理时,temperature sampling 用于平衡 exploration 与 exploitation,是离散值 language model 的关键机制,但它在连续值 LM 中尚未得到充分研究。本文把 temperature 定义为沿反向 ODE 轨迹引入噪声的时间点,并据此为连续值 AR model 提出 temperature sampling。不同于需要大量步数的 SDE-based 方法 [12, 34],该方法适用于更快的 ODE solver,并能在多样性与确定性之间取得平衡。
DiTAR 以 language model 为基础,擅长 zero-shot 生成任务。作者将其用于 zero-shot text-to-speech(TTS),即根据未见说话人的 prompt 生成语音。不同于采用 coarse-to-fine 流水线的系统 [2, 7, 8, 13],DiTAR 让 language model 直接预测最终特征,从而省去多阶段流程。它在稳健性、说话人相似度与自然度方面取得 SOTA 结果,同时计算需求远低于竞品模型。
概括而言,本文的主要贡献如下:
- 本文提出 DiTAR:一种把 LM 与 DiT 无缝结合的 patch-based autoregressive framework,既保留二者优势,又获得很强的生成能力和更低的计算需求。
- 推理阶段,本文重新定义 temperature,并提出一种面向 diffusion loss autoregressive model 的快速 temperature sampling 方法。
- 本文将 DiTAR 用于 zero-shot 语音生成,以显著更低的计算量取得 SOTA 表现。
2 相关工作
Autoregressive Language Model 与 Diffusion 的结合。 Language model 主要用于离散表示,而 diffusion 擅长建模连续分布;把二者结合用于多模态建模,是一个关键研究方向。一些工作 [5, 38, 58] 通过改变相邻 token 的去噪速率,让靠前 token 更早完成预测,从而使 diffusion 具备 autoregressive 能力。Transfusion [62] 让 diffusion 与 language model 共用同一个 transformer:离散 token 使用 causal attention,连续 token 使用 bidirectional attention,但它并不天然支持连续 token 的 autoregressive generation。这些方法把 language model 参数复用于 diffusion;随着序列变长、language model 变大,计算需求会显著增加。与本文最相关的是 Li 等人 [34] 提出的 next-token diffusion head,不过它用于 causal language model 时性能相对较差。
这些工作使用 patchification 的主要目的,是通过缩短序列降低计算量;而在本文中,patchification 除了减少计算,还让 autoregressive framework 能在 patch 内执行 bidirectional modeling,从而进一步提升建模效果。
Zero-Shot Text-to-Speech。 Zero-shot TTS 的目标,是根据未见说话人的 prompt 生成语音。现有工作可分为 multi-stage 和 single-stage 两类。Multi-stage 方法 [2, 7, 8, 22, 23, 31] 使用多种表示描述语音,主要区分为 coarse 与 fine 两级。Autoregressive language model 往往负责预测信息量较低、通常为离散值的 coarse 表示,例如语义 [2, 4, 10, 21, 26] 与韵律 [22, 23, 24],再由另一个模型完成 coarse-to-fine 转换。
Single-stage 方法侧重生成可直接重建音频波形的高信息量连续表示,例如 Mel spectrogram 或 auto-encoder latent,主要采用基于 non-causal-attention transformer 的 diffusion [9, 14, 16, 29]。另一些工作 [33, 43, 50, 57] 直接用 AR 建模语音 Mel spectrogram,但通常需要在输入阶段使用 Dropout [53] 保证生成稳健性,因此 in-context learning 能力较弱,更适合训练集内说话人的 TTS。本文提出一种 single-stage autoregressive zero-shot TTS 方法,并在生成稳健性和声音相似度上取得 SOTA。
3 方法
3.1 概览
简言之,DiTAR 是一种基于连续表示的 patch-based autoregressive system,把 causal-attention AR 与 bidirectional-attention transformer diffusion 的优势结合起来。
3.1.1 问题表述
DiTAR 通过 next-token prediction 构成 autoregressive model。考虑连续 token 序列 ,可用概率链式法则分解其联合分布:
其中, 表示 AR generative model 的参数。相邻连续 token 之间高度相似,说明局部区域内存在 bidirectional dependency。基于这一观察,作者把局部 聚合为大小为 的 patch,再用 bidirectional attention 建模每个 patch 内的 token。模型可分为 和 两部分: 是负责长上下文学习的 autoregressive model,建模 ; 是执行 next-patch prediction 的 bidirectional-attention diffusion transformer,建模 。这里 是 language model 的输出,也是 diffusion 的条件。
作者在 zero-shot text-to-speech 任务上验证 DiTAR。依照上述形式,他们像 [7] 一样把 zero-shot TTS 看作 AR model 的 conditional continuation:将 prompt 文本、目标文本和 prompt 语音拼接为 prefix context 输入模型,再由模型在给定上下文时 autoregressively 生成目标语音。
3.1.2 整体架构
Li 等人 [34] 发现,causal-attention autoregressive model 与 diffusion loss 结合后的性能,显著弱于使用 full attention 的系统。为此,DiTAR 采用分而治之策略,将长连续 token 序列划分为多个 patch:language model 负责 patch 间预测,diffusion transformer 负责 patch 内预测。
如 Figure 1 所示,系统 backbone 是执行 next-token prediction 的 causal-attention transformer。每个连续 token patch 先经 aggregation encoder 压成一个向量,再输入 AR model 得到输出 embedding ; 随后作为 diffusion decoder LocDiT 的条件。训练时沿用 [34],对输出连续 token 使用 diffusion loss。
3.2 LocDiT:下一 Patch 的双向建模
Diffusion transformer [37, 45] 已在多个生成领域取得成功。这类方法利用 bidirectional transformer 的完整感受野生成整个样本。DiTAR 则使用名为 Local Diffusion Transformer(LocDiT)的 bidirectional transformer diffusion,生成局部连续 token patch。
LocDiT 根据 AR 输出生成下一个语音 patch,但作者发现,单凭这一条件,diffusion 很难预测 next patch。为发挥 diffusion transformer 的上下文学习能力,他们提出 context-aware diffusion:如 Figure 1 右半部分所示,把历史 token patch 作为 LocDiT 的 prefix input,使任务更接近 outpainting,从而显著改善生成表现。定量结果见 §4.3。
这一设计还隐含着 coarse-to-fine 过程。现有方法 [2, 7, 13] 通常显式区分 coarse 与 fine feature:language model 预测 coarse feature,另一个网络负责从 coarse 转到 fine;但 multi-stage 方法容易累积误差。DiTAR 则以无缝 end-to-end 方式工作:把每个 token patch 压缩到隐式 coarse feature space,再由 LocDiT 展开为高保真连续 token。
3.3 LM Guidance
Classifier-free guidance(CFG)[19] 被广泛用于增强生成模型对条件的遵循程度。在 diffusion 中,conditional 与 unconditional model 共享参数,通过训练时随机省略条件进行联合训练。推理时,用参数 合并两路输出,在多样性与保真度之间取舍;这等价于从分布 采样。其中 是模型参数, 是条件, 是时刻 的含噪样本。对离散值 language model,CFG [49] 往往需要把 language model 计算两次,以得到 conditional 与 unconditional logits,计算代价较高。
DiTAR 同时包含 LM 与 diffusion head。作者为此提出 LM guidance:只需计算两次 diffusion head 和一次 LM。LM 的第 个输出 本质上表示全部历史输入 ;训练时,他们沿序列随机把 替换为 dummy embedding 。推理时,通过下式从 采样:
其中, 表示 diffusion 在时刻 的第 个含噪序列样本, 是 LocDiT 估计的 score, 是代表 unconditional modeling 的 dummy vector。在 velocity space 中使用 conditional Flow Matching target 也与此等价。§4.3 将表明,该方法显著提升模型性能。
3.4 连续值 LM 的 Temperature
Temperature-based sampling 用于平衡 exploration 与 exploitation,是离散值 LM 的基础机制,但在连续值 LM 中研究较少。Li 等人 [34] 基于 DDPM reverse process [20] 提出一种采样方法;它属于一阶 SDE solver,并把 temperature 定义为每一步的噪声缩放因子。由于 Wiener process 具有随机性,SDE solver 需要很小的步长,因而必须使用更多步数才能收敛 [52]。这一 temperature 定义也难以直接扩展到当代应用中更常见、更快速的 ODE solver [40, 41, 51]。为解决这些问题,作者重新定义 temperature,并提出一种与 ODE solver 兼容的新采样方法。
作者把 temperature 定义为求解 diffusion 反向 ODE 时引入噪声的时间点。具体考虑按 patch 定义的 Gaussian diffusion forward process:,其中 ,,, 与 共同定义 flow path。
当 时,采样等价于标准 ODE sampling:从 到 求解反向 ODE ,初始 , 是预测 vector field。当 时,不引入随机噪声,过程完全确定。由于 是 standard Gaussian 中 likelihood 最高的取值,作者把从 开始的采样定义为 greedy sampling,以保证确定性。
当 时,在时刻 用 forward process 对估计的 加噪,从而引入随机性。Equations (3)–(4) 概括了迭代过程;为便于说明,默认 ODE solver 采用 Euler method。
其中 表示估计的 ,可通过线性变换从估计 velocity 或 score 推导得到,推导见 §A.3。§4.3 表明, 能有效平衡多样性与稳定性。完整采样过程见 Algorithm 1。
输入:-prediction model ;离散时间点 、;ODE solver ;变换函数 ;temperature 。
1. 令 。
2. 若 ,采样初始噪声 ;否则令 。
3. 对 :
- 计算 ;
- 若 ,令 ,采样 ,再令 ;
- 否则令 。
输出:。
3.5 实现
3.5.1 连续语音 Tokenization
沿用 LDM [47],作者使用 variational auto-encoder(VAE)[27] 把波形转换为 latent 的分布,并用均值与方差表示。VAE encoder 由多层 convolutional network 构成。
Decoder 架构与 adversarial training scheme 均沿用 BigVGAN [30],discriminator 则采用 Kong 等人 [28] 提出的 multi-period discriminator(MPD)和 multi-scale discriminator(MSD)。在本文设置中, 波形被压缩为 、 维的 latent。
3.5.2 模型
DiTAR 包含 aggregation encoder、language model 和 decoder(LocDiT)三个模块,三者都基于 transformer。Encoder 与 decoder 使用 bidirectional attention mask,LM 使用 causal attention mask;所有 transformer 均采用 Pre-Norm [59],并使用 RMSNorm [61] 与 RoPE [54]。
每个连续 token patch 连同一个置于序列开头、类似 [11] 的可学习 special token,一起输入 aggregation encoder;special token 位置的输出作为 aggregation embedding。不同 patch 的 aggregation embedding 组成序列,交给 LM 处理。在 LocDiT 中,LM 输出与 time embedding 相加,再与历史 context patch、含噪目标 token 组成一个新序列,作为 LocDiT 输入。计算 loss 时,只考虑含噪目标 token 位置的输出。训练期间,以 概率把 LM 输出随机替换为全零向量,从而为 LocDiT 启用 LM guidance。
3.5.3 Diffusion 形式
其中, 表示数据, 表示 standard Gaussian noise,。训练采用 conditional Flow Matching loss [36]:
Velocity 定义为 。推理时使用 DDIM sampler [51];它本质上是相对于 signal-to-noise ratio 、而非相对于 的 Euler ODE sampler,已有研究表明这更符合 diffusion ODE 的 semi-linear 性质 [40]。
3.5.4 Zero-shot TTS 系统
文本序列先转换为 phoneme,再通过 lookup table 得到 text embedding;speech token 经 aggregation encoder 变成 speech embedding,并与 text embedding 拼接。所得 embedding sequence 作为 DiTAR LM 的输入,训练时不计算文本部分的 loss。沿用 Li 等人 [33] 和 Wang 等人 [57],作者还在 LM 输出端加入带 fully connected layer 的 binary classifier,用于预测何时停止。Zero-shot TTS 的 loss 可写为 。推理时,把 prompt 文本、目标文本和 prompt 音频作为 prefix input 送入 DiTAR LM,再 autoregressively 生成目标音频。
4 实验
4.1 Zero-Shot TTS 的 SOTA 表现
本节将 DiTAR 与领先系统进行 benchmark 对比,并展示其 SOTA 表现。
4.1.1 实验设置
为了公平评测 zero-shot TTS,需要同时考虑 prompt audio、文本与评测工具。作者统一这些变量,以便更客观、公平地比较不同系统。
评测使用三个开源数据集:1)LibriSpeech(PC) [42, 44] test-clean,包含 位不同英语说话人、共 小时语音。作者使用两个既有子集:NaturalSpeech3 的 subset A,含 个三秒语音 prompt 与 个目标样本;F5TTS 发布的 subset B,含 个 prompt 与 个样本。2)Seed-ZH:中文语音数据集 DiDiSpeech 2 [17] 的子集,含 组 prompt 与 target。3)Seed-EN:带多样口音的 crowdsourcing 英语数据集 Common Voice [3] 子集,含 组 prompt 与 target。
评测指标。作者评估四项客观指标:1)Word Error Rate(WER),用于衡量生成稳健性。为保持一致,不同测试集沿用既有工作的 ASR 设置:LibriSpeech test-clean subset A 使用 HuBERT-based model〔注 1〕,subset B 使用 Faster-Whisper-large-v3〔注 2〕[46],Seed-EN 使用 Whisper-large-v3〔注 3〕,Seed-ZH 使用 Paraformer-zh。2)相对 prompt audio 的说话人相似度(SIM):使用 WavLM-large [6] 计算生成语音与参考语音之间的 cosine distance。3)UTMOS [48]:自动预测的 mean opinion score(MOS),用于评估语音质量。4)Floating Point Operations(FLOPs):衡量模型计算负担,计算过程见 §A.4。
主观评测使用四项 MOS 指标:1)N-MOS 衡量自然度;2)Q-MOS 衡量音质;3)S-MOS 衡量说话人声音相似度;4)CMOS 用于与真人音频做 side-by-side 比较。
模型设置与 Baseline。作者将 DiTAR 与多种架构的 zero-shot TTS 系统比较,包括工作在离散或连续值空间中的 multi-stage 与 single-stage 方案。对比使用 B 参数、patch size 为 的 DiTAR。
| 类型 | 系统 | 参数量 | 训练数据 | WER (%) ↓ | SIM ↑ | UTMOS ↑ | TFLOPs ↓ |
|---|---|---|---|---|---|---|---|
| LibriSpeech test-clean A | |||||||
| - | 真人 | - | - | 0.34 | 0.68 | 4.14 | - |
| - | Vocoder | - | - | 0.34 | 0.63 | 4.03 | - |
| 离散 AR + 离散 NAR | VALL-E ♦ | 0.4B | LibriLight | 6.11 | 0.47 | 3.68 | ~2.99 |
| 离散 AR + 连续 NAR | MegaTTS 2 ♦ | 0.5B | LibriLight | 2.32 | 0.53 | 4.02 | ~0.06 |
| 离散 NAR | NaturalSpeech 3 ♦ | 0.5B | LibriLight | 1.81 | 0.67 | 4.30 | ~8.92 |
| 连续 NAR | NaturalSpeech 2 ♦ | 0.4B | LibriLight | 1.94 | 0.55 | 3.88 | ~12.89 |
| 连续 NAR | Voicebox (NFE=32) ♦ | 0.4B | LibriLight | 2.14 | 0.48 | 3.73 | ~60.89 |
| 连续 AR | DiTAR (NFE=10) | 0.6B | LibriLight | 1.78 | 0.64 | 4.15 | ~2.75 |
| LibriSpeech test-clean B | |||||||
| - | 真人 | - | - | 2.23 | 0.69 | 4.10 | - |
| - | Vocoder 重合成 | - | - | 2.38 | 0.66 | 3.97 | - |
| 离散 NAR | MaskGCT (NFE=50) ♠ | 1.1B | Emilia | 2.72 | 0.69 | 3.90 | ~116.66 |
| 连续 NAR | E2TTS (NFE=32) ♣ | 0.3B | Emilia | 2.95 | 0.69 | 3.56 | ~56.46 |
| 连续 NAR | F5TTS (NFE=32) ♣ | 0.3B | Emilia | 2.42 | 0.66 | 3.88 | ~37.36 |
| 连续 AR | DiTAR (NFE=10) | 0.6B | Emilia | 2.39 | 0.67 | 4.22 | ~2.75 |
| 系统 | N-MOS | Q-MOS | S-MOS | CMOS |
|---|---|---|---|---|
| 真人 | 3.89 | 3.61 | 3.56 | +0.18 |
| E2TTS | 3.27 | 3.44 | 3.15 | -0.32 |
| F5TTS | 3.36 | 3.58 | 3.33 | -0.04 |
| DiTAR | 3.69 | 3.87 | 3.55 | 0.00 |
推理时,LocDiT 使用 。DiTAR 的具体参数设置见 Appendix A.2。
4.1.2 实验结果
作者从多个维度比较 DiTAR 与 baseline。客观指标见 Table 1 的 LibriSpeech test-clean 结果;主观评测邀请 位英语专家给生成音频打分。N-MOS、Q-MOS 和 S-MOS 采用 – 分;CMOS 则让专家把生成音频与 ground truth(GT)比较,给出 到 的分数。结果见 Table 2。
生成稳健性。如 Table 1 所示,在两种训练数据配置和测试集上,DiTAR 都取得最佳 WER,合成稳健性可与带 phone-level duration model 的 NAR 系统匹敌。Table 3 进一步与使用 proprietary data 训练的模型比较,显示 DiTAR 具有很强的合成稳定性。
说话人相似度。作者同时做客观与主观评估。客观上,Table 1 中 DiTAR 的 SIM 与 NAR 系统相当;主观上,Table 2 中 DiTAR 的 S-MOS 超过领先 NAR 系统,体现出良好的 in-context learning 能力。
自然度。作者使用 N-MOS 与 CMOS 两项主观指标评估语音自然度。
Table 2 表明,DiTAR 的自然度分数高于所比较的领先 NAR 系统。
音频质量。作者用客观指标 UTMOS 与主观指标 Q-MOS 评估音质。Table 1 中,DiTAR 在 LibriSpeech test-clean subset A 的 UTMOS 仅次于 NaturalSpeech3,在 subset B 则最高;Table 2 的主观结果中,DiTAR 的 Q-MOS 甚至高于 ground truth,显示其输出具有很高的感知质量。
计算负担。Table 1 表明,DiTAR 在保证高质量音频生成的同时,相比其他 NAR 系统把计算需求降低约 。Hybrid system 的计算量更低,但输出质量往往也较差。推理效率详见 §4.4.2。
4.1.3 与更多模型比较
为评估 DiTAR 的性能上界,作者在 小时数据上训练 B 参数的 DiTAR,并与更广泛的模型比较,包括 Seed-TTS 等 closed-source 系统。测试使用 Seed-EN 与 Seed-ZH 两种语言的数据集。Table 3 显示,DiTAR 获得最佳生成稳健性和很高的说话人相似度;其他系统结果均来自各自论文。
| 系统 | Seed-EN | Seed-ZH | ||
|---|---|---|---|---|
| WER (%) ↓ | SIM ↑ | WER (%) ↓ | SIM ↑ | |
| 真人 | 2.06 | 0.73 | 1.254 | 0.750 |
| Seed-TTS DiT | 1.733 | 0.790 | 1.178 | 0.809 |
| CosyVoice | 4.29 | 0.609 | 3.63 | 0.723 |
| CosyVoice 2 | 2.57 | 0.652 | 1.45 | 0.748 |
| CosyVoice 2-S | 2.38 | 0.654 | 1.45 | 0.753 |
| FireRedTTS | 3.82 | 0.46 | 1.51 | 0.63 |
| MaskGCT | 2.623 | 0.717 | 2.273 | 0.774 |
| E2TTS | 2.19 | 0.71 | 1.97 | 0.73 |
| F5TTS | 1.83 | 0.67 | 1.56 | 0.76 |
| DiTAR | 1.685 | 0.735 | 1.023 | 0.753 |
4.2 Scaling 行为
本节以 Seed-EN 为测试集,从模型架构与训练数据两方面研究 DiTAR 在 zero-shot 语音生成上的 scaling 性质。
数据量或模型规模增加时,DiTAR 的性能都会持续提升。作者同时进行 data scaling 与 model scaling。固定 B 模型,把训练数据从 小时扩展到 小时;固定 小时数据,则把模型从 B 扩展到 B,并同步增大 encoder、language model 和 LocDiT。具体设置见 Table 8。Figure 2 显示,随着训练数据和模型参数增加,WER 与 SIM 持续改善。
Language model 与 diffusion decoder 从 scaling 中获益更多。作者以在 小时数据上训练的 B 模型为起点,分别扩大 encoder、language model 和 decoder(LocDiT)。由于 encoder 与 decoder 处理更短序列,他们经验性地把更多参数分配给 language model。Table 4 表明,扩大 language model 和 LocDiT 能提升性能,而增加 encoder 大小的影响很小。
| 系统 | WER (%) ↓ | SIM ↑ |
|---|---|---|
| DiTAR (0.4B) | 1.876 | 0.716 |
| Encoder 大小 ×4 | 1.821 | 0.72 |
| Language model 大小 ×4 | 1.695 | 0.727 |
| LocDiT 大小 ×4 | 1.785 | 0.726 |
4.3 方法分析与 Ablation Study
本节详细分析 DiTAR 的各个组件。除非另有说明,默认使用 B 参数、patch size 为 、 的 DiTAR,并在 Seed-EN 上测试。
默认测试集为 Seed-EN。
Patch Size。LocDiT 用 bidirectional attention 生成 next patch。作者保持总参数量不变,只改变 patch size。Figure 3 显示,patch 过大或过小时性能都会下降:过小会削弱 bidirectional attention 能力,使模型更依赖 causal-attention AR,从而退化;这或许能解释 Li 等人 [34] 观察到的 causal AR 配 diffusion loss 效果不佳。过大的 patch 则会让 LocDiT 成为瓶颈,需要投入更多参数。
LocDiT 的历史 Patch 数量。作者改变 historical patch 数量,验证 LocDiT context 的关键作用。Table 5 表明,没有历史上下文时性能会严重恶化;加入历史上下文会把 LocDiT 从单纯生成转变为 outpainting,显著改善合成结果。对 这类较大 patch,使用一个历史 patch 能在计算效率与性能之间取得最佳平衡。
| Patch 大小 | 历史 Patch 数 | WER (%) ↓ | SIM ↑ |
|---|---|---|---|
| 1 | 2 | 3.334 | 0.716 |
| 1 | 6.131 | 0.692 | |
| 0(不使用) | 53★ | 0.34★ | |
| 4 | 2 | 1.809 | 0.73 |
| 1 | 1.736 | 0.72 | |
| 0(不使用) | 22.874★ | 0.56★ |
LM Guidance。Figure 4 显示,LM guidance 显著改善 diffusion decoder 的推理。没有 guidance()时,WER 与 SIM 都明显恶化;guidance scale 过大同样会损害结果。即使 NFE 极低(如 ),只要配合 LM guidance,DiTAR 在 WER 与 SIM 上仍能保持良好表现。
4.4 推理分析
4.4.1 Temperature 的影响
Temperature 对 language model 推理中平衡多样性与确定性至关重要,但连续值 LM 中的定义仍缺乏研究。本文把 temperature 定义为反向 ODE 求解过程中引入随机采样的时间点。
为研究 如何平衡多样性与稳定性,作者在不同 下把同一文本合成 次,用于评估声音多样性。只把文本作为 DiTAR prefix input,让模型 autoregressively 生成随机声音;随后用 WavLM-large 提取 speaker embedding,再使用预先在训练集上拟合的 Principal Component Analysis(PCA)降维并可视化前两个主成分。Figure 5 表明, 越大,说话人声音越多样。
作者进一步测试不同 temperature 下客观指标的变化。Table 6 显示,在大规模测试集上,不同 temperature 都能得到较好的客观指标。
整体趋势是:较高 temperature 会带来略好的 SIM,较低 temperature 则带来更好的 WER。作者推测,这是因为模仿未见说话人的声音需要模型具备更大多样性,而发音稳健性更依赖确定性与稳定性。
| τ | NFE=2 | NFE=10 | ||
|---|---|---|---|---|
| WER (%) ↓ | SIM ↑ | WER (%) ↓ | SIM ↑ | |
| 0 | 1.666 | 0.717 | 1.623 | 0.719 |
| 0.5 | 1.669 | 0.722 | 1.699 | 0.727 |
| 1 | 1.686 | 0.72 | 1.689 | 0.727 |
4.4.2 效率
作者考察三项推理指标:1)throughput,单位时间生成的音频时长;2)Real Time Factor(RTF),生成时间与音频时长之比;3)latency,输出首帧音频所需时间(不含 vocoder)。在参数规模相同的条件下,比较 NAR(diffusion transformer)与 DiTAR。推理时所有系统均使用 CFG 和 ,并在一张 A100 GPU 上生成 秒音频来评估全部指标。
如 Figure 6 所示,batch size 较小时,NAR 因不含 autoregressive computation 而具有更高 throughput;随着 batch size 增大,NAR 的高 FLOPs 限制 throughput 增长,而 DiTAR 的 throughput 快速上升并显著超过 NAR。
| 系统 | 延迟(秒)↓ | RTF ↓ |
|---|---|---|
| Batch size = 500 | ||
| NAR | 50 | 5.03 |
| DiTAR (P=4) | 0.14 | 1.39 |
| DiTAR (P=2) | 0.11 | 2.17 |
| Batch size = 1 | ||
| NAR | 0.37 | 0.037 |
| DiTAR (P=4) | 0.066 | 0.66 |
| DiTAR (P=2) | 0.064 | 1.28 |
DiTAR 结合 language model 与 diffusion transformer,也继承了两者的特性。Table 7 显示,由于 autoregressive 性质,DiTAR 的 latency 始终低于 NAR;RTF 方面,NAR 并行度高,在小 batch 下速度更快。DiTAR 则可通过改变 patch size 调整并行度,在 latency 与 RTF 之间取舍。
5 结论
本文提出 DiTAR:利用 diffusion transformer 的高质量生成能力创建局部 patch,同时保留 language model 的核心 autoregressive 特征。推理时,把 temperature 定义为求解反向 diffusion ODE 过程中引入噪声的时间点。用于 zero-shot speech synthesis 后,DiTAR 以显著更低的计算需求,在稳健性、说话人相似度与自然度方面取得 SOTA。
参考文献
以下 62 条参考文献保留原始书目信息与论文顺序。
- Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, et al. Gpt-4 technical report. arXiv preprint arXiv:2303.08774, 2023.
- Philip Anastassiou, Jiawei Chen, Jitong Chen, Yuanzhe Chen, Zhuo Chen, Ziyi Chen, Jian Cong, Lelai Deng, Chuang Ding, Lu Gao, et al. Seed-tts: A family of high-quality versatile speech generation models. arXiv preprint arXiv:2406.02430, 2024.
- Rosana Ardila, Megan Branson, Kelly Davis, Michael Henretty, Michael Kohler, Josh Meyer, Reuben Morais, Lindsay Saunders, Francis M Tyers, and Gregor Weber. Common voice: A massively-multilingual speech corpus. arXiv preprint arXiv:1912.06670, 2019.
- Alexei Baevski, Yuhao Zhou, Abdelrahman Mohamed, and Michael Auli. wav2vec 2.0: A framework for self- supervised learning of speech representations. Advances in neural information processing systems, 33:12449–12460, 2020.
- Boyuan Chen, Diego Marti Monso, Yilun Du, Max Simchowitz, Russ Tedrake, and Vincent Sitzmann. Diffusion forcing: Next-token prediction meets full-sequence diffusion. arXiv preprint arXiv:2407.01392, 2024.
- Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, et al. Wavlm: Large-scale self-supervised pre-training for full stack speech processing. IEEE Journal of Selected Topics in Signal Processing, 16(6):1505–1518, 2022.
- Sanyuan Chen, Shujie Liu, Long Zhou, Yanqing Liu, Xu Tan, Jinyu Li, Sheng Zhao, Yao Qian, and Furu Wei. Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers. arXiv preprint arXiv:2406.05370, 2024.
- Sanyuan Chen, Chengyi Wang, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, et al. Neural codec language models are zero-shot text to speech synthesizers. IEEE Transactions on Audio, Speech and Language Processing, 2025.
- Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Chunhui Wang, Jian Zhao, Kai Yu, and Xie Chen. F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching. arXiv preprint arXiv:2410.06885, 2024.
- Yu-An Chung, Yu Zhang, Wei Han, Chung-Cheng Chiu, James Qin, Ruoming Pang, and Yonghui Wu. W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training. In 2021 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), pages 244–250. IEEE, 2021.
- Jacob Devlin. Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805, 2018.
- Prafulla Dhariwal and Alexander Nichol. Diffusion models beat gans on image synthesis. Advances in neural information processing systems, 34:8780–8794, 2021.
- Zhihao Du, Qian Chen, Shiliang Zhang, Kai Hu, Heng Lu, Yexin Yang, Hangrui Hu, Siqi Zheng, Yue Gu, Ziyang Ma, et al. Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens. arXiv preprint arXiv:2407.05407, 2024.
- Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Canrun Li, Chung-Hsien Tsai, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Xu Tan, et al. E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts. In 2024 IEEE Spoken Language Technology Workshop (SLT), pages 682–689. IEEE, 2024.
- Lijie Fan, Tianhong Li, Siyang Qin, Yuanzhen Li, Chen Sun, Michael Rubinstein, Deqing Sun, Kaiming He, and Yonglong Tian. Fluid: Scaling autoregressive text-to-image generative models with continuous tokens. arXiv preprint arXiv:2410.13863, 2024.
- Yuan Gao, Nobuyuki Morioka, Yu Zhang, and Nanxin Chen. E3 tts: Easy end-to-end diffusion-based text to speech. In 2023 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), pages 1–8. IEEE, 2023.
- Tingwei Guo, Cheng Wen, Dongwei Jiang, Ne Luo, Ruixiong Zhang, Shuaijiang Zhao, Wubo Li, Cheng Gong, Wei Zou, Kun Han, et al. Didispeech: A large scale mandarin speech corpus. In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 6968–6972. IEEE, 2021.
- Haorui He, Zengqiang Shang, Chaoren Wang, Xuyuan Li, Yicheng Gu, Hua Hua, Liwei Liu, Chen Yang, Jiaqi Li, Peiyang Shi, et al. Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation. In 2024 IEEE Spoken Language Technology Workshop (SLT), pages 885–890. IEEE, 2024.
- Jonathan Ho and Tim Salimans. Classifier-free diffusion guidance. arXiv preprint arXiv:2207.12598, 2022.
- Jonathan Ho, Ajay Jain, and Pieter Abbeel. Denoising diffusion probabilistic models. Advances in neural information processing systems, 33:6840–6851, 2020.
- Wei-Ning Hsu, Benjamin Bolte, Yao-Hung Hubert Tsai, Kushal Lakhotia, Ruslan Salakhutdinov, and Abdelrah- man Mohamed. Hubert: Self-supervised speech representation learning by masked prediction of hidden units. IEEE/ACM transactions on audio, speech, and language processing, 29:3451–3460, 2021.
- Ziyue Jiang, Jinglin Liu, Yi Ren, Jinzheng He, Zhenhui Ye, Shengpeng Ji, Qian Yang, Chen Zhang, Pengfei Wei, Chunfeng Wang, et al. Boosting prompting mechanisms for zero-shot speech synthesis. In The Twelfth International Conference on Learning Representations, 2023.
- Ziyue Jiang, Yi Ren, Zhenhui Ye, Jinglin Liu, Chen Zhang, Qian Yang, Shengpeng Ji, Rongjie Huang, Chunfeng Wang, Xiang Yin, et al. Mega-tts: Zero-shot text-to-speech at scale with intrinsic inductive bias. arXiv preprint arXiv:2306.03509, 2023.
- Zeqian Ju, Yuancheng Wang, Kai Shen, Xu Tan, Detai Xin, Dongchao Yang, Yanqing Liu, Yichong Leng, Kaitao Song, Siliang Tang, et al. Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models. arXiv preprint arXiv:2403.03100, 2024.
- Jacob Kahn, Morgane Riviere, Weiyi Zheng, Evgeny Kharitonov, Qiantong Xu, Pierre-Emmanuel Mazaré, Julien Karadayi, Vitaliy Liptchinsky, Ronan Collobert, Christian Fuegen, et al. Libri-light: A benchmark for asr with limited or no supervision. In ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 7669–7673. IEEE, 2020.
- Eugene Kharitonov, Damien Vincent, Zalán Borsos, Raphaël Marinier, Sertan Girgin, Olivier Pietquin, Matt Sharifi, Marco Tagliasacchi, and Neil Zeghidour. Speak, read and prompt: High-fidelity text-to-speech with minimal supervision. Transactions of the Association for Computational Linguistics, 11:1703–1718, 2023.
- Diederik P Kingma. Auto-encoding variational bayes. arXiv preprint arXiv:1312.6114, 2013.
- Jungil Kong, Jaehyeon Kim, and Jaekyoung Bae. Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis. Advances in neural information processing systems, 33:17022–17033, 2020.
- Matthew Le, Apoorv Vyas, Bowen Shi, Brian Karrer, Leda Sari, Rashel Moritz, Mary Williamson, Vimal Manohar, Yossi Adi, Jay Mahadeokar, et al. Voicebox: Text-guided multilingual universal speech generation at scale. Advances in neural information processing systems, 36, 2024.
- Sang-gil Lee, Wei Ping, Boris Ginsburg, Bryan Catanzaro, and Sungroh Yoon. Bigvgan: A universal neural vocoder with large-scale training. arXiv preprint arXiv:2206.04658, 2022.
- Sang-Hoon Lee, Ha-Yeong Choi, Seung-Bin Kim, and Seong-Whan Lee. Hierspeech++: Bridging the gap between semantic and acoustic representation of speech by hierarchical variational inference for zero-shot speech synthesis. arXiv preprint arXiv:2311.12454, 2023.
- Feng Li, Renrui Zhang, Hao Zhang, Yuanhan Zhang, Bo Li, Wei Li, Zejun Ma, and Chunyuan Li. Llava-next- interleave: Tackling multi-image, video, and 3d in large multimodal models. arXiv preprint arXiv:2407.07895, 2024.
- Naihan Li, Shujie Liu, Yanqing Liu, Sheng Zhao, and Ming Liu. Neural speech synthesis with transformer network. In Proceedings of the AAAI conference on artificial intelligence, volume 33, pages 6706–6713, 2019.
- Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, and Kaiming He. Autoregressive image generation without vector quantization. arXiv preprint arXiv:2406.11838, 2024.
- Xiang Li, Kai Qiu, Hao Chen, Jason Kuen, Jiuxiang Gu, Bhiksha Raj, and Zhe Lin. Imagefolder: Autoregressive image generation with folded tokens. arXiv preprint arXiv:2410.01756, 2024.
- Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, and Matt Le. Flow matching for generative modeling. arXiv preprint arXiv:2210.02747, 2022.
- Yixin Liu, Kai Zhang, Yuan Li, Zhiling Yan, Chujie Gao, Ruoxi Chen, Zhengqing Yuan, Yue Huang, Hanchi Sun, Jianfeng Gao, et al. Sora: A review on background, technology, limitations, and opportunities of large vision models. arXiv preprint arXiv:2402.17177, 2024.
- Zhijun Liu, Shuai Wang, Sho Inoue, Qibing Bai, and Haizhou Li. Autoregressive diffusion transformer for text-to-speech synthesis. arXiv preprint arXiv:2406.05551, 2024.
- Cheng Lu and Yang Song. Simplifying, stabilizing and scaling continuous-time consistency models. arXiv preprint arXiv:2410.11081, 2024.
- Cheng Lu, Yuhao Zhou, Fan Bao, Jianfei Chen, Chongxuan Li, and Jun Zhu. Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps. Advances in Neural Information Processing Systems, 35:5775–5787, 2022.
- Cheng Lu, Yuhao Zhou, Fan Bao, Jianfei Chen, Chongxuan Li, and Jun Zhu. Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models. arXiv preprint arXiv:2211.01095, 2022.
- Aleksandr Meister, Matvei Novikov, Nikolay Karpov, Evelina Bakhturina, Vitaly Lavrukhin, and Boris Ginsburg. Librispeech-pc: Benchmark for evaluation of punctuation and capitalization capabilities of end-to-end asr models. In 2023 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), pages 1–7. IEEE, 2023.
- Lingwei Meng, Long Zhou, Shujie Liu, Sanyuan Chen, Bing Han, Shujie Hu, Yanqing Liu, Jinyu Li, Sheng Zhao, Xixin Wu, et al. Autoregressive speech synthesis without vector quantization. arXiv preprint arXiv:2407.08551, 2024.
- Vassil Panayotov, Guoguo Chen, Daniel Povey, and Sanjeev Khudanpur. Librispeech: an asr corpus based on public domain audio books. In 2015 IEEE international conference on acoustics, speech and signal processing (ICASSP), pages 5206–5210. IEEE, 2015.
- William Peebles and Saining Xie. Scalable diffusion models with transformers. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 4195–4205, 2023.
- Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, and Ilya Sutskever. Robust speech recognition via large-scale weak supervision, 2022. URL https://arxiv.org/abs/2212.04356.
- Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer. High-resolution image synthesis with latent diffusion models. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 10684–10695, 2022.
- Takaaki Saeki, Detai Xin, Wataru Nakata, Tomoki Koriyama, Shinnosuke Takamichi, and Hiroshi Saruwatari. Utmos: Utokyo-sarulab system for voicemos challenge 2022. arXiv preprint arXiv:2204.02152, 2022.
- Guillaume Sanchez, Honglu Fan, Alexander Spangher, Elad Levi, Pawan Sasanka Ammanamanchi, and Stella Biderman. Stay on topic with classifier-free guidance. arXiv preprint arXiv:2306.17806, 2023.
- Jonathan Shen, Ruoming Pang, Ron J Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, Rj Skerrv-Ryan, et al. Natural tts synthesis by conditioning wavenet on mel spectrogram predictions. In 2018 IEEE international conference on acoustics, speech and signal processing (ICASSP), pages 4779–4783. IEEE, 2018.
- Jiaming Song, Chenlin Meng, and Stefano Ermon. Denoising diffusion implicit models. arXiv preprint arXiv:2010.02502, 2020.
- Yang Song, Jascha Sohl-Dickstein, Diederik P Kingma, Abhishek Kumar, Stefano Ermon, and Ben Poole. Score-based generative modeling through stochastic differential equations. arXiv preprint arXiv:2011.13456, 2020.
- Nitish Srivastava, Geoffrey Hinton, Alex Krizhevsky, Ilya Sutskever, and Ruslan Salakhutdinov. Dropout: a simple way to prevent neural networks from overfitting. The journal of machine learning research, 15(1):1929–1958, 2014.
- Jianlin Su, Murtadha Ahmed, Yu Lu, Shengfeng Pan, Wen Bo, and Yunfeng Liu. Roformer: Enhanced transformer with rotary position embedding. Neurocomputing, 568:127063, 2024.
- Gemini Team, Rohan Anil, Sebastian Borgeaud, Jean-Baptiste Alayrac, Jiahui Yu, Radu Soricut, Johan Schalkwyk, Andrew M Dai, Anja Hauth, Katie Millican, et al. Gemini: a family of highly capable multimodal models. arXiv preprint arXiv:2312.11805, 2023.
- Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timothée Lacroix, Baptiste Rozière, Naman Goyal, Eric Hambro, Faisal Azhar, et al. Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971, 2023.
- Yuxuan Wang, RJ Skerry-Ryan, Daisy Stanton, Yonghui Wu, Ron J Weiss, Navdeep Jaitly, Zongheng Yang, Ying Xiao, Zhifeng Chen, Samy Bengio, et al. Tacotron: Towards end-to-end speech synthesis. Interspeech 2017, page 4006, 2017.
- Tong Wu, Zhihao Fan, Xiao Liu, Hai-Tao Zheng, Yeyun Gong, Jian Jiao, Juntao Li, Jian Guo, Nan Duan, Weizhu Chen, et al. Ar-diffusion: Auto-regressive diffusion model for text generation. Advances in Neural Information Processing Systems, 36:39957–39974, 2023.
- Ruibin Xiong, Yunchang Yang, Di He, Kai Zheng, Shuxin Zheng, Chen Xing, Huishuai Zhang, Yanyan Lan, Liwei Wang, and Tieyan Liu. On layer normalization in the transformer architecture. In International Conference on Machine Learning, pages 10524–10533. PMLR, 2020.
- An Yang, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chengyuan Li, Dayiheng Liu, Fei Huang, Haoran Wei, et al. Qwen2. 5 technical report. arXiv preprint arXiv:2412.15115, 2024.
- Biao Zhang and Rico Sennrich. Root mean square layer normalization. Advances in Neural Information Processing Systems, 32, 2019.
- Chunting Zhou, Lili Yu, Arun Babu, Kushal Tirumala, Michihiro Yasunaga, Leonid Shamis, Jacob Kahn, Xuezhe Ma, Luke Zettlemoyer, and Omer Levy. Transfusion: Predict the next token and diffuse images with one multi-modal model. arXiv preprint arXiv:2408.11039, 2024.
附录
A 实现细节
A.1 训练细节
LibriLight 没有 transcription,因此作者使用内部 ASR 系统转写该数据集,再把文本转换为 phoneme。对 Emilia,则对官方提供的 transcription 执行 Grapheme-to-Phoneme(G2P)转换。
训练使用 张 A100 GPU,每张处理 token 的 batch,共训练 M step。优化器为 AdamW,constant learning rate 为 ,、。对 B 参数 DiTAR,则使用 张 A100 GPU,每张 GPU 的 batch size 为 。
A.2 Scaling 的模型配置
为验证 DiTAR 的 scaling behavior,作者训练了四种规模的模型,参数量从 B 到 B;具体 hyperparameter 见 Table 8。
| 模型规模 | ~0.1B | ~0.4B | ~0.6B | ~1B | |
|---|---|---|---|---|---|
| 超参数 | 取值 | ||||
| Encoder | 层数 | 4 | 4 | 6 | 8 |
| 隐藏维度 | 512 | 1024 | 1024 | 1024 | |
| Head 数 | 8 | 16 | 16 | 16 | |
| FFN 维度 | 2048 | 4096 | 4096 | 4096 | |
| Language Model | 层数 | 24 | 24 | 36 | 24 |
| 隐藏维度 | 512 | 1024 | 1024 | 1536 | |
| Head 数 | 8 | 16 | 16 | 24 | |
| FFN 维度 | 1024 | 4096 | 4096 | 6144 | |
| LocDiT | 层数 | 4 | 4 | 6 | 8 |
| 隐藏维度 | 512 | 1024 | 1024 | 1024 | |
| Head 数 | 8 | 16 | 16 | 16 | |
| FFN 维度 | 2048 | 4096 | 4096 | 4096 | |
A.3 不同 Diffusion 参数化下 Temperature Sampling 中 的推导
如 Equation (5) 所述, 表示预测数据,可在不同 diffusion parameterization 下推导。考虑 ,其中 表示数据, 表示 standard Gaussian noise,。
对 -prediction mode:
对 -prediction mode, 就是模型的直接预测。对又称 Flow Matching 的 -prediction mode,可从 的定义逐步推导:
重新整理 与 后得到:
因此:
A.4 FLOPs 计算
计算各系统 FLOPs 时,作者使用 秒 audio prompt 合成 秒音频。假设文本 frame rate 为 ,prompt 文本长度为 ,目标文本长度为 。只统计计算占主导的模块,包括 causal transformer、non-causal transformer 与 convolutional layer;causal transformer 的计算考虑 KV cache。Multi-head 设置不影响 FLOPs,因此统一假设 head 数为 ;bias 与 normalization layer 对总 FLOPs 贡献很小,暂不计入。
矩阵乘法中的加法与乘法次数相同,因此结果乘以 。Diffusion 部分还要乘以 Number of Function Evaluations(NFE),Classifier-Free Guidance(CFG)则带来双倍计算成本。
对具有 层、hidden channel size 为 、kernel size 为 、输入长度为 的一维 convolution network,FLOPs 为:
对具有 层、hidden size 为 、FFN intermediate hidden size 为 、输入长度为 的 non-causal transformer,FLOPs 分解如下:
对具有 层、hidden size 为 、FFN intermediate hidden size 为 、prefix input length 为 、输入长度为 的 causal transformer,FLOPs 分解如下。需要注意,原 PDF 的 Equation (22) 是 align 环境产生的空编号行,译稿按原样保留其编号。
B 主观评测
除客观指标外,作者还采用多种主观指标,全面评估不同系统的生成能力。评测时,评分者会看到两段待比较音频和一段参考音频;既要比较两段音频后给出 CMOS,也要分别为每段音频打 N-MOS、Q-MOS 与 S-MOS。用户界面见 Figure 7 和 Figure 8。
C 与其他 Autoregressive Diffusion 工作的比较
不同系统采用不同设计理念。MAR 与 DiTAR 把 diffusion 计算下放给 diffusion head,而 ARDiT 在整个模型中执行 diffusion。DiTAR 在结构上更像 causal language model;扩展规模后,它会成为 continuous-valued LLM。