ACM MULTIMEDIA 2025 · 中文全文译稿

AlignDiT
Multimodal Aligned Diffusion Transformer
for Synchronized Speech Generation

Jeongsoo Choi · Ji-Hoon Kim · Kim Sung-Bin · Tae-Hyun Oh · Joon Son ChungKorea Advanced Institute of Science and Technology · Pohang University of Science and Technology
TEXTWHAT
SILENT VIDEOWHEN
REFERENCEWHO
CROSS-ATTENTION DiTALIGNED SPEECH
PDF
10 页
Figures
3
Tables
7
Equations
11
References
78
Figure 1. AlignDiT 旨在生成同时满足三项要求的自然语音:① 与给定文本准确对齐;② 与输入视频在时间上同步;③ 在声学特征上与参考语音一致。这个通用系统可用于:自动对白替换(ADR)、Video-to-Speech(VTS)和视觉强制对齐(VFA)。

本文研究 multimodal-to-speech generation:从文本、视频和参考音频等多种输入模态合成高质量语音。它可用于影视制作、配音和虚拟化身等广泛场景,因而日益受到关注。尽管近期已有进展,现有方法在语音可懂度、音视频同步、语音自然度以及与参考说话人的音色相似度上仍有不足。为解决这些问题,我们提出 AlignDiT——一种多模态 Aligned Diffusion Transformer,能够从已对齐的多模态输入生成准确、同步且自然的语音。AlignDiT 建立在 DiT 架构的 in-context learning 能力之上,探索了三种有效的多模态表示对齐策略。我们还提出新的 multimodal classifier-free guidance,使模型能在语音合成过程中自适应平衡各模态的信息。大量实验表明,AlignDiT 在质量、同步性和说话人相似度等多项指标上显著优于既有方法;同时,它能很好地泛化到 Video-to-Speech 和视觉强制对齐等多模态任务,并持续取得 state-of-the-art 表现。Demo 页面:https://mm.kaist.ac.kr/projects/AlignDiT

CCS Concepts:Information systems → Multimedia content creation。关键词:Diffusion Transformer、Speech Generation、Multimodal Alignment、Automated Dialogue Replacement。

1 引言

人类通过口语交换信息,口语是人与人互动的基本方式。这个过程会自然产生同时承载语言内容与副语言线索的多模态信号。音频、视频和文本是语音与语言处理中最常用的三种关键模态:音频携带音素内容、语调与节奏等韵律信息以及说话人特征;视频捕获与音频同步的唇部运动、面部表情和非言语信号;文本虽然不是物理世界中可直接观测的信号,却是语言内容的符号化离散表示,并随时间与音频、视频保持单调对齐。三种模态彼此互补,共同构成对人类言语交流的完整观察。 ([50][28][19]) ([58][64]

为了支持无障碍访问和多模态交互,研究者已广泛探索“由其他模态合成或推断某一模态”的跨模态生成任务,典型例子包括 text-to-speech(TTS)、automatic speech recognition(ASR)、唇读、Video-to-Speech 和 talking-face generation。许多任务只完成单一输入模态到另一模态的转换;若引入多个输入模态,不同模态提供的互补信息通常能让生成更准确、更稳健。例如,audio-visual speech recognition(AVSR)同时利用音频和视频,在噪声环境下尤其能提高转写准确率。 ([63][6][8][51]) ([65][4][23][62]) ([67][47][46][76]) ([52][75][34][10]) ([61][56][72]) ([1][29][13]

这促使我们同时以视频和文本为条件生成语音:唇部运动提供视觉线索,显式文本提供语言内容,两者相互补充。代表性应用是影视后期广泛使用的 Automated Dialogue Replacement(ADR,自动对白替换)。当现场录音受到背景噪声或录制条件影响时,演员会重新录制对白,以提高音质并保持与视频同步。随着深度学习语音生成模型的发展,已有工作尝试从静音视频、转写文本和短参考音频生成语音,但仍面临三项核心挑战:第一,建模能力和训练数据有限,难以生成自然且可懂的语音;第二,缺少调节各模态重要性的机制,因此当某些输入缺失或受损时不够稳健;第三,许多方法依赖外部 forced aligner 或 duration predictor 实现同步,既增加监督成本,也可能传播对齐误差。 ([15][16]

为此,我们提出 AlignDiT——面向自然、同步语音生成的 multimodal aligned diffusion transformer。它在统一框架内联合建模视频、文本和参考音频,不依赖显式 duration predictor 或外部 forced aligner,而是隐式学习跨模态对齐。AlignDiT 将语音合成表述为条件生成扩散过程,使生成语音自然地对齐视觉唇动、语言内容和说话人声音特征。主观与客观实验表明,AlignDiT 在语音可懂度、同步准确率和说话人相似度等所有评价维度上都显著优于既有 ADR 方法;它还能有效泛化到 Video-to-Speech 与视觉强制对齐,体现出在多种多模态场景中的稳健性和灵活性(见 Figure 1)。

  • 我们提出 AlignDiT,联合利用视频、文本和参考音频,为 ADR 合成准确、高质量且同步的语音。
  • 我们通过广泛分析与实验考察多种设置,找出最有效的多模态对齐方式。
  • 我们把 AlignDiT 成功适配到 Video-to-Speech 和视觉强制对齐等相关任务,展示其通用性。

2 相关工作

2.1 多模态语音任务

Automated dialogue replacement(ADR)。早期 ADR(也称自动视频配音)被表述为多模态 TTS。Neural Dubber 首先从文本生成语音,并以视频唇动为条件;VisualTTS 随后把视觉信息更显式地纳入 TTS:通过 text-visual attention 学习音素与唇帧的对齐,并在声学解码阶段融合视觉特征。VDTTS 把这一思路扩展到无约束、多说话人场景,预测更细粒度的韵律成分以获得更自然的配音。近期 HPMDubbing 使用层级韵律建模,从唇部、面部和场景三个层级提取视觉特征,分别控制时序、能量/音高和全局情绪,成为 ADR 的强基线。StyleDubber 又利用参考音频做音素级与话语级两层风格学习,强调说话风格和发音习惯。 ([31]) ([45]) ([24]) ([15]) ([16]) HPMDubbing 与 StyleDubber 都需要在训练中借助 forced aligner 做显式对齐,以确保视频与语音之间的准确同步。

Figure 2. 为 DiT blocks 注入多模态条件的三种方式:① Early Fusion & Self-Attention——在 channel 维拼接文本、参考语音和视觉特征;② Prefix & Self-Attention——把文本作为 prefix;③ Multimodal Cross-Attention——通过 cross-attention 注入文本条件。方案①中的 ϕ\phi 表示 filler token。

Video-to-Speech。不同于 ADR,Video-to-Speech 不需要转写文本,而是直接从静音视频生成语音。早期方法采用 CNN 或 sequence-to-sequence 模型捕捉唇动并生成语音;近期方法又引入 GAN、normalizing flow 和 diffusion model 以提高质量。多数工作从参考音频提取 speaker embedding 来保留说话人特征;考虑到推理时未必能获得参考音频,也有研究直接从输入视频提取说话人信息,实现 speaker-aware speech synthesis。 ([20][38]) ([60]) ([35][53]) ([25][34]) ([9][75]) ([11][52]) ([9][75][34][33]

Visual forced alignment(VFA)。VFA 根据对应文本,在静音视频中确定每个词或音素的起止时间,因此必须准确对齐唇动与文本。一类方法使用 visual keyword spotting 来定位单个词的持续时间,再遍历整段视频;但这种做法计算量大,且相邻词重叠可能导致误差。另一类常用方法使用 CTC——它在 visual speech recognition 中常用于 video-text alignment。DVFA 是首个专门面向 VFA 的方法,通过多模态 attention 有效对齐文本转写与唇部运动。 ([59][54]) ([39]) ([22]) ([36]

我们的方案综合了上述三条研究路线,通过学习语音、视频与文本之间的跨模态对齐来取长补短。关键在于:AlignDiT 通过隐式多模态对齐,避免使用 HPMDubbing、StyleDubber 所需的专用 speech-text aligner,从而改善内容准确率与说话人相似度。这种灵活的对齐方式还能超越 ADR,扩展到 Video-to-Speech 和 VFA,体现出较强的通用性。

2.2 Text-to-Speech(TTS)合成

近期 TTS 研究取得了显著进展。autoregressive TTS 通常把强大的 speech tokenizer 与 next-token prediction language modeling 结合,已获得良好效果;non-autoregressive(NAR)模型则利用并行计算实现更快推理,在质量与延迟之间取得平衡。diffusion model 对当前 NAR TTS 尤其重要:Matcha-TTS 用 optimal-transport conditional flow matching 训练,并依赖音素级 duration model;DiTTo-TTS 使用 Diffusion Transformer,通过 cross-attention 接收预训练语言模型编码的文本,以改善对齐;E2 TTS 移除音素和时长预测器,直接在字符序列末尾补 filler token,使其长度匹配 mel-spectrogram;F5-TTS 则把 ConvNeXt V2 融入 diffusion transformer,进一步加强 text-speech alignment。本文把 NAR TTS——尤其是 DiT——扩展到多模态 TTS,并通过 classifier-free guidance 与精心设计的条件机制,灵活处理 text-only、video-only 和多模态输入,以合成高质量语音。 ([70][6][32]) ([17][78]) ([26][68]) ([51]) ([42]) ([41]) ([57]) ([21]) ([8]) ([71]

3 AlignDiT

我们的目标是生成一段语音波形:它要匹配视频中的唇部运动,表达给定文本脚本的内容,并呈现参考语音所指定目标说话人的声音特征。为处理多模态输入,我们采用基于 in-context learning 的语音合成方法。现有 TTS 已探索多种文本条件注入方式,但据我们所知,在基于 in-context learning 的生成模型中,此前还没有方法能同时处理视频、文本和参考语音,并为语音合成实现多模态对齐。 ([21][8][74][41]

因此,我们考察多种设置,寻找最适合的多模态对齐方法,使模型既能灵活处理单模态输入,也能处理多模态输入,并合成高质量、准确的语音。

3.1 模型架构

我们使用 Diffusion Transformer(DiT)完成 multimodal-to-speech generation,因为 DiT 已被证明适合语音生成。沿用既有 TTS 工作,模型以 Flow Matching 目标训练,并在推理时从随机噪声出发,通过迭代过程生成 mel-spectrogram。模型由多个 block 组成,每个 block 遵循带 self-attention 的标准 Transformer 架构,并额外加入注入 diffusion timestep 的参数。多模态生成时,融合后的多模态表示作为条件引导生成过程,使模型逐步把带噪 mel-spectrogram 精炼为与输入多模态信息一致的表示。 ([57]) ([40][8]) ([69]

3.2 多模态条件

Audio-Video Fusion。音频与视频天然同步:说话时,同一时刻的唇部运动和声学特征紧密对应,因此可以逐帧融合。但两种模态的帧率通常不同,需先把它们编码到相同时间分辨率。具体而言,音频被转换为 100 fps 的 mel-spectrogram 序列 haudioh_{audio};视频先经专门建模唇动的预训练 video encoder 得到 hvideoh_{video},再通过轻量 transposed convolution 把 25 fps 上采样到 100 fps,并使用 Conformer encoder 增强上下文建模。时间对齐后,音频与视频特征沿 channel 维拼接,形成统一多模态表示,用来编码“何时说”与“怎样说”。 ([23]

为使模型生成符合参考语音音色特征的语音,我们对 mel-spectrogram 施加二值时间掩码 MM,以 (1M)haudio(1-M)\odot h_{audio} 为输入,让模型 inpaint 被掩码区域。训练时随机选择掩码区间,以增强模型的 in-context learning 能力。推理阶段不应要求参考话语必须同时具备配对视频,因此训练时对视频特征施加互补掩码,使输入变为 MhvideoM\odot h_{video}:模型在参考区域依赖音频,同时忽略被掩码的视频。audio-video fusion 可写为:

hav=[(1M)haudio;Mhvideo]RT×2D(1)h_{av}=[(1-M)\odot h_{audio};\,M\odot h_{video}]\in\mathbb{R}^{T\times 2D}\tag{1}

其中,TTDD 分别表示时间长度和 hidden dimension。

Audio-Video-Text Fusion。audio-video 流天然具备时间对齐,而文本与二者只保持单调对齐,并没有严格的 frame-level synchronization。以往方法常依赖外部 forced aligner 和 duration predictor 提供 text token 级时长;我们则让生成模型在没有显式时长约束的情况下自然融合各模态。这样既简化数据预处理、便于扩大数据集,也避免 forced alignment 带来的潜在偏差,从而获得更自然的 audio-video-text alignment。为研究 DiT blocks 中可行的模态融合方式,我们考察 Figure 2 所示三种条件策略。三种方案的文本编码方式相同:字符序列先经 lookup table 做 embedding,再由 convolutional encoder 精炼为长度 LLhtexth_{text}。 ([49]) ([63]

(a)Early Fusion & Self-Attention。最直接的做法是在 channel axis 上拼接所有条件模态。参考 E2 TTS,我们在文本序列末尾补 filler token,使其总长度匹配。完成 early fusion 后,DiT blocks 的 self-attention 自然学习对齐,并预测 mel-spectrogram 的掩码部分: ([21]

h=[hav;htext]RT×3D(2)h'=[h_{av};\,h_{text}]\in\mathbb{R}^{T\times 3D}\tag{2}
h=hWa+baRT×D(3)h=h'W_a+b_a\in\mathbb{R}^{T\times D}\tag{3}

其中,WaW_abab_a 是 fully connected layer 的参数,用于把 channel dimension 映射为 DD

(b)Prefix & Self-Attention。另一种方式是在 sequence 维把文本特征与 audio-video 特征拼接,把文本视为 prefix。它利用 in-context conditioning,使文本 prefix 能在 DiT blocks 的 self-attention 中引导模型。模型输出完整序列后,丢弃长度对应文本的 prefix 部分,留下预测 mel-spectrogram: ([70][74]

h=Concat(htext,hav)R(L+T)×2D(4)h'=\operatorname{Concat}(h_{text},h_{av})\in\mathbb{R}^{(L+T)\times 2D}\tag{4}
h=hWb+bbR(L+T)×D(5)h=h'W_b+b_b\in\mathbb{R}^{(L+T)\times D}\tag{5}

其中,WbW_bbbb_b 是 fully connected layer 的参数。

(c)Multimodal Cross-Attention(AlignDiT)。最后一种方案不在输入层融合 audio-video 与文本特征,而是在保留音视频天然同步关系的同时,逐步注入文本信息。为此,我们在每个 DiT block 的 self-attention 之外插入 cross-attention layer:audio-video 表示 havh_{av} 作为 query,文本 embedding htexth_{text} 作为 multi-head cross-attention 的 key 和 value:

h=MHCA(havWQ,htextWK,htextWV)RT×D(6)h=\operatorname{MHCA}(h_{av}W_Q,h_{text}W_K,h_{text}W_V)\in\mathbb{R}^{T\times D}\tag{6}

其中,WQW_QWKW_KWVW_V 是可学习投影矩阵。第 5.1 节对三种方案的分析表明,方案(c)既能自然对齐 audio-visual feature,又能有效引入文本特征,得到最佳的多模态对齐效果,因此 AlignDiT 采用这一方案。

3.3 训练目标

在融合多模态表示的基础上,我们用 multi-task learning 训练 AlignDiT。首先采用 conditional flow matching(CFM)训练目标;它已被证明可以高效生成高质量数据样本。CFM 要把从易处理分布 p0p_0 到近似目标分布 p1p_1 的 probability path ptp_t 匹配起来。给定融合多模态表示 hh 和带噪 mel-spectrogram xtx_tt[0,1]t\in[0,1]),AlignDiT 用 CFM 目标回归 vector field utu_t: ([42]

LCFM=Et,ptvt(xth,θ)ut(xt)2(7)\mathcal{L}_{CFM}=\mathbb{E}_{t,p_t}\left\lVert v_t(x_t\mid h,\theta)-u_t(x_t)\right\rVert^2\tag{7}

其中,θ\theta 定义 DiT blocks;当 xtpt(x)x_t\sim p_t(x) 时,vt(xth,θ)v_t(x_t\mid h,\theta) 表示估计的 vector field。

其次,CFM loss 能促进自然 mel-spectrogram 的生成,但它只提供间接学习信号,单独使用时不足以完成模态对齐。为此,我们引入 Connectionist Temporal Classification(CTC)loss,引导 DiT blocks 的中间表示更直接地与文本内容对齐。具体做法是在若干中间 block 上接轻量 projection head,根据 hidden representation 预测文本序列: ([12]) ([22]

LCTC=iIlogpCTC(texthi)(8)\mathcal{L}_{CTC}=-\sum_{i\in\mathcal{I}}\log p_{CTC}(\text{text}\mid h^i)\tag{8}

其中,hih^i 是第 ii 个 DiT block 的输出,I\mathcal{I} 表示被选中的层。CTC loss 无需外部 alignment module,就能促使模型保留更多语言信息。最终 multi-task loss 为:

Ltotal=LCFM+λCTCLCTC(9)\mathcal{L}_{total}=\mathcal{L}_{CFM}+\lambda_{CTC}\mathcal{L}_{CTC}\tag{9}

其中,λCTC\lambda_{CTC} 是平衡两项损失的 hyperparameter。

3.4 Audio-only Pretraining

同时生成高质量语音并学习多模态对齐并不容易。为了给 AlignDiT 提供更好的初始化,我们在引入视频和文本条件之前增加 audio-only pretraining。预训练时,模型根据未掩码上下文预测输入 mel-spectrogram 的掩码区域;这一方式已在 TTS 中证明有效。我们还采用 self-supervised speech model 作为 teacher,把丰富特征蒸馏到 DiT 中间层,以加快收敛。模型先获得 unconditional speech generation 能力,再学习多模态条件,从而简化后续 audio-video-text fusion。相比成对的 audio-video-text 数据,纯音频资源更充足,因此该预训练策略易于扩展,也是一种实际的性能提升手段。 ([43]) ([77]) ([30]

3.5 Multimodal Classifier-Free Guidance

在 diffusion-based generative model 中,classifier-free guidance(CFG)常用于在推理阶段增强条件信号的影响。它让同一个模型同时给出 conditional 与 unconditional prediction,再按下式引导生成: ([27]

vt,CFG=vt(xt,h)+s(vt(xt,h)vt(xt,))(10)v_{t,CFG}=v_t(x_t,h)+s\cdot\left(v_t(x_t,h)-v_t(x_t,\varnothing)\right)\tag{10}

其中,ss 是 guidance scale。

不同模态的特征不同,因此我们认为对所有模态使用同一个 guidance scale 可能并非最优。为了在推理时更细致地控制各模态,我们为不同模态设置独立 scale,提出 multimodal classifier-free guidance:

vt,CFG=vt(xt,htext,hvideo)+svideo ⁣[vt(xt,htext,hvideo)vt(xt,htext,)]+stext ⁣[vt(xt,htext,)vt(xt,,)].(11)\begin{aligned}v_{t,CFG}={}&v_t(x_t,h_{text},h_{video})\\&+s_{video}\!\left[v_t(x_t,h_{text},h_{video})-v_t(x_t,h_{text},\varnothing)\right]\\&+s_{text}\!\left[v_t(x_t,h_{text},\varnothing)-v_t(x_t,\varnothing,\varnothing)\right].\end{aligned}\tag{11}

其中,stexts_{text} 是文本模态的 guidance scale,svideos_{video} 是视频模态的 scale。调节二者即可自适应控制模型在两种模态之间的侧重:更大的 stexts_{text} 促使模型更严格遵循文本、改善可懂度;更大的 svideos_{video} 则带来更好的唇音同步。

为了支持 CFG,训练时会随机丢弃文本、视频或两者,执行 modality dropout。这样既能实现 multimodal CFG,也能提高输入模态缺失时的稳健性。

4 实验

4.1 数据集

我们在大规模 audio-visual 数据集 LRS3 上训练并评估 AlignDiT。LRS3 包含来自数千名说话人的 TED/TEDx 视频,共 439 小时英语句级数据;每个视频片段都包含无约束的音视频语音和准确转写,适合本文的多模态设置。训练使用约 131,000 条话语。评估时,我们构建 LRS3-cross 测试集,每个样本是“参考语音、文本、静音视频”三元组;参考语音取自同一说话人的另一条话语,而非 ground-truth speech,从而避免测试阶段泄漏真值语音。对 Video-to-Speech,不使用数据集自带文本,而是用现成 lip-reading model 直接从静音视频提取转写。 ([2]

4.2 评估指标

主观指标。研究重点是自然且同步的语音,因此主观评估对准确衡量模型性能很重要。ADR 人类评测采用 MOS,包含两项标准:naturalness 衡量整体语音质量;similarity 衡量合成语音与参考语音的说话人相似度。20 名参与者对随机抽取的 30 条话语使用 5 点 Likert scale 评分:1 表示“很差”或“非常不同”,5 表示“很好”或“非常相似”。 ([48][3]

客观指标。ADR 和 Video-to-Speech 都用 Word Error Rate(WER)衡量内容准确率,合成语音由 Whisper-large-v3 转写;speaker similarity(spkSIM)则用基于 WavLM-large 的 speaker verification model 提取合成语音与参考语音的 embedding,再计算 cosine similarity。视频与合成语音的 lip-sync accuracy(AVSync)使用 AVHuBERT:比较“视频 + ground-truth speech”和“视频 + synthesized speech”两组输入的 AVHuBERT feature cosine similarity。已有研究表明,这比基于 SyncNet 的传统 lip-sync metric 更稳健、更适合验证 audio-visual synchronization。 ([62]) ([7]) ([66]) ([73]) ([14]) 对 alignment task,我们把模型得到的 word-level timestamp 与由原始音频对齐得到的 ground-truth timestamp 比较,并报告每个词的平均 absolute time error(毫秒)。

Table 1. 模态条件方式的消融实验。
方案LCTC\mathcal{L}_{CTC}WER ↓AVSync ↑spkSIM ↑
(a)28.8280.6660.530
2.2360.7480.511
(b)5.4560.7260.536
1.9170.7450.519
(c)2.5070.7450.543
1.4010.7510.515
Table 2. Audio-only pretraining 的消融实验。
预训练数据WER ↓AVSync ↑spkSIM ↑
2.0400.7460.396
LRS31.7200.7500.503
LibriSpeech1.4010.7510.515
Table 3. Multimodal CFG 的消融实验。
stexts_{text}svideos_{video}WER ↓AVSync ↑spkSIM ↑
003.7850.7160.391
222.3100.7580.497
521.4010.7510.515
552.5070.7600.501
Table 4. 输入模态的消融实验。
输入模态WER ↓AVSync ↑spkSIM ↑
textvideo
27.8200.6740.486
1.7690.2700.501
1.4010.7510.515

4.3 实现细节

数据预处理。音频使用 16 kHz mono waveform,经 filter size 640、hop size 160 转成 80-bin mel-spectrogram,帧率为 100 Hz。视频为 25 fps:先用 RetinaFace 检测人脸,再用 FAN 提取 facial landmark,根据 landmark 裁切以嘴唇为中心的区域并缩放到 88×8888\times88;预训练 AV-HuBERT Large 提取 25 Hz visual representation,因此其长度与音频特征固定为 1:4。文本输入表示为字符序列,其时间长度通常短于音频特征。 ([18]) ([5]) ([66]) ([64]

架构。visual feature encoder 由两层 stride 为 2 的 transposed convolution 和两层 Conformer encoder 组成;每层 Conformer 的 embedding size 为 512,含 4 个 attention head 与 1024 维 feed-forward layer。text encoder 使用 4 层 ConvNeXt v2,hidden embedding 为 512 维。多模态特征拼接后先经 linear layer 投影,再送入 18 个 DiT block;每个 block 的 embedding size 为 768,含 12 个 attention head 与 3072 维 feed-forward layer。 ([23]) ([71]

训练。使用 AdamW optimizer;前 20k steps warmup 到峰值 learning rate 7.5×1057.5\times10^{-5},随后线性衰减。audio-only pretraining 训练 500k steps,总 batch size 为 0.3 小时;成对 audio-video-text 数据上 finetune 400k steps,总 batch size 为 0.1 小时。初始阶段把 λCTC\lambda_{CTC} 设为 0.1,以平衡 CTC loss 与 CFM loss。对文本、视频以及所有模态的 dropout probability 分别设为 0.2。 ([44]

推理。使用 decay rate 0.999 的 EMA weights 稳定预测。AlignDiT 的输入包含参考语音及其对应 transcript,生成总时长由输入视频长度决定。采样使用 Euler ODE solver,并沿用 F5-TTS 的 sway sampling timestep scaling,系数为 -1。最终使用在 LRS3 上训练的 HiFi-GAN,把 mel-spectrogram 转成 waveform。 ([8]) ([37]

4.4 基线模型

ADR 基线是 state-of-the-art 开源系统 HPMDubbing 与 StyleDubber。为公平比较并提高它们的泛化能力,我们都在比原始训练集大得多的 LRS3 上重新训练,并把三个系统的 lip feature extractor 统一替换为 AV-HuBERT Large,从而在相同设置下比较架构本身。两种基线在训练时都需要显式 duration aligner。Video-to-Speech 基线是专为该任务设计的 DiffV2S、Intelligible 和 LipVoicer;VFA 基线包括 visual keyword spotting 方法 KWS-Net、Transpotter,以及 CTC-based 方法和 DVFA。 ([15]) ([16]) ([2]) ([66]) ([9]) ([11]) ([75]) ([54]) ([59]) ([39]) ([36]

5 结果

5.1 消融实验

Figure 3. 对比 ADR 中 ground-truth speech、AlignDiT、HPMDubbing 与 StyleDubber 的合成 mel-spectrogram,同时展示 video-only(VTS)和 text-only(TTS)输入结果。每幅谱图下方文字由 Whisper-large-v3 提取并按时间对齐;红字表示相对 ground truth 合成错误的词。
Table 5. LRS3-cross 上的实验结果。主观 MOS 给出 95% confidence interval;↑ 越高越好,↓ 越低越好;粗体为最佳结果。
方法主观客观
Naturalness ↑Speaker Similarity ↑WER ↓AVSync ↑spkSIM ↑
GT4.13±0.133.96±0.142.3351.0000.562
HPMDubbing2.37±0.142.43±0.165.3820.7500.287
StyleDubber1.79±0.122.35±0.183.1700.5860.349
Ours3.79±0.163.96±0.131.4010.7510.515

我们通过深入消融分析各个 AlignDiT 组件的贡献,并用 WER、AVSync、spkSIM 等客观指标,从模态条件方式、audio-only pretraining、multimodal CFG 和输入模态四个方面给出结果。

模态条件方式。我们比较三种条件方案:Early Fusion & Self-Attention、Prefix & Self-Attention、Multimodal Cross-Attention,并分别考察 CTC loss 的影响。Table 1 证明 multimodal cross-attention 最有效,在 WER、AVSync 与 spkSIM 上取得整体最佳表现。除 cross-attention 的 spkSIM 有轻微例外外,去掉 LCTC\mathcal{L}_{CTC} 会让所有方案和指标一致退化,尤其 WER 在三种方案中都显著变差。这说明 LCTC\mathcal{L}_{CTC} 能促进 DiT blocks 更准确地学习输入文本与输出语音之间的对齐。

Audio-only pretraining。Table 2 显示纯音频预训练的收益。在主训练同样使用的 LRS3 上预训练,所有指标都稳定改善;换成后续训练未见过的 LibriSpeech,提升更大。这说明预训练阶段使用多样化音频有明确好处,也表明 AlignDiT 可以通过易获得的音频资源进一步提升。 ([55]

Multimodal CFG。Table 3 比较不同 stexts_{text}svideos_{video}。首先,使用相同 scale 的普通 CFG(两者都取 2 或 5)始终优于不使用 CFG。更重要的是,分别调节两种 scale、平衡模态信息,能进一步改善整体表现,说明 multimodal CFG 有助于生成更自然的语音。最终取 stext=5s_{text}=5svideo=2s_{video}=2,WER 与 spkSIM 最佳。 ([27][40]

输入模态。去掉文本时 WER 显著上升,说明文本信息对生成准确、可懂语音至关重要;去掉视频也会降低整体表现,尤其 AVSync 大幅退化。text + video 同时使用时,语音既可懂又同步,体现出 multimodal-to-speech generation 的优势。

Table 6. Video-to-Speech benchmark。
方法WER ↓AVSync ↑spkSIM ↑
DiffV2S35.2100.6080.115
Intelligible27.4320.6750.316
LipVoicer21.1640.5240.094
Ours19.5130.6880.508
Table 7. Visual forced alignment benchmark。
方法MAE ↓ACC ↑
KWS-Net262.9 ms42.6%
CTC-based124.5 ms60.6%
Transpotter167.3 ms61.8%
DVFA97.7 ms80.2%
Ours41.5 ms83.7%

5.2 定量比较

Table 5 给出 AlignDiT 与基线的主观、客观评估。AlignDiT 在所有指标上持续优于全部基线:主观评测中 naturalness 为 3.79,speaker similarity 为 3.96,均大幅领先基线,说明其语音流畅,在感知自然度和说话人相似度上更好。

客观结果进一步支持 AlignDiT 的有效性:最低 WER 为 1.401,说明能准确合成输入文本;最高 AVSync 为 0.751,说明在不依赖基线常用额外 aligner 或 duration predictor 的情况下,仍能有效学习 audio-video temporal alignment;spkSIM 也最佳,说明模型能较好复现目标说话人的声音特征。

5.3 定性比较

Figure 3 对比 ground truth、既有 ADR 方法与多模态 AlignDiT 的合成 mel-spectrogram,同时展示 video-only(VTS)和 text-only(TTS)结果。观察第 1、2 列橙/红框及谱图下方转写可见,既有方法经常生成错误语音且谱图模糊;第 3、4 列中,它们虽然内容正确,仍偶尔产生非预期声音,或谱图细节不足、显得模糊。单模态结果与第 5.1 节一致:video-only 因缺少文本,内容准确率很不稳定,所有样本都出现错误;text-only 因有文本而内容正确,但缺少视频导致时间对齐偏离 ground truth。相比之下,AlignDiT 在所有样本中都稳定合成准确内容,谱图细节也与 ground truth 接近。结果说明模型能生成质量高、内容准确、接近真值的语音。 ([15][16]

5.4 应用

AlignDiT 在多种多模态场景中具备稳健性和灵活性。我们把它泛化到 Video-to-Speech 与视觉强制对齐,展示方法的通用性。

Video-to-Speech。VTS 不同于 ADR:输入是没有文本的静音视频,模型读取唇动并合成对应语音。既有工作有的完全 textless,有的(如 LipVoicer)借助现成 lip-reading model 引导合成。为公平比较 LipVoicer,本文采用同一个 lip reader 获得 pseudo-text label。Table 6 显示 AlignDiT 在所有指标上都显著优于既有方法,包括专为 VTS 设计且同样使用专家 lip reader 的 LipVoicer。这表明多模态对齐机制具有稳健泛化能力,即便任务超出原始设计也能取得更好表现。 ([9][11]) ([75]) ([46]

Visual forced alignment(VFA)。传统 VFA 需要在静音视频中确定每个词或音素的 timestamp。AlignDiT 能根据静音视频和文本生成语音,因此无需直接比较视频与文本,而是先利用两种输入合成语音,再用 Montreal Forced Aligner 把合成语音与对应文本对齐,得到每个词的时间戳。所有测试样本共用一条 canonical reference speech,不需要按说话人提供参考。Table 7 显示,AlignDiT 合成语音与输入视频高度同步,因此能与文本精确 forced alignment,显著优于专门为 VFA 设计的既有方法。这支持模型能从多模态输入生成准确、时间同步的语音。 ([49]) ([54][59][39][36]

6 结论

本文提出 AlignDiT:从文本、视频与参考音频生成准确、自然且同步语音的统一框架。通过广泛分析,我们比较多种配置,找出无需显式 duration modeling 的最佳多模态对齐策略;同时提出 multimodal classifier-free guidance,自适应平衡各模态信息。AlignDiT 在多个 benchmark 上达到 state of the art,并在 Video-to-Speech 与视觉强制对齐等关键多模态任务中证明有效。我们希望这些发现能为未来的 multimodal alignment 与 generation 研究提供启发。

致谢

本工作得到韩国政府(MSIT)资助的 IITP 项目支持:RS-2025-02263169“新兴与未发现 Voice Phishing 的检测与预测”,以及 RS-2024-00457882“National AI Research Lab Project”。

参考文献

参考文献保留原始书目信息与顺序。

  1. Triantafyllos Afouras, Joon Son Chung, Andrew Senior, Oriol Vinyals, Andrew Zisserman. 2018. Deep audio-visual speech recognition. IEEE Trans. on Pattern Analysis and Machine Intelligence.
  2. Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman. 2018. LRS3-TED: a large-scale dataset for visual speech recognition. arXiv preprint arXiv:1809.00496.
  3. Junseok Ahn, Youkyum Kim, Yeunju Choi, Doyeop Kwak, Ji-Hoon Kim, Seongkyu Mun, Joon Son Chung. 2024. VoxSim: A perceptual voice similarity dataset. Proc. Interspeech.
  4. Alexei Baevski, Yuhao Zhou, Abdelrahman Mohamed, Michael Auli. 2020. wav2vec 2.0: A framework for self-supervised learning of speech representations. Proc. NeurIPS.
  5. Adrian Bulat, Georgios Tzimiropoulos. 2017. How Far are We from Solving the 2D & 3D Face Alignment Problem?(and a Dataset of 230,000 3D Facial Landmarks). Proc. ICCV.
  6. Sanyuan Chen, Shujie Liu, Long Zhou, Yanqing Liu, Xu Tan, Jinyu Li, Sheng Zhao, Yao Qian, Furu Wei. 2024. Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers. arXiv preprint arXiv:2406.05370.
  7. Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, others. 2022. Wavlm: Large-scale self-supervised pre-training for full stack speech processing. IEEE Journal of Selected Topics in Signal Processing.
  8. Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Chunhui Wang, Jian Zhao, Kai Yu, Xie Chen. 2025. F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching. Proc. ACL.
  9. Jeongsoo Choi, Joanna Hong, Yong Man Ro. 2023. DiffV2S: Diffusion-based video-to-speech synthesis with vision-guided speaker embedding. Proc. ICCV.
  10. Jeongsoo Choi, Ji-Hoon Kim, Jinyu Li, Joon Son Chung, Shujie Liu. 2025. V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow. Proc. ICASSP.
  11. Jeongsoo Choi, Minsu Kim, Yong Man Ro. 2023. Intelligible Lip-to-Speech Synthesis with Speech Units. Proc. Interspeech.
  12. Jeongsoo Choi, Zhikang Niu, Ji-Hoon Kim, Chunhui Wang, Joon Son Chung, Xie Chen. 2025. Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment. Proc. Interspeech.
  13. Jeongsoo Choi, Se Jin Park, Minsu Kim, Yong Man Ro. 2024. Av2av: Direct audio-visual speech to audio-visual speech translation with unified audio-visual speech representation. Proc. CVPR.
  14. Joon Son Chung, Andrew Zisserman. 2016. Out of time: automated lip sync in the wild. ACCV workshop.
  15. Gaoxiang Cong, Liang Li, Yuankai Qi, Zheng-Jun Zha, Qi Wu, Wenyu Wang, Bin Jiang, Ming-Hsuan Yang, Qingming Huang. 2023. Learning to dub movies via hierarchical prosody models. Proc. CVPR.
  16. Gaoxiang Cong, Yuankai Qi, Liang Li, Amin Beheshti, Zhedong Zhang, Anton van den Hengel, Ming-Hsuan Yang, Chenggang Yan, Qingming Huang. 2024. Styledubber: towards multi-scale style learning for movie dubbing. Findings of ACL.
  17. Alexandre Défossez, Jade Copet, Gabriel Synnaeve, Yossi Adi. 2023. High Fidelity Neural Audio Compression. Trans. on Machine Learning Research.
  18. Jiankang Deng, Jia Guo, Evangelos Ververas, Irene Kotsia, Stefanos Zafeiriou. 2020. Retinaface: Single-shot multi-level face localisation in the wild. Proc. CVPR.
  19. Linda Drijvers, Judith Holler. 2023. The multimodal facilitation effect in human communication. Psychonomic Bulletin & Review.
  20. Ariel Ephrat, Shmuel Peleg. 2017. Vid2speech: speech reconstruction from silent video. Proc. ICASSP.
  21. Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Canrun Li, Chung-Hsien Tsai, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Xu Tan, others. 2024. E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts. IEEE Spoken Language Technology workshop.
  22. Alex Graves, Santiago Fernández, Faustino Gomez, Jürgen Schmidhuber. 2006. Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks. Proc. ICML.
  23. Anmol Gulati, James Qin, Chung-Cheng Chiu, Niki Parmar, Yu Zhang, Jiahui Yu, Wei Han, Shibo Wang, Zhengdong Zhang, Yonghui Wu, others. 2020. Conformer: Convolution-augmented transformer for speech recognition. Proc. Interspeech.
  24. Michael Hassid, Michelle Tadmor Ramanovich, Brendan Shillingford, Miaosen Wang, Ye Jia, Tal Remez. 2022. More than words: In-the-wild visually-driven prosody for text-to-speech. Proc. CVPR.
  25. Jinzheng He, Zhou Zhao, Yi Ren, Jinglin Liu, Baoxing Huai, Nicholas Yuan. 2022. Flow-based unconstrained lip to speech generation. Proc. AAAI.
  26. Jonathan Ho, Ajay Jain, Pieter Abbeel. 2020. Denoising diffusion probabilistic models. Proc. NeurIPS.
  27. Jonathan Ho, Tim Salimans. 2021. Classifier-Free Diffusion Guidance. NeurIPS workshop.
  28. Judith Holler, Stephen C Levinson. 2019. Multimodal language processing in human communication. Trends in Cognitive Sciences.
  29. Joanna Hong, Minsu Kim, Jeongsoo Choi, Yong Man Ro. 2023. Watch or listen: Robust audio-visual speech recognition with visual corruption modeling and reliability scoring. Proc. CVPR.
  30. Wei-Ning Hsu, Benjamin Bolte, Yao-Hung Hubert Tsai, Kushal Lakhotia, Ruslan Salakhutdinov, Abdelrahman Mohamed. 2021. Hubert: Self-supervised speech representation learning by masked prediction of hidden units. IEEE/ACM Trans. on Audio, Speech, and Language Processing.
  31. Chenxu Hu, Qiao Tian, Tingle Li, Wang Yuping, Yuxuan Wang, Hang Zhao. 2021. Neural dubber: Dubbing for videos according to scripts. Proc. NeurIPS.
  32. Eugene Kharitonov, Damien Vincent, Zalán Borsos, Raphaël Marinier, Sertan Girgin, Olivier Pietquin, Matt Sharifi, Marco Tagliasacchi, Neil Zeghidour. 2023. Speak, read and prompt: High-fidelity text-to-speech with minimal supervision. Trans. of the Association for Computational Linguistics.
  33. Ji-Hoon Kim, Jeongsoo Choi, Jaehun Kim, Chaeyoung Jung, Joon Son Chung. 2025. From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech. Proc. CVPR.
  34. Ji-Hoon Kim, Jaehun Kim, Joon Son Chung. 2024. Let there be sound: reconstructing high quality speech from silent videos. Proc. AAAI.
  35. Minsu Kim, Joanna Hong, Yong Man Ro. 2021. Lip to speech synthesis with visual context attentional GAN. Proc. NeurIPS.
  36. Minsu Kim, Chae Won Kim, Yong Man Ro. 2023. Deep visual forced alignment: learning to align transcription with talking face video. Proc. AAAI.
  37. Jungil Kong, Jaehyeon Kim, Jaekyoung Bae. 2020. Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis. Proc. NeurIPS.
  38. Yaman Kumar, Rohit Jain, Khwaja Mohd Salik, Rajiv Ratn Shah, Yifang Yin, Roger Zimmermann. 2019. Lipper: Synthesizing thy speech using multi-view lipreading. Proc. AAAI.
  39. Ludwig Kürzinger, Dominik Winkelbauer, Lujun Li, Tobias Watzel, Gerhard Rigoll. 2020. Ctc-segmentation of large corpora for german end-to-end speech recognition. International Conference on Speech and Computer.
  40. Matthew Le, Apoorv Vyas, Bowen Shi, Brian Karrer, Leda Sari, Rashel Moritz, Mary Williamson, Vimal Manohar, Yossi Adi, Jay Mahadeokar, others. 2023. Voicebox: Text-guided multilingual universal speech generation at scale. Proc. NeurIPS.
  41. Keon Lee, Dong Won Kim, Jaehyeon Kim, Jaewoong Cho. 2025. Ditto-tts: Efficient and scalable zero-shot text-to-speech with diffusion transformer. Proc. ICLR.
  42. Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, Matt Le. 2023. Flow matching for generative modeling. Proc. ICLR.
  43. Alexander H Liu, Matt Le, Apoorv Vyas, Bowen Shi, Andros Tjandra, Wei-Ning Hsu. 2024. Generative pre-training for speech with flow matching. Proc. ICLR.
  44. Ilya Loshchilov, Frank Hutter. 2019. Decoupled Weight Decay Regularization. Proc. ICLR.
  45. Junchen Lu, Berrak Sisman, Rui Liu, Mingyang Zhang, Haizhou Li. 2022. Visualtts: Tts with accurate lip-speech synchronization for automatic voice over. Proc. ICASSP.
  46. Pingchuan Ma, Alexandros Haliassos, Adriana Fernandez-Lopez, Honglie Chen, Stavros Petridis, Maja Pantic. 2023. Auto-avsr: Audio-visual speech recognition with automatic labels. Proc. ICASSP.
  47. Pingchuan Ma, Yujiang Wang, Jie Shen, Stavros Petridis, Maja Pantic. 2021. Lip-reading with densely connected temporal convolutional networks. Proc. WACV.
  48. Soumi Maiti, Yifan Peng, Takaaki Saeki, Shinji Watanabe. 2023. Speechlmscore: Evaluating speech generation using speech language model. Proc. ICASSP.
  49. Michael McAuliffe, Michaela Socolof, Sarah Mihuc, Michael Wagner, Morgan Sonderegger. 2017. Montreal forced aligner: Trainable text-speech alignment using kaldi. Proc. Interspeech.
  50. Harry McGurk, John MacDonald. 1976. Hearing lips and seeing voices. Nature.
  51. Shivam Mehta, Ruibo Tu, Jonas Beskow, Éva Székely, Gustav Eje Henter. 2024. Matcha-TTS: A fast TTS architecture with conditional flow matching. Proc. ICASSP.
  52. Rodrigo Mira, Alexandros Haliassos, Stavros Petridis, Björn W Schuller, Maja Pantic. 2022. SVTS: Scalable Video-to-Speech Synthesis. Proc. Interspeech.
  53. Rodrigo Mira, Konstantinos Vougioukas, Pingchuan Ma, Stavros Petridis, Björn W Schuller, Maja Pantic. 2022. End-to-end video-to-speech synthesis using generative adversarial networks. IEEE Trans. on Cybernetics.
  54. Liliane Momeni, Triantafyllos Afouras, Themos Stafylakis, Samuel Albanie, Andrew Zisserman. 2020. Seeing wake words: Audio-visual keyword spotting. Proc. BMVC..
  55. Vassil Panayotov, Guoguo Chen, Daniel Povey, Sanjeev Khudanpur. 2015. Librispeech: an asr corpus based on public domain audio books. Proc. ICASSP.
  56. Se Jin Park, Minsu Kim, Joanna Hong, Jeongsoo Choi, Yong Man Ro. 2022. Synctalkface: Talking face generation with precise lip-syncing via audio-lip memory. Proc. AAAI.
  57. William Peebles, Saining Xie. 2023. Scalable diffusion models with transformers. Proc. CVPR.
  58. Stavros Petridis, Themos Stafylakis, Pingchuan Ma, Georgios Tzimiropoulos, Maja Pantic. 2018. Audio-visual speech recognition with a hybrid ctc/attention architecture. IEEE Spoken Language Technology workshop.
  59. KR Prajwal, Liliane Momeni, Triantafyllos Afouras, Andrew Zisserman. 2021. Visual keyword spotting with attention. Proc. BMVC..
  60. KR Prajwal, Rudrabha Mukhopadhyay, Vinay P Namboodiri, CV Jawahar. 2020. Learning individual speaking styles for accurate lip to speech synthesis. Proc. CVPR.
  61. KR Prajwal, Rudrabha Mukhopadhyay, Vinay P Namboodiri, CV Jawahar. 2020. A lip sync expert is all you need for speech to lip generation in the wild. Proc. ACM MM.
  62. Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, Ilya Sutskever. 2023. Robust speech recognition via large-scale weak supervision. Proc. ICML.
  63. Yi Ren, Chenxu Hu, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, Tie-Yan Liu. 2021. Fastspeech 2: Fast and high-quality end-to-end text to speech. Proc. ICLR.
  64. Yi Ren, Yangjun Ruan, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, Tie-Yan Liu. 2019. Fastspeech: Fast, robust and controllable text to speech. Proc. NeurIPS.
  65. Steffen Schneider, Alexei Baevski, Ronan Collobert, Michael Auli. 2019. wav2vec: Unsupervised pre-training for speech recognition. Proc. Interspeech.
  66. Bowen Shi, Wei-Ning Hsu, Kushal Lakhotia, Abdelrahman Mohamed. 2022. Learning audio-visual speech representation by masked multimodal cluster prediction. Proc. ICLR.
  67. Joon Son Chung, Andrew Senior, Oriol Vinyals, Andrew Zisserman. 2017. Lip reading sentences in the wild. Proc. CVPR.
  68. Yang Song, Jascha Sohl-Dickstein, Diederik P Kingma, Abhishek Kumar, Stefano Ermon, Ben Poole. 2020. Score-based generative modeling through stochastic differential equations. arXiv preprint arXiv:2011.13456.
  69. Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Lukasz Kaiser, Illia Polosukhin. 2017. Attention is all you need. Proc. NeurIPS.
  70. Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, others. 2023. Neural codec language models are zero-shot text to speech synthesizers. arXiv preprint arXiv:2301.02111.
  71. Sanghyun Woo, Shoubhik Debnath, Ronghang Hu, Xinlei Chen, Zhuang Liu, In So Kweon, Saining Xie. 2023. Convnext v2: Co-designing and scaling convnets with masked autoencoders. Proc. CVPR.
  72. Sicheng Xu, Guojun Chen, Yu-Xiao Guo, Jiaolong Yang, Chong Li, Zhenyu Zang, Yizhong Zhang, Xin Tong, Baining Guo. 2024. Vasa-1: Lifelike audio-driven talking faces generated in real time. Proc. NeurIPS.
  73. Dogucan Yaman, Fevziye Irem Eyiokur, Leonard Bärmann, Seymanur Akti, Hazim Kemal Ekenel, Alexander Waibel. 2024. Audio-Visual Speech Representation Expert for Enhanced Talking Face Video Generation and Evaluation. CVPR workshop.
  74. Dongchao Yang, Dingdong Wang, Haohan Guo, Xueyuan Chen, Xixin Wu, Helen Meng. 2024. Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models. Proc. Interspeech.
  75. Yochai Yemini, Aviv Shamsian, Lior Bracha, Sharon Gannot, Ethan Fetaya. 2024. LipVoicer: Generating Speech from Silent Videos Guided by Lip Reading. Proc. ICLR.
  76. Jeong Hun Yeo, Minsu Kim, Jeongsoo Choi, Dae Hoe Kim, Yong Man Ro. 2024. Akvsr: Audio knowledge empowered visual speech recognition by compressing audio knowledge of a pretrained model. IEEE Trans. on Multimedia.
  77. Sihyun Yu, Sangkyung Kwak, Huiwon Jang, Jongheon Jeong, Jonathan Huang, Jinwoo Shin, Saining Xie. 2025. Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think. Proc. ICLR.
  78. Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, Marco Tagliasacchi. 2021. Soundstream: An end-to-end neural audio codec. IEEE/ACM Trans. on Audio, Speech, and Language Processing.

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭