本文研究 multimodal-to-speech generation:从文本、视频和参考音频等多种输入模态合成高质量语音。它可用于影视制作、配音和虚拟化身等广泛场景,因而日益受到关注。尽管近期已有进展,现有方法在语音可懂度、音视频同步、语音自然度以及与参考说话人的音色相似度上仍有不足。为解决这些问题,我们提出 AlignDiT——一种多模态 Aligned Diffusion Transformer,能够从已对齐的多模态输入生成准确、同步且自然的语音。AlignDiT 建立在 DiT 架构的 in-context learning 能力之上,探索了三种有效的多模态表示对齐策略。我们还提出新的 multimodal classifier-free guidance,使模型能在语音合成过程中自适应平衡各模态的信息。大量实验表明,AlignDiT 在质量、同步性和说话人相似度等多项指标上显著优于既有方法;同时,它能很好地泛化到 Video-to-Speech 和视觉强制对齐等多模态任务,并持续取得 state-of-the-art 表现。Demo 页面:https://mm.kaist.ac.kr/projects/AlignDiT。
CCS Concepts:Information systems → Multimedia content creation。关键词:Diffusion Transformer、Speech Generation、Multimodal Alignment、Automated Dialogue Replacement。
1 引言
人类通过口语交换信息,口语是人与人互动的基本方式。这个过程会自然产生同时承载语言内容与副语言线索的多模态信号。音频、视频和文本是语音与语言处理中最常用的三种关键模态:音频携带音素内容、语调与节奏等韵律信息以及说话人特征;视频捕获与音频同步的唇部运动、面部表情和非言语信号;文本虽然不是物理世界中可直接观测的信号,却是语言内容的符号化离散表示,并随时间与音频、视频保持单调对齐。三种模态彼此互补,共同构成对人类言语交流的完整观察。 ([50];[28];[19]) ([58];[64])
为了支持无障碍访问和多模态交互,研究者已广泛探索“由其他模态合成或推断某一模态”的跨模态生成任务,典型例子包括 text-to-speech(TTS)、automatic speech recognition(ASR)、唇读、Video-to-Speech 和 talking-face generation。许多任务只完成单一输入模态到另一模态的转换;若引入多个输入模态,不同模态提供的互补信息通常能让生成更准确、更稳健。例如,audio-visual speech recognition(AVSR)同时利用音频和视频,在噪声环境下尤其能提高转写准确率。 ([63];[6];[8];[51]) ([65];[4];[23];[62]) ([67];[47];[46];[76]) ([52];[75];[34];[10]) ([61];[56];[72]) ([1];[29];[13])
这促使我们同时以视频和文本为条件生成语音:唇部运动提供视觉线索,显式文本提供语言内容,两者相互补充。代表性应用是影视后期广泛使用的 Automated Dialogue Replacement(ADR,自动对白替换)。当现场录音受到背景噪声或录制条件影响时,演员会重新录制对白,以提高音质并保持与视频同步。随着深度学习语音生成模型的发展,已有工作尝试从静音视频、转写文本和短参考音频生成语音,但仍面临三项核心挑战:第一,建模能力和训练数据有限,难以生成自然且可懂的语音;第二,缺少调节各模态重要性的机制,因此当某些输入缺失或受损时不够稳健;第三,许多方法依赖外部 forced aligner 或 duration predictor 实现同步,既增加监督成本,也可能传播对齐误差。 ([15];[16])
为此,我们提出 AlignDiT——面向自然、同步语音生成的 multimodal aligned diffusion transformer。它在统一框架内联合建模视频、文本和参考音频,不依赖显式 duration predictor 或外部 forced aligner,而是隐式学习跨模态对齐。AlignDiT 将语音合成表述为条件生成扩散过程,使生成语音自然地对齐视觉唇动、语言内容和说话人声音特征。主观与客观实验表明,AlignDiT 在语音可懂度、同步准确率和说话人相似度等所有评价维度上都显著优于既有 ADR 方法;它还能有效泛化到 Video-to-Speech 与视觉强制对齐,体现出在多种多模态场景中的稳健性和灵活性(见 Figure 1)。
- 我们提出 AlignDiT,联合利用视频、文本和参考音频,为 ADR 合成准确、高质量且同步的语音。
- 我们通过广泛分析与实验考察多种设置,找出最有效的多模态对齐方式。
- 我们把 AlignDiT 成功适配到 Video-to-Speech 和视觉强制对齐等相关任务,展示其通用性。
2 相关工作
2.1 多模态语音任务
Automated dialogue replacement(ADR)。早期 ADR(也称自动视频配音)被表述为多模态 TTS。Neural Dubber 首先从文本生成语音,并以视频唇动为条件;VisualTTS 随后把视觉信息更显式地纳入 TTS:通过 text-visual attention 学习音素与唇帧的对齐,并在声学解码阶段融合视觉特征。VDTTS 把这一思路扩展到无约束、多说话人场景,预测更细粒度的韵律成分以获得更自然的配音。近期 HPMDubbing 使用层级韵律建模,从唇部、面部和场景三个层级提取视觉特征,分别控制时序、能量/音高和全局情绪,成为 ADR 的强基线。StyleDubber 又利用参考音频做音素级与话语级两层风格学习,强调说话风格和发音习惯。 ([31]) ([45]) ([24]) ([15]) ([16]) HPMDubbing 与 StyleDubber 都需要在训练中借助 forced aligner 做显式对齐,以确保视频与语音之间的准确同步。
Video-to-Speech。不同于 ADR,Video-to-Speech 不需要转写文本,而是直接从静音视频生成语音。早期方法采用 CNN 或 sequence-to-sequence 模型捕捉唇动并生成语音;近期方法又引入 GAN、normalizing flow 和 diffusion model 以提高质量。多数工作从参考音频提取 speaker embedding 来保留说话人特征;考虑到推理时未必能获得参考音频,也有研究直接从输入视频提取说话人信息,实现 speaker-aware speech synthesis。 ([20];[38]) ([60]) ([35];[53]) ([25];[34]) ([9];[75]) ([11];[52]) ([9];[75];[34];[33])
Visual forced alignment(VFA)。VFA 根据对应文本,在静音视频中确定每个词或音素的起止时间,因此必须准确对齐唇动与文本。一类方法使用 visual keyword spotting 来定位单个词的持续时间,再遍历整段视频;但这种做法计算量大,且相邻词重叠可能导致误差。另一类常用方法使用 CTC——它在 visual speech recognition 中常用于 video-text alignment。DVFA 是首个专门面向 VFA 的方法,通过多模态 attention 有效对齐文本转写与唇部运动。 ([59];[54]) ([39]) ([22]) ([36])
我们的方案综合了上述三条研究路线,通过学习语音、视频与文本之间的跨模态对齐来取长补短。关键在于:AlignDiT 通过隐式多模态对齐,避免使用 HPMDubbing、StyleDubber 所需的专用 speech-text aligner,从而改善内容准确率与说话人相似度。这种灵活的对齐方式还能超越 ADR,扩展到 Video-to-Speech 和 VFA,体现出较强的通用性。
2.2 Text-to-Speech(TTS)合成
近期 TTS 研究取得了显著进展。autoregressive TTS 通常把强大的 speech tokenizer 与 next-token prediction language modeling 结合,已获得良好效果;non-autoregressive(NAR)模型则利用并行计算实现更快推理,在质量与延迟之间取得平衡。diffusion model 对当前 NAR TTS 尤其重要:Matcha-TTS 用 optimal-transport conditional flow matching 训练,并依赖音素级 duration model;DiTTo-TTS 使用 Diffusion Transformer,通过 cross-attention 接收预训练语言模型编码的文本,以改善对齐;E2 TTS 移除音素和时长预测器,直接在字符序列末尾补 filler token,使其长度匹配 mel-spectrogram;F5-TTS 则把 ConvNeXt V2 融入 diffusion transformer,进一步加强 text-speech alignment。本文把 NAR TTS——尤其是 DiT——扩展到多模态 TTS,并通过 classifier-free guidance 与精心设计的条件机制,灵活处理 text-only、video-only 和多模态输入,以合成高质量语音。 ([70];[6];[32]) ([17];[78]) ([26];[68]) ([51]) ([42]) ([41]) ([57]) ([21]) ([8]) ([71])
3 AlignDiT
我们的目标是生成一段语音波形:它要匹配视频中的唇部运动,表达给定文本脚本的内容,并呈现参考语音所指定目标说话人的声音特征。为处理多模态输入,我们采用基于 in-context learning 的语音合成方法。现有 TTS 已探索多种文本条件注入方式,但据我们所知,在基于 in-context learning 的生成模型中,此前还没有方法能同时处理视频、文本和参考语音,并为语音合成实现多模态对齐。 ([21];[8];[74];[41])
因此,我们考察多种设置,寻找最适合的多模态对齐方法,使模型既能灵活处理单模态输入,也能处理多模态输入,并合成高质量、准确的语音。
3.1 模型架构
我们使用 Diffusion Transformer(DiT)完成 multimodal-to-speech generation,因为 DiT 已被证明适合语音生成。沿用既有 TTS 工作,模型以 Flow Matching 目标训练,并在推理时从随机噪声出发,通过迭代过程生成 mel-spectrogram。模型由多个 block 组成,每个 block 遵循带 self-attention 的标准 Transformer 架构,并额外加入注入 diffusion timestep 的参数。多模态生成时,融合后的多模态表示作为条件引导生成过程,使模型逐步把带噪 mel-spectrogram 精炼为与输入多模态信息一致的表示。 ([57]) ([40];[8]) ([69])
3.2 多模态条件
Audio-Video Fusion。音频与视频天然同步:说话时,同一时刻的唇部运动和声学特征紧密对应,因此可以逐帧融合。但两种模态的帧率通常不同,需先把它们编码到相同时间分辨率。具体而言,音频被转换为 100 fps 的 mel-spectrogram 序列 ;视频先经专门建模唇动的预训练 video encoder 得到 ,再通过轻量 transposed convolution 把 25 fps 上采样到 100 fps,并使用 Conformer encoder 增强上下文建模。时间对齐后,音频与视频特征沿 channel 维拼接,形成统一多模态表示,用来编码“何时说”与“怎样说”。 ([23])
为使模型生成符合参考语音音色特征的语音,我们对 mel-spectrogram 施加二值时间掩码 ,以 为输入,让模型 inpaint 被掩码区域。训练时随机选择掩码区间,以增强模型的 in-context learning 能力。推理阶段不应要求参考话语必须同时具备配对视频,因此训练时对视频特征施加互补掩码,使输入变为 :模型在参考区域依赖音频,同时忽略被掩码的视频。audio-video fusion 可写为:
其中, 与 分别表示时间长度和 hidden dimension。
Audio-Video-Text Fusion。audio-video 流天然具备时间对齐,而文本与二者只保持单调对齐,并没有严格的 frame-level synchronization。以往方法常依赖外部 forced aligner 和 duration predictor 提供 text token 级时长;我们则让生成模型在没有显式时长约束的情况下自然融合各模态。这样既简化数据预处理、便于扩大数据集,也避免 forced alignment 带来的潜在偏差,从而获得更自然的 audio-video-text alignment。为研究 DiT blocks 中可行的模态融合方式,我们考察 Figure 2 所示三种条件策略。三种方案的文本编码方式相同:字符序列先经 lookup table 做 embedding,再由 convolutional encoder 精炼为长度 的 。 ([49]) ([63])
(a)Early Fusion & Self-Attention。最直接的做法是在 channel axis 上拼接所有条件模态。参考 E2 TTS,我们在文本序列末尾补 filler token,使其总长度匹配。完成 early fusion 后,DiT blocks 的 self-attention 自然学习对齐,并预测 mel-spectrogram 的掩码部分: ([21])
其中, 和 是 fully connected layer 的参数,用于把 channel dimension 映射为 。
(b)Prefix & Self-Attention。另一种方式是在 sequence 维把文本特征与 audio-video 特征拼接,把文本视为 prefix。它利用 in-context conditioning,使文本 prefix 能在 DiT blocks 的 self-attention 中引导模型。模型输出完整序列后,丢弃长度对应文本的 prefix 部分,留下预测 mel-spectrogram: ([70];[74])
其中, 与 是 fully connected layer 的参数。
(c)Multimodal Cross-Attention(AlignDiT)。最后一种方案不在输入层融合 audio-video 与文本特征,而是在保留音视频天然同步关系的同时,逐步注入文本信息。为此,我们在每个 DiT block 的 self-attention 之外插入 cross-attention layer:audio-video 表示 作为 query,文本 embedding 作为 multi-head cross-attention 的 key 和 value:
其中,、 与 是可学习投影矩阵。第 5.1 节对三种方案的分析表明,方案(c)既能自然对齐 audio-visual feature,又能有效引入文本特征,得到最佳的多模态对齐效果,因此 AlignDiT 采用这一方案。
3.3 训练目标
在融合多模态表示的基础上,我们用 multi-task learning 训练 AlignDiT。首先采用 conditional flow matching(CFM)训练目标;它已被证明可以高效生成高质量数据样本。CFM 要把从易处理分布 到近似目标分布 的 probability path 匹配起来。给定融合多模态表示 和带噪 mel-spectrogram (),AlignDiT 用 CFM 目标回归 vector field : ([42])
其中, 定义 DiT blocks;当 时, 表示估计的 vector field。
其次,CFM loss 能促进自然 mel-spectrogram 的生成,但它只提供间接学习信号,单独使用时不足以完成模态对齐。为此,我们引入 Connectionist Temporal Classification(CTC)loss,引导 DiT blocks 的中间表示更直接地与文本内容对齐。具体做法是在若干中间 block 上接轻量 projection head,根据 hidden representation 预测文本序列: ([12]) ([22])
其中, 是第 个 DiT block 的输出, 表示被选中的层。CTC loss 无需外部 alignment module,就能促使模型保留更多语言信息。最终 multi-task loss 为:
其中, 是平衡两项损失的 hyperparameter。
3.4 Audio-only Pretraining
同时生成高质量语音并学习多模态对齐并不容易。为了给 AlignDiT 提供更好的初始化,我们在引入视频和文本条件之前增加 audio-only pretraining。预训练时,模型根据未掩码上下文预测输入 mel-spectrogram 的掩码区域;这一方式已在 TTS 中证明有效。我们还采用 self-supervised speech model 作为 teacher,把丰富特征蒸馏到 DiT 中间层,以加快收敛。模型先获得 unconditional speech generation 能力,再学习多模态条件,从而简化后续 audio-video-text fusion。相比成对的 audio-video-text 数据,纯音频资源更充足,因此该预训练策略易于扩展,也是一种实际的性能提升手段。 ([43]) ([77]) ([30])
3.5 Multimodal Classifier-Free Guidance
在 diffusion-based generative model 中,classifier-free guidance(CFG)常用于在推理阶段增强条件信号的影响。它让同一个模型同时给出 conditional 与 unconditional prediction,再按下式引导生成: ([27])
其中, 是 guidance scale。
不同模态的特征不同,因此我们认为对所有模态使用同一个 guidance scale 可能并非最优。为了在推理时更细致地控制各模态,我们为不同模态设置独立 scale,提出 multimodal classifier-free guidance:
其中, 是文本模态的 guidance scale, 是视频模态的 scale。调节二者即可自适应控制模型在两种模态之间的侧重:更大的 促使模型更严格遵循文本、改善可懂度;更大的 则带来更好的唇音同步。
为了支持 CFG,训练时会随机丢弃文本、视频或两者,执行 modality dropout。这样既能实现 multimodal CFG,也能提高输入模态缺失时的稳健性。
4 实验
4.1 数据集
我们在大规模 audio-visual 数据集 LRS3 上训练并评估 AlignDiT。LRS3 包含来自数千名说话人的 TED/TEDx 视频,共 439 小时英语句级数据;每个视频片段都包含无约束的音视频语音和准确转写,适合本文的多模态设置。训练使用约 131,000 条话语。评估时,我们构建 LRS3-cross 测试集,每个样本是“参考语音、文本、静音视频”三元组;参考语音取自同一说话人的另一条话语,而非 ground-truth speech,从而避免测试阶段泄漏真值语音。对 Video-to-Speech,不使用数据集自带文本,而是用现成 lip-reading model 直接从静音视频提取转写。 ([2])
4.2 评估指标
主观指标。研究重点是自然且同步的语音,因此主观评估对准确衡量模型性能很重要。ADR 人类评测采用 MOS,包含两项标准:naturalness 衡量整体语音质量;similarity 衡量合成语音与参考语音的说话人相似度。20 名参与者对随机抽取的 30 条话语使用 5 点 Likert scale 评分:1 表示“很差”或“非常不同”,5 表示“很好”或“非常相似”。 ([48];[3])
客观指标。ADR 和 Video-to-Speech 都用 Word Error Rate(WER)衡量内容准确率,合成语音由 Whisper-large-v3 转写;speaker similarity(spkSIM)则用基于 WavLM-large 的 speaker verification model 提取合成语音与参考语音的 embedding,再计算 cosine similarity。视频与合成语音的 lip-sync accuracy(AVSync)使用 AVHuBERT:比较“视频 + ground-truth speech”和“视频 + synthesized speech”两组输入的 AVHuBERT feature cosine similarity。已有研究表明,这比基于 SyncNet 的传统 lip-sync metric 更稳健、更适合验证 audio-visual synchronization。 ([62]) ([7]) ([66]) ([73]) ([14]) 对 alignment task,我们把模型得到的 word-level timestamp 与由原始音频对齐得到的 ground-truth timestamp 比较,并报告每个词的平均 absolute time error(毫秒)。
| 方案 | WER ↓ | AVSync ↑ | spkSIM ↑ | |
|---|---|---|---|---|
| (a) | ✗ | 28.828 | 0.666 | 0.530 |
| ✓ | 2.236 | 0.748 | 0.511 | |
| (b) | ✗ | 5.456 | 0.726 | 0.536 |
| ✓ | 1.917 | 0.745 | 0.519 | |
| (c) | ✗ | 2.507 | 0.745 | 0.543 |
| ✓ | 1.401 | 0.751 | 0.515 |
| 预训练数据 | WER ↓ | AVSync ↑ | spkSIM ↑ |
|---|---|---|---|
| 无 | 2.040 | 0.746 | 0.396 |
| LRS3 | 1.720 | 0.750 | 0.503 |
| LibriSpeech | 1.401 | 0.751 | 0.515 |
| WER ↓ | AVSync ↑ | spkSIM ↑ | ||
|---|---|---|---|---|
| 0 | 0 | 3.785 | 0.716 | 0.391 |
| 2 | 2 | 2.310 | 0.758 | 0.497 |
| 5 | 2 | 1.401 | 0.751 | 0.515 |
| 5 | 5 | 2.507 | 0.760 | 0.501 |
| 输入模态 | WER ↓ | AVSync ↑ | spkSIM ↑ | |
|---|---|---|---|---|
| text | video | |||
| ✗ | ✓ | 27.820 | 0.674 | 0.486 |
| ✓ | ✗ | 1.769 | 0.270 | 0.501 |
| ✓ | ✓ | 1.401 | 0.751 | 0.515 |
4.3 实现细节
数据预处理。音频使用 16 kHz mono waveform,经 filter size 640、hop size 160 转成 80-bin mel-spectrogram,帧率为 100 Hz。视频为 25 fps:先用 RetinaFace 检测人脸,再用 FAN 提取 facial landmark,根据 landmark 裁切以嘴唇为中心的区域并缩放到 ;预训练 AV-HuBERT Large 提取 25 Hz visual representation,因此其长度与音频特征固定为 1:4。文本输入表示为字符序列,其时间长度通常短于音频特征。 ([18]) ([5]) ([66]) ([64])
架构。visual feature encoder 由两层 stride 为 2 的 transposed convolution 和两层 Conformer encoder 组成;每层 Conformer 的 embedding size 为 512,含 4 个 attention head 与 1024 维 feed-forward layer。text encoder 使用 4 层 ConvNeXt v2,hidden embedding 为 512 维。多模态特征拼接后先经 linear layer 投影,再送入 18 个 DiT block;每个 block 的 embedding size 为 768,含 12 个 attention head 与 3072 维 feed-forward layer。 ([23]) ([71])
训练。使用 AdamW optimizer;前 20k steps warmup 到峰值 learning rate ,随后线性衰减。audio-only pretraining 训练 500k steps,总 batch size 为 0.3 小时;成对 audio-video-text 数据上 finetune 400k steps,总 batch size 为 0.1 小时。初始阶段把 设为 0.1,以平衡 CTC loss 与 CFM loss。对文本、视频以及所有模态的 dropout probability 分别设为 0.2。 ([44])
推理。使用 decay rate 0.999 的 EMA weights 稳定预测。AlignDiT 的输入包含参考语音及其对应 transcript,生成总时长由输入视频长度决定。采样使用 Euler ODE solver,并沿用 F5-TTS 的 sway sampling timestep scaling,系数为 -1。最终使用在 LRS3 上训练的 HiFi-GAN,把 mel-spectrogram 转成 waveform。 ([8]) ([37])
4.4 基线模型
ADR 基线是 state-of-the-art 开源系统 HPMDubbing 与 StyleDubber。为公平比较并提高它们的泛化能力,我们都在比原始训练集大得多的 LRS3 上重新训练,并把三个系统的 lip feature extractor 统一替换为 AV-HuBERT Large,从而在相同设置下比较架构本身。两种基线在训练时都需要显式 duration aligner。Video-to-Speech 基线是专为该任务设计的 DiffV2S、Intelligible 和 LipVoicer;VFA 基线包括 visual keyword spotting 方法 KWS-Net、Transpotter,以及 CTC-based 方法和 DVFA。 ([15]) ([16]) ([2]) ([66]) ([9]) ([11]) ([75]) ([54]) ([59]) ([39]) ([36])
5 结果
5.1 消融实验
| 方法 | 主观 | 客观 | |||
|---|---|---|---|---|---|
| Naturalness ↑ | Speaker Similarity ↑ | WER ↓ | AVSync ↑ | spkSIM ↑ | |
| GT | 4.13±0.13 | 3.96±0.14 | 2.335 | 1.000 | 0.562 |
| HPMDubbing | 2.37±0.14 | 2.43±0.16 | 5.382 | 0.750 | 0.287 |
| StyleDubber | 1.79±0.12 | 2.35±0.18 | 3.170 | 0.586 | 0.349 |
| Ours | 3.79±0.16 | 3.96±0.13 | 1.401 | 0.751 | 0.515 |
我们通过深入消融分析各个 AlignDiT 组件的贡献,并用 WER、AVSync、spkSIM 等客观指标,从模态条件方式、audio-only pretraining、multimodal CFG 和输入模态四个方面给出结果。
模态条件方式。我们比较三种条件方案:Early Fusion & Self-Attention、Prefix & Self-Attention、Multimodal Cross-Attention,并分别考察 CTC loss 的影响。Table 1 证明 multimodal cross-attention 最有效,在 WER、AVSync 与 spkSIM 上取得整体最佳表现。除 cross-attention 的 spkSIM 有轻微例外外,去掉 会让所有方案和指标一致退化,尤其 WER 在三种方案中都显著变差。这说明 能促进 DiT blocks 更准确地学习输入文本与输出语音之间的对齐。
Audio-only pretraining。Table 2 显示纯音频预训练的收益。在主训练同样使用的 LRS3 上预训练,所有指标都稳定改善;换成后续训练未见过的 LibriSpeech,提升更大。这说明预训练阶段使用多样化音频有明确好处,也表明 AlignDiT 可以通过易获得的音频资源进一步提升。 ([55])
Multimodal CFG。Table 3 比较不同 与 。首先,使用相同 scale 的普通 CFG(两者都取 2 或 5)始终优于不使用 CFG。更重要的是,分别调节两种 scale、平衡模态信息,能进一步改善整体表现,说明 multimodal CFG 有助于生成更自然的语音。最终取 、,WER 与 spkSIM 最佳。 ([27];[40])
输入模态。去掉文本时 WER 显著上升,说明文本信息对生成准确、可懂语音至关重要;去掉视频也会降低整体表现,尤其 AVSync 大幅退化。text + video 同时使用时,语音既可懂又同步,体现出 multimodal-to-speech generation 的优势。
| 方法 | WER ↓ | AVSync ↑ | spkSIM ↑ |
|---|---|---|---|
| DiffV2S | 35.210 | 0.608 | 0.115 |
| Intelligible | 27.432 | 0.675 | 0.316 |
| LipVoicer | 21.164 | 0.524 | 0.094 |
| Ours | 19.513 | 0.688 | 0.508 |
| 方法 | MAE ↓ | ACC ↑ |
|---|---|---|
| KWS-Net | 262.9 ms | 42.6% |
| CTC-based | 124.5 ms | 60.6% |
| Transpotter | 167.3 ms | 61.8% |
| DVFA | 97.7 ms | 80.2% |
| Ours | 41.5 ms | 83.7% |
5.2 定量比较
Table 5 给出 AlignDiT 与基线的主观、客观评估。AlignDiT 在所有指标上持续优于全部基线:主观评测中 naturalness 为 3.79,speaker similarity 为 3.96,均大幅领先基线,说明其语音流畅,在感知自然度和说话人相似度上更好。
客观结果进一步支持 AlignDiT 的有效性:最低 WER 为 1.401,说明能准确合成输入文本;最高 AVSync 为 0.751,说明在不依赖基线常用额外 aligner 或 duration predictor 的情况下,仍能有效学习 audio-video temporal alignment;spkSIM 也最佳,说明模型能较好复现目标说话人的声音特征。
5.3 定性比较
Figure 3 对比 ground truth、既有 ADR 方法与多模态 AlignDiT 的合成 mel-spectrogram,同时展示 video-only(VTS)和 text-only(TTS)结果。观察第 1、2 列橙/红框及谱图下方转写可见,既有方法经常生成错误语音且谱图模糊;第 3、4 列中,它们虽然内容正确,仍偶尔产生非预期声音,或谱图细节不足、显得模糊。单模态结果与第 5.1 节一致:video-only 因缺少文本,内容准确率很不稳定,所有样本都出现错误;text-only 因有文本而内容正确,但缺少视频导致时间对齐偏离 ground truth。相比之下,AlignDiT 在所有样本中都稳定合成准确内容,谱图细节也与 ground truth 接近。结果说明模型能生成质量高、内容准确、接近真值的语音。 ([15];[16])
5.4 应用
AlignDiT 在多种多模态场景中具备稳健性和灵活性。我们把它泛化到 Video-to-Speech 与视觉强制对齐,展示方法的通用性。
Video-to-Speech。VTS 不同于 ADR:输入是没有文本的静音视频,模型读取唇动并合成对应语音。既有工作有的完全 textless,有的(如 LipVoicer)借助现成 lip-reading model 引导合成。为公平比较 LipVoicer,本文采用同一个 lip reader 获得 pseudo-text label。Table 6 显示 AlignDiT 在所有指标上都显著优于既有方法,包括专为 VTS 设计且同样使用专家 lip reader 的 LipVoicer。这表明多模态对齐机制具有稳健泛化能力,即便任务超出原始设计也能取得更好表现。 ([9];[11]) ([75]) ([46])
Visual forced alignment(VFA)。传统 VFA 需要在静音视频中确定每个词或音素的 timestamp。AlignDiT 能根据静音视频和文本生成语音,因此无需直接比较视频与文本,而是先利用两种输入合成语音,再用 Montreal Forced Aligner 把合成语音与对应文本对齐,得到每个词的时间戳。所有测试样本共用一条 canonical reference speech,不需要按说话人提供参考。Table 7 显示,AlignDiT 合成语音与输入视频高度同步,因此能与文本精确 forced alignment,显著优于专门为 VFA 设计的既有方法。这支持模型能从多模态输入生成准确、时间同步的语音。 ([49]) ([54];[59];[39];[36])
6 结论
本文提出 AlignDiT:从文本、视频与参考音频生成准确、自然且同步语音的统一框架。通过广泛分析,我们比较多种配置,找出无需显式 duration modeling 的最佳多模态对齐策略;同时提出 multimodal classifier-free guidance,自适应平衡各模态信息。AlignDiT 在多个 benchmark 上达到 state of the art,并在 Video-to-Speech 与视觉强制对齐等关键多模态任务中证明有效。我们希望这些发现能为未来的 multimodal alignment 与 generation 研究提供启发。
致谢
本工作得到韩国政府(MSIT)资助的 IITP 项目支持:RS-2025-02263169“新兴与未发现 Voice Phishing 的检测与预测”,以及 RS-2024-00457882“National AI Research Lab Project”。
参考文献
参考文献保留原始书目信息与顺序。
- Triantafyllos Afouras, Joon Son Chung, Andrew Senior, Oriol Vinyals, Andrew Zisserman. 2018. Deep audio-visual speech recognition. IEEE Trans. on Pattern Analysis and Machine Intelligence.
- Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman. 2018. LRS3-TED: a large-scale dataset for visual speech recognition. arXiv preprint arXiv:1809.00496.
- Junseok Ahn, Youkyum Kim, Yeunju Choi, Doyeop Kwak, Ji-Hoon Kim, Seongkyu Mun, Joon Son Chung. 2024. VoxSim: A perceptual voice similarity dataset. Proc. Interspeech.
- Alexei Baevski, Yuhao Zhou, Abdelrahman Mohamed, Michael Auli. 2020. wav2vec 2.0: A framework for self-supervised learning of speech representations. Proc. NeurIPS.
- Adrian Bulat, Georgios Tzimiropoulos. 2017. How Far are We from Solving the 2D & 3D Face Alignment Problem?(and a Dataset of 230,000 3D Facial Landmarks). Proc. ICCV.
- Sanyuan Chen, Shujie Liu, Long Zhou, Yanqing Liu, Xu Tan, Jinyu Li, Sheng Zhao, Yao Qian, Furu Wei. 2024. Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers. arXiv preprint arXiv:2406.05370.
- Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, others. 2022. Wavlm: Large-scale self-supervised pre-training for full stack speech processing. IEEE Journal of Selected Topics in Signal Processing.
- Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Chunhui Wang, Jian Zhao, Kai Yu, Xie Chen. 2025. F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching. Proc. ACL.
- Jeongsoo Choi, Joanna Hong, Yong Man Ro. 2023. DiffV2S: Diffusion-based video-to-speech synthesis with vision-guided speaker embedding. Proc. ICCV.
- Jeongsoo Choi, Ji-Hoon Kim, Jinyu Li, Joon Son Chung, Shujie Liu. 2025. V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow. Proc. ICASSP.
- Jeongsoo Choi, Minsu Kim, Yong Man Ro. 2023. Intelligible Lip-to-Speech Synthesis with Speech Units. Proc. Interspeech.
- Jeongsoo Choi, Zhikang Niu, Ji-Hoon Kim, Chunhui Wang, Joon Son Chung, Xie Chen. 2025. Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment. Proc. Interspeech.
- Jeongsoo Choi, Se Jin Park, Minsu Kim, Yong Man Ro. 2024. Av2av: Direct audio-visual speech to audio-visual speech translation with unified audio-visual speech representation. Proc. CVPR.
- Joon Son Chung, Andrew Zisserman. 2016. Out of time: automated lip sync in the wild. ACCV workshop.
- Gaoxiang Cong, Liang Li, Yuankai Qi, Zheng-Jun Zha, Qi Wu, Wenyu Wang, Bin Jiang, Ming-Hsuan Yang, Qingming Huang. 2023. Learning to dub movies via hierarchical prosody models. Proc. CVPR.
- Gaoxiang Cong, Yuankai Qi, Liang Li, Amin Beheshti, Zhedong Zhang, Anton van den Hengel, Ming-Hsuan Yang, Chenggang Yan, Qingming Huang. 2024. Styledubber: towards multi-scale style learning for movie dubbing. Findings of ACL.
- Alexandre Défossez, Jade Copet, Gabriel Synnaeve, Yossi Adi. 2023. High Fidelity Neural Audio Compression. Trans. on Machine Learning Research.
- Jiankang Deng, Jia Guo, Evangelos Ververas, Irene Kotsia, Stefanos Zafeiriou. 2020. Retinaface: Single-shot multi-level face localisation in the wild. Proc. CVPR.
- Linda Drijvers, Judith Holler. 2023. The multimodal facilitation effect in human communication. Psychonomic Bulletin & Review.
- Ariel Ephrat, Shmuel Peleg. 2017. Vid2speech: speech reconstruction from silent video. Proc. ICASSP.
- Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Canrun Li, Chung-Hsien Tsai, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Xu Tan, others. 2024. E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts. IEEE Spoken Language Technology workshop.
- Alex Graves, Santiago Fernández, Faustino Gomez, Jürgen Schmidhuber. 2006. Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks. Proc. ICML.
- Anmol Gulati, James Qin, Chung-Cheng Chiu, Niki Parmar, Yu Zhang, Jiahui Yu, Wei Han, Shibo Wang, Zhengdong Zhang, Yonghui Wu, others. 2020. Conformer: Convolution-augmented transformer for speech recognition. Proc. Interspeech.
- Michael Hassid, Michelle Tadmor Ramanovich, Brendan Shillingford, Miaosen Wang, Ye Jia, Tal Remez. 2022. More than words: In-the-wild visually-driven prosody for text-to-speech. Proc. CVPR.
- Jinzheng He, Zhou Zhao, Yi Ren, Jinglin Liu, Baoxing Huai, Nicholas Yuan. 2022. Flow-based unconstrained lip to speech generation. Proc. AAAI.
- Jonathan Ho, Ajay Jain, Pieter Abbeel. 2020. Denoising diffusion probabilistic models. Proc. NeurIPS.
- Jonathan Ho, Tim Salimans. 2021. Classifier-Free Diffusion Guidance. NeurIPS workshop.
- Judith Holler, Stephen C Levinson. 2019. Multimodal language processing in human communication. Trends in Cognitive Sciences.
- Joanna Hong, Minsu Kim, Jeongsoo Choi, Yong Man Ro. 2023. Watch or listen: Robust audio-visual speech recognition with visual corruption modeling and reliability scoring. Proc. CVPR.
- Wei-Ning Hsu, Benjamin Bolte, Yao-Hung Hubert Tsai, Kushal Lakhotia, Ruslan Salakhutdinov, Abdelrahman Mohamed. 2021. Hubert: Self-supervised speech representation learning by masked prediction of hidden units. IEEE/ACM Trans. on Audio, Speech, and Language Processing.
- Chenxu Hu, Qiao Tian, Tingle Li, Wang Yuping, Yuxuan Wang, Hang Zhao. 2021. Neural dubber: Dubbing for videos according to scripts. Proc. NeurIPS.
- Eugene Kharitonov, Damien Vincent, Zalán Borsos, Raphaël Marinier, Sertan Girgin, Olivier Pietquin, Matt Sharifi, Marco Tagliasacchi, Neil Zeghidour. 2023. Speak, read and prompt: High-fidelity text-to-speech with minimal supervision. Trans. of the Association for Computational Linguistics.
- Ji-Hoon Kim, Jeongsoo Choi, Jaehun Kim, Chaeyoung Jung, Joon Son Chung. 2025. From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech. Proc. CVPR.
- Ji-Hoon Kim, Jaehun Kim, Joon Son Chung. 2024. Let there be sound: reconstructing high quality speech from silent videos. Proc. AAAI.
- Minsu Kim, Joanna Hong, Yong Man Ro. 2021. Lip to speech synthesis with visual context attentional GAN. Proc. NeurIPS.
- Minsu Kim, Chae Won Kim, Yong Man Ro. 2023. Deep visual forced alignment: learning to align transcription with talking face video. Proc. AAAI.
- Jungil Kong, Jaehyeon Kim, Jaekyoung Bae. 2020. Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis. Proc. NeurIPS.
- Yaman Kumar, Rohit Jain, Khwaja Mohd Salik, Rajiv Ratn Shah, Yifang Yin, Roger Zimmermann. 2019. Lipper: Synthesizing thy speech using multi-view lipreading. Proc. AAAI.
- Ludwig Kürzinger, Dominik Winkelbauer, Lujun Li, Tobias Watzel, Gerhard Rigoll. 2020. Ctc-segmentation of large corpora for german end-to-end speech recognition. International Conference on Speech and Computer.
- Matthew Le, Apoorv Vyas, Bowen Shi, Brian Karrer, Leda Sari, Rashel Moritz, Mary Williamson, Vimal Manohar, Yossi Adi, Jay Mahadeokar, others. 2023. Voicebox: Text-guided multilingual universal speech generation at scale. Proc. NeurIPS.
- Keon Lee, Dong Won Kim, Jaehyeon Kim, Jaewoong Cho. 2025. Ditto-tts: Efficient and scalable zero-shot text-to-speech with diffusion transformer. Proc. ICLR.
- Yaron Lipman, Ricky TQ Chen, Heli Ben-Hamu, Maximilian Nickel, Matt Le. 2023. Flow matching for generative modeling. Proc. ICLR.
- Alexander H Liu, Matt Le, Apoorv Vyas, Bowen Shi, Andros Tjandra, Wei-Ning Hsu. 2024. Generative pre-training for speech with flow matching. Proc. ICLR.
- Ilya Loshchilov, Frank Hutter. 2019. Decoupled Weight Decay Regularization. Proc. ICLR.
- Junchen Lu, Berrak Sisman, Rui Liu, Mingyang Zhang, Haizhou Li. 2022. Visualtts: Tts with accurate lip-speech synchronization for automatic voice over. Proc. ICASSP.
- Pingchuan Ma, Alexandros Haliassos, Adriana Fernandez-Lopez, Honglie Chen, Stavros Petridis, Maja Pantic. 2023. Auto-avsr: Audio-visual speech recognition with automatic labels. Proc. ICASSP.
- Pingchuan Ma, Yujiang Wang, Jie Shen, Stavros Petridis, Maja Pantic. 2021. Lip-reading with densely connected temporal convolutional networks. Proc. WACV.
- Soumi Maiti, Yifan Peng, Takaaki Saeki, Shinji Watanabe. 2023. Speechlmscore: Evaluating speech generation using speech language model. Proc. ICASSP.
- Michael McAuliffe, Michaela Socolof, Sarah Mihuc, Michael Wagner, Morgan Sonderegger. 2017. Montreal forced aligner: Trainable text-speech alignment using kaldi. Proc. Interspeech.
- Harry McGurk, John MacDonald. 1976. Hearing lips and seeing voices. Nature.
- Shivam Mehta, Ruibo Tu, Jonas Beskow, Éva Székely, Gustav Eje Henter. 2024. Matcha-TTS: A fast TTS architecture with conditional flow matching. Proc. ICASSP.
- Rodrigo Mira, Alexandros Haliassos, Stavros Petridis, Björn W Schuller, Maja Pantic. 2022. SVTS: Scalable Video-to-Speech Synthesis. Proc. Interspeech.
- Rodrigo Mira, Konstantinos Vougioukas, Pingchuan Ma, Stavros Petridis, Björn W Schuller, Maja Pantic. 2022. End-to-end video-to-speech synthesis using generative adversarial networks. IEEE Trans. on Cybernetics.
- Liliane Momeni, Triantafyllos Afouras, Themos Stafylakis, Samuel Albanie, Andrew Zisserman. 2020. Seeing wake words: Audio-visual keyword spotting. Proc. BMVC..
- Vassil Panayotov, Guoguo Chen, Daniel Povey, Sanjeev Khudanpur. 2015. Librispeech: an asr corpus based on public domain audio books. Proc. ICASSP.
- Se Jin Park, Minsu Kim, Joanna Hong, Jeongsoo Choi, Yong Man Ro. 2022. Synctalkface: Talking face generation with precise lip-syncing via audio-lip memory. Proc. AAAI.
- William Peebles, Saining Xie. 2023. Scalable diffusion models with transformers. Proc. CVPR.
- Stavros Petridis, Themos Stafylakis, Pingchuan Ma, Georgios Tzimiropoulos, Maja Pantic. 2018. Audio-visual speech recognition with a hybrid ctc/attention architecture. IEEE Spoken Language Technology workshop.
- KR Prajwal, Liliane Momeni, Triantafyllos Afouras, Andrew Zisserman. 2021. Visual keyword spotting with attention. Proc. BMVC..
- KR Prajwal, Rudrabha Mukhopadhyay, Vinay P Namboodiri, CV Jawahar. 2020. Learning individual speaking styles for accurate lip to speech synthesis. Proc. CVPR.
- KR Prajwal, Rudrabha Mukhopadhyay, Vinay P Namboodiri, CV Jawahar. 2020. A lip sync expert is all you need for speech to lip generation in the wild. Proc. ACM MM.
- Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, Ilya Sutskever. 2023. Robust speech recognition via large-scale weak supervision. Proc. ICML.
- Yi Ren, Chenxu Hu, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, Tie-Yan Liu. 2021. Fastspeech 2: Fast and high-quality end-to-end text to speech. Proc. ICLR.
- Yi Ren, Yangjun Ruan, Xu Tan, Tao Qin, Sheng Zhao, Zhou Zhao, Tie-Yan Liu. 2019. Fastspeech: Fast, robust and controllable text to speech. Proc. NeurIPS.
- Steffen Schneider, Alexei Baevski, Ronan Collobert, Michael Auli. 2019. wav2vec: Unsupervised pre-training for speech recognition. Proc. Interspeech.
- Bowen Shi, Wei-Ning Hsu, Kushal Lakhotia, Abdelrahman Mohamed. 2022. Learning audio-visual speech representation by masked multimodal cluster prediction. Proc. ICLR.
- Joon Son Chung, Andrew Senior, Oriol Vinyals, Andrew Zisserman. 2017. Lip reading sentences in the wild. Proc. CVPR.
- Yang Song, Jascha Sohl-Dickstein, Diederik P Kingma, Abhishek Kumar, Stefano Ermon, Ben Poole. 2020. Score-based generative modeling through stochastic differential equations. arXiv preprint arXiv:2011.13456.
- Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Lukasz Kaiser, Illia Polosukhin. 2017. Attention is all you need. Proc. NeurIPS.
- Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, others. 2023. Neural codec language models are zero-shot text to speech synthesizers. arXiv preprint arXiv:2301.02111.
- Sanghyun Woo, Shoubhik Debnath, Ronghang Hu, Xinlei Chen, Zhuang Liu, In So Kweon, Saining Xie. 2023. Convnext v2: Co-designing and scaling convnets with masked autoencoders. Proc. CVPR.
- Sicheng Xu, Guojun Chen, Yu-Xiao Guo, Jiaolong Yang, Chong Li, Zhenyu Zang, Yizhong Zhang, Xin Tong, Baining Guo. 2024. Vasa-1: Lifelike audio-driven talking faces generated in real time. Proc. NeurIPS.
- Dogucan Yaman, Fevziye Irem Eyiokur, Leonard Bärmann, Seymanur Akti, Hazim Kemal Ekenel, Alexander Waibel. 2024. Audio-Visual Speech Representation Expert for Enhanced Talking Face Video Generation and Evaluation. CVPR workshop.
- Dongchao Yang, Dingdong Wang, Haohan Guo, Xueyuan Chen, Xixin Wu, Helen Meng. 2024. Simplespeech: Towards simple and efficient text-to-speech with scalar latent transformer diffusion models. Proc. Interspeech.
- Yochai Yemini, Aviv Shamsian, Lior Bracha, Sharon Gannot, Ethan Fetaya. 2024. LipVoicer: Generating Speech from Silent Videos Guided by Lip Reading. Proc. ICLR.
- Jeong Hun Yeo, Minsu Kim, Jeongsoo Choi, Dae Hoe Kim, Yong Man Ro. 2024. Akvsr: Audio knowledge empowered visual speech recognition by compressing audio knowledge of a pretrained model. IEEE Trans. on Multimedia.
- Sihyun Yu, Sangkyung Kwak, Huiwon Jang, Jongheon Jeong, Jonathan Huang, Jinwoo Shin, Saining Xie. 2025. Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think. Proc. ICLR.
- Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, Marco Tagliasacchi. 2021. Soundstream: An end-to-end neural audio codec. IEEE/ACM Trans. on Audio, Speech, and Language Processing.