READING NOTES · MULTIMODAL SPEECH
AlignDiT
精读笔记
文本回答“说什么”,静音视频约束“何时说”,参考语音定义“谁在说”。AlignDiT 的核心不是把三种 embedding 粘起来,而是让三种不同的对齐关系在同一个 DiT 里各走合适的通路。
30 秒速览
TL;DRAlignDiT 处理 multimodal-to-speech:以文本、静音视频、参考语音为条件,生成内容正确、与唇动同步、并保持目标音色的语音。视频特征先从 25 Hz 上采样到与 100 Hz mel-spectrogram 相同的时间分辨率;参考音频与视频采用互补掩码;文本则通过每个 DiT block 中的 cross-attention 注入。
最值得记住的一句话:先保住 audio-video 的 frame-level alignment,再让文本以 cross-attention 提供单调但非逐帧的语言约束。
01 三种融合,为什么 cross-attention 胜出
ALIGNMENT原论文比较 channel 维 early fusion、sequence 维 text prefix,以及把 audio-video 作为 query、文本作为 key/value 的 cross-attention。
- Early fusion
- 把补齐到时间长度的文本、audio-video 特征沿 channel 拼接。简单,但要求 filler token 人为拉长文本。
- Text prefix
- 把文本放在 sequence 前缀,靠 self-attention 传播条件。保留 in-context 形式,但文本长度和声学时间仍混在同一序列。
- Cross-attention
- audio-video 继续保留天然的逐帧关系;每个 DiT block 再用 audio-video query 读取 text key/value。不同对齐坐标系不被硬塞成一条轴。
Table 1 的关键消融是:加 CTC 后,方案 (c) 的 WER / AVSync 达到 1.401 / 0.751;方案 (a) 为 2.236 / 0.748,方案 (b) 为 1.917 / 0.745。spkSIM 并非所有维度都同时最优,因此应理解为整体折中,而不是每个指标绝对支配。
02 CFM、CTC 和 multimodal CFG 各管一件事
OBJECTIVE- CFM:回归 mel-spectrogram 概率路径的 vector field,主要负责自然、高质量的声学生成。
- 中间层 CTC:从若干 DiT hidden state 预测字符序列,给文本—语音对齐更直接的监督;去掉它时三种融合方式的 WER 都明显变差。
- Audio-only pretraining:先学习 masked mel inpainting 和无条件语音先验,再引入视频、文本;LibriSpeech 预训练比 LRS3 内域预训练收益更大。
- Multimodal CFG:分别调节文本与视频的 guidance。更高 text scale 改善可懂度,更高 video scale 改善 lip-sync;两者并非越大越好。
Table 3 给出的最优 WER / spkSIM 配置是 s_text = 5, s_video = 2;若把两者都提到 5,AVSync 略高到 0.760,但 WER 恶化到 2.507。它说明“对齐”是多目标平衡,而非单个 scale 的单调优化。
03 最能支持论文主张的结果
EVIDENCE完整 7 张表及全部数值见中文全文页。
| 比较 | AlignDiT | 强基线 / 对照 | 支持的结论 |
|---|---|---|---|
| ADR 主结果 | WER 1.401 · AVSync .751 · spkSIM .515 | StyleDubber 3.170 · .586 · .349 | 内容、同步、音色同时改善 |
| 主观 MOS | 自然度 3.79±.16 · 相似度 3.96±.13 | Ground truth 自然度 4.13±.13 | 感知质量接近但未达到真值 |
| 输入模态 | Text + Video:1.401 / .751 | Video-only WER 27.820;Text-only AVSync .270 | 两种条件确实互补 |
| VFA | MAE 41.5 ms · ACC 83.7% | DVFA 97.7 ms · 80.2% | 合成语音可作为视频—文本桥梁 |
AlignDiT 的谱图细节与真值更接近;video-only 的语言内容不稳定,text-only 则缺少视频时序约束。
04 四个常见误读
MISCONCEPTIONS- 误读 1
- “模型完全不需要 aligner。” 核心合成训练不依赖显式 duration aligner;但 VFA 应用先合成语音,再使用 Montreal Forced Aligner 得到词级时间戳。
- 误读 2
- “三种输入必须逐帧对齐。” audio-video 是 frame-level 同步;文本只有单调对应,因此论文把它放进 cross-attention,而不是强制补成真实时长。
- 误读 3
- “表中基线就是公开 checkpoint 的原始成绩。” 作者在更大的 LRS3 上重新训练 HPMDubbing 与 StyleDubber,并统一替换 AV-HuBERT lip encoder,属于受控重训比较。
- 误读 4
- “s_text 和 s_video 越大越好。” 两者控制不同目标并有冲突;5/5 的 AVSync 更高,但 WER 明显差于 5/2。
05 编辑判断与开放问题
VERDICTAlignDiT 最强的贡献是把“文本、视频、参考音频”的不同对齐关系拆开处理,并用 CTC 与独立 CFG scale 补足生成目标和对齐目标之间的张力。
证据覆盖 ADR、VTS、VFA,消融也能闭环支持设计;但边界同样清晰:训练与评估仅在英语 LRS3 上完成;主观评测是 20 人 × 30 条;论文没有给参数量、GFLOPs 或 RTF,无法判断质量收益的计算代价;VFA 仍借助现成 forced aligner。对中文 TTS 或真实影视 ADR,仍需验证更复杂语速、情绪、遮挡和多人镜头下的泛化。