跳转到内容

输入关键词开始搜索

    资料摘要:AlignDiT

    论文摘要更新 2026-08-17置信度 high待阅读原始来源 ↗#语音合成#多模态#扩散模型#深度#易过时

    AlignDiT 是一个 multimodal-to-speech 框架:文本约束内容,静音视频约束唇动时序,参考语音约束说话人音色;它保留 audio-video 的逐帧对齐,用 cross-attention 注入只具单调对齐关系的文本,并以 CFM、CTC 和模态独立 CFG scale 分别承担声学生成、语言对齐与推理期条件平衡。

    • 任务不是普通 TTS。 输入为文本、静音视频、参考语音及参考文本,输出需同时满足“说对内容、跟上嘴型、保持音色”。论文以 Automated Dialogue Replacement(ADR)为主任务,并扩展到 Video-to-Speech(VTS)和 Visual Forced Alignment(VFA)。
    • Audio-video 先在同一时间轴融合。 mel-spectrogram 为 100 Hz;AV-HuBERT visual feature 为 25 Hz,经两层 stride-2 transposed convolution 上采样至 100 Hz,再由 Conformer 编码。参考音频与视频使用互补时间掩码,使参考区域依赖音频、待生成区域依赖视频。
    • 文本不强行伪装成 frame-level 条件。 论文比较 early fusion、text prefix 和 multimodal cross-attention;最终方案让 audio-video representation 作 query,text embedding 作 key/value,在每个 DiT block 中逐层注入文本信息。
    • CFM 管音质,CTC 管显式语言对齐。 CFM 回归 mel probability path 的 vector field;若只用 CFM,对齐信号偏间接,因此在若干 DiT 中间层接轻量 CTC head,从 hidden state 预测字符序列。Table 1 中加入 CTC 后,三种融合方式的 WER 都显著降低。
    • Audio-only pretraining 提供可扩展初始化。 模型先做 masked mel inpainting,并蒸馏 self-supervised speech teacher 的中间特征,再用成对 audio-video-text 数据微调。LibriSpeech 预训练比 LRS3 内域预训练带来更大的整体收益。
    • Multimodal CFG 将内容与同步分开调节。 较高 stexts_{text} 强化可懂度,较高 svideos_{video} 强化 lip-sync;Table 3 的 WER / spkSIM 最佳点为 stext=5,svideo=2s_{text}=5, s_{video}=2,而 5/55/5 虽把 AVSync 提到 0.760,却使 WER 恶化到 2.507。
    AlignDiT 多模态对齐架构
    AlignDiT 多模态对齐架构
    • 音频:16 kHz mono,80-bin mel-spectrogram,filter size 640、hop size 160,因此为 100 Hz;记为 haudioh_{audio}
    • 视频:25 fps;RetinaFace 检测、FAN landmark、88×8888\times88 唇部裁切,AV-HuBERT Large 抽取 25 Hz visual representation,再上采样为 100 Hz;记为 hvideoh_{video}
    • 文本:字符 lookup embedding 后经 4 层 ConvNeXt v2,得到长度 LL、hidden size 512 的 htexth_{text}
    • 主干:18 个 DiT block,embedding size 768、12 个 attention head、FFN 3072;最终生成 mel,再由 LRS3 上训练的 HiFi-GAN 转回 waveform。
    1. **Early Fusion & Self-Attention:**把补 filler token 后的文本、音频、视频沿 channel axis 拼接,再投影回 DiT hidden size。
    2. **Prefix & Self-Attention:**把文本作为 sequence prefix 与 audio-video 特征拼接;生成后丢掉对应文本长度的 prefix 输出。
    3. **Multimodal Cross-Attention:**保持 audio-video 时间轴不变,每个 DiT block 额外插入 cross-attention;havh_{av} 作 query,htexth_{text} 作 key/value。这是 AlignDiT 的最终选择。

    该比较真正区分的是三种坐标关系:audio-video 具有 frame-level synchronization;文本只与它们保持单调关系。cross-attention 不要求文本 token 和 acoustic frame 共用一条伪造时间轴,因而更贴合条件本身的结构。

    • 在 audio-only 数据上预训练 500k steps,总 batch size 为 0.3 小时;在成对 audio-video-text 数据上微调 400k steps,总 batch size 为 0.1 小时。
    • AdamW 前 20k steps warmup 到 7.5×1057.5\times10^{-5},再线性衰减;初始 λCTC=0.1\lambda_{CTC}=0.1。文本、视频、全条件三种 dropout probability 均为 0.2,用于训练 conditional / partially conditional / unconditional 分支。
    • 推理使用 decay 0.999 的 EMA weights、Euler ODE solver 和 F5-TTS 的 sway sampling timestep scaling(系数 -1);生成时长直接由视频长度确定。
    • Multimodal CFG 以文本与视频两个增量分解 conditional velocity,从而分别控制语言内容和视频同步。
    • **ADR:**作者在 LRS3 上重训 HPMDubbing 与 StyleDubber,并把三者的 lip feature extractor 统一为 AV-HuBERT Large;这增强了受控公平性,但结果不等于公开 checkpoint 的原始横向跑分。
    • **VTS:**没有真实文本时,使用与 LipVoicer 相同的 off-the-shelf lip reader 产生 pseudo-text;因此 AlignDiT 的 VTS 结果不是纯 textless generation。
    • **VFA:**模型先根据静音视频与文本合成语音,再用 Montreal Forced Aligner 对齐合成语音和文本,得到词级时间戳。核心合成训练“不依赖显式 duration aligner”成立,但不能把 VFA 应用说成完全 aligner-free。
    • **数据集:**LRS3,439 小时英语 TED / TEDx 音视频;约 131,000 条训练 utterance。测试采用 LRS3-cross triplet,参考语音来自同一说话人的另一句话,避免把 ground-truth speech 泄漏给模型。
    • **主观评测:**20 名参与者、随机 30 条 utterance、5 分 Likert;AlignDiT naturalness 为 3.79±0.163.79\pm0.16,speaker similarity 为 3.96±0.133.96\pm0.13;ground truth naturalness 为 4.13±0.134.13\pm0.13
    • **ADR 客观结果:**WER 1.401、AVSync 0.751、spkSIM 0.515;StyleDubber 为 3.170 / 0.586 / 0.349。
    • **输入消融:**video-only WER 27.820;text-only AVSync 0.270;text + video 为 WER 1.401、AVSync 0.751,支持两种输入互补。
    • **VFA:**MAE 41.5 ms、ACC 83.7%;DVFA 为 97.7 ms / 80.2%。
    • **证据限制:**仅在英语 LRS3 上训练评估;主观样本有限;论文未报告参数量、GFLOPs、RTF 或端到端延迟,无法从结果判断质量收益的计算代价。
    • 当前实现状态(2026-08-17 核验):官方仓库已发布训练/推理代码与 checkpoint,代码使用 MIT License;论文 PDF 自身标注 CC BY-ND 4.0,二者的许可边界不能混用。
    • 本地精读:中文全文译稿 · 精读笔记 · arXiv 原文