全模态音视频生成模型

MiniMax H3 模型结构解析

从文本、图像、视频和音频条件如何进入模型开始,依次理解 H3-Encoder、VisualVAE、AudioVAE 与 Omni Transformer 如何协作,最终联合生成视频和立体声音频。

阅读主线:条件编码 → 多模态序列 → 联合预测视频/音频 latent → 双 VAE 解码。

00

导读

摘要

MiniMax H3 的核心是一条统一的音视频生成链路。文本由 Qwen3-VL-32B 编码,参考图像和视频同时进入视觉编码路径与 VisualVAE,参考音频进入 AudioVAE;这些表示被组织成同一个多模态序列,交给 33B Omni Transformer 联合预测视频和音频 latent,最后再由两个 VAE 分别解码。

理解这套模型时,关键不在于记住每个配置值,而在于抓住两件事:第一,视频与音频不是两个串联模型的产物,而是在同一 Transformer 中联合建模;第二,Transformer 处理的不是原始像素和波形,而是经过强压缩、仍保留时空结构的连续 latent。

01

系统视角

整体架构

完整工作流分成上下文整理、基础生成和 2K 再生成三部分。学习模型结构时,重点是中间的 H3-Base:它接收已经整理好的多模态条件,在 latent 空间中联合生成视频与音频。

步骤 1

H3-Context-IR

解析自由形式的文本、图像、视频和音频,建立跨模态关联与时间关系,并补足未明确的语义细节。

上下文整理
步骤 2

H3-Base

多编码器形成统一 packed sequence;Omni Transformer 联合预测视频与音频 latent;VAE 解码为 768p 视频和立体声。

核心生成模型
步骤 3

Regenerate-2K

把 768p 结果与原始上下文重新输入 H3,以 in-context regeneration 而非传统超分辨率生成 2K。

可选的高分辨率再生成
图 1 · MiniMax H3 的三段式生成流程。后续章节主要分析 H3-Base。
02

输入如何进入模型

条件编码

H3 使用完整的 Qwen3-VL-32B 作为 H3-Encoder,并把第 50 层 hidden states 送入 Omni Transformer。视觉参考同时经过 Qwen3-VL 的视觉路径和 VisualVAE;音频则只经过 AudioVAE。

Table 1 · Qwen3-VL-32B 在 H3 中暴露的关键配置
部分配置技术含义
Text backbone64 层;hidden 5120不是 CLIP/T5 式附属编码器,而是一颗完整大模型
Attention64 Q heads / 8 KV headsGQA;head dim 为 128
Vision encoder27 层;hidden 1152输出投影到 5120 维,与文本表示对齐
H3 handoff第 50 层 hidden state生成主干接收中间层表示,而非语言模型最终 logits
Special tokens<d>、lyrics/caption token官方 tokenizer 配置属于模型契约,不能随意替换
03

视觉 latent

VisualVAE:因果 3D CNN 编码,ViT 解码

视觉编码器沿时间保持因果性,把视频压缩为 24 通道 latent;解码端不是对称 CNN,而是额外训练的 36 层 ViT3D。这种非对称结构让编码器侧重获得适合生成的 latent,让解码器侧重恢复画面细节。

原始像素3 × T × H × W视频像素
VAE latent24 × T/4 × H/16 × W/16f16t4d24
Transformer tokenT/4 × H/32 × W/32patch 1×2×2
NvF4H32W32N_{v} \approx \left\lceil \frac{F}{4} \right\rceil \cdot \frac{H}{32} \cdot \frac{W}{32}

视频 token 数的近似式。它忽略因果 padding、token drop 与具体分辨率对齐,只用于理解序列长度的数量级。

04

音频 latent

AudioVAE:共享权重、逐声道处理

左右声道使用同一套 encoder/decoder,但分别通过网络,最后再组合成立体声。每个声道把 32 kHz 波形压缩为 40 Hz、32 通道的连续 latent 序列。

输入32 kHz每个声道
编码器步幅2 × 4 × 4 × 5 × 5 = 800卷积时间压缩
输出40 Hz32-channel latent

源码中的 encoder 是分层 1D 卷积,随后用 attention projection 产生 Gaussian latent 的 mean 与 log-scale;解码端采用 BigVGAN。这里的“音频 token”不是离散 codec code,而是供生成模型预测的连续 latent。

05

统一生成主干

Omni Transformer 如何联合建模

这是一个 33B dense single-stream Transformer:attention 和 FFN 不包含模态专属结构;模态差异集中在输入/输出投影和 AdaLN 分支。位置采用覆盖时间与二维空间的 3D MM-RoPE。

层数50+ 2 层 refiner
隐藏维度5376text dim 5120
Attention56 × 128inner 7168
FFN 维度14336≈ 2.67 × hidden
位置编码MM-RoPE(t, h, w)

参数量交叉核算

核心 Transformer Python 实现不在模型仓库中,因此下面不是逐 tensor 精确盘点,而是按常见 Q/K/V/O 投影与 gated FFN 结构、结合配置宽度做的交叉核算。

每层 Attention
4dda4 d d_a
154.14M
每层 Gated FFN
3ddf3 d d_f
231.21M
50 层核心主干
50(4dda+3ddf)50(4dd_a + 3dd_f)
19.27B
50 层 AdaLN
50(dt18d+18d)50(d_t \cdot 18d + 18d)
13.01B
配置推导小计32.28B

再加输入/输出层、2 层 refiner、norm 与 embedding 后,与官方 33B 相符。尤其是 adaln_out_features = 96,768 = 18 × 5,376,使 AdaLN 分支自然落在约 13B 的数量级。

06

不同输入条件

任务模式

FL2VA 与 Ref2VA 使用相同的 Transformer、VisualVAE 和 AudioVAE 结构;差异落在任务专用权重和输入编排,而不是网络尺寸。两个 checkpoint 都是经过 CFG 蒸馏的 Omni Transformer。

Table 2 · 两个 checkpoint 的输入模式
Checkpoint任务条件输入结构差异
H3 Base FL2VAt2va、fl2va文本;可选首帧、尾帧或两者与 Ref2VA 配置相同,权重不同
H3 Base Ref2VAref2va文本 + 参考图像、视频和/或音频与 FL2VA 配置相同,权重不同

视频和音频使用独立 scheduler,配置中的 shift 分别为 123。这说明二者虽由同一 Transformer 联合预测,噪声时间表仍保留模态差异。

07

从条件到输出

一次生成如何完成

把前面的组件串起来,一次 H3-Base 推理可以理解为四个阶段。视频和音频虽然分别拥有 latent 空间与 scheduler,但它们在同一个 Transformer 中反复交换信息。

  1. 编码条件

    文本和视觉参考由 H3-Encoder 转换为 5120 维条件表示;参考视频和音频同时被各自的 VAE 压缩为 latent。

  2. 组织多模态序列

    文本、视觉 latent 与音频 latent 被投影到统一隐藏空间,并携带由 MM-RoPE 表示的时间和空间位置。

  3. 联合去噪

    Omni Transformer 在每个采样步同时更新视频与音频 latent。两种模态使用独立 scheduler,shift 分别为 123

  4. 分别解码

    VisualVAE 把视频 latent 还原为帧,AudioVAE 把左右声道 latent 还原为 32 kHz 立体声,二者按共同时间轴组成最终结果。

08

阅读时需要保留的未知项

公开资料的技术边界

公开代码足以理解模块组成和主要张量关系,但还不足以还原完整训练方法。下面这些问题会直接影响对模型能力、效率与可复现性的判断。

  • 训练过程:训练数据构成、清洗策略、完整目标函数和优化超参数尚未公开。
  • 稀疏注意力:模型卡说明训练后期采用原生 sparse attention,但当前发布只提供 full-attention 推理。
  • 上下文编排:H3-Context-IR 的指令解析、跨模态关联和语义补全由托管服务完成。
  • 2K 再生成:Regenerate-2K 的模型结构与训练方式尚未公开。
进一步研究时可追踪的问题
  1. H3-Context-IR 的模型组成、训练方法和序列化格式未公开。
  2. H3-Regenerate-2K 的结构、权重和训练细节未公开。
  3. 主 H3-Omni-Transformer 的完整训练代码与初始 sparse-attention 实现未随模型仓库发布。
  4. 训练数据、训练算力、优化目标、benchmark、ablation 与安全评测没有正式技术报告级披露。
·

继续阅读

参考实现

正文中的配置与结构说明来自官方模型卡和公开实现。具体文件默认收起,需要核对实现时再展开。

查看官方模型卡、配置与实现文件
  1. S1官方模型卡 ↗
  2. S2Modular Pipeline 索引 ↗
  3. S3H3-Encoder 配置 ↗
  4. S4H3-Omni-Transformer 配置 ↗
  5. S5VisualVAE 配置 ↗
  6. S6VisualVAE 实现 ↗
  7. S7AudioVAE 元数据 ↗
  8. S8AudioVAE 实现 ↗
  9. S9FL2VA 任务索引 ↗
  10. S10Ref2VA 任务索引 ↗