导读
摘要
MiniMax H3 的核心是一条统一的音视频生成链路。文本由 Qwen3-VL-32B 编码,参考图像和视频同时进入视觉编码路径与 VisualVAE,参考音频进入 AudioVAE;这些表示被组织成同一个多模态序列,交给 33B Omni Transformer 联合预测视频和音频 latent,最后再由两个 VAE 分别解码。
理解这套模型时,关键不在于记住每个配置值,而在于抓住两件事:第一,视频与音频不是两个串联模型的产物,而是在同一 Transformer 中联合建模;第二,Transformer 处理的不是原始像素和波形,而是经过强压缩、仍保留时空结构的连续 latent。
系统视角
整体架构
完整工作流分成上下文整理、基础生成和 2K 再生成三部分。学习模型结构时,重点是中间的 H3-Base:它接收已经整理好的多模态条件,在 latent 空间中联合生成视频与音频。
H3-Context-IR
解析自由形式的文本、图像、视频和音频,建立跨模态关联与时间关系,并补足未明确的语义细节。
上下文整理H3-Base
多编码器形成统一 packed sequence;Omni Transformer 联合预测视频与音频 latent;VAE 解码为 768p 视频和立体声。
核心生成模型Regenerate-2K
把 768p 结果与原始上下文重新输入 H3,以 in-context regeneration 而非传统超分辨率生成 2K。
可选的高分辨率再生成输入如何进入模型
条件编码
H3 使用完整的 Qwen3-VL-32B 作为 H3-Encoder,并把第 50 层 hidden states 送入 Omni Transformer。视觉参考同时经过 Qwen3-VL 的视觉路径和 VisualVAE;音频则只经过 AudioVAE。
| 部分 | 配置 | 技术含义 |
|---|---|---|
| Text backbone | 64 层;hidden 5120 | 不是 CLIP/T5 式附属编码器,而是一颗完整大模型 |
| Attention | 64 Q heads / 8 KV heads | GQA;head dim 为 128 |
| Vision encoder | 27 层;hidden 1152 | 输出投影到 5120 维,与文本表示对齐 |
| H3 handoff | 第 50 层 hidden state | 生成主干接收中间层表示,而非语言模型最终 logits |
| Special tokens | <d>、lyrics/caption token | 官方 tokenizer 配置属于模型契约,不能随意替换 |
视觉 latent
VisualVAE:因果 3D CNN 编码,ViT 解码
视觉编码器沿时间保持因果性,把视频压缩为 24 通道 latent;解码端不是对称 CNN,而是额外训练的 36 层 ViT3D。这种非对称结构让编码器侧重获得适合生成的 latent,让解码器侧重恢复画面细节。
视频 token 数的近似式。它忽略因果 padding、token drop 与具体分辨率对齐,只用于理解序列长度的数量级。
音频 latent
AudioVAE:共享权重、逐声道处理
左右声道使用同一套 encoder/decoder,但分别通过网络,最后再组合成立体声。每个声道把 32 kHz 波形压缩为 40 Hz、32 通道的连续 latent 序列。
源码中的 encoder 是分层 1D 卷积,随后用 attention projection 产生 Gaussian latent 的 mean 与 log-scale;解码端采用 BigVGAN。这里的“音频 token”不是离散 codec code,而是供生成模型预测的连续 latent。
统一生成主干
Omni Transformer 如何联合建模
这是一个 33B dense single-stream Transformer:attention 和 FFN 不包含模态专属结构;模态差异集中在输入/输出投影和 AdaLN 分支。位置采用覆盖时间与二维空间的 3D MM-RoPE。
参数量交叉核算
核心 Transformer Python 实现不在模型仓库中,因此下面不是逐 tensor 精确盘点,而是按常见 Q/K/V/O 投影与 gated FFN 结构、结合配置宽度做的交叉核算。
再加输入/输出层、2 层 refiner、norm 与 embedding 后,与官方 33B 相符。尤其是 adaln_out_features = 96,768 = 18 × 5,376,使 AdaLN 分支自然落在约 13B 的数量级。
不同输入条件
任务模式
FL2VA 与 Ref2VA 使用相同的 Transformer、VisualVAE 和 AudioVAE 结构;差异落在任务专用权重和输入编排,而不是网络尺寸。两个 checkpoint 都是经过 CFG 蒸馏的 Omni Transformer。
| Checkpoint | 任务 | 条件输入 | 结构差异 |
|---|---|---|---|
| H3 Base FL2VA | t2va、fl2va | 文本;可选首帧、尾帧或两者 | 与 Ref2VA 配置相同,权重不同 |
| H3 Base Ref2VA | ref2va | 文本 + 参考图像、视频和/或音频 | 与 FL2VA 配置相同,权重不同 |
视频和音频使用独立 scheduler,配置中的 shift 分别为 12 和 3。这说明二者虽由同一 Transformer 联合预测,噪声时间表仍保留模态差异。
从条件到输出
一次生成如何完成
把前面的组件串起来,一次 H3-Base 推理可以理解为四个阶段。视频和音频虽然分别拥有 latent 空间与 scheduler,但它们在同一个 Transformer 中反复交换信息。
- 编码条件
文本和视觉参考由 H3-Encoder 转换为 5120 维条件表示;参考视频和音频同时被各自的 VAE 压缩为 latent。
- 组织多模态序列
文本、视觉 latent 与音频 latent 被投影到统一隐藏空间,并携带由 MM-RoPE 表示的时间和空间位置。
- 联合去噪
Omni Transformer 在每个采样步同时更新视频与音频 latent。两种模态使用独立 scheduler,shift 分别为 12 和 3。
- 分别解码
VisualVAE 把视频 latent 还原为帧,AudioVAE 把左右声道 latent 还原为 32 kHz 立体声,二者按共同时间轴组成最终结果。
阅读时需要保留的未知项
公开资料的技术边界
公开代码足以理解模块组成和主要张量关系,但还不足以还原完整训练方法。下面这些问题会直接影响对模型能力、效率与可复现性的判断。
- 训练过程:训练数据构成、清洗策略、完整目标函数和优化超参数尚未公开。
- 稀疏注意力:模型卡说明训练后期采用原生 sparse attention,但当前发布只提供 full-attention 推理。
- 上下文编排:H3-Context-IR 的指令解析、跨模态关联和语义补全由托管服务完成。
- 2K 再生成:Regenerate-2K 的模型结构与训练方式尚未公开。
进一步研究时可追踪的问题
- H3-Context-IR 的模型组成、训练方法和序列化格式未公开。
- H3-Regenerate-2K 的结构、权重和训练细节未公开。
- 主 H3-Omni-Transformer 的完整训练代码与初始 sparse-attention 实现未随模型仓库发布。
- 训练数据、训练算力、优化目标、benchmark、ablation 与安全评测没有正式技术报告级披露。
继续阅读
参考实现
正文中的配置与结构说明来自官方模型卡和公开实现。具体文件默认收起,需要核对实现时再展开。