最重要的分层视角
GLOBALTransformer 建模 token 依赖
CONDITION上下文产生条件向量
LOCALDiffusion 采样单个 token
MAR 没有用一个大 diffusion model 同时去噪整张 latent 图。Transformer 决定序列结构,小型 MLP diffusion network 只负责当前 token 的条件概率分布;两部分端到端联合训练。
Diffusion Loss 替换了什么
离散 AR 用 softmax 加交叉熵预测类别;连续 token 没有有限类别集合,因此论文把逐 token negative log-likelihood 的建模任务交给 diffusion objective。这样既保留 AR factorization,又不需要 vector quantizer。
同一个 loss 可以用于严格的 raster-order AR,也可以用于随机掩码顺序的 MAR,说明 loss 与序列生成顺序是可拆开的。
为什么 masked AR 更实用
逐 token raster sampling 太慢;MAR 每轮并行预测一批 masked token,并逐步降低 mask ratio,用更少迭代换取速度。论文的消融把 diffusion steps、采样步数、mask schedule 与 classifier-free guidance 分开考察。
与 GIVT 的关系
- 共同点:都否定“AR 必须使用 vector-quantized token”。
- GIVT:输出显式 Gaussian mixture,保留 causal decoder 路线。
- MAR:输出条件 diffusion distribution,并把 masked autoregressive generation 作为主力实现。
MAR 的漂亮之处是模块边界清晰,但“无需 vector quantization”不等于“无需 tokenizer”:它仍依赖连续 VAE encoder/decoder。性能应理解为序列模型、连续 tokenizer、diffusion loss 和 CFG 的联合结果。