READING NOTES · MAR

序列之间自回归,token 内部做 diffusion

Diffusion Loss 取代 categorical cross-entropy,让 AR 与 masked AR 直接生成连续 VAE latent。
返回中文全文 →

最重要的分层视角

GLOBALTransformer 建模 token 依赖
CONDITION上下文产生条件向量
LOCALDiffusion 采样单个 token

MAR 没有用一个大 diffusion model 同时去噪整张 latent 图。Transformer 决定序列结构,小型 MLP diffusion network 只负责当前 token 的条件概率分布;两部分端到端联合训练。

Diffusion Loss 替换了什么

离散 AR 用 softmax 加交叉熵预测类别;连续 token 没有有限类别集合,因此论文把逐 token negative log-likelihood 的建模任务交给 diffusion objective。这样既保留 AR factorization,又不需要 vector quantizer。

同一个 loss 可以用于严格的 raster-order AR,也可以用于随机掩码顺序的 MAR,说明 loss 与序列生成顺序是可拆开的。

为什么 masked AR 更实用

逐 token raster sampling 太慢;MAR 每轮并行预测一批 masked token,并逐步降低 mask ratio,用更少迭代换取速度。论文的消融把 diffusion steps、采样步数、mask schedule 与 classifier-free guidance 分开考察。

与 GIVT 的关系

  • 共同点:都否定“AR 必须使用 vector-quantized token”。
  • GIVT:输出显式 Gaussian mixture,保留 causal decoder 路线。
  • MAR:输出条件 diffusion distribution,并把 masked autoregressive generation 作为主力实现。
批判性判断

MAR 的漂亮之处是模块边界清晰,但“无需 vector quantization”不等于“无需 tokenizer”:它仍依赖连续 VAE encoder/decoder。性能应理解为序列模型、连续 tokenizer、diffusion loss 和 CFG 的联合结果。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭