READING NOTES · GIVT

Transformer 不需要有限词表

把离散词表查找与 categorical logits 替换掉,自回归 Transformer 就能直接建模连续 latent 序列。
返回中文全文 →

两处替换就得到无限词表

INPUT向量线性投影
BACKBONEdecoder-only Transformer
OUTPUT多元 Gaussian mixture

“无限词表”不是维护一个无限大的字典,而是词元来自连续空间,理论上有无限多种取值。Transformer 仍按序列做 next-token prediction,只是每一步预测的是概率密度而非有限类别概率。

为什么输出用 Gaussian mixture

单个 Gaussian 难以表达多峰条件分布;mixture model 允许同一上下文对应多个合理的 latent。模型输出 mixture weight、mean 与 scale,再从该分布采样下一个连续向量。

这与后来的 MAR 有清晰分工:GIVT 用显式参数化的 Gaussian mixture 表达逐 token 分布,MAR 则用条件 diffusion 隐式表达更灵活的逐 token 分布。

实验为何不只看图像生成

  • 在 class-conditional ImageNet 上与 VQ-GAN、MaskGIT 和 latent diffusion 路线比较,检验连续 latent 是否能替代 VQ token。
  • 在 panoptic segmentation 与 depth estimation 上使用 UViM 变体,说明连续序列建模并不局限于自然图像采样。
  • 附录还检查无条件生成、CFG、FLOPs、中间表征与更多视觉样例。
批判性判断

GIVT 最有价值的贡献是拆掉“自回归模型必然等于离散 token”的概念绑定。它仍依赖两阶段 VAE latent,且 Gaussian mixture 的表达能力和数值稳定性会限制逐 token 分布;这也解释了 MAR 为什么继续探索 diffusion loss。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭