两处替换就得到无限词表
INPUT向量线性投影
BACKBONEdecoder-only Transformer
OUTPUT多元 Gaussian mixture
“无限词表”不是维护一个无限大的字典,而是词元来自连续空间,理论上有无限多种取值。Transformer 仍按序列做 next-token prediction,只是每一步预测的是概率密度而非有限类别概率。
为什么输出用 Gaussian mixture
单个 Gaussian 难以表达多峰条件分布;mixture model 允许同一上下文对应多个合理的 latent。模型输出 mixture weight、mean 与 scale,再从该分布采样下一个连续向量。
这与后来的 MAR 有清晰分工:GIVT 用显式参数化的 Gaussian mixture 表达逐 token 分布,MAR 则用条件 diffusion 隐式表达更灵活的逐 token 分布。
实验为何不只看图像生成
- 在 class-conditional ImageNet 上与 VQ-GAN、MaskGIT 和 latent diffusion 路线比较,检验连续 latent 是否能替代 VQ token。
- 在 panoptic segmentation 与 depth estimation 上使用 UViM 变体,说明连续序列建模并不局限于自然图像采样。
- 附录还检查无条件生成、CFG、FLOPs、中间表征与更多视觉样例。
GIVT 最有价值的贡献是拆掉“自回归模型必然等于离散 token”的概念绑定。它仍依赖两阶段 VAE latent,且 Gaussian mixture 的表达能力和数值稳定性会限制逐 token 分布;这也解释了 MAR 为什么继续探索 diffusion loss。