Discrete & generative image models
Image tokenisers and models that generate images.
| Concept | Introduced by | Years | Papers |
|---|---|---|---|
| Discrete visual tokens (VQ-VAE) Compress images into a vocabulary of discrete codes so Transformers can model them like text. | VQ-VAE | 2017–2022 | 5 |
| Autoregressive text-to-image Transformer Model text and image tokens as one stream and sample images from text. | DALL·E | 2021–2022 | 4 |
| ViT-based image tokenizer A ViT-based VQGAN gives better image tokens for autoregressive image modelling. | ViT-VQGAN | 2021–2022 | 1 |