Scalable High-Resolution Pixel-Space Image Synthesis with Hourglass Diffusion Transformers
arxiv.org · 5,843 words · saved by 1 readers
N/A
Scalable High-Resolution Pixel-Space Image Synthesis with Hourglass Diffusion Transformers Katherine Crowson * 1 Stefan Andreas Baumann * 2 Alex Birch * 3 Tanishq Mathew Abraham 1 Daniel Z. Kaplan 4 Enrico Shippole 5 Abstract arXiv:2401.11605v2 [cs.CV] 25 Mar 2026 We present…
related reading
- Scalable Diffusion Models with Transformersopenaccess.thecvf.com
- Scalable Diffusion Models with Transformersarxiv.org
- Fast Training of Diffusion Models with Masked Transformers | PDFarxiv.org
- [2112.10752] High-Resolution Image Synthesis with Latent Diffusion Modelsarxiv.org
- What are Diffusion Models? | Lil'Loglilianweng.github.io
- What are Diffusion Models?lilianweng.github.io
- High Fidelity Image Generation Using Diffusion Modelsai.googleblog.com
- [2605.05331] ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parametersarxiv.org
- ⭐️ Diffusion Modelsandrewkchan.dev
- [2404.02905] Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Predictionarxiv.org
- [2006.11239] Denoising Diffusion Probabilistic Modelsarxiv.org
- 2408.11039arxiv.org