Accelerating Diffusion LLMs via Adaptive Parallel Decoding
arxiv.org · 7,032 words · saved by 1 readers
N/A
Accelerating Diffusion LLMs via Adaptive Parallel Decoding Daniel Israel Guy Van den Broeck Department of Computer Science Department of Computer Science University of California, Los Angeles University of California, Los Angeles disrael@cs.ucla.edu…
related reading
- Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decodingarxiv.org
- Speculative Decoding - philkravphilkrav.com
- Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusionarxiv.org
- Fast-dLLM v2nvlabs.github.io
- Fast Inference from Transformers via Speculative Decodingarxiv.org
- Speculative Decoding: How It Evolved, When It Stays Lossless, and What's Nextneurips2026-speculative-decoding.vercel.app
- Looking back at speculative decodingresearch.google
- How speculative decoding makes LLMs go brrr – Leonie Monigattileoniemonigatti.com
- Fast Inference from Transformers via Speculative Decodingarxiv.org
- Large Language Diffusion Modelsarxiv.org
- Decoding Speculative Decoding from First Principlesjwlabs.vercel.app
- TiDAR: Think in Diffusion, Talk in Autoregressionalphaxiv.org