CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credits
arxiv.org · 5,479 words · saved by 1 readers
N/A
CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit Kangyu Wang1,2,* , Zhiyun Jiang2,3,* , Haibo Feng2 , Weijia Zhao2 Lin Liu2 , Jianguo Li2,† , Zhenzhong Lan2,3,† , Weiyao Lin1,† 1 Shanghai Jiao Tong University, 2 Ant Group, 3 Westlake University…
related reading
- Speculative Decoding - philkravphilkrav.com
- Fast Inference from Transformers via Speculative Decodingarxiv.org
- Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decodingarxiv.org
- Speculative Decoding: How It Evolved, When It Stays Lossless, and What's Nextneurips2026-speculative-decoding.vercel.app
- From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Modelsarxiv.org
- Fast Inference from Transformers via Speculative Decodingarxiv.org
- How speculative decoding makes LLMs go brrr – Leonie Monigattileoniemonigatti.com
- Looking back at speculative decodingresearch.google
- Accelerating Diffusion LLMs via Adaptive Parallel Decodingarxiv.org
- Large Language Diffusion Modelsarxiv.org
- Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusionarxiv.org
- Wide-In, Narrow-Out: Revokable Decoding for Efficient and Effective DLLMsarxiv.org