flâneur

Efficient Memory Management for Large Language Model Serving with PagedAttention

arxiv.org · 5,348 words · saved by 1 readers

N/A

Efficient Memory Management for Large Language Model Serving with PagedAttention Woosuk Kwon1,∗ Zhuohan Li1,∗ Siyuan Zhuang1 Ying Sheng1,2 Lianmin Zheng1 Cody Hao Yu3 Joseph E. Gonzalez1 Hao Zhang4 Ion Stoica1 1 UC Berkeley 2 Stanford University 3 Independent Researcher 4 UC San Diego…

related reading