flâneur

Prompt Cache: Modular Attention Reuse for Low-Latency Inference

arxiv.org · 7,138 words · saved by 1 readers

N/A

P ROMPT C ACHE : M ODULAR ATTENTION R EUSE FOR L OW-L ATENCY I NFERENCE In Gim 1 Guojun Chen 1 Seung-seob Lee 1 Nikhil Sarda 2 Anurag Khandelwal 1 Lin Zhong 1 A BSTRACT We present Prompt Cache, an approach for accelerating inference for large language models (LLM) by reusing arXiv:2311.04934v2 [cs.CL] 25 Apr 2024…

related reading