flâneur

Parallel CPU-GPU Execution for LLM Inference on Constrained GPUs

arxiv.org · 6,622 words · saved by 1 readers

N/A

APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs Jiakun Fan1 , Yanglin Zhang2 , Xiangchen Li1 , and Dimitrios S. Nikolopoulos1 1 Department of Computer Science, Virginia Tech…

saved by

related reading