vLLM 简介
vLLM 是 UC Berkeley 开源的 LLM 推理框架,通过 PagedAttention 技术实现接近零浪费的 KV 缓存管理。
快速开始
pip install vllm
vllm serve meta-llama/Llama-3-8B
PagedAttention
传统 KV 缓存管理存在严重的内存碎片问题。PagedAttention 借鉴操作系统的虚拟内存分页思想,将 KV 缓存划分为固定大小的 block。
vLLM 的吞吐量相比 HuggingFace Transformers 提升可达 10-20 倍,是生产环境部署的首选方案。