vLLM 简介

vLLM 是 UC Berkeley 开源的 LLM 推理框架,通过 PagedAttention 技术实现接近零浪费的 KV 缓存管理。

快速开始

pip install vllm
vllm serve meta-llama/Llama-3-8B

PagedAttention

传统 KV 缓存管理存在严重的内存碎片问题。PagedAttention 借鉴操作系统的虚拟内存分页思想,将 KV 缓存划分为固定大小的 block。

vLLM 的吞吐量相比 HuggingFace Transformers 提升可达 10-20 倍,是生产环境部署的首选方案。