vLLM
生产环境部署 LLM 的默认答案:PagedAttention 把 KV cache 碎片化问题解决掉,吞吐比朴素实现高一个量级。
- 类型
- 推理框架 / 服务引擎
- 支持
- PagedAttention · 张量并行 · FP8/AWQ/GPTQ · OpenAI 兼容 API · 多模态
- 上手难点
- 版本迭代快,参数名和模型支持列表跨版本变化大,务必锁定版本再上生产
- 许可
- Apache-2.0
- 发布
- 2023-06-20
- 收录
- 2026-10-02
它解决什么
自回归推理的瓶颈不在算力,而在显存里的 KV cache 管理。 vLLM 用操作系统的虚拟内存思路做 PagedAttention,把 KV cache 分页复用, 显存浪费从 60~80% 降到个位数,同样的卡能塞下数倍的并发。
这是过去两年“自部署 LLM 成本下降”最主要的技术原因之一。
什么时候用它
- 要对外提供 API,且关注吞吐和并发成本 → 首选。
- 需要 OpenAI 兼容接口,让现有客户端无痛切换 → 一条命令就能起。
- 需要多卡张量并行、FP8 量化、结构化输出 → 都原生支持。