vLLMvLLM 社区(原 UC Berkeley)
生产环境部署 LLM 的默认答案:PagedAttention 把 KV cache 碎片化问题解决掉,吞吐比朴素实现高一个量级。
推理框架 / 服务引擎PagedAttention张量并行FP8/AWQ/GPTQOpenAI 兼容 API多模态
vLLM 的昇腾 NPU 社区硬件插件:同一套 vLLM 接口跑在国产算力上,国产 LLM(Qwen / DeepSeek / GLM 等)私有化部署的主要通道。
vLLM 的主干只覆盖 NVIDIA / 部分 AMD;昇腾 NPU 上想用同一套 API 与运维习惯, 就得靠这个社区维护的硬件插件:适配 CANN 运行时、移植 PagedAttention 等核心算子, 让「换卡不换代码」在国产算力上成立。