vllm-ascend

社区项目vLLM 社区(华为昇腾方向)

vLLM 的昇腾 NPU 社区硬件插件:同一套 vLLM 接口跑在国产算力上,国产 LLM(Qwen / DeepSeek / GLM 等)私有化部署的主要通道。

项目形态
硬件后端(昇腾 NPU)
许可
Apache-2.0
发布
2025-01-29
收录
2026-10-03

它解决什么

vLLM 的主干只覆盖 NVIDIA / 部分 AMD;昇腾 NPU 上想用同一套 API 与运维习惯, 就得靠这个社区维护的硬件插件:适配 CANN 运行时、移植 PagedAttention 等核心算子, 让「换卡不换代码」在国产算力上成立。

什么时候用它

  • 私有化部署落点是昇腾 910 系列 → 它是当前最完整的 vLLM 方案。
  • 已有 vLLM 运维经验、只做算力替换 → 启动参数与模型列表大体沿用主仓库。

上手难点

  • 版本耦合最紧:vLLM 主干、CANN、插件三方都要对得上,升级前先查兼容性矩阵。
  • 算子覆盖度落后主干,某些新模型结构要等社区移植。

可用的部署方式

vLLMvLLM 社区(原 UC Berkeley)

生产环境部署 LLM 的默认答案:PagedAttention 把 KV cache 碎片化问题解决掉,吞吐比朴素实现高一个量级。

推理框架 / 服务引擎PagedAttention张量并行FP8/AWQ/GPTQOpenAI 兼容 API多模态
GitHub ↗