ONNX Runtime GenAI

部署方式Microsoft

微软 ONNX Runtime 的生成式 AI 扩展,把 LLM 的 ONNX 形态跑在 Windows CPU/GPU 与 Azure 上,Windows 本地部署的官方路线之一。

类型
推理框架 / 服务引擎
支持
ONNX 模型格式 · Windows CPU / DirectML / CUDA · Azure 部署 · C / C++ / Python API
上手难点
生态小、模型覆盖面窄;要先把模型转成 ONNX
许可
MIT
发布
2023-11-13
收录
2026-10-03

它解决什么

很多企业 Windows 环境的默认推理运行时是 ONNX Runtime(视觉、NLP 都在用)。 onnxruntime-genai 把 LLM 接进同一个运行时:统一的 C/C++/Python API、 DirectML 与 CUDA 后端、可直接上 Azure。对“不引入新运行时”的 Windows 本地部署来说,这是微软的官方路线。

什么时候用它

  • Windows 环境、团队已有 ONNX Runtime 基建 → 加 LLM 不用换栈。
  • 要 C++ 原生嵌入(桌面应用内推理)→ API 层最友好。
  • 走 Azure 混合部署 → 本地与云上同一套模型格式。

上手难点

  • 模型要转 ONNX 格式,主流模型的官方 ONNX 权重少,自己转换质量要验证。
  • 社区与第三方生态远小于 llama.cpp / vLLM 阵营。
  • 高吞吐服务化能力有限,适合单机嵌入场景。