TensorRT-LLM

部署方式NVIDIA

NVIDIA 官方的 GPU 推理优化引擎:用 Python API 定义 LLM,在 NVIDIA GPU(含 Blackwell)上做状态最先进的推理优化。

类型
推理框架 / 服务引擎
支持
CUDA / Blackwell · MoE · 张量并行 · Python API 建模 · C++ 运行时
上手难点
绑定 NVIDIA 硬件;构建与版本链复杂,模型适配周期长于 vLLM
许可
自定义(GitHub 标注 NOASSERTION)
发布
2023-08-16
收录
2026-10-03

它解决什么

在 NVIDIA 卡上把吞吐挤到极限。TensorRT-LLM 把模型编译成高度优化的 kernel 组合(算子融合、in-flight batching、KV cache 管理), 官方定位是“easy-to-use Python API to define LLMs”加 “state-of-the-art optimizations”。NVIDIA 自己的推理服务(DGX / 推理云产品)底层就是它。

什么时候用它

  • 全是 NVIDIA 卡、追求极限吞吐/成本比 → 通常比通用引擎再快一截。
  • 要和 NVIDIA 官方工具链(NeMo、Triton)对齐 → 配套最顺。
  • 要 C++ 运行时嵌入自己的服务 → 它提供 Python 与 C++ 两侧。

上手难点

  • 硬件锁定 NVIDIA,混合环境或 AMD 卡用不上。
  • 版本迭代快、模型支持有滞后,新模型出来通常先等 vLLM。
  • 构建/环境链(容器、CUDA 版本)比 pip 装的引擎麻烦不少。