TGI(Text Generation Inference)

部署方式Hugging Face已停止维护

Hugging Face 的文本生成推理服务,曾是与 vLLM 并列的两大托管推理引擎之一;仓库 2026-03 起归档、停止维护。

类型
推理框架 / 服务引擎
支持
Flash Attention · 连续批处理 · OpenAI 兼容接口 · HF Inference Endpoints 同款技术栈
上手难点
仓库已归档(archived),只读维护,新项目不建议再选
许可
Apache-2.0
发布
2022-10-08
收录
2026-10-03

它解决什么

TGI 是 Hugging Face 官方推理服务(Inference Endpoints)背后的开源引擎: Flash Attention + 连续批处理,把 HF 模型库里的模型直接变成 OpenAI 兼容的 HTTP 服务。过去两年它和 vLLM 是托管推理的两个默认选项。

什么时候用它

  • 存量系统已经在用 TGI → 继续维护没问题,镜像和文档都还在。
  • 了解 HF Inference Endpoints 的底层机制 → 看它的实现最直接。
  • 新项目不建议再选:仓库已归档,功能冻结。

上手难点

  • 已归档意味着安全修复与模型支持都不再跟进,长期风险明确。
  • 性能上限低于当前活跃的 vLLM / TensorRT-LLM 优化路线。
  • 迁移成本低(接口同为 OpenAI 兼容),没有留下的强理由。