SGLang
用 RadixAttention 做前缀缓存复用的推理引擎,多轮对话和批量同前缀请求的吞吐明显优于通用方案。
- 类型
- 推理框架 / 服务引擎
- 支持
- RadixAttention · 前缀缓存 · 结构化输出 · 多卡并行 · OpenAI 兼容 API
- 上手难点
- 生态与文档比 vLLM 薄,冷门模型支持滞后,出问题时要自己读源码
- 许可
- Apache-2.0
- 发布
- 2024-01-08
- 收录
- 2026-10-02
它解决什么
真实业务里大量请求共享前缀——同一个 system prompt、同一份长文档、 多轮对话的历史上下文。SGLang 用 RadixAttention 把这些前缀的 KV cache 建成基数树缓存, 命中后直接复用,省掉重复的 prefill。
在“长 system prompt + 高并发”的场景下,这个优化的收益经常比换硬件更明显。
什么时候用它
- 多轮对话、Agent 类应用、同一份文档被反复提问 → 收益最大。
- 需要强制 JSON / 正则约束输出 → 它的结构化输出实现比较成熟。
- 团队有能力读源码、愿意为性能多花调试时间。
上手难点
- 模型支持列表更新比 vLLM 慢,冷门模型可能要先等社区合并。
- 报错信息偏底层,遇到不支持的特性往往直接抛断言而非降级。
- 如果不是前缀复用场景,和 vLLM 的差距没想象中大,别为了追新而迁移。