KTransformers

部署方式KVCache.ai

CPU+GPU 混合推理框架:把 MoE 专家的激活放进 GPU、权重放内存,让消费级配置跑 DeepSeek 这类超大模型,中文社区活跃。

类型
推理框架 / 服务引擎
支持
CPU+GPU 异构推理 · GGUF 专家权重 · MoE 超大模型 · 本地微调 · OpenAI 兼容服务
上手难点
依赖多、环境搭建繁琐;模型支持清单短,冷门模型等社区补
许可
Apache-2.0
发布
2024-07-26
收录
2026-10-03

它解决什么

超大 MoE 模型(DeepSeek 671B 级)的权重放不进显存,但激活参数其实不大。 KTransformers 把“权重”留在 CPU 内存、把“激活计算”放进 GPU, 用 CPU-GPU 混合执行让 32G 显存 + 大内存的消费级配置也能跑 旗舰 MoE 模型。官方定位是“heterogeneous LLM inference/fine-tune optimizations”的灵活框架。

什么时候用它

  • 只有一张消费级 NVIDIA 卡 + 大内存,却想跑 DeepSeek 级 MoE → 它的招牌场景。
  • 内存带宽比显存更充裕的老工作站 → 利用率高于纯 CPU 方案。
  • 中文文档与教程多,社区答疑快。

上手难点

  • 环境依赖多(CUDA、特定库版本),Windows 与 Linux 都有踩坑报告。
  • 支持的模型清单远短于 vLLM / llama.cpp,新模型要等社区适配。
  • 吞吐低于多卡方案,属于“跑得起来”优先的方案。