Cactus

社区项目Cactus Compute

面向手机、手表与机器人的全套端侧栈:量化、CUDA 级内核、运行时与推理引擎一体,把 LLM / Whisper / 扩散模型压进 4GB 内存设备。

项目形态
端侧推理引擎
许可
自定义(仓库未标注 SPDX)
发布
2025-04-23
收录
2026-10-03

它解决什么

端侧 LLM 的「最后一公里」是硬件差异:ARM 手机、RISC-V 手表、机器人控制器各玩各的。 Cactus 把量化、算子库、调度与推理引擎做成同一套 C++ 栈,跨 Android / iOS / 嵌入式 Linux 复用同一模型文件,官方宣称在 4GB 内存设备上能实时跑多模态模型。

什么时候用它

  • 产品形态是设备而不是服务器 → 它给的是一套可直接交付的运行时。
  • 已有 llama.cpp 但被「每个平台重新调」拖住 → 用它的统一栈替换。
  • 商用前先看许可:仓库未标注 SPDX,需与作者书面确认。

上手难点

  • 文档面向其商业产品线,社区教程少,排错主要靠 issue 区。
  • 深度绑定其量化格式,从 GGUF 迁移要跑一遍转换并重新验证精度。