picolm

社区项目RightNow AI

把 1B 级 LLM 塞进 10 美元开发板 + 256MB 内存的嵌入式推理运行时:纯 C、极致量化,验证「LLM 下移到传感器边缘」的下限。

项目形态
嵌入式推理运行时
许可
MIT
发布
2026-02-19
收录
2026-10-03

它解决什么

「没有 SoC 级 NPU 的廉价设备能不能跑 LLM」一直是演示级问题。 picolm 用激进量化与精简解码器把 1B 模型的常驻内存压进 256MB, 在树莓派 / RISC-V 开发板上以可用速度出 token,把边缘推理的成本门槛往下打了一档。

什么时候用它

  • 设备成本敏感、联网不可靠的离线推理场景(工业传感、车载副驾)。
  • 评估「模型下移」的技术边界 → 它是当前公开仓库里最激进的下限样本。

上手难点

  • 模型上限就是 1B 级,别期待通用问答质量;它解决的是「在不在设备上」。
  • 运行时针对特定板型优化,换硬件要自己重调量化与内存布局。