picolm
把 1B 级 LLM 塞进 10 美元开发板 + 256MB 内存的嵌入式推理运行时:纯 C、极致量化,验证「LLM 下移到传感器边缘」的下限。
- 项目形态
- 嵌入式推理运行时
- 许可
- MIT
- 发布
- 2026-02-19
- 收录
- 2026-10-03
它解决什么
「没有 SoC 级 NPU 的廉价设备能不能跑 LLM」一直是演示级问题。 picolm 用激进量化与精简解码器把 1B 模型的常驻内存压进 256MB, 在树莓派 / RISC-V 开发板上以可用速度出 token,把边缘推理的成本门槛往下打了一档。
什么时候用它
- 设备成本敏感、联网不可靠的离线推理场景(工业传感、车载副驾)。
- 评估「模型下移」的技术边界 → 它是当前公开仓库里最激进的下限样本。
上手难点
- 模型上限就是 1B 级,别期待通用问答质量;它解决的是「在不在设备上」。
- 运行时针对特定板型优化,换硬件要自己重调量化与内存布局。