Ollama
把"下载模型 + 量化 + 起服务"压成一条命令的工具,底层基于 llama.cpp,适合快速验证和个人本地使用。
- 类型
- 一体化本地运行工具
- 支持
- 一行命令拉模型 · Modelfile 自定义 · OpenAI 兼容 API · GGUF · 跨平台
- 上手难点
- 默认参数偏保守,性能调优空间小;服务端能力弱于专业推理引擎
- 许可
- MIT
- 发布
- 2023-07-24
- 收录
- 2026-10-02
它解决什么
自部署最大的摩擦不是推理,而是环境:装依赖、下权重、写配置、起服务。
Ollama 把这些收敛成 ollama run <model> 一条命令,
并且给了 Modelfile 来固化 system prompt 和参数——相当于模型的 Dockerfile。
什么时候用它
- 个人本地使用、原型验证、给非工程同事演示 → 最省时间。
- 想在自己的应用里快速接一个本地模型,需要 OpenAI 兼容接口 → 直接可用。
- 做 Agent 原型时把模型跑在笔记本上 → 它的资源占用比较友好。