把"下载模型 + 量化 + 起服务"压成一条命令的工具,底层基于 llama.cpp,适合快速验证和个人本地使用。
一体化本地运行工具 2
支撑性生态 2
本地微调与量化(GGUF / MLX / FP8 / NVFP4 等)的事实标准工具,量化后直接喂给 llama.cpp 或 Ollama 就能跑。
Apple 官方的 Apple Silicon 数组计算框架,Mac 上本地跑 LLM 的主流底层(LM Studio 的 MLX 引擎、MLX-LM 都基于它)。
通用本地 AI 平台 3
自托管的本地 LLM Web 前端,原生对接 Ollama 与 OpenAI 兼容 API,内置 RAG 知识库与 MCP,团队共用本地模型的首选入口。
本地优先的 AI 工作台:内置向量库与 RAG,可对接 Ollama 等本地推理后端,把"模型 + 知识库 + 应用"装进一个产品里。
开源本地 AI 引擎:一个 OpenAI 兼容服务里跑 LLM、视觉、语音、图像、视频,官方口径"无 GPU 也能跑",Docker 一键起。
推理框架 / 服务引擎 10
纯 C/C++ 的推理实现,把大模型塞进 CPU、Mac 统一内存和各种边缘设备,GGUF 量化格式的事实标准。
生产环境部署 LLM 的默认答案:PagedAttention 把 KV cache 碎片化问题解决掉,吞吐比朴素实现高一个量级。
用 RadixAttention 做前缀缓存复用的推理引擎,多轮对话和批量同前缀请求的吞吐明显优于通用方案。
基于 ML 编译(TVM)的通用 LLM 部署引擎,同一套工具链把模型编译到桌面 GPU、iOS、Android、Web,跨端部署的代表作。
CPU+GPU 混合推理框架:把 MoE 专家的激活放进 GPU、权重放内存,让消费级配置跑 DeepSeek 这类超大模型,中文社区活跃。
NVIDIA 官方的 GPU 推理优化引擎:用 Python API 定义 LLM,在 NVIDIA GPU(含 Blackwell)上做状态最先进的推理优化。
单文件 C++ 的 GGUF 推理器,自带 Web 界面与 OpenAI 兼容 API,采样参数控制极细,创意写作与角色扮演社区的主力。
Intel 官方推理优化工具包,把模型优化部署到 Intel CPU / GPU / NPU,本地 LLM 在 Intel 平台上的官方路线。
Hugging Face 的文本生成推理服务,曾是与 vLLM 并列的两大托管推理引擎之一;仓库 2026-03 起归档、停止维护。
微软 ONNX Runtime 的生成式 AI 扩展,把 LLM 的 ONNX 形态跑在 Windows CPU/GPU 与 Azure 上,Windows 本地部署的官方路线之一。