一体化本地运行工具 2

OllamaOllama

把"下载模型 + 量化 + 起服务"压成一条命令的工具,底层基于 llama.cpp,适合快速验证和个人本地使用。

一体化本地运行工具一行命令拉模型Modelfile 自定义OpenAI 兼容 APIGGUF跨平台
GitHub ↗
LM StudioElement Labs(LM Studio)

桌面版"一键本地 LLM":应用内下载模型、聊天、起本地 OpenAI 兼容服务,运行时是 llama.cpp 加 Apple MLX 双引擎。

一体化本地运行工具应用内下载模型内置聊天界面本地 OpenAI 兼容服务llama.cpp + MLX 双引擎lms CLI / Python / JS SDK
GitHub ↗

支撑性生态 2

UnslothUnsloth AI

本地微调与量化(GGUF / MLX / FP8 / NVFP4 等)的事实标准工具,量化后直接喂给 llama.cpp 或 Ollama 就能跑。

支撑性生态GGUF / MLX / FP8 / NVFP4 量化4bit 快微调128K 上下文训练本地运行 UIHF 量化工作流
GitHub ↗
MLXML Explore(Apple)

Apple 官方的 Apple Silicon 数组计算框架,Mac 上本地跑 LLM 的主流底层(LM Studio 的 MLX 引擎、MLX-LM 都基于它)。

支撑性生态Apple Silicon 统一内存懒求值计算图与 NumPy / PyTorch 互操作训练 + 推理
GitHub ↗

通用本地 AI 平台 3

Open WebUIOpen WebUI 社区

自托管的本地 LLM Web 前端,原生对接 Ollama 与 OpenAI 兼容 API,内置 RAG 知识库与 MCP,团队共用本地模型的首选入口。

通用本地 AI 平台Ollama / OpenAI 兼容后端RAG 知识库多用户与权限MCP自托管
GitHub ↗
AnythingLLMMintplex Labs

本地优先的 AI 工作台:内置向量库与 RAG,可对接 Ollama 等本地推理后端,把"模型 + 知识库 + 应用"装进一个产品里。

通用本地 AI 平台本地向量库RAG 知识库Ollama 等后端接入桌面版 / Docker 版agent 工作流
GitHub ↗
LocalAImudler(社区)

开源本地 AI 引擎:一个 OpenAI 兼容服务里跑 LLM、视觉、语音、图像、视频,官方口径"无 GPU 也能跑",Docker 一键起。

通用本地 AI 平台LLM / 视觉 / 语音 / 图像 / 视频OpenAI 兼容 APIDocker 部署无 GPU 运行后端可换(llama.cpp 等)
GitHub ↗

推理框架 / 服务引擎 10

llama.cppggml-org(Georgi Gerganov 等)

纯 C/C++ 的推理实现,把大模型塞进 CPU、Mac 统一内存和各种边缘设备,GGUF 量化格式的事实标准。

推理框架 / 服务引擎GGUFCPU / Metal / CUDA / Vulkan1.5~8bit 量化无 Python 依赖
GitHub ↗
vLLMvLLM 社区(原 UC Berkeley)

生产环境部署 LLM 的默认答案:PagedAttention 把 KV cache 碎片化问题解决掉,吞吐比朴素实现高一个量级。

推理框架 / 服务引擎PagedAttention张量并行FP8/AWQ/GPTQOpenAI 兼容 API多模态
GitHub ↗
SGLangSGLang 社区(LMSYS / 上海交大等)

用 RadixAttention 做前缀缓存复用的推理引擎,多轮对话和批量同前缀请求的吞吐明显优于通用方案。

推理框架 / 服务引擎RadixAttention前缀缓存结构化输出多卡并行OpenAI 兼容 API
GitHub ↗
MLC-LLMMLC-AI 社区

基于 ML 编译(TVM)的通用 LLM 部署引擎,同一套工具链把模型编译到桌面 GPU、iOS、Android、Web,跨端部署的代表作。

推理框架 / 服务引擎TVM/MLC 编译Metal / CUDA / VulkaniOS / Android 端侧WebAssembly 浏览器部署C API
GitHub ↗
KTransformersKVCache.ai

CPU+GPU 混合推理框架:把 MoE 专家的激活放进 GPU、权重放内存,让消费级配置跑 DeepSeek 这类超大模型,中文社区活跃。

推理框架 / 服务引擎CPU+GPU 异构推理GGUF 专家权重MoE 超大模型本地微调OpenAI 兼容服务
GitHub ↗
TensorRT-LLMNVIDIA

NVIDIA 官方的 GPU 推理优化引擎:用 Python API 定义 LLM,在 NVIDIA GPU(含 Blackwell)上做状态最先进的推理优化。

推理框架 / 服务引擎CUDA / BlackwellMoE张量并行Python API 建模C++ 运行时
GitHub ↗
KoboldCppKobold AI 社区(LostRuins)

单文件 C++ 的 GGUF 推理器,自带 Web 界面与 OpenAI 兼容 API,采样参数控制极细,创意写作与角色扮演社区的主力。

推理框架 / 服务引擎GGUF内置 Web UIOpenAI 兼容 API细粒度采样参数跨平台单文件二进制
GitHub ↗
OpenVINOIntel

Intel 官方推理优化工具包,把模型优化部署到 Intel CPU / GPU / NPU,本地 LLM 在 Intel 平台上的官方路线。

推理框架 / 服务引擎Intel CPU / iGPU / Arc GPU / NPULLM 推理(OpenVINO GenAI)模型优化与量化多后端统一 API
GitHub ↗
TGI(Text Generation Inference)Hugging Face

Hugging Face 的文本生成推理服务,曾是与 vLLM 并列的两大托管推理引擎之一;仓库 2026-03 起归档、停止维护。

推理框架 / 服务引擎Flash Attention连续批处理OpenAI 兼容接口HF Inference Endpoints 同款技术栈
GitHub ↗
ONNX Runtime GenAIMicrosoft

微软 ONNX Runtime 的生成式 AI 扩展,把 LLM 的 ONNX 形态跑在 Windows CPU/GPU 与 Azure 上,Windows 本地部署的官方路线之一。

推理框架 / 服务引擎ONNX 模型格式Windows CPU / DirectML / CUDAAzure 部署C / C++ / Python API
GitHub ↗