时间全部时间
2026 年13
2025 年8

2026 年 10 月 1

KVMemkvmem 社区

给 llama.cpp 加一层可压缩的 KV cache 记忆,把长对话的历史从"全量缓存"变成"按需检索",显存占用随对话长度基本走平。

推理加速 / KV cacheMIT
GitHub ↗

2026 年 9 月 1

StrataNiko1221

面向 LLM Agent 的分层记忆方案:把工具输出、反思、事实分别落到不同层,按需组装进上下文,长任务不容易"忘事"。

Agent 记忆Apache-2.0
GitHub ↗

2026 年 8 月 2

Qwen3.8-27B GSQ-RCO GGUFISTA-DASLab · Qwen

ISTA DASLab 的非均匀 GGUF 量化:GSQ 学每个张量的量化网格,RCO 在尺寸预算内给每个张量分配位宽,3.5 bpw 的 IQ3_S 在 AIME25 / LiveCodeBench 上与 BF16 基座打平,11.8 GB 起在原版 llama.cpp / Ollama 里就能跑。

非均匀量化(GGUF)Apache-2.0
GitHub ↗HuggingFace ↗
kimi-k3-in-cFareedKhan-dev

把 2.78T 的 Kimi K3 跑进单 CPU + 8.24GB 内存的极端实验:纯 C99、无 BLAS 无框架无 GPU,MXFP4 量化 + AVX2 手写内核。

CPU 极限推理实验Apache-2.0
GitHub ↗

2026 年 7 月 1

kvpressNVIDIA 社区

把常用的 KV cache 压缩策略(淘汰、量化、低秩)收成一套统一接口,方便对比哪种压缩在自己的任务上掉点最少。

KV cache 压缩Apache-2.0
GitHub ↗

2026 年 6 月 2

DeepSpecDeepSeek

DeepSeek 开源的投机解码全栈代码库:训练 drafter、评估接受率与端到端加速比都在一套接口里,复现与改进投机解码方案的干净基线。

投机解码研究基线MIT
GitHub ↗
NInferNeroued

从零写的 C++/CUDA 单卡推理引擎:一张 RTX 5090 上跑 Qwen3.5 / 3.8 的 Dense 与 MoE,MTP3 投机解码加两级 KV 缓存,CLI 与 OpenAI / Anthropic 兼容 API,并官方发布 NVFP4 / groupwise-int 工件。

单 GPU 推理引擎Apache-2.0
GitHub ↗HuggingFace ↗

2026 年 4 月 1

LuceboxLuce

面向消费级 GPU 与异构硬件的投机推理服务器:投机解码 + 投机预填充 + 单 megakernel 调度,RTX 3090 / AMD R9700 这类卡上把 decode 延迟打下来。

投机推理服务器Apache-2.0
GitHub ↗

2026 年 3 月 2

Bonsai 2 27B DemoPrismML

PrismML 的 Bonsai 2 27B 本地部署演示:三值(ternary)权重的完整 27B 级思考模型,5.9 GB、262K 上下文,带视觉与原生 tool calling,一条 setup 脚本在 Mac / Windows / Linux 上跑起来。

本地部署演示Apache-2.0
GitHub ↗HuggingFace ↗
whichllmAndyyyy64

一条命令回答「我的机器上哪个本地 LLM 真正跑得动、跑得快」:用按硬件分档、按时间加权的新鲜基准排名,而不是看参数量。

本地选型 / 基准工具MIT
GitHub ↗

2026 年 2 月 2

picolmRightNow AI

把 1B 级 LLM 塞进 10 美元开发板 + 256MB 内存的嵌入式推理运行时:纯 C、极致量化,验证「LLM 下移到传感器边缘」的下限。

嵌入式推理运行时MIT
GitHub ↗
omlxjundot

Apple Silicon 上的本地 LLM 推理服务:连续批处理 + SSD 缓存权重,菜单栏常驻管理,Mac 上跑 DeepSeek / Qwen 这类大 MoE 的默认选择之一。

本地推理服务(Apple Silicon)Apache-2.0
GitHub ↗

2026 年 1 月 1

DFlashz-lab

用块扩散起草、自回归校验的投机解码方案:草稿一次出一块 token,接受率与加速比明显好于经典小模型 drafter,本地长文生成提速的热门路线。

投机解码MIT
GitHub ↗

2025 年 12 月 2

vllm-metalvLLM 社区(Apple Silicon 方向)

vLLM 的 Apple Silicon 社区硬件插件:Metal 后端对齐 vLLM 主接口,Mac 上用 vLLM 工作流(量化、OpenAI API、批处理)不用换框架。

硬件后端(Apple Silicon)Apache-2.0
GitHub ↗
vllm-mlxwaybarrios

原生 MLX 实现的 OpenAI / Anthropic 兼容推理服务器:连续批处理、多模态、MCP 工具调用全支持,给 Mac 上的 Claude Code / Agent 当本地后端。

本地推理服务(Apple Silicon)Apache-2.0
GitHub ↗

2025 年 7 月 1

Runanywhere SDKRunanywhereAI

一套「在终端设备上本地跑 AI」的生产级 SDK:C++ 核心 + iOS / Android / Flutter / Web 绑定,把 LLM、VLM 与扩散模型压进手机和手表。

端侧推理 SDK自定义(仓库未标注 SPDX)
GitHub ↗

2025 年 6 月 1

nano-vllmGeeeekExplorer

约 300 行 PyTorch 复现的「迷你 vLLM」:只保留 PagedAttention 与连续批处理两个核心机制,读一遍就能看懂生产推理引擎的骨架。

推理引擎教学实现MIT
GitHub ↗

2025 年 4 月 2

CactusCactus Compute

面向手机、手表与机器人的全套端侧栈:量化、CUDA 级内核、运行时与推理引擎一体,把 LLM / Whisper / 扩散模型压进 4GB 内存设备。

端侧推理引擎自定义(仓库未标注 SPDX)
GitHub ↗
ExLlamaV3turboderp

ExLlama 系列的第三代 CUDA 推理引擎:重写注意力与采样路径、引入全新量化体系,消费级显卡上 Dense / MoE 大模型吞吐的标杆之一。

CUDA 推理引擎MIT
GitHub ↗

2025 年 3 月 1

MLX-LMMLX (Apple) 社区

基于 Apple MLX 框架的 LLM 运行工具包:命令行聊天、微调、LoRA 训练、量化转换一条龙,Apple Silicon 本地玩法的核心入口。

本地推理 / 微调工具包(MLX)MIT
GitHub ↗

2025 年 1 月 1

vllm-ascendvLLM 社区(华为昇腾方向)

vLLM 的昇腾 NPU 社区硬件插件:同一套 vLLM 接口跑在国产算力上,国产 LLM(Qwen / DeepSeek / GLM 等)私有化部署的主要通道。

硬件后端(昇腾 NPU)Apache-2.0
GitHub ↗