给 llama.cpp 加一层可压缩的 KV cache 记忆,把长对话的历史从"全量缓存"变成"按需检索",显存占用随对话长度基本走平。
时间全部时间
2026 年 10 月 1
2026 年 9 月 1
2026 年 8 月 2
ISTA DASLab 的非均匀 GGUF 量化:GSQ 学每个张量的量化网格,RCO 在尺寸预算内给每个张量分配位宽,3.5 bpw 的 IQ3_S 在 AIME25 / LiveCodeBench 上与 BF16 基座打平,11.8 GB 起在原版 llama.cpp / Ollama 里就能跑。
把 2.78T 的 Kimi K3 跑进单 CPU + 8.24GB 内存的极端实验:纯 C99、无 BLAS 无框架无 GPU,MXFP4 量化 + AVX2 手写内核。
2026 年 7 月 1
2026 年 6 月 2
2026 年 4 月 1
2026 年 3 月 2
PrismML 的 Bonsai 2 27B 本地部署演示:三值(ternary)权重的完整 27B 级思考模型,5.9 GB、262K 上下文,带视觉与原生 tool calling,一条 setup 脚本在 Mac / Windows / Linux 上跑起来。
一条命令回答「我的机器上哪个本地 LLM 真正跑得动、跑得快」:用按硬件分档、按时间加权的新鲜基准排名,而不是看参数量。
2026 年 2 月 2
2026 年 1 月 1
2025 年 12 月 2
vLLM 的 Apple Silicon 社区硬件插件:Metal 后端对齐 vLLM 主接口,Mac 上用 vLLM 工作流(量化、OpenAI API、批处理)不用换框架。
原生 MLX 实现的 OpenAI / Anthropic 兼容推理服务器:连续批处理、多模态、MCP 工具调用全支持,给 Mac 上的 Claude Code / Agent 当本地后端。
2025 年 7 月 1
一套「在终端设备上本地跑 AI」的生产级 SDK:C++ 核心 + iOS / Android / Flutter / Web 绑定,把 LLM、VLM 与扩散模型压进手机和手表。
2025 年 6 月 1
2025 年 4 月 2
2025 年 3 月 1
2025 年 1 月 1
vLLM 的昇腾 NPU 社区硬件插件:同一套 vLLM 接口跑在国产算力上,国产 LLM(Qwen / DeepSeek / GLM 等)私有化部署的主要通道。