Moonlight-16B-A3B

LLM月之暗面 Moonshot AI

模型简介

Kimi 放出的 Muon 优化器验证模型,16B 只激活 3B,训练效率与效果都写进了技术报告。

参数量
16B (激活 3B)
上下文
32K
硬件
BF16 单张 40G 可跑
所属
Kimi
类型
纯文本
商用
可商用
许可
MIT
发布
2025-02-23
收录
2026-10-03

可用的部署方式

vLLMvLLM 社区(原 UC Berkeley)

生产环境部署 LLM 的默认答案:PagedAttention 把 KV cache 碎片化问题解决掉,吞吐比朴素实现高一个量级。

推理框架 / 服务引擎PagedAttention张量并行FP8/AWQ/GPTQOpenAI 兼容 API多模态
GitHub ↗
llama.cppggml-org(Georgi Gerganov 等)

纯 C/C++ 的推理实现,把大模型塞进 CPU、Mac 统一内存和各种边缘设备,GGUF 量化格式的事实标准。

推理框架 / 服务引擎GGUFCPU / Metal / CUDA / Vulkan1.5~8bit 量化无 Python 依赖
GitHub ↗
OllamaOllama

把"下载模型 + 量化 + 起服务"压成一条命令的工具,底层基于 llama.cpp,适合快速验证和个人本地使用。

一体化本地运行工具一行命令拉模型Modelfile 自定义OpenAI 兼容 APIGGUF跨平台
GitHub ↗