Mooncake

用缓存复用和分离式调度,让大模型服务又快又省

Mooncake 是 Moonshot AI 为其 Kimi 大语言模型服务打造的高性能推理平台,核心解决 LLM 服务中的高吞吐、低延迟和成本控制问题。它基于 KVCache 缓存复用技术,将预填充(prefill)和解码(decoding)阶段分离,通过分布式缓存和调度策略显著提升 GPU 利用率。平台支持 PagedAttention、Prefix Caching 等优化,并针对长上下文场景进行深度调优,使 Kimi 能够高效处理海量并发请求。Mooncake 以 C++ 实现,提供灵活的资源管理和弹性扩展能力,适用于大规模生产环境。其设计理念强调以缓存为中心,通过智能调度减少重复计算,从而降低服务成本并加速响应速度。

开源 unknown 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 6642
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类开源模型
开发团队kvcache-ai
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言C++
技术栈/模型disaggregation,inference,kvcache,llm,rdma,reinforcement-learning,sglang,tokenspeed,trt-llm,vllm
GitHub 星标★ 6642
30天Star增速
HF 下载量
上线时间2024-06-25 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • 已安装 Python 与 pip 的运行环境
  • NVIDIA GPU 及 CUDA 环境(README 按 CUDA 是否小于 13.0 区分安装包)
  • 如需其它加速器后端(华为、AMD、寒武纪、摩尔线程等)或从源码构建,需按官网文档准备
  • 多机部署需要 RDMA 等高速互联网络支持

安装与启动步骤

  1. 1确认 CUDA 版本

    Mooncake 依据 CUDA 版本提供两个 pip 安装包:CUDA 小于 13.0 与 CUDA 大于等于 13.0,需先确认本机 CUDA 版本再选择对应包。

  2. 2安装(CUDA<13.0)

    CUDA 版本低于 13.0 时安装 mooncake-transfer-engine,该包包含 Transfer Engine、Mooncake Store、Mooncake EP 与 PG。

    pip install mooncake-transfer-engine
  3. 3安装(CUDA≥13.0)

    CUDA 版本为 13.0 及以上时改用 mooncake-transfer-engine-cuda13,功能与前者一致,只是适配更高版本 CUDA。

    pip install mooncake-transfer-engine-cuda13
  4. 4查阅快速开始

    README 将完整安装与部署说明指向官网 Quick Start 与 Build from Source 文档,装完后按文档继续配置。

  5. 5对接推理框架

    按官网集成指南把 Mooncake 作为 SGLang 或 vLLM 的 KV 缓存传输与存储后端,用于 PD 分离部署。

如何确认成功

README 未给出启动验证命令,安装完成后请按官网 Quick Start 文档验证环境与后端是否可用。

常见问题

Q:应该安装哪个包?

A:看 CUDA 版本:CUDA 小于 13.0 安装 mooncake-transfer-engine;CUDA 大于等于 13.0 安装 mooncake-transfer-engine-cuda13。

Q:支持哪些硬件后端?

A:README 列出 NVIDIA、华为、AMD、寒武纪、摩尔线程、AWS、MetaX、平头哥、阿里云、Sunrise、海光、壁仞科技等,具体协议见官网 supported protocols 文档。

Q:如何从源码构建?

A:README 只提供了源码构建文档入口,见官网 getting_started/build.html,未在 README 中给出具体编译命令。

Q:如何接入 SGLang 或 vLLM?

A:使用官网给出的 SGLang 与 vLLM 集成指南,分别配置 PD 分离部署、分层 KV 缓存(HiCache)或分布式 KV 缓存池。

注意事项

  • 本教程内容全部来自 README 节选,官方完整说明以 https://kvcache-ai.github.io/Mooncake/ 文档为准。
  • README 仅提供 pip 安装方式,源码构建、Mooncake Store 部署等细节需查阅官网对应文档。
  • Mooncake 面向生产级大规模 LLM 推理场景,实际部署通常涉及多节点与 RDMA 网络,单机 pip 安装只是第一步。
  • 技术栈涉及 vLLM、SGLang、TRT-LLM 等,请确认目标推理框架版本与官网集成指南一致。

核心亮点

  • KVCache 复用大幅降低重复计算,提升吞吐
  • 分离式预填充/解码架构,优化长上下文场景
  • 生产级验证,支撑 Kimi 大规模服务

不足之处

  • 文档/社区待观察
  • 依赖特定硬件和复杂分布式部署

适用场景

  • 高并发 LLM API 服务
  • 长上下文对话场景
  • 成本敏感的大规模推理部署

替代项目

vLLM、TensorRT-LLM、SGLang

项目介绍

Mooncake 是基础设施领域的开源项目,由 kvcache-ai 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(6,642)位列前 7%,在基础设施分类的 1,132 个项目里位列前 11%。

近 41 天,它的 GitHub 星标从 6,255 增加到 6,642,净增 387。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。

它主要面向的使用场景是:高并发LLMAPI服务。同类可对比的替代方案包括 vLLM、TensorRT-LLM、SGLang。

上一篇:awesome-free-llm-apis

下一篇:agentops

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09