LMCache

复用KV缓存,让LLM推理快如闪电

LMCache 是一个专为大型语言模型(LLM)推理场景设计的 KV 缓存加速层,旨在解决长上下文和多轮对话场景下推理速度慢、显存占用高的问题。它通过智能管理 KV 缓存(键值缓存)的存储、复用和分发,显著提升推理吞吐量并降低延迟。核心能力包括:跨请求的 KV 缓存复用、分层存储(显存/内存/磁盘)、分布式缓存共享,以及与 vLLM 等主流推理框架的无缝集成。LMCache 能够自动识别并复用重复的 KV 块,避免重复计算,从而在长序列生成、多轮对话、多智能体协作等场景下实现性能跃升。项目采用 Python 编写,提供灵活的配置接口,支持多种后端存储,并持续优化缓存策略,是当前 LLM 推理优化领域的重要基础设施。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 11892
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队LMCache
所属国家
官网地址https://lmcache.ai
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型amd,cuda,fast,inference,kv-cache,llm,pytorch,rocm,speed,vllm
GitHub 星标★ 11892
30天Star增速
HF 下载量
上线时间2024-05-28 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • 已安装 Python 与 pip 包管理器
  • 支持 CUDA 的 NVIDIA GPU 或 AMD ROCm 环境(项目技术栈含 cuda/rocm/amd)
  • 已安装并可运行 vLLM 等推理框架(如需与其集成)

安装与启动步骤

  1. 1准备运行环境

    准备一台带 GPU 的机器和 Python 环境,LMCache 面向 LLM 推理加速,README 标注支持 CUDA 与 AMD ROCm。

  2. 2安装 LMCache

    README 给出的唯一安装方式:用 pip 从包管理器安装 lmcache,建议在已激活的虚拟环境中执行。

    pip install lmcache
  3. 3验证安装成功

    在命令行导入 lmcache 模块,不报 ModuleNotFoundError 即说明包已正确安装到当前环境。

    python -c "import lmcache"
  4. 4查阅安装与快速开始

    README 未展开更多安装细节,更多安装选项和示例请前往官方 Installation 与 Quickstart 页面。

  5. 5参考配方与部署文档

    需要接入具体推理框架或做生产部署时,查阅 LMCache Recipes、CLI Reference、基准测试与生产部署文档。

如何确认成功

执行 python -c "import lmcache" 无报错,即表示包已安装成功。

常见问题

Q:怎么安装 LMCache?

A:README 只给出一种方式:pip install lmcache。更多安装选项和依赖说明请查看官方 Installation 文档(docs.lmcache.ai)。

Q:怎么和 vLLM 等推理框架配合使用?

A:README 指向官方 Quickstart(docs.lmcache.ai/getting_started/quickstart.html)和 LMCache Recipes,里面给出了与主流推理框架集成的示例。

Q:没有 NVIDIA GPU 可以用吗?

A:项目技术栈包含 rocm 和 amd,官方有 AMD MI300X 的基准测试博客,具体硬件与依赖要求请以 Installation 文档为准。

Q:生产环境怎么部署?

A:README 提供了 Production Deployment 文档链接(docs.lmcache.ai/mp/deployment.html),并提到新的多进程(MP)架构。

注意事项

  • 本教程仅依据 README 中出现的 pip install lmcache 编写,未包含任何 README 之外的参数或路径。
  • README 未给出端口、配置项和启动文件,具体配置请以官方文档 docs.lmcache.ai 为准。
  • 建议先 pip install lmcache,再按 Quickstart 接入现有推理服务。

核心亮点

  • 跨请求KV复用,长对话/多轮场景吞吐提升数倍
  • 分层存储(GPU/CPU/磁盘)自动调度,显存压力大减
  • 与vLLM深度集成,一行代码接入主流推理栈

不足之处

  • 文档/社区待观察
  • 对非vLLM框架的适配尚不完善

适用场景

  • 高并发多轮对话服务
  • 长文档问答与摘要生成
  • 多智能体协同推理

替代项目

vLLM、SGLang、KVQuant

项目介绍

LMCache 是基础设施领域的开源项目,由 LMCache 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(11,892)位列前 5%,在基础设施分类的 1,132 个项目里位列前 6%。

近 41 天,它的 GitHub 星标从 11,123 增加到 11,892,净增 769。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:高并发多轮对话服务。同类可对比的替代方案包括 vLLM、SGLang、KVQuant。

上一篇:gateway

下一篇:mistral-inference

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09