kvcached

让 GPU 显存像云硬盘一样弹性共享,多模型推理不再浪费缓存。

kvcached 是一个面向大语言模型推理场景的虚拟化弹性 KV 缓存管理框架,核心目标是解决多模型、多租户共享 GPU 时 KV 缓存资源利用率低、隔离性差的问题。它通过将 KV 缓存虚拟化,实现缓存的动态分配与弹性伸缩,支持在多个推理任务间按需共享 GPU 显存,从而提升整体吞吐和资源利用率。项目提供 Python 接口,可无缝集成主流推理引擎(如 vLLM、TGI),并支持细粒度的缓存调度策略,降低显存碎片化。其核心能力包括:缓存池化、动态扩容缩容、多租户隔离、以及基于负载的自动调优。适用于云服务商、AI 平台等需要高密度部署 LLM 服务的场景,能显著降低单请求成本。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1484
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队ovg-project
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自由使用和部署,无付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型elastic-kvcache,gpu-mutiplexing,gpu-sharing,inference-engine,kvcache,kvcache-optimization,kvcached,llm,llm-framework,llm-inference,llm-serving,ollama,online-offline-coserve,serverless,sglang,vllm
GitHub 星标★ 1484
30天Star增速
HF 下载量
上线时间2025-05-27 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 3.9 至 3.13(README 徽章标注的支持范围)
  • 已安装 pip,可访问 PyPI
  • 如需容器方式,需本机已安装 Docker 并能拉取 ghcr.io 镜像
  • GPU 推理引擎(vLLM / SGLang)由官方镜像自带,无需自行准备

安装与启动步骤

  1. 1确认 Python 版本

    kvcached 要求 Python 3.9~3.13,先检查本机版本是否落在该区间,不满足需先升级或切换环境。

    python --version
  2. 2从 PyPI 安装

    官方推荐方式,README 明确要求带上 --no-build-isolation 参数,建议在虚拟环境中执行。

    pip install kvcached --no-build-isolation
  3. 3拉取 SGLang 镜像

    若走容器方式,可拉取已集成 SGLang 的镜像,对应 kvcached-v0.1.5-sglang-v0.5.10。

    docker pull ghcr.io/ovg-project/kvcached-sglang:latest
  4. 4拉取 vLLM 镜像

    拉取集成 vLLM 的镜像,对应 kvcached-v0.1.5-vllm-v0.19.0,适合已有 vLLM 部署流程的用户。

    docker pull ghcr.io/ovg-project/kvcached-vllm:latest
  5. 5拉取开发镜像

    面向开发者的一站式镜像,包含完整开发环境,便于自行编译或二次开发调试。

    docker pull ghcr.io/ovg-project/kvcached-dev:latest

如何确认成功

执行 pip show kvcached 能显示版本信息;用 docker images 能看到已拉取的 kvcached 镜像。

常见问题

Q:支持哪些 Python 版本?

A:README 徽章标注支持 Python 3.9 到 3.13,低于 3.9 或高于 3.13 的版本未声明兼容,建议切换版本后再安装。

Q:安装时为什么建议加 --no-build-isolation?

A:README 给出的安装命令即为 pip install kvcached --no-build-isolation,直接照抄该参数可避免构建隔离导致的依赖问题。

Q:该用哪个 Docker 镜像?

A:按推理引擎选:用 SGLang 选 kvcached-sglang,用 vLLM 选 kvcached-vllm;需要开发调试环境则选 kvcached-dev。

Q:有 GB200 的镜像吗?

A:README 说明 GB200 的 Docker 镜像仍在准备中(on the way),暂未提供,可关注仓库后续更新。

Q:从哪里获取更多资料?

A:README 提供了 DeepWiki 文档、kvcached.org 主页、Slack 交流群以及两篇 arXiv 论文链接,可据此深入了解。

注意事项

  • README 中 Install from source 一节没有给出任何命令,源码安装需自行参考仓库内容。
  • Docker 相关的更多说明位于仓库的 docker/README.md,README 正文仅给出镜像拉取命令。
  • 项目采用 Apache 2.0 许可证。
  • 镜像标签 latest 会随版本更新,生产环境建议固定到实际版本标签。

核心亮点

  • 将 KV 缓存虚拟化,支持动态伸缩,显存利用率提升显著
  • 提供细粒度调度策略,减少缓存碎片,提升多租户隔离性
  • 与主流推理引擎(vLLM 等)集成简单,Python 接口友好

不足之处

  • 项目较新,生产环境稳定性案例不足
  • 文档和社区生态待观察

适用场景

  • 云服务商多租户 LLM 推理平台
  • 高并发多模型共享 GPU 集群
  • 边缘设备上动态调整缓存容量

替代项目

vLLM、SGLang、TensorRT-LLM

项目介绍

kvcached 是基础设施领域的开源项目,由 ovg-project 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,484)位列前 30%,在基础设施分类中处于中上游。

近 45 天,它的 GitHub 星标从 1,130 增加到 1,484,净增 354。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,可自由使用和部署,无付费版本。

它主要面向的使用场景是:云服务商多租户LLM推理平台。同类可对比的替代方案包括 vLLM、SGLang、TensorRT-LLM。

上一篇:llamafile

下一篇:ort

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09