llm-d-kv-cache

把大模型KV缓存拆到多机,省显存提吞吐

llm-d-kv-cache 是一个用 Go 编写的分布式 KV 缓存调度与卸载库,面向大语言模型推理服务场景。它解决的核心问题是:在多实例、多轮对话或长上下文推理中,KV 缓存体积巨大且重复计算严重,单机显存难以承载,导致吞吐下降和延迟升高。该项目提供缓存的分片、调度和卸载能力,让推理引擎可以把 KV 缓存分布到多台机器或分层存储上,并在需要时按需取回,从而提升显存利用率、降低重复 prefill 开销。它属于 llm-d 生态的孵化组件,强调与推理框架解耦,以库的形式集成,适合构建分布式推理平台。当前项目处于早期阶段,星标数不高,接口和实现可能仍在快速演进。

开源 free 基础设施
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 178
维护状态 活跃
是否开源
定价模式 free

项目数据

分类基础设施
开发团队llm-d
所属国家
定价模式free
价格说明开源免费,属llm-d项目孵化组件
访问状态
是否开源
开源协议Apache-2.0
主要语言Go
技术栈/模型ai,incubating
GitHub 星标★ 178
30天Star增速
HF 下载量
上线时间2025-04-29 00:00:00
最近更新2026-09-15 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

核心亮点

  • 用 Go 实现,便于与 Go 生态的推理网关/调度器集成,部署轻量
  • 专注 KV 缓存的分片调度与卸载,切中大模型长上下文推理的显存瓶颈
  • 属于 llm-d 孵化项目,有明确的分布式推理生态定位,后续可复用其调度能力

不足之处

  • 项目处于早期,星标仅 177,API 和文档可能不稳定
  • 生态与案例较少,生产环境验证和社区支持有待观察

适用场景

  • 多实例大模型推理服务中,把 KV 缓存分布到多台机器以支撑长上下文
  • 推理平台需要按请求调度和卸载 KV 缓存,降低重复 prefill 计算
  • 构建分布式 LLM 推理网关时,作为缓存层组件集成到调度链路

替代项目

vLLM、SGLang

项目介绍

llm-d-kv-cache 是一个基础设施领域的开源项目,官方简介:Distributed KV cache scheduling & offloading libraries。项目使用 Go 开发,在 GitHub 上获得 177 星标。

上一篇:pathway

下一篇:vLLM-2080Ti-Definitive

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···

★ 202 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8576 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 435 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181269 2026-08-09