
llm-d-kv-cache
把大模型KV缓存拆到多机,省显存提吞吐
llm-d-kv-cache 是一个用 Go 编写的分布式 KV 缓存调度与卸载库,面向大语言模型推理服务场景。它解决的核心问题是:在多实例、多轮对话或长上下文推理中,KV 缓存体积巨大且重复计算严重,单机显存难以承载,导致吞吐下降和延迟升高。该项目提供缓存的分片、调度和卸载能力,让推理引擎可以把 KV 缓存分布到多台机器或分层存储上,并在需要时按需取回,从而提升显存利用率、降低重复 prefill 开销。它属于 llm-d 生态的孵化组件,强调与推理框架解耦,以库的形式集成,适合构建分布式推理平台。当前项目处于早期阶段,星标数不高,接口和实现可能仍在快速演进。
开源
free
基础设施
GitHub 星标
★ 178
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类基础设施
开发团队llm-d
所属国家
定价模式free
价格说明开源免费,属llm-d项目孵化组件
访问状态
是否开源是
开源协议Apache-2.0
主要语言Go
技术栈/模型ai,incubating
GitHub 星标★ 178
30天Star增速
HF 下载量
上线时间2025-04-29 00:00:00
最近更新2026-09-15 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0
使用教程
核心亮点
- 用 Go 实现,便于与 Go 生态的推理网关/调度器集成,部署轻量
- 专注 KV 缓存的分片调度与卸载,切中大模型长上下文推理的显存瓶颈
- 属于 llm-d 孵化项目,有明确的分布式推理生态定位,后续可复用其调度能力
不足之处
- 项目处于早期,星标仅 177,API 和文档可能不稳定
- 生态与案例较少,生产环境验证和社区支持有待观察
适用场景
- 多实例大模型推理服务中,把 KV 缓存分布到多台机器以支撑长上下文
- 推理平台需要按请求调度和卸载 KV 缓存,降低重复 prefill 计算
- 构建分布式 LLM 推理网关时,作为缓存层组件集成到调度链路
替代项目
vLLM、SGLang
项目介绍
上一篇:pathway
同类项目推荐
freebuff-proxy
开源
聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。
OpenAI-compatible gateway for FreeBuff coding models. Token pool, session lifecycle,···
microduck
开源
用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。
A Tiny biped duck robot
soperator
开源
用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。
Run Slurm in Kubernetes
ollama
开源
一条命令本地跑起大模型,免费、私密、不卡顿
Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···