prompt-cache

给 LLM 加个缓存,成本直降 80%,响应快到飞起

prompt-cache 是一个用 Go 编写的 LLM 代理,通过智能语义缓存将 LLM 调用成本降低最多 80%,并实现亚毫秒级响应。它作为即插即用的中间层,兼容任意 LLM 提供商,自动缓存相似的提示词和响应,避免重复调用昂贵的模型。核心能力包括语义相似度匹配、缓存命中判断、多提供商支持,以及低延迟的请求转发。该项目解决了 LLM 应用中重复查询导致的成本高、响应慢的问题,适合高频、相似请求的场景,如客服问答、代码补全等。当前处于早期阶段,但设计简洁,易于集成。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 409
维护状态 维护中
是否开源
定价模式 free

项目数据

分类搜索知识
开发团队messkan
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署。
访问状态
是否开源
开源协议MIT
主要语言Go
技术栈/模型ai,badgerdb,cache,claude,cost-optimization,go,langchain,llm,middleware,mistral,openai,performance,rag,rag-ai,semantic-search,vector-database
GitHub 星标★ 409
30天Star增速
HF 下载量
上线时间2025-11-22 00:00:00
最近更新2026-09-15 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 语义缓存精准,相似问题直接命中,不重复烧钱
  • Go 编写,代理层延迟极低,亚毫秒级响应
  • 不绑定厂商,兼容任意 LLM 服务,接入成本低

不足之处

  • 早期项目,GitHub 星标仅 244,生态和文档待完善
  • 语义匹配的准确性和误判率需在真实场景中验证

适用场景

  • 高频重复的客服问答系统,降低 API 费用
  • 企业内部知识库查询,加速响应
  • AI 编程助手,缓存常见代码生成请求

替代项目

GPTCache、RedisLangChain Cache、Semantic Cache (LiteLLM)

项目介绍

prompt-cache 是基础设施领域的开源项目,由 messkan 开发,2025 年首次发布。

它收录于基础设施分类,该分类目前共有 1,130 个项目,GitHub 星标数为 409。

项目仍在小幅维护中,最近一次代码更新于 2026-09-15。MIT许可证,完全免费,需自行部署。

它主要面向的使用场景是:高频重复的客服问答系统,降低API费用。同类可对比的替代方案包括 GPTCache、RedisLangChain Cache、Semantic Cache (LiteLLM)。

上一篇:cortexdb

下一篇:satoriDB

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09