kv-cache

本站收录 10 个带「kv-cache」标签的 AI 开源项目

LMCacheLMCache 是一个专为大型语言模型(LLM)推理场景设计的 KV 缓存加速层,旨在解决长上下文和多轮对话场景下推理速度慢、显存占用高的问题。它通过智能管理 ★ 11,941zero-to-sglangzero-to-sglang 是 SGLang 官方与 Datawhale 联合推出的 LLM 推理学习课程,面向想深入理解大模型推理引擎的开发者。它解决的是「★ 1,323kvpresskvpress 是一个专注于大语言模型(LLM)KV 缓存压缩的 Python 库,旨在让 KV 缓存压缩变得简单易用。它解决了长上下文推理中 KV 缓存占用大★ 1,222llm_notellm_note 是一个面向大语言模型学习者的开源笔记仓库,用 Python 编写,内容覆盖模型推理、Transformer 结构解析以及主流 LLM 框架的源★ 892pegainferpegainfer 是一个用纯 Rust 编写的 LLM 推理引擎,底层直接调用 CUDA 内核,不依赖 PyTorch 或任何 Python 运行时。它解决的★ 712C2CC2C 是论文《Cache-to-Cache: Direct Semantic Communication Between Large Language Mod★ 690mixture_of_recursionsMixture-of-Recursions(MoR)是一个面向大语言模型训练与推理的递归 Transformer 架构实现,论文已被 NeurIPS 2025 ★ 632Awesome-KV-Cache-Optimization这是一个面向大模型推理服务的 KV Cache 优化综述仓库,对应 ACL 2026 论文《Towards Efficient Large Language M★ 415spectralquantSpectralQuant 是一个针对大语言模型推理时 KV-Cache 压缩的开源工具库。它通过特征基旋转(Eigenbasis Rotation)和基于注水★ 203awesome-llm-token-optimization这是一个精选资源列表,汇集了降低大语言模型(LLM)Token 成本、提升生产环境效率的策略、工具、论文和资源。它解决的核心问题是 LLM 使用中 Token ★ 82