KIVI

2bit 量化 KV Cache,长上下文推理显存减半不降质

KIVI 是一个针对大语言模型 KV Cache 的免调优非对称 2bit 量化工具,由 ICML 2024 论文提出。它解决的是长上下文场景下 KV Cache 内存占用过大、推理速度下降的问题。核心能力包括:对 Key 和 Value 采用非对称量化策略,Key 按通道量化以保留重要信息,Value 按 token 量化以降低延迟;支持 2bit 量化,在保持模型性能的同时显著减少显存占用;无需微调或重新训练,可直接应用于现有模型。KIVI 提供了 PyTorch 实现,支持主流模型架构,并集成了量化感知推理内核,实测可将 KV Cache 内存减少数倍,同时保持输出质量。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 432
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队jy-yuan
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型inference,large-language-models,llama,llm,natural-language-processing,quantization,transformer
GitHub 星标★ 432
30天Star增速
HF 下载量
上线时间2024-02-02 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 非对称量化设计:Key 按通道、Value 按 token,兼顾精度与速度
  • 免调优:无需微调或重新训练,即插即用
  • 实测效果显著:内存占用降低 2.6-4 倍,速度提升 1.7-2.4 倍

不足之处

  • 仅支持特定模型架构,通用性有限
  • 文档/社区待观察

适用场景

  • 长文本生成(如文档摘要、对话历史)
  • 显存受限的本地推理部署
  • 需要降低推理成本的服务端场景

替代项目

KVQuant、ZipKV、GEAR

项目介绍

KIVI 是模型训练领域的开源项目,由 jy-yuan 开发,2024 年首次发布。

它收录于模型训练分类,该分类目前共有 518 个项目,GitHub 星标数为 432。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:长文本生成(如文档摘要、对话历史)。同类可对比的替代方案包括 KVQuant、ZipKV、GEAR。

上一篇:OmniQuant

下一篇:EvoTune

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13