llm-compressor

一键压缩大模型,vLLM 直接跑,省显存提吞吐

llm-compressor 是 vLLM 团队推出的 LLM 压缩工具库,与 Hugging Face Transformers 无缝兼容。它解决的核心问题是:大模型部署时显存占用高、推理速度慢,而现有量化方案往往与推理框架脱节,需要手动转换格式。该库内置多种压缩算法,包括 GPTQ、AWQ、SmoothQuant、INT8/FP8 量化以及稀疏化等,可直接对 Transformers 模型进行压缩,并输出 vLLM 可直接加载的格式,省去中间转换环节。它支持校准数据集配置、逐层量化策略和多种精度选择,让开发者能在精度损失可控的前提下显著降低模型体积、提升吞吐。作为 vLLM 生态的官方配套工具,它把量化从研究脚本变成了可复用的工程流程,适合需要在生产环境部署大模型的团队使用。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3795
维护状态 活跃
是否开源
定价模式 free

项目数据

分类模型训练
开发团队vllm-project
所属国家
定价模式free
价格说明开源免费,Apache 2.0 许可证
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型compression,quantization
GitHub 星标★ 3795
30天Star增速
HF 下载量
上线时间2024-06-20 00:00:00
最近更新2026-09-18 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

难度:入门 约 5 分钟 部署方式:库/依赖 3 步

环境要求

  • Python 环境(README 未指定最低版本,需自行确认)
  • 已安装 pip 包管理器
  • 需要联网访问 PyPI 下载依赖

安装与启动步骤

  1. 1安装 llmcompressor

    README 中给出的唯一安装方式,直接用 pip 从 PyPI 安装该库,会自动拉取相关依赖。

    pip install llmcompressor
  2. 2验证是否安装成功

    在 Python 中导入 llmcompressor,若无报错即表示包已正确安装到当前环境。

    python -c "import llmcompressor"
  3. 3查阅官方文档

    README 未提供压缩示例代码,实际量化/压缩用法请到官方文档查看。

如何确认成功

执行 python -c "import llmcompressor" 无 ModuleNotFoundError 等报错即安装成功。

常见问题

Q:安装完怎么开始压缩模型?

A:README 只给出了 pip 安装命令,没有示例代码。请到官方文档 https://docs.vllm.ai/projects/llm-compressor 查看具体量化与压缩流程。

Q:压缩后的模型能直接被 vLLM 加载吗?

A:可以。模型会以 compressed-tensors 格式保存,该格式与 vLLM 兼容,无需额外手动转换。

Q:支持哪些压缩/量化能力?

A:README 说明覆盖权重、激活、KV cache 与 attention 量化,并提供多种量化算法与变换(项目简介提及 GPTQ、AWQ、SmoothQuant、INT8/FP8 及稀疏化)。

Q:超大模型显存不够怎么办?

A:README 提到支持 DDP 与磁盘卸载(disk offloading),可在硬件受限的情况下压缩大模型。

注意事项

  • README 未给出 Python 版本、CUDA 版本等硬性依赖要求,安装前请自行确认环境。
  • 压缩结果统一保存为 compressed-tensors 格式,面向 vLLM 部署。
  • 需要压缩超大模型时可使用 DDP 和磁盘卸载能力。
  • 遇到问题可在 vLLM 社区 Slack 的 #llm-compressor 或 #sig-quantization 频道提问。

核心亮点

  • 与 vLLM 官方生态深度绑定,压缩产物可直接被 vLLM 加载,无需格式转换
  • 覆盖 GPTQ、AWQ、SmoothQuant、FP8 等主流算法,一个库满足多种量化需求
  • 基于 Transformers 接口,已有 HF 模型可低成本接入压缩流程

不足之处

  • 算法参数和校准配置有一定学习成本,新手需要试错
  • 部分高级压缩方案对硬件和 CUDA 版本有要求,环境适配需注意

适用场景

  • 将 70B 级模型量化到 INT4/FP8 后部署到 vLLM 推理服务
  • 在有限显存的单卡或多卡环境压缩模型以降低部署成本
  • 为已训练好的 HF 模型快速生成可上线的量化版本

替代项目

AutoGPTQ、AutoAWQ、GPTQ-for-LLaMa

项目介绍

llm-compressor 是模型训练领域的开源项目,由 vllm-project 开发,2024 年首次发布。

在全站 12,822 个收录项目中,它的 GitHub 星标数(3,795)位列前 30%,在模型训练分类的 516 个项目里位列前 13%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-18。开源免费,Apache 2.0 许可证。

它主要面向的使用场景是:将70B级模型量化到INT4/FP8后部署到vLLM推理服务。同类可对比的替代方案包括 AutoGPTQ、AutoAWQ、GPTQ-for-LLaMa。

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 61694 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1284 2026-08-13