AutoGPTQ

一键量化大模型,显存减半推理加速

AutoGPTQ 是一个基于 GPTQ 算法的 LLM 量化工具包,提供简洁易用的 API,帮助开发者将大语言模型压缩为低比特(如 4-bit)表示,从而大幅降低显存占用和推理成本。它解决了大模型在消费级硬件上部署困难的问题,支持 Hugging Face Transformers 生态,可一键量化主流模型,并提供了量化后模型的推理加速。核心能力包括:多种量化配置(如 4-bit、8-bit)、支持 CPU/GPU 推理、与 transformers 无缝集成、以及高效的量化内核。通过 AutoGPTQ,开发者无需深入底层算法即可完成模型量化,适合在资源受限环境中部署大模型。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5067
维护状态 低维护
是否开源
定价模式 free

项目数据

分类开源模型
开发团队AutoGPTQ
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型deep-learning,inference,large-language-models,llms,nlp,pytorch,quantization,transformer,transformers
GitHub 星标★ 5067
30天Star增速
HF 下载量
上线时间2023-04-13 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数10

使用教程

难度:进阶 约 15 分钟 部署方式:库/依赖 7 步

环境要求

  • 操作系统:仅支持 Linux 和 Windows
  • NVIDIA 显卡需高于 Maxwell 架构(Maxwell 及更低不支持)
  • CUDA 11.8 / CUDA 12.1 或 ROCm 5.7 环境,且需匹配对应的 PyTorch(如 2.2.1+cu118、2.2.1+cu121、2.
  • 已安装 Python 与 pip;从源码安装还需能编译 PyTorch 扩展

安装与启动步骤

  1. 1确认平台与GPU

    确认系统为 Linux 或 Windows,并核对 CUDA/ROCm 版本与显卡架构(NVIDIA 需高于 Maxwell),再选择对应安装命令。

  2. 2pip安装(CUDA 12.1)

    CUDA 12.1 环境直接安装官方预编译 wheel,无需额外索引地址,务必带 --no-build-isolation。

    pip install auto-gptq --no-build-isolation
  3. 3pip安装(CUDA 11.8)

    CUDA 11.8 环境需通过 autogptq-index 的 cu118 索引安装预编译包,否则会尝试本地编译。

    pip install auto-gptq --no-build-isolation --extra-index-url https://huggingface.github.io/autogptq-index/whl/cu118/
  4. 4pip安装(ROCm 5.7)

    AMD ROCm 5.7 环境使用 rocm573 索引安装对应的预编译 wheel。

    pip install auto-gptq --no-build-isolation --extra-index-url https://huggingface.github.io/autogptq-index/whl/rocm573/
  5. 5可选Triton后端

    如需 Triton 后端可加装 [triton] 依赖,目前仅支持 Linux,且不支持 3-bit 量化。

    pip install auto-gptq[triton] --no-build-isolation
  6. 6从源码安装

    克隆仓库后先装 numpy、gekko、pandas 等构建依赖,再以 -e 方式本地安装;不建议关闭 CUDA 扩展编译。

    git clone https://github.com/PanQiWei/AutoGPTQ.git && cd AutoGPTQ
    pip install numpy gekko pandas
    pip install -vvv --no-build-isolation -e .
  7. 7运行测试验证

    在仓库根目录执行测试用例,确认安装与量化内核可用;需先完成源码克隆并进入项目目录。

    pytest tests/ -s

关键配置

配置项必填说明示例
use_marlin加载模型时启用 Marlin int4*fp16 矩阵乘内核加速use_marlin=True
BUILD_CUDA_EXT设为 0 可跳过 PyTorch 扩展编译,但会退化为慢速 Python 实现BUILD_CUDA_EXT=0

如何确认成功

运行 pytest tests/ -s,测试通过且无编译或导入报错即表示安装成功。

常见问题

Q:安装命令执行失败怎么办?

A:先确保已安装 numpy gekko pandas 等构建依赖;若仍失败,可按 README 提示尝试最后的兜底方式 python setup.py install。

Q:为什么我的 NVIDIA 显卡不被支持?

A:AutoGPTQ 在 NVIDIA 系统上不支持 Maxwell 或更低架构的 GPU,需要更高级别的显卡。

Q:Triton 后端有什么限制?

A:Triton 后端目前仅支持 Linux 系统,并且不支持 3-bit 量化。

Q:Marlin 内核需要什么硬件?

A:仅在计算能力 8.0 或 8.6 的设备(Ampere GPU)上可用,加载模型时传 use_marlin=True 启用。

Q:这个项目还在维护吗?

A:README 顶部已标注 AutoGPTQ 处于 unmaintained 状态,官方建议改用 GPTQModel 获取修复与新模型支持。

注意事项

  • README 明确标注项目已不再维护,建议新项目改用 GPTQModel。
  • 除非万不得已,不要设置 BUILD_CUDA_EXT=0,否则会回退到慢速的 Python 实现。
  • 安装务必保留 --no-build-isolation 参数,否则可能编译失败。
  • Transformers、optimum 和 peft 已集成 auto-gptq,可直接在生态内运行与训练 GPTQ 模型。

核心亮点

  • API 简洁,几行代码完成模型量化,上手快
  • 与 Hugging Face Transformers 深度集成,兼容主流模型
  • 量化后推理速度快,显存占用显著降低,适合消费级显卡

不足之处

  • 文档偏少,部分高级用法需读源码
  • 对非 Transformer 架构模型支持有限

适用场景

  • 在 8GB 显存显卡上部署 7B/13B 模型
  • 批量压缩模型以降低云服务成本
  • 为移动端或边缘设备准备轻量模型

替代项目

bitsandbytes、GPTQ-for-LLaMa、llama.cpp

项目介绍

AutoGPTQ 是模型训练领域的开源项目,由 AutoGPTQ 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(5,067)位列前 9%,在模型训练分类的 518 个项目里位列前 11%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:在8GB显存显卡上部署7B/13B模型。同类可对比的替代方案包括 bitsandbytes、GPTQ-for-LLaMa、llama.cpp。

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13