bitsandbytes

把大模型塞进小显存,量化微调一条龙

bitsandbytes 是一个为 PyTorch 提供 k-bit 量化支持的开源库,旨在让大语言模型(LLM)的部署和微调更加高效、可访问。它解决了大模型显存占用过高、普通硬件难以运行的问题,通过将模型权重从 32 位浮点数压缩到 8 位或 4 位整数,显著降低显存需求,同时尽量保持模型精度。核心能力包括:支持 8 位和 4 位量化、QLoRA 微调(在量化模型上做低秩适配)、以及多种量化算法(如 absmax、zeropoint、GPTQ 兼容)。该库与 Hugging Face Transformers 紧密集成,用户只需简单配置即可加载量化模型,无需修改现有代码。它特别适合在消费级 GPU(如 RTX 3090/4090)上运行 7B-70B 参数级别的模型,推动了 LLM 的本地化和民主化。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8498
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队bitsandbytes-foundation
所属国家
官网地址
定价模式free
价格说明开源库,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型llm,machine-learning,pytorch,qlora,quantization
GitHub 星标★ 8498
30天Star增速
HF 下载量
上线时间2021-06-04 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(bitsandbytes 通过 PyPI 分发,支持版本以 PyPI 页面标注为准)
  • 已安装 PyTorch(README 明确该库为 PyTorch 提供 k-bit 量化支持)
  • 网络可访问 PyPI 以完成安装包下载

安装与启动步骤

  1. 1检查 Python 环境

    确认本机已安装 Python 且可正常调用 pip,版本需满足 PyPI 页面标注的要求。

    python --version
    pip --version
  2. 2确认 PyTorch 就绪

    bitsandbytes 依赖 PyTorch 运行,先确认 torch 可导入并查看版本,避免后续量化调用失败。

    python -c "import torch; print(torch.__version__)"
  3. 3安装 bitsandbytes

    从 PyPI 安装官方发行包,建议在虚拟环境中执行,避免污染系统 Python 环境。

    pip install bitsandbytes
  4. 4验证导入是否成功

    导入库并打印对象信息,无报错即说明安装路径与依赖正常。

    python -c "import bitsandbytes as bnb; print(bnb)"

如何确认成功

执行 python -c "import bitsandbytes as bnb; print(bnb)" 无异常报错,即表示库安装成功。

常见问题

Q:bitsandbytes 提供哪些量化能力?

A:README 列出 8-bit 优化器(分块量化,接近 32 位性能)与 LLM.int8() 8 位量化推理,用于大幅降低显存占用。

Q:安装后导入报错怎么办?

A:README 节选未提供排错说明,请核对 Python 与 PyTorch 版本是否匹配,或到 GitHub 仓库的 Issues 中检索同类问题。

Q:需要什么硬件才能用?

A:README 节选未给出硬件要求说明,请以 GitHub 仓库和官方文档中的最新说明为准。

Q:能配合 Hugging Face Transformers 使用吗?

A:可以,项目定位即为与 Transformers 集成,通过配置即可加载量化模型,具体参数请查阅仓库文档。

注意事项

  • README 节选未直接给出安装命令,pip install 依据其 PyPI 发行链接推断,请以官方文档为准。
  • 该库为 Python 库而非独立服务,没有端口、服务进程或后台常驻的概念。
  • qLoRA 微调等进阶用法在节选中被截断,使用前请查阅完整仓库文档。

核心亮点

  • 显存占用直降 75%,4-bit 量化让 70B 模型跑在 24G 显卡上
  • 与 Transformers 无缝集成,一行代码切换量化模式
  • 支持 QLoRA 微调,消费级硬件也能高效微调大模型

不足之处

  • 量化后推理速度可能略慢于原生 FP16,尤其在小 batch 场景
  • 文档/社区待观察,部分高级量化配置的教程不够详尽

适用场景

  • 在单卡 24G 显存下部署 13B-70B 级 LLM 做推理
  • 基于 QLoRA 在消费级 GPU 上微调大模型适配垂直任务
  • 需要同时加载多个大模型进行对比实验的科研场景

替代项目

GPTQ-for-LLaMA、llama.cpp、AutoGPTQ

项目介绍

bitsandbytes 是模型训练领域的开源项目,由 bitsandbytes-foundation 开发,2021 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(8,498)位列前 6%,在模型训练分类的 522 个项目里位列前 6%。

近 41 天,它的 GitHub 星标从 8,414 增加到 8,498,净增 84。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。开源库,MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:在单卡24G显存下部署13B-70B级LLM做推理。同类可对比的替代方案包括 GPTQ-for-LLaMA、llama.cpp、AutoGPTQ。

上一篇:train-llm-from-scratch

下一篇:optimate

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13