airllm

4GB 显卡跑 70B 大模型,显存不够也能玩转

AirLLM 是一个针对大模型推理优化的开源工具,核心目标是让 70B 级别的超大模型能够在仅 4GB 显存的单张 GPU 上运行。它通过分层推理和显存卸载技术,将模型权重按层动态加载到显存,计算完即释放,从而突破显存限制。解决了个人开发者和小型企业因硬件成本高而无法使用前沿大模型的问题。核心能力包括:支持 Hugging Face 格式的模型、自动优化推理速度、提供简单的 Python API 集成。用户无需修改模型代码即可实现低显存推理,适合本地部署和实验。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 34696
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队lyogavin
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Jupyter Notebook
技术栈/模型chinese-llm,chinese-nlp,finetune,generative-ai,instruct-gpt,instruction-set,llama,llm,lora,open-models,open-source,open-source-models,qlora
GitHub 星标★ 34696
30天Star增速
HF 下载量
上线时间2023-06-12 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境与 pip(用于安装 airllm 包)
  • 一张 NVIDIA GPU,显存最低约 4GB(70B 模型),125B 约 6GB,671B 约 12GB
  • 足够的磁盘空间,用于下载并保存分层转换后的模型权重
  • 如需下载 meta-llama/Llama-2-7b-hf 等门控模型,需要 Hugging Face token

安装与启动步骤

  1. 1安装 airllm 包

    直接用 pip 安装官方发布的 airllm 包,这是 README 给出的唯一安装方式。建议在虚拟环境中安装,避免与已有依赖冲突。

    pip install airllm
  2. 2准备训练数据文件

    训练脚本通过 --data 指定 jsonl 数据文件。若不传 --data,脚本会用内置的小片段做过度拟合,仅适合验证流程。

  3. 3训练 125B MoE 模型

    在仓库根目录执行脚本,用 LoRA 方式微调 Qwen 125B MoE 模型,adapter 保存在指定 pt 文件中。seq-len 与 epochs 可按需调整。

    python air_llm/examples/train_qwen38_flash_next_lora.py 
      --data my_data.jsonl 
      --seq-len 512 
      --epochs 1 
      --save-adapter qwen38-flash-next-lora.pt
  4. 4训练 27B 密集模型

    如需微调 27B 密集模型,改用对应的训练脚本,参数含义一致,只需更换数据与保存的 adapter 文件名。

    python air_llm/examples/train_qwen38_lora.py 
      --data my_data.jsonl 
      --seq-len 512 
      --epochs 1 
      --save-adapter qwen38-27b-lora.pt
  5. 5冒烟测试

    加上 --steps N 参数后,只处理 N 条样本就停止,适合在正式训练前快速确认环境与显存是否正常。

    python air_llm/examples/train_qwen38_flash_next_lora.py 
      --data my_data.jsonl 
      --seq-len 512 
      --epochs 1 
      --steps 1 
      --save-adapter qwen38-flash-next-lora.pt

关键配置

配置项必填说明示例
compression否模型压缩方式,可选 4bit、8bit 分块量化,默认 None 不压缩4bit
profiling_mode否设为 True 时输出各阶段耗时,便于排查性能瓶颈,默认 FalseTrue
layer_shards_saving_path否指定分层切片模型的另一保存路径/your/path
hf_token否下载 gated 类模型时需提供的 Hugging Face tokenhf_xxxxxxxxxxxxxxxx
prefetching否预取以重叠模型加载与计算,默认开启,目前仅 AirLLMLlama2 支持True
delete_original否磁盘不足时设为 True,删除原始 HF 模型只保留转换后版本以省一半空间True

如何确认成功

pip install 过程无报错,并在 Python 中 import airllm 成功,即表示包已正确安装。

常见问题

Q:显存不够怎么办?

A:可在初始化模型时把 compression 设为 4bit 或 8bit 做分块量化,进一步降低显存占用;AirLLM 本身按层加载并即时释放权重。

Q:下载 Llama-2 等模型时报权限错误?

A:这类模型属于 gated model,需要在 Hugging Face 申请权限后,初始化时通过 hf_token 配置项传入自己的访问 token。

Q:磁盘空间不够放模型怎么办?

A:把 delete_original 设为 True,转换完成后会删除原始下载的 Hugging Face 模型,只保留分层后的版本,可节省约一半空间。

Q:想先确认脚本能跑通再正式训练?

A:在训练命令中加 --steps N,处理完 N 条样本即停止;省略 --data 时脚本会用内置片段过拟合,也可用于快速验证。

注意事项

  • README 节选只给出了 pip 安装与训练脚本命令,未提供推理调用的示例代码,实际使用请以仓库中的 notebooks 为准。
  • 训练脚本需在仓库根目录下执行,示例数据文件名为 my_data.jsonl,请替换为自己的真实文件路径。
  • prefetching 目前仅 AirLLMLlama2 支持,其他模型开启后不一定生效。
  • 模型越大对显存与磁盘要求越高,建议先用小参数 + --steps 做冒烟测试再跑全量。

核心亮点

  • 显存占用极低,4GB 显卡可跑 70B 模型,突破硬件限制
  • 基于分层推理,自动卸载和加载权重,无需手动优化
  • 兼容 Hugging Face 生态,集成简单,几行代码即可使用

不足之处

  • 推理速度较慢,因为涉及频繁的显存与内存/磁盘交换
  • 文档/社区待观察

适用场景

  • 个人开发者本地实验 70B 级大模型,无需高端显卡
  • 资源受限的云环境或边缘设备部署大模型
  • 教学演示和学术研究,探索低资源推理技术

替代项目

llama.cpp、DeepSpeed、Accelerate

项目介绍

airllm 是基础设施领域的开源项目,由 lyogavin 开发,2023 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(34,696)位列前 2%,在基础设施分类的 1,133 个项目里位列前 3%。

近 41 天,它的 GitHub 星标从 30,878 增加到 34,696,净增 3,818。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:个人开发者本地实验70B级大模型,无需高端显卡。同类可对比的替代方案包括 llama.cpp、DeepSpeed、Accelerate。

上一篇:llmfit

下一篇:mlc-llm

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

[DEPRECATED / UNMAINTAINED] Multi-account gateway. No longer maintained; fork it and···

★ 303 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09