AngelSlim

一键压缩大模型,部署更快更省资源

AngelSlim 是一个面向大语言模型的开源压缩工具包,旨在让模型压缩更易用、更全面、更高效。它解决了模型部署中体积大、推理慢、成本高的问题,提供从剪枝、量化到蒸馏的一站式压缩方案。核心能力包括:支持多种主流模型架构(如LLaMA、Qwen等),提供统一的压缩接口和自动化配置,能显著减少模型参数量和显存占用,同时尽量保持模型性能。工具包设计上强调用户友好,通过简单的API调用即可完成复杂的压缩流程,并内置了压缩后模型的效果评估功能,帮助用户在压缩率与精度损失之间找到平衡。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1665
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队Tencent
所属国家
官网地址
定价模式free
价格说明开源模型压缩工具包,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型audio,deepseek,dflash,diffusion,eagle,fp4,hunyuan,llm,llm-compression,quantization,qwen,speculative-decoding,vlm
GitHub 星标★ 1665
30天Star增速
HF 下载量
上线时间2025-07-04 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:进阶 约 30 分钟 部署方式:库/依赖 8 步

环境要求

  • Python 环境(可执行 pip 命令)
  • 安装 vLLM 时建议 vllm>=0.8.5.post1,MOE INT8 量化模型需 vllm>=0.9.0
  • 安装 SGLang 时建议 sglang>=0.4.6.post1
  • 单机快速开始示例需要 4 张 GPU(2 张推理 + 2 张训练)
  • 克隆源码需支持 git submodule 的 git 环境

安装与启动步骤

  1. 1安装 AngelSlim

    官方推荐用 pip 直接安装最新稳定版 AngelSlim,最省事,装完即可调用压缩接口。

    pip install angelslim
  2. 2源码方式安装

    想改代码或跟踪最新功能时,用递归克隆仓库并以可编辑/源码方式安装,注意必须带 --recursive。

    git clone --recursive https://github.com/Tencent/AngelSlim.git
    cd AngelSlim && python setup.py install
  3. 3初始化子模块

    AngelSpec 以 git submodule 形式放在 third_party/AngelSpec/,已克隆的仓库要手动初始化拉取。

    git submodule update --init --recursive
  4. 4装 AngelSpec 与 vLLM

    进入子模块目录安装 AngelSpec 及其 vLLM 后端,这是跑投机解码训练与推理的前置依赖。

    cd third_party/AngelSpec
    pip install -e ".[vllm]"
  5. 5装 mooncake 传输引擎

    隐藏状态传输组件不在 extras 里,必须单独安装,否则分布式训练链路会缺依赖。

    pip install mooncake-transfer-engine
  6. 6运行单机快速开始

    仓库自带 qwen3-8b 单机示例脚本,默认用 4 张卡(2 推理 + 2 训练),先确保卡空闲。

    ./examples/qwen3-8b-single-node/run.sh
  7. 7部署 vLLM 服务

    把 MODEL_PATH 换成你的量化模型路径,用脚本拉起 OpenAI 兼容接口;-d 选卡、-t 张量并行、-p 流水并行、-g 显存利用率。

    bash scripts/deploy/run_vllm.sh --model-path /your/model/path --port 8080 -d 0,1,2,3 -t 4 -p 1 -g 0.8 --max-model-len 4096
  8. 8部署 SGLang 服务

    不想用 vLLM 时可换 SGLang 脚本部署同样的 OpenAI 兼容服务,参数含义与 vLLM 脚本基本一致。

    bash scripts/deploy/run_sglang.sh --model-path /your/model/path --port 8080 -d 0,1,2,3 -t 4 -g 0.8

关键配置

配置项必填说明示例
--model-path是指定已量化好的模型目录路径/your/model/path
--port否API 服务监听端口8080
-d否可见的 GPU 设备编号列表0,1,2,3
-t否张量并行大小(tensor parallel size)4
-p否流水并行大小,vLLM 脚本参数1
-g否GPU 显存利用率,显存不足可调小0.8

如何确认成功

访问 http://localhost:8080 的 OpenAI 兼容接口能正常返回;单机示例脚本无报错跑通即成功。

常见问题

Q:克隆后运行提示缺少 AngelSpec/子模块为空怎么办?

A:说明克隆时没带子模块。重新用 git clone --recursive 克隆,或在已有仓库里执行 git submodule update --init --recursive 拉取。

Q:MOE INT8 量化模型部署失败怎么排查?

A:vLLM 版本过低。普通模型用 vllm>=0.8.5.post1,MOE INT8 量化模型必须升级到 vllm>=0.9.0。

Q:单机快速开始脚本跑不起来?

A:该示例默认需要 4 张 GPU(2 张推理 + 2 张训练),请确认显卡数量与空闲状态,或改用其他部署方式。

Q:pip 安装后还需要装 vLLM 后端吗?

A:需要。pip install angelslim 只装 AngelSlim 本体,跑 AngelSpec 训练/推理还要进 third_party/AngelSpec 执行 pip install -e ".[vllm]"。

注意事项

  • AngelSlim 集成 AngelSpec 作为 git submodule,克隆时务必加 --recursive,否则子模块目录为空。
  • mooncake-transfer-engine 不在 extras 依赖中,必须单独 pip install。
  • vLLM 脚本与 SGLang 脚本参数不完全一致,SGLang 脚本没有 -p 参数。
  • 更详细的安装与平台适配说明以官方 Installation 文档为准。

核心亮点

  • 支持剪枝、量化、蒸馏等多种压缩方法,覆盖全面
  • API设计简洁,几行代码即可完成模型压缩流程
  • 自动评估压缩后模型效果,方便权衡性能与体积

不足之处

  • 文档/社区待观察
  • 对超大模型(千亿参数)的压缩效率尚未验证

适用场景

  • 将大模型部署到边缘设备或移动端
  • 降低云端推理服务的GPU显存和成本
  • 快速生成可用于测试的轻量级模型副本

替代项目

llm-compressor、SparseGPT、GPTQ

项目介绍

AngelSlim 是模型训练领域的开源项目,由 Tencent 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,665)位列前 30%,在模型训练分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,522 增加到 1,665,净增 143。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源模型压缩工具包,MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:将大模型部署到边缘设备或移动端。同类可对比的替代方案包括 llm-compressor、SparseGPT、GPTQ。

上一篇:RLHF-Reward-Modeling

下一篇:ReCall

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13