neural-compressor

一键压缩大模型,低比特量化提速省内存

neural-compressor 是英特尔开源的模型压缩工具库,专注于低比特量化与稀疏化技术,支持 INT8、FP8、MXFP8、INT4、MXFP4、NVFP4 等多种数据格式,覆盖 PyTorch、TensorFlow 和 ONNX Runtime 主流框架。它解决 LLM 部署时内存占用大、推理速度慢的问题,提供从量化感知训练、训练后量化到动态量化的一站式流程,并集成自动调优算法,帮助用户在精度损失可控的前提下显著压缩模型体积、提升推理性能。核心能力包括:多种量化精度支持、混合精度策略搜索、稀疏化剪枝、以及面向 Intel 硬件的深度优化。项目 API 设计简洁,支持命令行和 Python 接口,适合生产环境集成。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2710
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队intel
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型auto-tuning,awq,fp4,gptq,int4,int8,knowledge-distillation,large-language-models,low-precision,mxformat,post-training-quantization,pruning,quantization,quantization-aware-training,smoothquant,sparsegpt,sparsity
GitHub 星标★ 2710
30天Star增速
HF 下载量
上线时间2020-07-21 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 30 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境(用于 pip 安装 neural-compressor)
  • PyTorch 后端:CPU/GPU 需安装 intel_extension_for_pytorch,其他平台安装常规 torch
  • 运行 FP8 示例需要 Intel Gaudi2 AI 加速器
  • 使用 Gaudi 时需使用带 Gaudi 软件栈的 Docker 镜像,并保证与 Neural Compressor 版本匹配

安装与启动步骤

  1. 1准备 PyTorch 框架

    按硬件环境选择安装:CPU 版或 Intel GPU 版 intel_extension_for_pytorch,其他平台直接安装 torch。

  2. 2安装 Neural Compressor

    从 PyPI 安装该库,建议在已装好 PyTorch 的虚拟环境中执行,避免依赖冲突。

    pip install neural-compressor
  3. 3启动 Gaudi 容器

    跑 FP8 示例推荐使用 Gaudi 软件栈镜像,以交互式 shell 启动容器并挂载全部 Gaudi 设备。

    docker run -it --runtime=habana -e HABANA_VISIBLE_DEVICES=all -e OMPI_MCA_btl_vader_single_copy_mechanism=none --cap-add=sys_nice --net=host --ipc=host vault.habana.ai/gaudi-docker/1.24.0/ubuntu24.04/habanalabs/pytorch-installer-2.10.0:latest
  4. 4设置懒执行模式

    Habana 1.21.0 起默认为 0,但多数低精度函数不支持,建议设为 1 以保证兼容。

    export PT_HPU_LAZY_MODE=1
  5. 5运行 FP8 量化示例

    用 resnet18 演示 FP8 E4M3 量化流程:先 prepare 再 convert,需在 Gaudi2 环境执行。

    python fp8_example.py

关键配置

配置项必填说明示例
fp8_config是指定 FP8 量化数据格式,示例中为 E4M3。E4M3
PT_HPU_LAZY_MODE否HPU 懒执行模式,低精度函数需要设为 1。1
HABANA_VISIBLE_DEVICES否指定容器内可见的 Gaudi 设备。all

如何确认成功

容器内可成功导入 neural_compressor.torch.quantization,且示例中 prepare/convert 执行无报错。

常见问题

Q:支持哪些深度学习框架?

A:README 说明支持主流框架 PyTorch、TensorFlow 和 JAX,安装时按部署环境选择对应框架依赖。

Q:FP8 量化示例需要什么硬件?

A:该示例由 Intel Gaudi2 AI 加速器支持,需在带 Gaudi 软件栈的 Docker 镜像中运行。

Q:Neural Compressor 与 Gaudi 版本不匹配怎么办?

A:两者存在版本映射关系,请查阅文档中的版本对应表,选择匹配的软件栈组合。

Q:低精度函数报错或不支持怎么办?

A:设置 PT_HPU_LAZY_MODE=1。Habana 1.21.0 起默认值为 0,convert_from_uint4 等函数不支持该设置。

注意事项

  • Neural Compressor 与 Gaudi 软件栈存在版本映射,务必使用匹配组合。
  • Gaudi 上跑低精度功能建议保持 PT_HPU_LAZY_MODE=1。
  • 非 Gaudi 用户无需启动 Habana 容器,直接安装对应 PyTorch 版本即可。
  • 安装 neural-compressor 前请先完成 PyTorch 后端依赖安装。

核心亮点

  • 支持 INT4/FP8/MXFP4 等前沿低比特格式,覆盖最新硬件特性
  • 自动混合精度搜索,在精度与性能间自动平衡
  • 跨框架支持 PyTorch/TensorFlow/ONNX,集成成本低

不足之处

  • 文档偏技术化,新手上手门槛较高
  • 对非 Intel 硬件的优化支持有限

适用场景

  • 大语言模型在 CPU/GPU 上的低比特量化部署
  • 边缘设备或资源受限环境的模型压缩
  • 生产环境需要同时兼顾精度与吞吐的推理服务

替代项目

Hugging Face Optimum、TensorFlow Lite、ONNX Runtime Quantization

项目介绍

neural-compressor 是模型训练领域的开源项目,由 intel 开发,2020 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,710)位列前 30%,在模型训练分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:大语言模型在CPU/GPU上的低比特量化部署。同类可对比的替代方案包括 Hugging Face Optimum、TensorFlow Lite、ONNX Runtime Quantization。

上一篇:paxml

下一篇:Adaptive-MT-LLM-Fine-tuning

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13