Model-Optimizer

一站式压缩大模型,导出即加速推理

Model-Optimizer 是 NVIDIA 开源的一套统一模型优化库,把量化、蒸馏、剪枝、神经架构搜索、投机解码等当前主流的模型压缩技术整合到一个 Python 工具链里。它要解决的问题是:大模型直接部署推理太慢、显存占用太高,而各种优化技术分散在不同论文和脚本中,工程化落地成本高。该库提供端到端的流程,支持训练后量化、量化感知训练、知识蒸馏、结构化剪枝以及投机解码等,并能把压缩后的模型导出给 TensorRT-LLM、TensorRT、vLLM 等下游推理框架直接使用,从而在保持精度的前提下提升推理速度、降低部署成本。项目由 NVIDIA 维护,与自家推理生态衔接紧密,适合需要在生产环境压缩和加速深度学习模型的团队。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5228
维护状态 活跃
是否开源 是
定价模式 free

项目预览

项目数据

分类模型训练
开发团队NVIDIA
所属国家
定价模式free
价格说明开源免费,NVIDIA 官方库
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 5228
30天Star增速
HF 下载量
上线时间2024-04-23 00:00:00
代码更新—
仓库体积—
本站数据更新—
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-10-07
浏览次数0

Star 增长趋势

本站每日记录该项目 GitHub 星标变化,观测越久曲线越完整

正在加载星标数据…

技术标签

使用教程

—

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • 已安装 Python 与 pip 环境(README 未注明最低版本要求)
  • 可访问 PyPI 以下载 nvidia-modelopt 及其依赖
  • 准备好待优化模型:Hugging Face、PyTorch 或 ONNX 格式之一
  • 需要使用训练相关优化时,需配合 Megatron-Bridge、Megatron-LM 或 Hugging Face Accelerate

安装与启动步骤

  1. 1安装优化库

    用 pip 从 PyPI 安装稳定版并带上全部可选依赖;安装过程会一并下载第三方开源组件。

    pip install -U nvidia-modelopt[all]
  2. 2准备输入模型

    Model Optimizer 目前支持 Hugging Face、PyTorch 或 ONNX 模型作为优化输入,先确认模型可用。

  3. 3选择优化技术

    按需求用 Python API 组合量化、剪枝、NAS、蒸馏、投机解码、稀疏化等技术,生成优化后的量化 checkpoint。

  4. 4接入训练框架

    量化感知训练等需要训练的技术,需与 Megatron-Bridge、Megatron-LM 或 Hugging Face Accelerate 集成使用。

  5. 5导出并部署

    把优化后的量化 checkpoint 导出,交给 TensorRT-LLM、TensorRT、vLLM 等下游推理框架部署使用。

如何确认成功

README 未给出验证方式;可执行 pip show nvidia-modelopt 查看版本,确认包已装到当前 Python 环境。

常见问题

Q:pip 安装的包名是什么?

A:包名为 nvidia-modelopt,README 给出的安装命令是 pip install -U nvidia-modelopt[all],其中 [all] 表示安装全部可选依赖。

Q:支持哪些模型作为输入?

A:目前支持 Hugging Face、PyTorch 和 ONNX 三种来源的模型作为输入,优化后导出量化 checkpoint 供下游框架部署。

Q:能实现哪些优化技术?

A:包含量化、剪枝、神经架构搜索(NAS)、蒸馏、投机解码和稀疏化等,均为 state-of-the-art 的模型优化技术。

Q:想用最新特性怎么安装?

A:README 提到可用 editable 模式从源码安装并带全部开发依赖,但节选中该命令被截断,请以官方文档为准。

Q:优化后的模型部署到哪里?

A:可无缝接入 NVIDIA AI 软件生态,量化 checkpoint 可直接用于 TensorRT-LLM、TensorRT、vLLM 等下游推理框架。

注意事项

  • Model Optimizer 会自动下载并安装第三方开源软件,使用前请审阅这些项目的许可证条款。
  • 量化感知训练等训练相关优化需配合 Megatron-Bridge、Megatron-LM 或 Hugging Face Accelerate。
  • README 节选未给出最低 Python 版本、完整源码安装命令与验证方法,请以官网文档 https://nvidia.github.io/Model-Optimizer 为准。

核心亮点

  • 覆盖量化、蒸馏、剪枝、NAS、投机解码等多种 SOTA 优化技术,一个库统一调用
  • 与 TensorRT-LLM、TensorRT、vLLM 等下游部署框架打通,压缩后可直接导出使用
  • 由 NVIDIA 维护,和自家 GPU 推理生态结合紧密,工程落地路径清晰

不足之处

  • 与 NVIDIA 推理栈绑定较深,非 NVIDIA 硬件或非 TensorRT/vLLM 场景收益有限
  • 功能覆盖面广但各技术成熟度和文档深度可能不均衡,需按版本验证

适用场景

  • 把训练好的 LLM 量化压缩后部署到 TensorRT-LLM 提升吞吐
  • 用蒸馏和剪枝把大模型压缩成小模型以降低线上推理成本
  • 在 vLLM 服务中结合投机解码降低生成延迟

替代项目

Neural Compressor、LLM Compressor

项目介绍

Model-Optimizer 是模型训练领域的开源项目,由 NVIDIA 开发,2024 年首次发布。

在全站 13,821 个收录项目中,它的 GitHub 星标数(5,228)位列前 9%,在模型训练分类的 543 个项目里位列前 10%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-10-06。开源免费,NVIDIA 官方库。

它主要面向的使用场景是:把训练好的LLM量化压缩后部署到TensorRT-LLM提升吞吐。同类可对比的替代方案包括 Neural Compressor、LLM Compressor。

上一篇:EasySteer

下一篇:NexRL

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 63243 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1308 2026-08-13