MindPipe

一键压缩大模型,让 LLM 在 NVIDIA 和昇腾上跑得更快更省显存。

MindPipe 是一个面向大语言模型(LLM)和多模态大模型(LVLM)的模型压缩框架,专门适配 NVIDIA GPU 和华为昇腾 NPU。它解决的是大模型在部署时面临的显存占用高、推理速度慢、硬件适配难等核心问题,提供量化、剪枝、蒸馏等主流压缩技术,帮助开发者在保持模型性能的前提下显著减小模型体积、提升推理效率。其核心能力包括:支持多种压缩算法、跨硬件平台(NVIDIA/昇腾)无缝切换、与主流模型库(如 Transformers)集成友好,以及自动化的压缩流程管理。对于需要将大模型落地到实际业务或边缘设备的团队,MindPipe 提供了一站式的模型瘦身方案,降低部署门槛和成本。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 7
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队MAC-AutoML
所属国家
官网地址
定价模式free
价格说明开源框架,本地部署,完全免费
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型
GitHub 星标★ 7
30天Star增速
HF 下载量
上线时间2026-08-15 00:00:00
最近更新2026-09-11 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • 同时支持 NVIDIA GPU 和华为昇腾 NPU,覆盖国产化部署需求
  • 集成量化、剪枝、蒸馏多种压缩算法,可灵活组合使用
  • 与 HuggingFace Transformers 生态兼容,上手成本低

不足之处

  • 项目较新,文档和社区生态仍在建设中
  • 压缩后模型精度损失的控制策略需用户自行调参,自动化程度有限

适用场景

  • 在昇腾 NPU 上部署大模型,需降低显存占用
  • 将大模型压缩至可接受体积,用于边缘设备或私有化部署
  • 多模态模型推理加速,提升响应速度

替代项目

llm-compressor、AutoGPTQ、TensorRT-LLM

项目介绍

MindPipe 是模型训练领域的开源项目,由 MAC-AutoML 开发,是 2026 年新上线的项目。

它收录于模型训练分类,该分类目前共有 518 个项目,GitHub 星标数为 7。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-11。本地部署,完全免费。

它主要面向的使用场景是:在昇腾NPU上部署大模型,需降低显存占用。同类可对比的替代方案包括 llm-compressor、AutoGPTQ、TensorRT-LLM。

上一篇:J-Wash

下一篇:JetSpec

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 62178 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1286 2026-08-13