nunchaku

让 12B 扩散模型在 6GB 显存上流畅跑,量化加速一步到位

nunchaku 是 ICML 2025 Spotlight 论文 SVDQuant 的官方开源实现,专注于 4-bit 扩散模型的量化推理与微调。它通过低秩组件吸收权重和激活中的离群值,显著降低量化误差,使 FLUX.1 等 12B 参数扩散模型能在 6GB 显存的消费级 GPU 上流畅运行。项目提供端到端推理引擎、ComfyUI 原生集成以及 LoRA 微调支持,核心能力包括:基于 SVD 的低秩分解量化算法、针对 4-bit 矩阵乘法的自定义内核(支持 CUDA 和 NPU)、动态量化感知缩放。用户可直接通过 ComfyUI 工作流体验加速,或使用 Python API 进行定制化部署。项目解决了扩散模型因体量过大难以在本地设备部署的痛点,为生成式 AI 的端侧落地提供了高效、低成本的解决方案。

开源 free 模型训练
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3949
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类模型训练
开发团队nunchux-ai
所属国家
官网地址https://nunchux.ai
定价模式free
价格说明开源项目,免费使用,定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型comfyui,diffusion-models,flux,genai,iclr,iclr2025,lora,mlsys,quantization
GitHub 星标★ 3949
30天Star增速
HF 下载量
上线时间2024-11-06 00:00:00
最近更新2026-09-16 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-08
浏览次数1

使用教程

难度:进阶 约 10 分钟 部署方式:库/依赖 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 消费级 NVIDIA GPU(约 6GB 显存即可运行 FLUX.1 等 12B 模型的 4-bit 量化版本)
  • Python 环境(项目主要开发语言为 Python)
  • 可选:ComfyUI,用于通过工作流直接体验加速效果
  • 可选:NPU 环境,自定义 4-bit 矩阵乘内核同时支持 CUDA 与 NPU

安装与启动步骤

  1. 1查阅官方安装文档

    README 的 Getting Started 只给出文档链接,具体安装步骤、依赖与内核编译方式以 Installation Guide 为准。

  2. 2克隆项目仓库

    获取源码,用于运行 app 目录下的 Gradio Demo,或按官方文档进行本地安装与编译。

    git clone https://github.com/nunchux-ai/nunchaku.git
  3. 3安装 ComfyUI 插件

    使用 ComfyUI-nunchaku 插件可在 ComfyUI 工作流中直接体验 4-bit 加速,安装方式见该仓库说明。

  4. 4运行 Gradio Demo

    参考仓库 app 目录中的示例(如 app/flux.1/t2i,可复现 SVDQuant 论文结果)体验量化推理。

  5. 5查阅 API 与 FAQ

    定制化部署参考 Python API Reference;遇到报错先查官方 FAQ 文档,再去 Discord 社区提问。

如何确认成功

README 未给出启动命令;以官方文档为准,能成功加载 4-bit 模型并正常出图即视为部署成功。

常见问题

Q:4-bit 模型需要多大显存?

A:项目定位是让 FLUX.1 等 12B 扩散模型在约 6GB 显存的消费级 GPU 上流畅运行,具体支持型号与配置请以官方文档为准。

Q:必须安装 ComfyUI 吗?

A:不是。既可用 ComfyUI-nunchaku 插件做工作流体验,也可通过 Python API 或仓库 app 目录下的 Gradio Demo 调用。

Q:如何量化自己的模型?

A:官方提供独立的 DeepCompressor 仓库用于自定义模型量化,采用基于 SVD 的低秩分解方案降低量化误差,流程见其文档。

Q:安装或运行报错去哪里查?

A:先查阅官方 FAQ 文档 https://nunchaku.tech/docs/nunchaku/faq/faq.html ,也可加入项目 Discord 社区交流。

注意事项

  • 本次 README 节选未包含实际安装命令,安装细节请以官方 Installation Guide(https://nunchaku.tech/docs/nunchaku/installation/installation.html)为准。
  • 量化矩阵乘内核依赖 CUDA 或 NPU 环境,需与硬件和驱动版本匹配。
  • 仓库地址为 https://github.com/nunchux-ai/nunchaku ,预量化模型权重发布在 Hugging Face 与 ModelScope 上。

核心亮点

  • SVDQuant 算法有效抑制离群值,4-bit 量化精度损失小,论文获 ICLR Spotlight 认可
  • 提供优化后的 CUDA 内核,实测 FLUX.1 推理速度显著提升,显存占用大幅降低
  • 原生集成 ComfyUI,用户无需编程即可体验量化加速,同时支持 LoRA 微调扩展

不足之处

  • 目前主要针对 FLUX.1 等特定架构优化,对其他扩散模型的支持可能有限
  • 依赖自定义内核,跨平台(如 AMD/Intel GPU)兼容性尚待验证

适用场景

  • 在消费级显卡上本地运行 FLUX.1 等大型扩散模型进行图像生成
  • 通过 ComfyUI 工作流快速集成量化推理,降低创作工具的硬件门槛
  • 对扩散模型进行 4-bit 低秩微调,适配特定风格或任务

替代项目

bitsandbytes、GPTQ、AWQ

项目介绍

nunchaku 是一个模型训练领域的开源项目,官方简介:[ICLR2025 Spotlight] SVDQuant: Absorbing Outliers by Low-Rank Components for 4-Bit Diffusion Models。项目使用 Python 开发,在 GitHub 上获得 3947 星标。

上一篇:DiffusionOPSD

下一篇:nncf

同类项目推荐

Long-RL 开源

让强化学习轻松驾驭超长序列,训练更稳更快

Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)

★ 729 2026-08-09
TPA 开源

把注意力复杂度从平方降到线性,长序列不再卡顿

[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···

★ 463 2026-08-09
minimind 开源

两小时造出你的小模型,练手入门不求人

Train a 64M-parameter LLM from scratch in just 2h!

★ 61327 2026-08-09
pruna 开源

一键优化 AI 模型,推理提速又省资源。

Pruna is a model optimization framework built for developers, enabling you to delive···

★ 1279 2026-08-13