
nunchaku
让 12B 扩散模型在 6GB 显存上流畅跑,量化加速一步到位
nunchaku 是 ICML 2025 Spotlight 论文 SVDQuant 的官方开源实现,专注于 4-bit 扩散模型的量化推理与微调。它通过低秩组件吸收权重和激活中的离群值,显著降低量化误差,使 FLUX.1 等 12B 参数扩散模型能在 6GB 显存的消费级 GPU 上流畅运行。项目提供端到端推理引擎、ComfyUI 原生集成以及 LoRA 微调支持,核心能力包括:基于 SVD 的低秩分解量化算法、针对 4-bit 矩阵乘法的自定义内核(支持 CUDA 和 NPU)、动态量化感知缩放。用户可直接通过 ComfyUI 工作流体验加速,或使用 Python API 进行定制化部署。项目解决了扩散模型因体量过大难以在本地设备部署的痛点,为生成式 AI 的端侧落地提供了高效、低成本的解决方案。
项目数据
使用教程
⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。
环境要求
- 消费级 NVIDIA GPU(约 6GB 显存即可运行 FLUX.1 等 12B 模型的 4-bit 量化版本)
- Python 环境(项目主要开发语言为 Python)
- 可选:ComfyUI,用于通过工作流直接体验加速效果
- 可选:NPU 环境,自定义 4-bit 矩阵乘内核同时支持 CUDA 与 NPU
安装与启动步骤
-
1查阅官方安装文档
README 的 Getting Started 只给出文档链接,具体安装步骤、依赖与内核编译方式以 Installation Guide 为准。
-
2克隆项目仓库
获取源码,用于运行 app 目录下的 Gradio Demo,或按官方文档进行本地安装与编译。
git clone https://github.com/nunchux-ai/nunchaku.git -
3安装 ComfyUI 插件
使用 ComfyUI-nunchaku 插件可在 ComfyUI 工作流中直接体验 4-bit 加速,安装方式见该仓库说明。
-
4运行 Gradio Demo
参考仓库 app 目录中的示例(如 app/flux.1/t2i,可复现 SVDQuant 论文结果)体验量化推理。
-
5查阅 API 与 FAQ
定制化部署参考 Python API Reference;遇到报错先查官方 FAQ 文档,再去 Discord 社区提问。
如何确认成功
README 未给出启动命令;以官方文档为准,能成功加载 4-bit 模型并正常出图即视为部署成功。
常见问题
Q:4-bit 模型需要多大显存?
A:项目定位是让 FLUX.1 等 12B 扩散模型在约 6GB 显存的消费级 GPU 上流畅运行,具体支持型号与配置请以官方文档为准。
Q:必须安装 ComfyUI 吗?
A:不是。既可用 ComfyUI-nunchaku 插件做工作流体验,也可通过 Python API 或仓库 app 目录下的 Gradio Demo 调用。
Q:如何量化自己的模型?
A:官方提供独立的 DeepCompressor 仓库用于自定义模型量化,采用基于 SVD 的低秩分解方案降低量化误差,流程见其文档。
Q:安装或运行报错去哪里查?
A:先查阅官方 FAQ 文档 https://nunchaku.tech/docs/nunchaku/faq/faq.html ,也可加入项目 Discord 社区交流。
注意事项
- 本次 README 节选未包含实际安装命令,安装细节请以官方 Installation Guide(https://nunchaku.tech/docs/nunchaku/installation/installation.html)为准。
- 量化矩阵乘内核依赖 CUDA 或 NPU 环境,需与硬件和驱动版本匹配。
- 仓库地址为 https://github.com/nunchux-ai/nunchaku ,预量化模型权重发布在 Hugging Face 与 ModelScope 上。
核心亮点
- SVDQuant 算法有效抑制离群值,4-bit 量化精度损失小,论文获 ICLR Spotlight 认可
- 提供优化后的 CUDA 内核,实测 FLUX.1 推理速度显著提升,显存占用大幅降低
- 原生集成 ComfyUI,用户无需编程即可体验量化加速,同时支持 LoRA 微调扩展
不足之处
- 目前主要针对 FLUX.1 等特定架构优化,对其他扩散模型的支持可能有限
- 依赖自定义内核,跨平台(如 AMD/Intel GPU)兼容性尚待验证
适用场景
- 在消费级显卡上本地运行 FLUX.1 等大型扩散模型进行图像生成
- 通过 ComfyUI 工作流快速集成量化推理,降低创作工具的硬件门槛
- 对扩散模型进行 4-bit 低秩微调,适配特定风格或任务
替代项目
bitsandbytes、GPTQ、AWQ
项目介绍
上一篇:DiffusionOPSD
下一篇:nncf
同类项目推荐
Long-RL
开源
让强化学习轻松驾驭超长序列,训练更稳更快
Long-RL: Scaling RL to Long Sequences (NeurIPS 2025)
TPA
开源
把注意力复杂度从平方降到线性,长序列不再卡顿
[NeurIPS 2025 Spotlight] TPA: Tensor ProducT ATTenTion Transformer (https://arxiv.or···
minimind
开源
两小时造出你的小模型,练手入门不求人
Train a 64M-parameter LLM from scratch in just 2h!
pruna
开源
一键优化 AI 模型,推理提速又省资源。
Pruna is a model optimization framework built for developers, enabling you to delive···