stable-fast

让 Stable Diffusion 在 NVIDIA GPU 上跑出数倍速度,无需改代码。

stable-fast 是一个专为 NVIDIA GPU 设计的 HuggingFace Diffusers 推理性能优化框架,由 WaveSpeed.ai 团队开发。它主要解决 Stable Diffusion 等扩散模型在推理时速度慢、显存占用高的问题,通过融合 CUDA 内核、利用 OpenAI Triton 编写高性能算子,并针对 Diffusers 库进行深度定制优化,从而显著提升图像和视频生成的速度。其核心能力包括:自动将模型转换为优化后的推理引擎,支持动态形状和批处理,减少内存拷贝和计算冗余,并提供了简单的 API 集成方式,开发者无需修改现有代码即可获得数倍的速度提升。该项目面向生产环境,适用于需要高吞吐量或低延迟的图像生成服务,也适合在资源受限的 GPU 上运行大型模型。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1304
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队chengzeyi
所属国家
官网地址
定价模式free
价格说明开源框架,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型cuda,deeplearnng,diffusers,inference-engines,openai-triton,performance-optimizations,pytorch,stable-diffusion,stable-video-diffusion,torch
GitHub 星标★ 1304
30天Star增速
HF 下载量
上线时间2023-10-17 00:00:00
最近更新2026-09-14 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 20 分钟 部署方式:库/依赖 4 步

环境要求

  • Linux 或 Windows 的 WSL2 系统(stable-fast 目前仅在这两者上测试过)
  • Python 3.10
  • 支持 CUDA 的 PyTorch(README 建议 1.12~2.1,作者实测 torch>=2.1.0)
  • CUDA 12.1 环境,且已安装 CUDNN/CUBLAS(源码编译时需要)
  • 作者实测搭配版本:xformers>=0.0.22、triton>=2.1.0

安装与启动步骤

  1. 1准备 CUDA 环境

    按 PyTorch 官网安装匹配 CUDA 12.1 的 PyTorch,并安装 xformers>=0.0.22、triton>=2.1.0。README 未给出具体安装命令。

  2. 2安装预构建 Wheel

    从 GitHub Releases 页面下载与本机系统匹配的 whl 文件,把命令中的 /your/path 换成实际下载路径。

    pip3 install /your/path/stable_fast.whl
  3. 3从 PyPI 安装

    README 注释中提到可从 PyPI 安装最新稳定版,适合不想自行编译源码的用户。

    pip3 install -v -U stable-fast
  4. 4从源码安装

    从 GitHub main 分支源码安装。需本机已有编译环境和 CUDNN/CUBLAS;若构建与运行 GPU 型号不同,先设 TORCH_CUDA_ARCH_LIST。

    pip3 install -v -U git+https://github.com/chengzeyi/stable-fast.git@main#egg=stable-fast

关键配置

配置项必填说明示例
TORCH_CUDA_ARCH_LIST否当构建与运行的 GPU 类型不同时,指定目标 GPU 架构再安装8.6

如何确认成功

README 未提供验证命令;pip 安装无报错、能成功 import stable_fast 即可认为安装完成。

常见问题

Q:支持原生 Windows 吗?

A:README 说明 stable-fast 目前仅在 Linux 和 Windows 的 WSL2 中测试过,原生 Windows 未经验证。

Q:安装时报编译错误怎么办?

A:先确认已安装支持 CUDA 的 PyTorch 以及 CUDNN/CUBLAS,并尽量使用作者实测的 CUDA 12.1、Python 3.10、torch>=2.1.0 组合。

Q:换 GPU 后重装报架构不匹配?

A:若运行和构建 stable-fast 的 GPU 类型不同,安装前设置 TORCH_CUDA_ARCH_LIST 环境变量指定目标架构。

Q:预构建 wheel 从哪里下载?

A:从 GitHub 项目的 Releases 页面下载与系统匹配的 wheel 文件,再用 pip3 install 命令安装。

注意事项

  • README 已声明 stable-fast 的活跃开发暂停,作者转向 ComfyUI 相关新项目。
  • 项目只面向 NVIDIA CUDA GPU,不支持非 CUDA 硬件后端。
  • 从源码安装需要本机具备编译工具链以及 CUDNN/CUBLAS。
  • README 未给出使用示例代码,具体 API 集成方式请以仓库后续文档为准。

核心亮点

  • 基于 Triton 和 CUDA 深度优化,推理速度提升显著,实测可达 2-3 倍。
  • 与 HuggingFace Diffusers 无缝集成,只需几行代码即可启用,降低使用门槛。
  • 支持动态形状和批处理,适合在线服务场景,能有效提升 GPU 利用率。

不足之处

  • 仅支持 NVIDIA GPU,对 AMD 或 Apple Silicon 用户不友好。
  • 文档和社区支持尚在完善中,遇到复杂问题可能缺乏现成解决方案。

适用场景

  • Stable Diffusion 在线生图服务,需要低延迟响应。
  • 批量生成图片或视频的离线任务,追求高吞吐量。
  • 在单卡或有限 GPU 资源上运行大型扩散模型,减少显存压力。

替代项目

TensorRT、AITemplate、ONNX Runtime

项目介绍

stable-fast 是基础设施领域的开源项目,由 chengzeyi 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,304)位列前 30%,在基础设施分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:StableDiffusion在线生图服务,需要低延迟响应。同类可对比的替代方案包括 TensorRT、AITemplate、ONNX Runtime。

上一篇:onediff

下一篇:modal-examples

同类项目推荐

freebuff-proxy 开源

聚合多账号,一键接入 OpenAI 兼容 API,轻松管理会话。

Multi-account OpenAI-compatible gateway for coding models. Pooled keys, session life···

★ 213 2026-08-20
microduck 开源

用 Rust 造一只会走路的桌面小鸭,快速上手双足机器人。

A Tiny biped duck robot

★ 8684 2026-09-10
soperator 开源

用 Kubernetes 原生方式运行 Slurm,简化 HPC 集群管理。

Run Slurm in Kubernetes

★ 439 2026-08-10
ollama 开源

一条命令本地跑起大模型,免费、私密、不卡顿

Get up and running with Kimi, GLM, MiniMax, DeepSeek, gpt-oss, Qwen, Gemma and other···

★ 181484 2026-08-09