Sana

一句话生成高清大图,放大细节也不糊

NVIDIA 开源的高效高分辨率图像合成模型,采用线性 Diffusion Transformer 架构,在保持高质量生成的同时显著降低计算开销,支持超高清图像生成,兼顾速度与画质。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 9129
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队NVlabs
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型diffusion,dit,linear-transformer,nvfp4,pytorch,reinforcement-learning,sana,streaming-video,system-algorithm-deisgn,text-to-image-generation,text-to-video,transformers,video-generation,world-models
GitHub 星标★ 9129
30天Star增速
HF 下载量
上线时间2024-10-11 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数7

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 4 步

环境要求

  • Linux 环境并配备支持 CUDA 的 NVIDIA GPU(项目大量使用 PyTorch 与 NVFP4 优化)
  • 已安装 Python 与 PyTorch 运行环境
  • 已安装 git,可访问 GitHub
  • 需能访问 HuggingFace 等模型托管站点以下载权重

安装与启动步骤

  1. 1克隆仓库

    把 Sana 官方仓库下载到本地,等待 git 拉取完成。

    git clone https://github.com/NVlabs/Sana.git
  2. 2运行环境安装脚本

    进入仓库目录并执行官方提供的环境安装脚本,脚本会自动配置依赖,耗时较长请保持网络稳定。

    cd Sana && ./environment_setup.sh sana
  3. 3查阅安装文档

    README 未给出完整依赖清单与推理命令,请按官方 Installation Guide 核对 CUDA、PyTorch 版本等细节。

  4. 4按文档下载模型并推理

    从 Model Zoo 与 Sana Inference 文档获取权重下载地址与推理脚本用法,再运行生成示例。

如何确认成功

环境安装脚本执行结束且无报错,随后按官方文档运行推理脚本能正常生成图像即视为成功。

常见问题

Q:README 里没有推理命令怎么办?

A:README 只提供 Quick Start 的环境安装,推理、训练与模型下载命令需查阅官方文档 https://nvlabs.github.io/Sana/docs/ 对应页面。

Q:没有 NVIDIA GPU 能跑吗?

A:项目面向 CUDA GPU 优化(含 NVFP4 量化路径),README 未提供 CPU 版安装方案,建议使用 NVIDIA 显卡环境。

Q:安装脚本很慢或失败怎么排查?

A:先确认网络能访问 GitHub 与 PyPI,再对照官方 Installation Guide 检查 CUDA 与 PyTorch 版本是否匹配。

Q:想少装依赖直接用现成界面?

A:README 给出了 ComfyUI 与 SGLang 的文档入口,可参考对应页面用已有集成方式调用 Sana。

注意事项

  • README 中的下载链接多为外部文档,实际安装步骤请以 nvlabs.github.io/Sana/docs/installation/ 为准。
  • environment_setup.sh 需在仓库根目录下执行,且脚本名后的 sana 参数不要省略。
  • 模型权重体积较大,请预留充足磁盘空间与稳定网络。
  • 仓库涵盖 Sana、SANA-Video、SANA-WM 等多个子项目,按需进入对应文档避免装错依赖。

核心亮点

  • 采用线性扩散Transformer架构,显著降低高分辨率图像生成的计算复杂度,实现高效合成。
  • 支持NVFP4量化与系统级算法优化,在保持生成质量的同时提升推理速度与资源效率。
  • 集成强化学习微调与流式视频生成能力,扩展了从静态图像到动态视频的应用边界。

不足之处

  • 文档/社区待观察

适用场景

  • 高分辨率图像快速生成,适用于设计、广告等创意产业。
  • 实时或交互式图像编辑场景,需低延迟响应。
  • 视频内容生成与增强,用于短视频制作或虚拟现实内容创建。

替代项目

Stable Diffusion、DiT (Diffusion Transformers)、PixArt

项目介绍

Sana 是图像领域的开源项目,由 NVlabs 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(9,129)位列前 6%,在图像分类的 839 个项目里位列前 3%。

近 41 天,它的 GitHub 星标从 8,751 增加到 9,129,净增 378。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。Apache-2.0许可证,可免费使用和部署,无付费版本。

它主要面向的使用场景是:高分辨率图像快速生成,适用于设计、广告等创意产业。同类可对比的替代方案包括 Stable Diffusion、DiT (Diffusion Transformers)、PixArt。

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09