Infinity

把图像拆成比特流,自回归生成高清图

Infinity 是一个基于自回归建模的高分辨率图像生成框架,核心创新在于将图像 token 化为 bitwise 形式,并通过大规模 bitwise 自回归建模实现高质量、高分辨率的文本到图像合成。它解决了传统自回归图像生成中 token 表示粒度粗、长序列建模效率低、高分辨率生成质量不佳等问题。项目提供了完整的训练和推理代码,支持从零训练和预训练模型微调,并集成了多种评估指标。其核心能力包括高效的 bitwise tokenizer、可扩展的自回归 transformer 架构,以及在 ImageNet 和文本到图像基准上的 SOTA 性能,论文发表于 CVPR 2025 Oral。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1588
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队FoundationVision
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型auto-regressive-model,autoregressive-models,generative-model,gpt,gpt-2,image-generation,text-to-image,text-to-image-generation,transformers
GitHub 星标★ 1588
30天Star增速
HF 下载量
上线时间2024-11-29 00:00:00
最近更新2026-09-14 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 45 分钟 部署方式:Docker 7 步

环境要求

  • torch>=2.5.1(FlexAttention 加速训练的要求)
  • 已安装 Python 与 pip3,用于执行 pip3 install -r requirements.txt
  • 支持 CUDA 的 NVIDIA GPU,docker run 需使用 --gpus all
  • 可访问 Hugging Face 的网络,用于下载 FoundationVision/infinity 与 google/flan-t5-xl 权重

安装与启动步骤

  1. 1获取项目代码

    把 Infinity 仓库克隆到本地,后续命令需在项目根目录(含 requirements.txt 与 Dockerfile)执行。

    git clone https://github.com/FoundationVision/Infinity.git
  2. 2安装 Python 依赖

    在项目根目录按 README 要求安装依赖清单,建议使用虚拟环境避免污染系统环境。

    pip3 install -r requirements.txt
  3. 3确认 PyTorch 版本

    FlexAttention 加速要求 torch>=2.5.1,先检查版本,不满足需先升级 torch。

    python -c "import torch; print(torch.__version__)"
  4. 4下载 flan-t5-xl

    用 transformers 自动下载 flan-t5-xl 到 ~/.cache/huggingface,另需从 Hugging Face 下载 FoundationVision/infinity 的 vae 与 transformers

    from transformers import T5Tokenizer, T5ForConditionalGeneration
    tokenizer = T5Tokenizer.from_pretrained("google/flan-t5-xl")
    model = T5ForConditionalGeneration.from_pretrained("google/flan-t5-xl")
  5. 5构建 Docker 镜像

    在项目根目录用 README 提供的 Dockerfile 构建镜像,需保证本机可访问 Docker 与网络。

    docker build -t my-flash-attn-env .
  6. 6启动 Docker 容器

    以 --gpus all 启动容器并把本地目录挂载到 /workspace,注意把 /your/path 换成你的实际本地路径。

    docker run --gpus all -it --name my-container -v /your/path:/workspace my-flash-attn-env
  7. 7运行推理脚本

    容器内执行复现脚本生成图像,如需自定义提示词可先修改 reproduce.py 中的 prompt。

    python Infinity/tools/reproduce.py

关键配置

配置项必填说明示例
reproduce.py 中的 prompt否文本到图像的提示词,可替换为自己的描述在 reproduce.py 中改为你的提示词

如何确认成功

容器内执行 python Infinity/tools/reproduce.py 能正常跑完并输出生成图像、无报错,即部署成功。

常见问题

Q:flan-t5-xl 权重会下载到哪里?

A:README 说明这三行代码会把 flan-t5-xl 下载到 ~/.cache/huggingface 目录,可通过该缓存目录确认是否下载完成。

Q:如何用自己的提示词生成图像?

A:参考 README 提示,只需修改 reproduce.py 里的 prompt 内容,然后重新执行该脚本即可。

Q:为什么要求 torch 版本?

A:README 说明训练使用 FlexAttention 加速,因此需要 torch>=2.5.1,版本过低可能无法运行。

Q:Docker 方式能做什么?

A:README 指出该容器方式适合没有相关背景的用户,用于在本地复现论文模型的推理(inference only)。

注意事项

  • Docker 方式按 README 说明仅用于推理复现,不含训练。
  • docker run 使用了 --gpus all,机器需具备可用的 NVIDIA GPU 与容器 GPU 支持。
  • 权重来自 Hugging Face(FoundationVision/infinity 及 google/flan-t5-xl),网络不佳时需耐心等待或提前准备缓存。
  • 安装依赖与构建镜像均需在克隆下来的项目根目录中执行。

核心亮点

  • bitwise 自回归建模创新性强,token 粒度更细,生成细节更丰富
  • 在 ImageNet 256/512 和文本到图像任务上达到 SOTA,有 CVPR Oral 背书
  • 代码开源,提供训练和推理脚本,便于复现和二次开发

不足之处

  • 训练资源需求高,普通开发者难以复现大规模实验
  • 文档/社区待观察,项目较新,生态和教程尚不完善

适用场景

  • 高分辨率文本到图像生成研究
  • 自回归生成模型架构探索
  • 图像 tokenizer 与离散表示学习

替代项目

VAR、LlamaGen、Muse

项目介绍

Infinity 是图像领域的开源项目,由 FoundationVision 开发,2024 年首次发布。

在全站 13,109 个收录项目中,它的 GitHub 星标数(1,588)位列前 30%,在图像分类的 840 个项目里位列前 11%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:高分辨率文本到图像生成研究。同类可对比的替代方案包括 VAR、LlamaGen、Muse。

上一篇:ru-dalle

下一篇:cog-face-to-many

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
imagen-pytorch 开源

说句话生成高清图,放大也不糊

Implementation of Imagen, Google's Text-to-Image Neural Network, in Pytorch

★ 8427 2026-08-09