Infinity 是图像领域的开源项目,由 FoundationVision 开发,2024 年首次发布。
在全站 13,109 个收录项目中,它的 GitHub 星标数(1,588)位列前 30%,在图像分类的 840 个项目里位列前 11%。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:高分辨率文本到图像生成研究。同类可对比的替代方案包括 VAR、LlamaGen、Muse。

把图像拆成比特流,自回归生成高清图
Infinity 是一个基于自回归建模的高分辨率图像生成框架,核心创新在于将图像 token 化为 bitwise 形式,并通过大规模 bitwise 自回归建模实现高质量、高分辨率的文本到图像合成。它解决了传统自回归图像生成中 token 表示粒度粗、长序列建模效率低、高分辨率生成质量不佳等问题。项目提供了完整的训练和推理代码,支持从零训练和预训练模型微调,并集成了多种评估指标。其核心能力包括高效的 bitwise tokenizer、可扩展的自回归 transformer 架构,以及在 ImageNet 和文本到图像基准上的 SOTA 性能,论文发表于 CVPR 2025 Oral。
1获取项目代码
把 Infinity 仓库克隆到本地,后续命令需在项目根目录(含 requirements.txt 与 Dockerfile)执行。
git clone https://github.com/FoundationVision/Infinity.git2安装 Python 依赖
在项目根目录按 README 要求安装依赖清单,建议使用虚拟环境避免污染系统环境。
pip3 install -r requirements.txt3确认 PyTorch 版本
FlexAttention 加速要求 torch>=2.5.1,先检查版本,不满足需先升级 torch。
python -c "import torch; print(torch.__version__)"4下载 flan-t5-xl
用 transformers 自动下载 flan-t5-xl 到 ~/.cache/huggingface,另需从 Hugging Face 下载 FoundationVision/infinity 的 vae 与 transformers
from transformers import T5Tokenizer, T5ForConditionalGeneration
tokenizer = T5Tokenizer.from_pretrained("google/flan-t5-xl")
model = T5ForConditionalGeneration.from_pretrained("google/flan-t5-xl")5构建 Docker 镜像
在项目根目录用 README 提供的 Dockerfile 构建镜像,需保证本机可访问 Docker 与网络。
docker build -t my-flash-attn-env .6启动 Docker 容器
以 --gpus all 启动容器并把本地目录挂载到 /workspace,注意把 /your/path 换成你的实际本地路径。
docker run --gpus all -it --name my-container -v /your/path:/workspace my-flash-attn-env7运行推理脚本
容器内执行复现脚本生成图像,如需自定义提示词可先修改 reproduce.py 中的 prompt。
python Infinity/tools/reproduce.py| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
reproduce.py 中的 prompt | 否 | 文本到图像的提示词,可替换为自己的描述 | 在 reproduce.py 中改为你的提示词 |
容器内执行 python Infinity/tools/reproduce.py 能正常跑完并输出生成图像、无报错,即部署成功。
Q:flan-t5-xl 权重会下载到哪里?
A:README 说明这三行代码会把 flan-t5-xl 下载到 ~/.cache/huggingface 目录,可通过该缓存目录确认是否下载完成。
Q:如何用自己的提示词生成图像?
A:参考 README 提示,只需修改 reproduce.py 里的 prompt 内容,然后重新执行该脚本即可。
Q:为什么要求 torch 版本?
A:README 说明训练使用 FlexAttention 加速,因此需要 torch>=2.5.1,版本过低可能无法运行。
Q:Docker 方式能做什么?
A:README 指出该容器方式适合没有相关背景的用户,用于在本地复现论文模型的推理(inference only)。
VAR、LlamaGen、Muse
Infinity 是图像领域的开源项目,由 FoundationVision 开发,2024 年首次发布。
在全站 13,109 个收录项目中,它的 GitHub 星标数(1,588)位列前 30%,在图像分类的 840 个项目里位列前 11%。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:高分辨率文本到图像生成研究。同类可对比的替代方案包括 VAR、LlamaGen、Muse。
上一篇:ru-dalle
下一篇:cog-face-to-many
satori
开源
网页代码一键变高清图,放大不糊,不用截图
Enlightened library to convert HTML and CSS to SVG
C2GAN
开源
用关键点精准控制图像生成,让AI画出你想要的结构
[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···
stable-diffusion-webui
开源
打开网页说想法,配图素材几秒到手
Stable Diffusion web UI
imagen-pytorch
开源
说句话生成高清图,放大也不糊
Implementation of Imagen, Google's Text-to-Image Neural Network, in Pytorch