imagen-pytorch

说句话生成高清图,放大也不糊

谷歌 Imagen 文生图模型的 PyTorch 实现,忠实还原其扩散模型架构与超分辨率能力,代码清晰、易于扩展,是研究文生图技术原理与二次开发的优质开源参考。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 8427
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队lucidrains
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型artificial-intelligence,deep-learning,imagination-machine,text-to-image,text-to-video
GitHub 星标★ 8427
30天Star增速
HF 下载量
上线时间2022-05-23 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数13

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 3 环境(README 未标注具体最低版本)
  • pip 包管理器
  • 已安装 PyTorch(示例代码中直接 import torch)
  • 建议使用虚拟环境隔离依赖

安装与启动步骤

  1. 1检查 Python 环境

    确认本机已装 Python 3 与 pip,建议先建虚拟环境再安装,避免与系统包冲突。

    python --version
    pip --version
  2. 2安装 imagen-pytorch

    README 唯一给出的安装方式,直接从 PyPI 安装官方包,会自动拉取依赖。

    pip install imagen-pytorch
  3. 3验证库可导入

    用 README 示例中的导入语句做冒烟测试,无报错即安装成功。

    python -c "import torch
    from imagen_pytorch import Unet, Imagen"
  4. 4生成默认配置

    运行内置命令行工具,生成包含训练器、数据集与 Imagen 三部分的可编辑配置。

    imagen config
  5. 5指定配置路径

    把配置写到自定义位置,便于后续按需修改训练器、数据集和模型参数。

    imagen config --path ./configs/config.json

如何确认成功

执行 python -c "from imagen_pytorch import Unet, Imagen" 不报错,说明库已安装成功。

常见问题

Q:安装很慢或超时怎么办?

A:README 未提供镜像说明,可自行指定 PyPI 国内镜像源加速,或换用更稳定的网络环境重试 pip install imagen-pytorch。

Q:需要多强的显卡?

A:README 未给出硬件要求。该库是扩散模型实现,含内存优化 UNet 设计,实际训练或推理建议使用带足够显存的 NVIDIA GPU。

Q:怎么改训练/数据集参数?

A:先运行 imagen config 生成配置文件,再编辑其中的 trainer、dataset 与 imagen 三部分;各参数含义 README 指向源码中的 configs.py。

Q:包名和导入名为什么不一样?

A:安装包名为 imagen-pytorch,导入模块名为 imagen_pytorch(下划线),使用时注意区分。

注意事项

  • 本仓库是研究性质的实现,README 未给出完整的训练与推理端到端流程,二次开发需阅读源码。
  • README 提到文本编码依赖大规模预训练 T5 模型,实际使用时需自行准备或下载相应权重。
  • README 的 Usage 代码片段在节选中不完整,运行前请补齐官网 README 中的完整示例。

核心亮点

  • 完整实现Google Imagen架构,支持文本到图像及视频生成,代码结构清晰,便于二次开发
  • 基于PyTorch,与主流深度学习生态兼容,提供预训练模型和推理示例,上手门槛较低
  • 项目活跃,持续更新,社区反馈及时,文档和示例代码覆盖常见使用场景

不足之处

  • 依赖大量外部库和预训练模型,环境配置复杂,资源消耗高
  • 文档/社区待观察

适用场景

  • 学术研究:用于文本到图像/视频生成模型的实验与改进
  • 创意设计:快速生成概念图、插画或短视频素材
  • 教育演示:作为深度学习生成模型的教学案例

替代项目

DALL-E 2 (OpenAI)、Stable Diffusion (Stability AI)、CogVideo (THUDM)

项目介绍

imagen-pytorch 是图像领域的开源项目,由 lucidrains 开发,2022 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(8,427)位列前 6%,在图像分类的 839 个项目里位列前 3%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:学术研究:用于文本到图像/视频生成模型的实验与改进。同类可对比的替代方案包括 DALL-E 2 (OpenAI)、Stable Diffusion (Stability AI)、CogVideo (THUDM)。

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09