CogView

用文字描述,一键生成高质量图像

CogView 是智源研究院开源的文本生成图像模型,源自 NeurIPS 2021 论文。它基于 Transformer 架构,将文本描述转化为高质量图像,解决文本到图像生成的跨模态难题。核心能力包括:利用预训练模型进行大规模图文联合建模,支持高分辨率图像生成,并提供多种采样策略。项目包含完整训练和推理代码,支持自定义数据集微调,适合研究和应用开发。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1799
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队zai-org
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型pretrained-models,pytorch,text-to-image,transformers
GitHub 星标★ 1799
30天Star增速
HF 下载量
上线时间2021-05-25 00:00:00
最近更新2026-09-17 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:进阶 约 30 分钟 部署方式:Docker 6 步

环境要求

  • Linux 服务器,推荐使用 NVIDIA V100 或 A100 GPU
  • PyTorch >= 1.7.0
  • NVIDIA apex(方案一需自行安装,README 给出其仓库链接)
  • Docker(方案二需要,镜像为 cogview/cuda111_torch181_deepspeed040)
  • Python 其他依赖见仓库 requirements.txt

安装与启动步骤

  1. 1准备硬件环境

    准备 Linux 服务器与 NVIDIA GPU,推荐 V100/A100;显存或算力不足时可减小推理批大小、或训练更小的模型。

  2. 2安装依赖(方案一)

    先自行安装 PyTorch(>=1.7.0) 与 apex,再安装其余依赖;README 只给出 apex 仓库链接,未给出安装命令。

    pip install -r requirements.txt
  3. 3拉取官方镜像

    方案二:环境配置失败时改用官方镜像,镜像名 cogview/cuda111_torch181_deepspeed040。

    docker pull cogview/cuda111_torch181_deepspeed040
  4. 4启动并进入容器

    执行仓库自带的 env/start_docker.sh 创建后台容器 bg-cogview,随后直接进入该容器。

    ./env/start_docker.sh && docker exec -it bg-cogview bash
  5. 5进入项目目录

    容器内代码放在 /root/cogview,进入后可看到推理与训练代码。

    cd /root/cogview
  6. 6查看推理脚本

    生成功能封装在 generate_samples.py,可调参数见 arguments.py,按这两个文件的说明执行生成。

关键配置

配置项必填说明示例
--max-inference-batch-size否推理批大小,显存较小的 GPU 上需要调小该值4

如何确认成功

容器方式下能进入 bg-cogview 容器并看到 /root/cogview 目录;方案一下 pip install 无报错且能导入 torch。

常见问题

Q:GPU 显存不够怎么办?

A:README 明确说明可减小 --max-inference-batch-size,或在较弱的 GPU 上训练更小的模型。

Q:依赖环境装不上怎么办?

A:改用方案二,拉取并运行官方 Docker 镜像 cogview/cuda111_torch181_deepspeed040,镜像内已配好环境。

Q:在哪看生成参数和用法?

A:生成函数封装在 generate_samples.py 中,参数定义在 arguments.py 中,阅读这两个文件即可。

Q:支持英文提示词吗?

A:README 提到较新的 CogView2 模型支持英文输入,但通常先翻译成中文效果更好。

注意事项

  • 项目为 4B 参数 Transformer,训练与推理都对 GPU 资源要求较高。
  • CogView 论文被 NeurIPS 2021 收录,PB-relax 与 Sandwich-LN 有助于稳定训练超深 Transformer。
  • CogView2 与 ImageReward 是另外的独立仓库(THUDM 下),不在本仓库中。
  • README 未给出推理的具体命令行参数,运行前请先阅读 generate_samples.py 与 arguments.py。

核心亮点

  • 基于 Transformer 的先进架构,生成图像质量高
  • 提供完整训练和推理代码,便于二次开发
  • 支持多种采样策略,灵活控制生成效果

不足之处

  • 模型参数量大,训练和推理资源需求高
  • 文档/社区待观察

适用场景

  • 学术研究:探索文本到图像生成的前沿方法
  • 创意设计:快速生成概念图或插画
  • 数据增强:为机器学习生成合成图像数据

替代项目

DALL-E、Stable Diffusion、Imagen

项目介绍

CogView 是图像领域的开源项目,由 zai-org 开发,2021 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,799)位列前 30%,在图像分类的 837 个项目里位列前 11%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-17。Apache-2.0许可,可免费使用和部署。

它主要面向的使用场景是:学术研究:探索文本到图像生成的前沿方法。同类可对比的替代方案包括 DALL-E、Stable Diffusion、Imagen。

上一篇:RPG-DiffusionMaster

下一篇:BrushNet

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09