CogView4

中文海报文字精准渲染,高分辨率图像一键生成

CogView4 是智谱AI开源的多模态图像生成模型系列,包含 CogView4、CogView3-Plus 和 CogView3(ECCV 2024)三个版本。它主要解决文本到图像生成中的高分辨率、细节保真和中文理解难题,核心能力包括:支持高分辨率图像生成、精准的中文长文本渲染(如海报中的中文文字)、以及基于扩散模型的稳定生成。项目提供完整的训练、推理和微调代码,并支持多种推理加速方案。相比同类模型,CogView4 在中文语义理解和图文对齐上表现突出,适合需要高质量中文视觉内容的场景。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1099
维护状态 低维护
是否开源
定价模式 free

项目数据

分类图像生成
开发团队zai-org
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型eccv2024,high-resolution,image-generation,text-to-image
GitHub 星标★ 1099
30天Star增速
HF 下载量
上线时间2024-09-23 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(README 仅给出 Python 推理脚本,未说明具体版本)
  • NVIDIA GPU:512×512 约需 33GB 显存,开启 model_cpu_offload 后约 20GB
  • 系统内存建议至少 32GB,防止进程被系统杀掉
  • 建议使用 BF16 精度推理(官方测试条件)

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 CogView4 代码仓库,包含 inference 目录下的推理脚本。README 未给出依赖安装命令,请自行按脚本导入项准备环境。

    git clone https://github.com/zai-org/CogView4.git
  2. 2确认显存与分辨率

    按 README 显存表选择分辨率:512×512 需 33GB,1280×720 / 1024×1024 需 35GB;开启 offload 后可降至约 20GB。

  3. 3运行命令行推理

    执行 README 中给出的命令行推理示例脚本,按脚本内提示输入中文或英文提示词生成图片。

    python inference/cli_demo_cogview4.py
  4. 4开启低显存优化

    在推理脚本中加入以下三行,可显著降低显存占用(配合 enable_model_cpu_offload 可降到 20GB 左右)。

    pipe.enable_model_cpu_offload()
    pipe.vae.enable_slicing()
    pipe.vae.enable_tiling()
  5. 5运行 int8/int4 量化版

    显存仍不足时,可用 README 提供的 TorchAO int8/int4 脚本加载 text encoder 与 transformer。

    python inference/cli_demo_cogview4_int8.py
  6. 6启动 Gradio 界面

    运行 README 中提到的 gradio 网页 demo,在浏览器中交互式输入提示词生成图像。

    python inference/gradio_web_demo.py

关键配置

配置项必填说明示例
prompt文本提示词,CogView4 支持原生中文输入A vibrant cherry red sports car sits proudly under the gleam
guidance_scale引导强度,README 示例使用 3.53.5
num_inference_steps推理步数,README 示例使用 5050
num_images_per_prompt每个提示词生成图片数量1
width生成图片宽度,README 示例为 10241024
height生成图片高度,README 示例为 10241024

如何确认成功

运行结束后在当前目录生成 cogview4.png 文件,即为推理成功。

常见问题

Q:显存不够、进程被杀怎么办?

A:开启 pipe.enable_model_cpu_offload()、pipe.vae.enable_slicing()、pipe.vae.enable_tiling(),显存可降至约 20GB;仍不够可用 text encoder 4bit 或 int8/int4 脚本。

Q:支持中文提示词吗?

A:支持。CogView4 为 6B 参数模型,支持原生中文输入与中文文生图,能渲染海报中的中文长文本。

Q:不想本地部署,能在线体验吗?

A:可以,README 提供了 HuggingFace Space(THUDM-HF-SPACE/CogView4)和 ModelScope Space 在线体验入口。

Q:想微调模型怎么办?

A:官方推出了 CogKit 工具包,用于 CogView4 与 CogVideoX 系列的微调与推理。

注意事项

  • README 节选未包含 pip 依赖安装命令,请按实际脚本的 import 自行安装依赖。
  • 官方 DIT 模型测试条件为 BF16 精度、batchsize=4。
  • 建议设备内存至少 32GB,否则进程可能被系统杀死。
  • 2025/03/24 起官方推荐使用 CogKit 进行微调与推理。

核心亮点

  • 中文长文本渲染能力业界领先,海报/广告文字清晰不糊
  • 支持高分辨率(如1024x1024以上)直接生成,细节丰富
  • 提供完整训练/推理/微调代码,二次开发门槛低

不足之处

  • 模型体积较大,推理资源需求高
  • 文档/社区待观察

适用场景

  • 电商海报与广告图自动生成
  • 中文绘本/漫画分镜快速创作
  • 设计稿预可视化与素材批量生成

替代项目

Stable Diffusion、FLUX.1、DALL·E 3

项目介绍

CogView4 是图像领域的开源项目,由 zai-org 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,099)位列前 30%,在图像分类的 837 个项目里位列前 15%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:电商海报与广告图自动生成。同类可对比的替代方案包括 Stable Diffusion、FLUX.1、DALL·E 3。

上一篇:UNO

下一篇:MultiDiffusion

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
ComfyUI 开源

像搭积木一样连节点,生图流程自己搭

The most powerful and modular diffusion model GUI, api and backend with a graph/node···

★ 134493 2026-08-09