Qwen-Image-2.1

开源文生图,中文提示词直出商业级图像

Qwen-Image-2.1 是阿里通义千问团队开源的最强图像生成模型,基于 Python 实现,定位为可本地部署的高质量文生图方案。它主要解决闭源图像模型 API 成本高、数据隐私不可控、无法深度定制的问题,让开发者和研究者能在自有环境中生成商业级图像。核心能力包括:对复杂中文提示词的精准理解与渲染,生成图像在构图、光影、材质细节上达到较高水准;支持多种宽高比与分辨率输出,适配海报、插画、电商图等场景;模型权重开放,可结合 LoRA 微调、ControlNet 等生态做风格定制与可控生成。相比同类开源模型,它在中文语义对齐和文字生成方面优势明显,适合需要中文场景落地的团队。项目星标约 1468,处于成长阶段,社区正在快速积累使用案例与工具链适配。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1468
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队QwenLM
所属国家
官网地址
定价模式free
价格说明开源模型,免费使用,需自行部署
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型
GitHub 星标★ 1468
30天Star增速
HF 下载量
上线时间2026-09-14 00:00:00
最近更新2026-09-25 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-26
浏览次数0

使用教程

难度:进阶 约 20 分钟 部署方式:模型权重 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目开发语言为 Python)
  • 可用的 CUDA GPU(示例代码使用 .to("cuda") 与 torch.Generator("cuda"))
  • 已安装 PyTorch(示例使用 torch.bfloat16 精度)
  • 已具备可加载 QwenImage21Pipeline 的推理环境(README 未给出具体安装命令)
  • 磁盘与显存需满足 7B 视觉生成组件的权重加载需求

安装与启动步骤

  1. 1获取模型权重

    README 只给出权重与体验入口:HuggingFace/ModelScope 页面及在线 Demo,未提供下载命令,请自行在页面获取权重。

  2. 2加载推理管道

    用 from_pretrained 载入 Qwen/Qwen-Image-2.1 权重并转 bfloat16、放到 cuda。需先自行导入 torch 与 QwenImage21Pipeline(README 未给导入路径)。

    pipe = QwenImage21Pipeline.from_pretrained(
        "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
    ).to("cuda")
  3. 3改写提示词

    README 提到先运行 rewriter(run_vllm.py)读取输出,得到 rewritten_prompt 与 wh_ratio;README 未给出该脚本的确切运行命令。

  4. 4按宽高比推理

    用 WH_RATIO_TO_SIZE 把 wh_ratio 映射为宽高,默认 (2048, 2048),推理步数 40,固定随机种子 42。

    width, height = WH_RATIO_TO_SIZE.get(rewrite["wh_ratio"], (2048, 2048))
    
    image = pipe(
        prompt=prompt,
        width=width, height=height,
        num_inference_steps=40,
        generator=torch.Generator("cuda").manual_seed(42),
    ).images[0]
  5. 5保存生成结果

    取返回结果的第一张图并落盘为 PNG,随后打开文件确认画面效果。

    image.save("rewritten_example.png")

关键配置

配置项必填说明示例
模型 ID是from_pretrained 传入的权重标识Qwen/Qwen-Image-2.1
torch_dtype是权重加载精度,示例用 bfloat16 省显存torch.bfloat16
width / height是输出分辨率,由 wh_ratio 经 WH_RATIO_TO_SIZE 映射2048, 2048
num_inference_steps是采样步数,示例为 4040
generator否随机种子,用于复现同一张图42
wh_ratio否提示词改写阶段输出的宽高比,用于换算分辨率16:9

如何确认成功

脚本运行结束后生成 rewritten_example.png,打开该图片,画面与提示词描述一致即为成功。

常见问题

Q:没有 GPU 能跑吗?

A:README 示例全程使用 cuda(.to("cuda")、torch.Generator("cuda")),未提供 CPU 路径,建议使用带 CUDA 的显卡。

Q:可以先不装模型直接体验吗?

A:可以,README 提供了 HuggingFace Spaces 在线 Demo 入口,可直接在浏览器中试用,无需本地环境。

Q:提示词要怎么准备?

A:README 建议先跑 rewriter(run_vllm.py),读取其输出的 rewritten_prompt 和 wh_ratio,再喂给推理管道。

Q:输出尺寸怎么定?

A:由改写结果中的 wh_ratio 经 WH_RATIO_TO_SIZE 映射,取不到时使用默认值 (2048, 2048)。

Q:显存不足怎么办?

A:README 未提供量化或低显存方案,可尝试降低 width/height 或减小 num_inference_steps,或以 bfloat16 之外的方式加载。

注意事项

  • README 节选中没有依赖安装(如 pip install)说明,本教程未编造任何安装命令
  • 权重可从 README 给出的 ModelScope 与 HuggingFace 页面获取
  • 文生图管线代码来自 README Quick Start 片段,其中 QwenImage21Pipeline 的导入路径未在节选中出现
  • 模型含 7B 参数的视觉生成组件,首次加载需下载较大权重,请预留时间与磁盘空间

核心亮点

  • 中文提示词理解与文字渲染能力强,适合中文场景落地
  • 模型权重完全开源,支持本地部署与 LoRA 等二次微调
  • 生成质量在开源模型中处于第一梯队,构图与光影细节到位

不足之处

  • 项目较新,周边工具链与社区教程尚在积累
  • 本地部署对显存和算力要求较高,推理成本不低

适用场景

  • 电商团队批量生成中文商品海报与主图
  • 设计师用本地模型做插画草稿与风格探索
  • 开发者基于权重微调垂直领域图像生成应用

替代项目

Stable Diffusion、FLUX.1

项目介绍

Qwen-Image-2.1 是图像领域的开源项目,由 QwenLM 开发,是 2026 年新上线的项目。

在全站 13,109 个收录项目中,它的 GitHub 星标数(1,468)位列前 30%,在图像分类的 840 个项目里位列前 12%。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-25。免费使用,需自行部署。

它主要面向的使用场景是:电商团队批量生成中文商品海报与主图。同类可对比的替代方案包括 Stable Diffusion、FLUX.1。

上一篇:dsh-image-gen

下一篇:没有了!

同类项目推荐

satori 开源

网页代码一键变高清图,放大不糊,不用截图

Enlightened library to convert HTML and CSS to SVG

★ 13967 2026-08-09
C2GAN 开源

用关键点精准控制图像生成,让AI画出你想要的结构

[ACM MM 2019 Oral] Cycle In Cycle Generative Adversarial Networks for Keypoint-Guide···

★ 70 2026-08-09
imagen-pytorch 开源

说句话生成高清图,放大也不糊

Implementation of Imagen, Google's Text-to-Image Neural Network, in Pytorch

★ 8427 2026-08-09