ComfyUI-Qwen-VL-API

在ComfyUI里直接调用通义千问视觉模型,让图像生成更智能

ComfyUI-Qwen-VL-API 是一个将阿里云通义千问视觉语言模型(Qwen-VL-Plus 和 Qwen-VL-Max)集成到 ComfyUI 的插件。它解决了 ComfyUI 用户无法直接调用商业级视觉理解模型的问题,使得在 ComfyUI 的节点化工作流中,可以轻松使用 Qwen-VL 进行图像描述、视觉问答、多模态推理等任务。该插件通过封装 API 接口,提供了简洁的节点,用户无需编写代码即可将视觉理解能力嵌入到图像生成流程中,例如用于生成提示词、图像内容分析、多轮对话等。核心能力包括:支持 Qwen-VL-Plus 和 Qwen-VL-Max 两种模型,支持图像输入和文本提示,可自定义 API 密钥和参数,并输出文本结果。项目基于 Python 开发,依赖 ComfyUI 和 Stable Diffusion 生态,安装简单,适合需要将视觉语言模型与图像生成工作流结合的用户。

开源 unknown 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 219
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类图像生成
开发团队ZHO-ZHO-ZHO
所属国家
官网地址
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议GPL-3.0
主要语言Python
技术栈/模型comfyui,stable-diffusion
GitHub 星标★ 219
30天Star增速
HF 下载量
上线时间2024-01-30 00:00:00
最近更新2026-07-03 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 无缝集成ComfyUI节点化工作流,无需编写代码即可调用Qwen-VL
  • 支持Plus和Max两个模型,覆盖不同精度和成本需求
  • 可灵活用于图像描述、提示词生成、视觉问答等多场景,扩展工作流能力

不足之处

  • 依赖阿里云API,需要付费且网络环境可能受限
  • 文档和社区支持相对薄弱,功能扩展依赖作者维护

适用场景

  • 在ComfyUI中自动生成图像提示词,提升文生图效率
  • 对生成的图像进行内容分析,用于质量评估或筛选
  • 结合多模态对话,实现交互式图像编辑或创作

替代项目

ComfyUI-LLM、ComfyUI-GPT4V、ComfyUI-ImageCaptioner

项目介绍

ComfyUI-Qwen-VL-API 是计算机视觉领域的开源项目,由 ZHO-ZHO-ZHO 开发,2024 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 219。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-07-03。

它主要面向的使用场景是:在ComfyUI中自动生成图像提示词,提升文生图效率。同类可对比的替代方案包括 ComfyUI-LLM、ComfyUI-GPT4V、ComfyUI-ImageCaptioner。

上一篇:EcoDepth

下一篇:pix2gestalt

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14