gen-cv

用自然语言搞定视觉任务,快速搭建生成式视觉应用

gen-cv 是微软推出的视觉 AI 解决方案加速器,旨在帮助开发者快速构建基于生成式计算机视觉的应用。它解决了传统计算机视觉任务(如目标检测、图像分割)依赖大量标注数据、难以灵活适配新场景的问题,通过整合 Azure 认知服务(如 Florence、DALL-E 3、Embeddings)与向量搜索,提供从图像理解到图像生成的端到端能力。项目核心包括:利用基础模型进行零样本/少样本视觉推理,通过自然语言交互完成检测、分类、描述等任务;结合认知搜索向量存储实现图像语义检索与多模态问答;支持生成式视觉任务,如根据文本生成或编辑图像。代码以 Jupyter Notebook 形式呈现,易于上手和二次开发,适合作为企业级视觉 AI 应用的起点。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 435
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队Azure
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,可免费使用和部署。
访问状态
是否开源是
开源协议MIT
主要语言Jupyter Notebook
技术栈/模型azure-computer-vision,cognitive-search-vector-store,dalle-3,embeddings,florence,foundation-models,generative-computer-vision,image-search,stable-diffusion
GitHub 星标★ 435
30天Star增速
HF 下载量
上线时间2023-05-26 00:00:00
最近更新2026-09-17 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 集成 Florence 与 DALL-E 3,零样本完成检测/分割/生成,无需训练数据
  • 结合向量搜索实现图像语义检索,支持多模态问答场景
  • 微软官方出品,代码示例完整,可直接在 Azure 环境部署

不足之处

  • 依赖 Azure 云服务,本地化部署成本高
  • 文档/社区待观察

适用场景

  • 工业质检:用自然语言描述缺陷,自动定位并分类
  • 智能相册:基于语义搜索快速找到特定内容图片
  • 内容创作:根据文案自动生成配图或编辑现有图像

替代项目

Hugging Face Transformers、OpenAI CLIP、LangChain

项目介绍

gen-cv 是计算机视觉领域的开源项目,由 Azure 开发,2023 年首次发布。

它收录于计算机视觉分类,该分类目前共有 446 个项目,GitHub 星标数为 435。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-17。MIT许可证,可免费使用和部署。

它主要面向的使用场景是:工业质检:用自然语言描述缺陷,自动定位并分类。同类可对比的替代方案包括 Hugging Face Transformers、OpenAI CLIP、LangChain。

上一篇:ladi-vton

下一篇:ComfyUI-BiRefNet-ZHO

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14