groundingLMM

让AI边聊边精准圈出图像中的每个物体

GLaMM(Grounding Large Multimodal Model)是CVPR 2024提出的首个能够将自然语言响应与对象分割掩码无缝集成的多模态大模型。它解决了传统多模态模型只能生成文本描述、无法在像素级定位或分割所指对象的问题。核心能力包括:像素级视觉定位(Pixel-Level Grounding),即生成文本时同步输出对应物体的分割掩码;多模态对话与分割的联合推理,支持基于图像内容的问答、指代分割和区域描述等任务;以及区域级理解(Region-Level Understanding),可对图像中特定区域进行细粒度分析。该模型通过统一架构将视觉编码器、语言模型和分割解码器结合,在多项基准上取得领先性能。项目提供预训练模型和推理代码,适合需要细粒度视觉理解与交互式分割的研究和应用场景。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 970
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队mbzuai-oryx
所属国家
定价模式free
价格说明开源模型,Apache-2.0许可证,可免费使用和部署,无在线服务或付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型foundation-models,llm-agent,lmm,vision-and-language,vision-language-model
GitHub 星标★ 970
30天Star增速
HF 下载量
上线时间2023-11-02 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 首个将文本生成与像素级分割掩码统一输出的多模态模型,创新性强
  • 支持指代分割、区域描述等细粒度任务,交互体验直观
  • 基于LLaVA架构扩展,社区生态兼容性好,易于二次开发

不足之处

  • 项目处于早期阶段,文档和示例代码不够完善
  • 模型参数量大,推理资源需求高,部署门槛较高

适用场景

  • 智能图像编辑工具,用户用自然语言指令选中并修改特定物体
  • 辅助视觉障碍人士理解图像,通过语音描述+区域高亮
  • 机器人视觉导航,实时定位并分割目标物体

替代项目

LLaVA、GPT-4V、SEEM

项目介绍

groundingLMM 是计算机视觉领域的开源项目,由 mbzuai-oryx 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(970)位列前 30%,在计算机视觉分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。Apache-2.0许可证,可免费使用和部署,无在线服务或付费版本。

它主要面向的使用场景是:智能图像编辑工具,用户用自然语言指令选中并修改特定物体。同类可对比的替代方案包括 LLaVA、GPT-4V、SEEM。

上一篇:torchxrayvision

下一篇:FasterViT

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14