Groma

让多模态模型精准指认图像中的每个区域,实现细粒度视觉定位。

Groma 是一个基于多模态大语言模型(MLLM)的视觉定位模型,核心创新在于“局部视觉标记化”(Localized Visual Tokenization)。它通过将图像中的区域级特征编码为离散的视觉标记,使模型能够精准地理解并引用图像中的具体区域,从而完成细粒度的视觉定位任务。Groma 解决了传统多模态模型在区域级理解上的不足,即模型能描述图像整体但难以精确指代局部对象。其核心能力包括:区域级视觉理解、基于文本指令的目标检测与分割、以及多模态对话中的视觉引用。该模型在 ECCV 2024 发表,提供了完整的训练和推理代码,并支持自定义数据微调,适合研究人员和开发者用于构建具备精细视觉定位能力的多模态应用。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 586
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队FoundationVision
所属国家
定价模式free
价格说明开源模型,Apache-2.0许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型foundation-models,grounding,large-language-models,llama,llama2,llm,mllm,multimodal,vision-language-model
GitHub 星标★ 586
30天Star增速
HF 下载量
上线时间2024-04-21 00:00:00
最近更新2026-08-13 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 创新局部视觉标记化,显著提升区域级理解精度
  • 支持文本指令驱动的目标检测与分割,交互直观
  • 代码开源,提供训练和推理脚本,易于复现和扩展

不足之处

  • 项目较新,社区生态和文档尚待完善
  • 模型体积较大,推理资源要求较高

适用场景

  • 多模态对话中需要精确指代图像对象的场景
  • 自动化图像标注和视觉问答系统
  • 机器人视觉导航中的目标定位

替代项目

Shikra、Ferret、GPT4RoI

项目介绍

Groma 是计算机视觉领域的开源项目,由 FoundationVision 开发,2024 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 586。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-13。Apache-2.0许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:多模态对话中需要精确指代图像对象的场景。同类可对比的替代方案包括 Shikra、Ferret、GPT4RoI。

上一篇:tokenize-anything

下一篇:Remote-Sensing-RVSA

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14