Groma 是计算机视觉领域的开源项目,由 FoundationVision 开发,2024 年首次发布。
它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 586。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-13。Apache-2.0许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:多模态对话中需要精确指代图像对象的场景。同类可对比的替代方案包括 Shikra、Ferret、GPT4RoI。

让多模态模型精准指认图像中的每个区域,实现细粒度视觉定位。
Groma 是一个基于多模态大语言模型(MLLM)的视觉定位模型,核心创新在于“局部视觉标记化”(Localized Visual Tokenization)。它通过将图像中的区域级特征编码为离散的视觉标记,使模型能够精准地理解并引用图像中的具体区域,从而完成细粒度的视觉定位任务。Groma 解决了传统多模态模型在区域级理解上的不足,即模型能描述图像整体但难以精确指代局部对象。其核心能力包括:区域级视觉理解、基于文本指令的目标检测与分割、以及多模态对话中的视觉引用。该模型在 ECCV 2024 发表,提供了完整的训练和推理代码,并支持自定义数据微调,适合研究人员和开发者用于构建具备精细视觉定位能力的多模态应用。
Shikra、Ferret、GPT4RoI
Groma 是计算机视觉领域的开源项目,由 FoundationVision 开发,2024 年首次发布。
它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 586。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-08-13。Apache-2.0许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:多模态对话中需要精确指代图像对象的场景。同类可对比的替代方案包括 Shikra、Ferret、GPT4RoI。
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3