VideoGLaMM 是计算机视觉领域的开源项目,由 mbzuai-oryx 开发,2024 年首次发布。
它收录于计算机视觉分类,该分类目前共有 446 个项目,GitHub 星标数为 105。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-05。可自行部署,完全免费。
它主要面向的使用场景是:视频编辑:自动分割并替换视频中的目标对象。同类可对比的替代方案包括 GLaMM、VideoLISA、SEEM。

让AI看懂视频里每个像素,指哪打哪精准分割
VideoGLaMM 是一个面向视频像素级视觉定位的大型多模态模型,由南洋理工大学等机构在 CVPR 2025 发表。它解决的是视频中细粒度对象理解与定位问题,能够根据文本描述在视频帧中生成精确的像素级掩码,同时支持视频对话和时空推理。其核心能力包括:像素级视频理解(将文本查询与视频中的具体对象或区域关联)、视频对话(基于视频内容进行多轮问答)、以及时空定位(跨帧跟踪并分割目标对象)。模型采用三阶段训练策略,结合了大规模图像-文本数据和视频-文本数据,实现了对视频中动态对象的精准追踪与分割。项目提供了完整的训练和推理代码,支持自定义数据集微调,为视频理解、视频编辑、机器人交互等应用提供了强大的基础模型。
GLaMM、VideoLISA、SEEM
VideoGLaMM 是计算机视觉领域的开源项目,由 mbzuai-oryx 开发,2024 年首次发布。
它收录于计算机视觉分类,该分类目前共有 446 个项目,GitHub 星标数为 105。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-05。可自行部署,完全免费。
它主要面向的使用场景是:视频编辑:自动分割并替换视频中的目标对象。同类可对比的替代方案包括 GLaMM、VideoLISA、SEEM。
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3