VideoGLaMM

让AI看懂视频里每个像素,指哪打哪精准分割

VideoGLaMM 是一个面向视频像素级视觉定位的大型多模态模型,由南洋理工大学等机构在 CVPR 2025 发表。它解决的是视频中细粒度对象理解与定位问题,能够根据文本描述在视频帧中生成精确的像素级掩码,同时支持视频对话和时空推理。其核心能力包括:像素级视频理解(将文本查询与视频中的具体对象或区域关联)、视频对话(基于视频内容进行多轮问答)、以及时空定位(跨帧跟踪并分割目标对象)。模型采用三阶段训练策略,结合了大规模图像-文本数据和视频-文本数据,实现了对视频中动态对象的精准追踪与分割。项目提供了完整的训练和推理代码,支持自定义数据集微调,为视频理解、视频编辑、机器人交互等应用提供了强大的基础模型。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 105
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队mbzuai-oryx
所属国家
定价模式free
价格说明开源模型,可自行部署,完全免费。
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型cvpr2025,foundation-models,llm-agent,lmm,vision-and-language,vision-language-model
GitHub 星标★ 105
30天Star增速
HF 下载量
上线时间2024-10-31 00:00:00
最近更新2026-09-05 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • 首个支持视频像素级视觉定位的多模态模型,能生成精确掩码而非粗糙框
  • 三阶段训练策略有效结合图像与视频数据,提升时空理解能力
  • 提供完整训练/推理代码和预训练模型,便于二次开发

不足之处

  • 项目处于早期,星标仅104,社区生态和文档待完善
  • 视频像素级定位对算力要求高,推理速度可能较慢

适用场景

  • 视频编辑:自动分割并替换视频中的目标对象
  • 视频问答:根据自然语言查询定位视频中的具体物体
  • 机器人交互:让机器人理解视频场景并精准抓取目标

替代项目

GLaMM、VideoLISA、SEEM

项目介绍

VideoGLaMM 是计算机视觉领域的开源项目,由 mbzuai-oryx 开发,2024 年首次发布。

它收录于计算机视觉分类,该分类目前共有 446 个项目,GitHub 星标数为 105。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-05。可自行部署,完全免费。

它主要面向的使用场景是:视频编辑:自动分割并替换视频中的目标对象。同类可对比的替代方案包括 GLaMM、VideoLISA、SEEM。

上一篇:BlackVIP

下一篇:Lexicon3D

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14