EventGPT 是计算机视觉领域的开源项目,由 XduSyL 开发,2024 年首次发布。
它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 115。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-11。从国内网络环境看,可直接访问。
它主要面向的使用场景是:事件相机动态场景理解与描述。同类可对比的替代方案包括 Video-LLaVA、LLaMA-VID、TimeChat。

让大模型看懂事件相机数据,实现动态场景理解与问答
EventGPT 是一个面向事件流(event stream)理解的多模态大语言模型框架,源自 CVPR 2025 论文。它解决的是传统视觉模型难以高效处理高时间分辨率、稀疏且异步的事件相机数据的问题,将事件流转化为适合大语言模型理解的表征,从而支持事件描述、问答、推理等任务。其核心能力包括:设计事件流专用的 tokenizer 和编码器,将事件数据映射到语言模型的语义空间;支持与文本、图像等多模态信息联合建模;提供完整的训练和推理流程,便于研究者复现与扩展。该项目旨在为事件相机数据与 LLM 的融合提供基础范式,推动动态视觉理解、机器人感知等领域的发展。
Video-LLaVA、LLaMA-VID、TimeChat
EventGPT 是计算机视觉领域的开源项目,由 XduSyL 开发,2024 年首次发布。
它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 115。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-11。从国内网络环境看,可直接访问。
它主要面向的使用场景是:事件相机动态场景理解与描述。同类可对比的替代方案包括 Video-LLaVA、LLaMA-VID、TimeChat。
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
DEIMv2
开源
用DINOv3做实时检测,又快又准,直接落地。
[DEIMv2] Real Time Object Detection Meets DINOv3