EventGPT

让大模型看懂事件相机数据,实现动态场景理解与问答

EventGPT 是一个面向事件流(event stream)理解的多模态大语言模型框架,源自 CVPR 2025 论文。它解决的是传统视觉模型难以高效处理高时间分辨率、稀疏且异步的事件相机数据的问题,将事件流转化为适合大语言模型理解的表征,从而支持事件描述、问答、推理等任务。其核心能力包括:设计事件流专用的 tokenizer 和编码器,将事件数据映射到语言模型的语义空间;支持与文本、图像等多模态信息联合建模;提供完整的训练和推理流程,便于研究者复现与扩展。该项目旨在为事件相机数据与 LLM 的融合提供基础范式,推动动态视觉理解、机器人感知等领域的发展。

开源 unknown 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 115
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类对话助手
开发团队XduSyL
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型chatbot,event-language,event-stream-understanding,eventgpt,foundation-models,llm,mllms,mutilmodel,representation-learning
GitHub 星标★ 115
30天Star增速
HF 下载量
上线时间2024-11-25 00:00:00
最近更新2026-09-11 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • 首次将事件流与多模态大语言模型系统结合,提供完整基线
  • 开源训练代码和模型权重,便于复现 CVPR 2025 成果
  • 针对事件数据特性设计专用编码器,兼顾稀疏性与时间信息

不足之处

  • 项目处于早期,文档和社区支持待观察
  • 依赖特定事件数据集,泛化到实际场景需额外适配

适用场景

  • 事件相机动态场景理解与描述
  • 机器人实时感知与交互问答
  • 高动态范围视觉任务研究

替代项目

Video-LLaVA、LLaMA-VID、TimeChat

项目介绍

EventGPT 是计算机视觉领域的开源项目,由 XduSyL 开发,2024 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 115。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-11。从国内网络环境看,可直接访问。

它主要面向的使用场景是:事件相机动态场景理解与描述。同类可对比的替代方案包括 Video-LLaVA、LLaMA-VID、TimeChat。

上一篇:Olympus

下一篇:ScanNow

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14