Flipped-VQA

翻转问答顺序,让LLM更懂视频因果

Flipped-VQA 是一个面向视频问答(VideoQA)的推理框架,核心思想是让大型语言模型(LLM)作为时间与因果推理器,通过翻转视频问答中的问题与答案生成顺序来提升推理能力。传统方法通常先看视频再回答问题,而 Flipped-VQA 先让模型基于问题生成候选答案,再结合视频内容进行验证和修正,从而更有效地利用视频中的时间动态和因果线索。项目提供了完整的训练与评估代码,支持多种视频特征提取和 LLM 接口,并基于 EMNLP 2023 论文实现。它解决了视频问答中模型难以捕捉事件时序和因果关系的问题,显著提升了在复杂视频问答基准上的表现。核心能力包括:翻转式推理范式、多模态特征融合、以及可扩展的 LLM 集成。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 77
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队mlvlab
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型emnlp2023,large-language-models,multi-modal,video-question-answering,visual-question-answering
GitHub 星标★ 77
30天Star增速
HF 下载量
上线时间2023-10-19 00:00:00
最近更新2026-04-27 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 提出翻转问答范式,先答后看,显著提升时间推理准确性
  • 支持多种LLM后端,易于集成现有视频特征
  • 基于EMNLP论文,方法有理论支撑,代码结构清晰

不足之处

  • 依赖外部LLM,推理成本高,不适合实时场景
  • 文档/社区待观察,星标少,示例和教程有限

适用场景

  • 视频理解研究,探索LLM在视频推理中的应用
  • 智能视频检索,根据自然语言问题定位关键事件
  • 辅助视频内容审核,判断事件因果是否符合逻辑

替代项目

VideoLLaMA、SeViLA、FrozenBiLM

项目介绍

Flipped-VQA 是计算机视觉领域的开源项目,由 mlvlab 开发,2023 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 77。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-04-27。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:视频理解研究,探索LLM在视频推理中的应用。同类可对比的替代方案包括 VideoLLaMA、SeViLA、FrozenBiLM。

上一篇:YoChameleon

下一篇:Exp-CLIP

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2046 2026-08-14