Awesome-LLMs-for-Video-Understanding

一页看全视频大模型论文代码数据集

这是一个面向视频理解领域的大语言模型(Vid-LLMs)资源汇总仓库,系统整理了最新论文、代码与数据集,并已被 IEEE TCSVT 收录。它解决的核心问题是:视频理解方向研究进展快、资料分散,研究者难以快速跟进前沿。仓库按任务与主题分类,覆盖视频问答、视频描述、时序定位、长视频理解等方向,同时收录多模态大模型在视频上的适配方法、评测基准与训练数据。对想入门或跟踪该领域的学生和工程师而言,它相当于一份持续更新的导航图,能显著降低检索成本,快速定位代表性工作与可复现资源。

开源 free 计算机视觉
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3285
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类计算机视觉
开发团队yunlong10
所属国家
官网地址
定价模式free
价格说明开源免费资源汇总
访问状态
是否开源
开源协议
主要语言
技术栈/模型
GitHub 星标★ 3285
30天Star增速
HF 下载量
上线时间2023-07-16 00:00:00
最近更新2026-09-18 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数0

使用教程

难度:入门 约 5 分钟 部署方式:本地安装 4 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • git 客户端(用于克隆仓库)
  • 可访问 GitHub 与 arXiv 的网络环境
  • 本地 Markdown 阅读工具(编辑器或浏览器)

安装与启动步骤

  1. 1克隆仓库到本地

    把资源清单仓库拉取到本地,方便离线检索与定期更新。README 未提供安装脚本,克隆即完成准备。

    git clone https://github.com/yunlong10/Awesome-LLMs-for-Video-Understanding.git
  2. 2阅读综述论文

    README 首条即官方综述《Video Understanding with Large Language Models: A Survey》,先读它可建立领域全貌。

  3. 3按任务主题检索

    README 按视频问答、视频描述、时序定位、长视频理解等方向分类,逐节浏览可定位代表性工作与数据集。

  4. 4跳转原始项目

    清单中每条论文/资源都带外部链接,进入对应官方仓库获取真正的代码、权重与数据。

如何确认成功

本地出现 Awesome-LLMs-for-Video-Understanding 目录,打开 README.md 能看到综述链接与各任务分类列表。

常见问题

Q:这个仓库需要安装依赖或配环境吗?

A:不需要。它是 Awesome 资源汇总清单,本身不含可运行代码、模型权重或服务,克隆或直接在线浏览即可。

Q:按 README 能跑通某个模型吗?

A:不能。README 只做导航,具体模型的安装与运行方法在各条资源链接指向的原始项目仓库中,请以那边文档为准。

Q:如何持续跟进最新进展?

A:在 GitHub 上 Star/Watch 该仓库以接收更新通知,并配合阅读 README 中给出的 IEEE TCSVT 收录综述掌握整体脉络。

注意事项

  • 本仓库为资料汇总型项目,无构建、部署或启动流程,故未使用 Docker 等部署方式。
  • 资源链接与论文信息均来自 README,未包含任何安装脚本或运行命令。
  • 复制清单中的方法到实际项目时,请回到原始论文仓库确认依赖与许可证。

核心亮点

  • 按任务与主题分类整理论文、代码和数据集,检索效率高
  • 持续跟踪最新 Vid-LLMs 工作,更新频率较好
  • 被 IEEE TCSVT 收录,具备一定学术认可度

不足之处

  • 仅做资源汇总,不提供统一评测或可运行代码
  • 分类粒度和收录标准依赖维护者,可能不够全面

适用场景

  • 研究生调研视频理解方向,快速锁定必读论文
  • 工程师为视频问答产品选型,对比可用模型与数据集
  • 论文写作时查找该领域基准与相关工作引用

替代项目

Awesome-Video-Understanding、Awesome-Multimodal-Large-Language-Models

项目介绍

Awesome-LLMs-for-Video-Understanding 是一个计算机视觉领域的开源项目,官方简介:[IEEE TCSVT] Latest Papers, Codes and Datasets on Vid-LLMs.。项目使用 未知 开发,在 GitHub 上获得 3285 星标。

上一篇:receipt-ocr

下一篇:CV-CUDA

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 3973 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90860 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
DEIMv2 开源

用DINOv3做实时检测,又快又准,直接落地。

[DEIMv2] Real Time Object Detection Meets DINOv3

★ 2032 2026-08-14