video-understanding
本站收录 24 个带「video-understanding」标签的 AI 开源项目
lmms-evallmms-eval 是一个面向多模态大模型的一站式评测工具包,支持文本、图像、视频和音频任务的统一评估。它解决了多模态模型评测标准不一、任务分散、复现困难的问题★ 4,437
Ask-AnythingAsk-Anything 是一个基于大语言模型的多模态视频理解对话助手,核心解决“让 AI 看懂视频并自然对话”的问题。它支持多种主流语言模型(如 miniGP★ 3,354
InternVideoInternVideo 是一个面向多模态理解的开源视频基础模型项目,由上海人工智能实验室发布,相关论文发表于 ECCV2024。它旨在解决视频理解中模型泛化能力★ 2,398
video-search-and-summarization这是NVIDIA推出的视频搜索与摘要参考架构(VSS Blueprint),旨在帮助开发者快速构建GPU加速的视频分析智能体。它解决了传统视频分析中检索效率低、★ 1,884
SALMONNSALMONN 是一个先进的多模态大语言模型(LLM)家族,由清华团队开发,旨在让机器能够同时理解和处理语音、音频、音乐、视频等多种模态信息。它解决了传统模型只★ 1,538
LanceLance 是一个仅 3B 激活参数的原生统一多模态模型,专攻图像与视频的理解、生成和编辑。它解决了传统多模态模型需要庞大参数、且各任务分离的问题,通过单一模型★ 1,349
Awesome-CV-MasterHubAwesome-CV-MasterHub 是一个计算机视觉领域的论文精选列表,汇总了图像生成、分类、描述、去雾、去噪、增强、融合等多个方向的最新研究成果。它解决★ 978
Chat-UniViChat-UniVi 是一个统一图像与视频理解的多模态大语言模型,由 CVPR 2024 Highlight 论文提出。它通过一种统一的视觉表示方法,将图像和视★ 944
telememTeleMem 是一个高性能的 Mem0 即插即用替代品,专注于为 AI 智能体提供长期对话记忆能力。它解决了传统记忆系统在语义重复、多模态信息处理上的痛点,通★ 492
Code-as-WorldCode-as-World 是一个面向物理推理的智能体研究项目,核心思路是让 AI 智能体通过生成可执行代码来发现和表达物理世界的规律。它把视频理解、视觉语言模★ 467
watch-skillwatch-skill 是一个面向 AI 智能体的视频理解与自我验证工具,旨在将视频、直播流和智能体屏幕录制转化为可搜索、带时间戳的证据,并借助内置的 THE ★ 399
MicroLensMicroLens 是一个大规模短视频推荐数据集,包含原始文本、音频、图像和视频数据,由 DeepMind 邀请的 Talk 中提出。它旨在为多模态推荐系统研究★ 302
video-SALMONN-2video-SALMONN-2 是清华大学电子工程系与字节跳动联合开发的新一代音视频大语言模型,旨在解决视频理解中音频与视觉信息融合不足的问题。该模型能够接收视★ 219
komakoma 是一个可自托管的 AI 视频分析工具,面向需要批量处理长视频的团队或个人。它把视频拆解为可检索的结构化信息:自动生成内容摘要、按语义切分章节、抽取关键★ 197
komakoma 是一个可自托管的 AI 视频分析工具,用 TypeScript 编写。它解决的核心问题是:面对长视频或大量视频素材时,人工观看、记录和整理成本极高。k★ 197
BEVTBEVT 是 CVPR 2022 论文《BEVT: BERT Pretraining of Video Transformers》的官方 PyTorch 实现。★ 161
FrozenBiLMFrozenBiLM 是一个用于零样本视频问答(VideoQA)的开源模型,来自 NeurIPS 2022 论文。它解决的是在没有任何视频标注数据的情况下,直接★ 159
VideoHighlighterVideoHighlighter 是一个基于 Ollama 的本地 AI 视频分析工具,目标是让视频理解完全离线、免费运行。它通过视觉搜索、自动高光提取、场景/★ 142
Awesome-Multimodal-Reasoning这是一个精选多模态推理与生成前沿资源的列表,聚焦于基于强化学习(RL)的多模态大语言模型(MLLM)技术。项目系统梳理了图像理解、图像推理、图像生成等方向的最新★ 104
context-aware-ragContext-Aware RAG 是一个面向知识图谱的检索增强生成(RAG)库,专注于知识图谱的摄入与检索功能。它解决的是传统 RAG 在复杂关系数据上表现不★ 90
Video-BenchVideo-Bench 是一个视频生成领域的评测基准项目,旨在系统评估视频生成模型的质量。它解决的核心问题是:当前视频生成模型(如Sora类模型)缺乏统一、客观★ 81
Impossible-VideosImpossible-Videos 是 ICML 2025 论文的官方基准与代码库,专注于视频生成与理解中的‘不可能视频’挑战。这类视频包含物理上不可能或高度反★ 81
Awesome-Video-MLLMsAwesome-Video-MLLMs 是一个专注于视频多模态大模型(MLLMs)及其基准测试的资源汇总项目,覆盖短视频、长视频和流式视频理解三大场景。它系统整★ 74
VideoLucyVideoLucy 是一个面向长视频理解的开源项目,发表于 NeurIPS 2025,核心创新在于“深度记忆回溯”(Deep Memory Backtracki★ 69