InternVideo

用海量视频数据预训练,一个模型搞定分类、问答和字幕生成。

InternVideo 是一个面向多模态理解的开源视频基础模型项目,由上海人工智能实验室发布,相关论文发表于 ECCV2024。它旨在解决视频理解中模型泛化能力不足和高质量数据稀缺的问题,通过自监督学习和多模态对齐,构建统一的视频表征。核心能力包括视频分类、时序动作检测、视频问答、视频字幕生成等。项目提供了预训练模型和微调代码,支持多种视频理解任务,并配套发布了大规模视频文本数据集,以推动视频多模态研究的发展。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2392
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队OpenGVLab
所属国家
官网地址
定价模式free
价格说明开源模型,Apache-2.0许可,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型action-recognition,benchmark,contrastive-learning,foundation-models,instruction-tuning,masked-autoencoder,multimodal,open-set-recognition,self-supervised,spatio-temporal-action-localization,temporal-action-localization,video-clip,video-data,video-dataset,video-question-answering,video-retrieval,video-understanding,vision-transformer,zero-shot-classification,zero-shot-retrieval
GitHub 星标★ 2392
30天Star增速
HF 下载量
上线时间2022-11-23 00:00:00
最近更新2026-09-21 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数8

使用教程

难度:进阶 约 10 分钟 部署方式:模型权重 6 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • Python 环境(项目开发语言为 Python)
  • Git 命令行工具
  • 可访问 GitHub 与 Hugging Face 的网络环境
  • 足够的磁盘空间(用于存放代码与预训练权重)

安装与启动步骤

  1. 1克隆项目仓库

    把 InternVideo 主仓库完整下载到本地,仓库内含各版本子目录与相关代码。

    git clone https://github.com/OpenGVLab/InternVideo.git
  2. 2进入项目目录

    切换到刚克隆下来的仓库根目录,后续所有操作都在此目录下进行。

    cd InternVideo
  3. 3查看仓库结构

    仓库按 InternVideo1/2/2.5/3、InternVideo-Next、Data/InternVid 等分目录组织,先列出目录确认。

    ls
  4. 4选择目标子项目

    按需求进入对应子目录,例如做世界理解选 InternVideo-Next,做长上下文推理选 InternVideo3。

    ls InternVideo2 InternVideo3 InternVideo-Next
  5. 5进入子目录看说明

    主 README 只做索引,各子项目的环境安装、训练与推理命令写在其子目录文档中,务必先阅读。

  6. 6下载预训练权重

    从官方 Hugging Face 合集中的对应页面下载模型权重,如 InternVideo-Next 权重集合、InternVideo3-8B-Instruct。

如何确认成功

在主 README 中找到并成功打开目标子项目(如 InternVideo2、InternVideo3)的子目录文档,且权重下载页面可正常访问。

常见问题

Q:为什么主 README 里没有安装命令?

A:该仓库是 InternVideo 系列多个子项目的集合入口,主 README 主要提供目录索引与更新日志,具体安装与使用说明放在各子目录自己的文档中。

Q:应该选择哪个版本使用?

A:按任务选:通用视频基础模型选 InternVideo/InternVideo2,长且丰富上下文的多模态理解选 InternVideo2.5/3,真实世界理解选 InternVideo-Next。

Q:模型权重去哪里下载?

A:README 中给出了官方 Hugging Face 链接,例如 InternVideo-Next 的模型权重集合,以及 InternVideo3 的 8B instruct 模型页面。

Q:视频文本数据集在哪里获取?

A:大规模视频文本数据集 InternVid 位于仓库的 Data/InternVid 目录;InternVideo3 的长视频 SFT 数据集在 Hugging Face 上单独发布。

注意事项

  • README 未提供统一的安装命令、依赖版本、端口或路径参数,本教程仅包含可确认的仓库获取与索引浏览步骤,实际部署请以各子目录文档为准。
  • 部分模型和数据为较新发布,Hugging Face 链接可能需要额外网络条件才能访问。
  • 使用前请分别查阅各子项目的许可证与使用条款,确认可否用于你的场景。

核心亮点

  • 在视频分类、问答等多项基准上达到领先水平,性能有实证支撑。
  • 提供了完整的预训练模型和微调代码,上手门槛低,便于二次开发。
  • 附带大规模视频文本数据集,为研究社区提供了宝贵的数据资源。

不足之处

  • 模型参数量较大,推理和训练对硬件资源要求高。
  • 文档和社区支持相对薄弱,新手可能遇到配置问题。

适用场景

  • 视频内容审核与分类
  • 视频问答与智能助手
  • 视频字幕生成与检索

替代项目

VideoMAE、TimeSformer、UniVL

项目介绍

InternVideo 是视频领域的开源项目,由 OpenGVLab 开发,2022 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(2,392)位列前 30%,在视频分类的 473 个项目里位列前 11%。

近 42 天,它的 GitHub 星标从 2,354 增加到 2,392,净增 38。

项目仍在小幅维护中,最近一次代码更新于 2026-09-21。Apache-2.0许可,可免费使用和部署。

它主要面向的使用场景是:视频内容审核与分类。同类可对比的替代方案包括 VideoMAE、TimeSformer、UniVL。

上一篇:ai-video-summarizer

下一篇:AnimateAnyMesh

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09