Video-ChatGPT

看视频聊细节,视频问答一步到位

Video-ChatGPT 是一个面向视频对话的多模态大模型,发表于 ACL 2024。它结合了大型语言模型(如 Vicuna、LLaMA)与预训练视觉编码器(CLIP),通过时空视频表示理解视频内容,支持用户围绕视频进行自然语言问答和对话。项目解决了视频理解中时序建模与语言生成结合的问题,核心能力包括视频描述、基于视频内容的问答、推理和对话。同时,论文提出了一个严格的定量评估基准,用于评测视频对话模型的性能。代码和模型开源,方便研究者复现和扩展。

开源 free 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1508
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类对话助手
开发团队mbzuai-oryx
所属国家
定价模式free
价格说明开源项目,基于CC-BY-4.0许可证,可免费使用和部署,无付费版本。
访问状态
是否开源是
开源协议CC-BY-4.0
主要语言Python
技术栈/模型chatbot,clip,gpt-4,llama,llava,mulit-modal,vicuna,video-chatboat,video-conversation,vision-language,vision-language-pretraining
GitHub 星标★ 1508
30天Star增速
HF 下载量
上线时间2023-05-18 00:00:00
最近更新2026-09-10 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • 已安装 Conda,可创建 Python 3.10 环境
  • 已安装 Git,能克隆 GitHub 仓库
  • 可正常使用 pip 安装依赖
  • 如需训练:需能编译安装 FlashAttention v1.0.7 的环境

安装与启动步骤

  1. 1创建 Conda 环境

    README 推荐为项目单独新建 conda 环境,指定 Python 3.10,并激活该环境。

    conda create --name=video_chatgpt python=3.10
    conda activate video_chatgpt
  2. 2克隆项目代码

    从 GitHub 拉取 Video-ChatGPT 仓库,并进入项目根目录,后续命令都在此目录执行。

    git clone https://github.com/mbzuai-oryx/Video-ChatGPT.git
    cd Video-ChatGPT
  3. 3安装 Python 依赖

    按 requirements.txt 一次性安装项目所需依赖,务必在已激活的 video_chatgpt 环境中执行。

    pip install -r requirements.txt
  4. 4设置 PYTHONPATH

    把项目根目录加入 PYTHONPATH,保证代码能以模块方式被导入。

    export PYTHONPATH="./:$PYTHONPATH"
  5. 5安装 FlashAttention

    README 说明训练需要 FlashAttention,先装 ninja,再克隆并切到 v1.0.7 编译安装。

    pip install ninja
    
    git clone https://github.com/HazyResearch/flash-attention.git
    cd flash-attention
    git checkout v1.0.7
    python setup.py install
  6. 6运行离线 Demo

    README 未给出离线 Demo 的具体命令,只指向 docs/offline_demo.md,请按该文档操作。

关键配置

配置项必填说明示例
PYTHONPATH是让项目根目录可被 Python 导入,安装后需导出该变量./:$PYTHONPATH

如何确认成功

README 未提供启动验证命令;确认 conda 环境激活、pip 依赖与 PYTHONPATH 设置均无报错即可。

常见问题

Q:不训练也需要装 FlashAttention 吗?

A:README 明确说 FlashAttention 是 training 额外需要的,若只跑离线 Demo 可先跳过这一步,遇到显存或 CUDA 问题再处理。

Q:离线 Demo 怎么启动?

A:README 只给出文档入口 docs/offline_demo.md,仓库内该文档中包含具体运行命令,请以它为准。

Q:为什么要创建单独的 conda 环境?

A:README 推荐为该项目单独建 conda 环境,可避免与其他项目的 Python 及依赖版本冲突。

Q:export PYTHONPATH 每条终端都要执行吗?

A:export 只在当前会话生效,重新打开终端或换会话后需要在新环境中再次执行。

注意事项

  • README 未提供 Docker、云服务或 pip 一键安装方式,本项目按本地源码安装。
  • 训练相关部分的依赖(FlashAttention v1.0.7)与推理/Demo 需求不同,请按用途取舍。
  • README 中提到多样化的视频生成性能基准(VCGBench-Diverse)与零样本问答评测,具体用法需查阅仓库对应文档。
  • 涉及模型权重与推理命令的内容 README 节选中未给出,请以官方仓库最新说明为准。

核心亮点

  • 基于 CLIP 和 LLM 的时空建模,能捕捉视频动态信息
  • 提供定量评估基准,方便对比视频对话模型效果
  • 代码结构清晰,支持自定义视频和问题,易于上手

不足之处

  • 模型推理速度较慢,对长视频处理有挑战
  • 文档/社区待观察

适用场景

  • 视频内容问答与摘要生成
  • 教育视频辅助学习与答疑
  • 视频检索与内容分析

替代项目

Video-LLaMA、LLaMA-VID、Video-Chat

项目介绍

Video-ChatGPT 是对话助手领域的开源项目,由 mbzuai-oryx 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,508)位列前 30%,在对话助手分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-10。基于CC-BY-4.0许可证,可免费使用和部署,无付费版本。

它主要面向的使用场景是:视频内容问答与摘要生成。同类可对比的替代方案包括 Video-LLaMA、LLaMA-VID、Video-Chat。

上一篇:Rasa_NLU_Chi

下一篇:easyChat

同类项目推荐

open-webui 开源

给本地模型配个漂亮聊天室,全家都能用

User-friendly AI Interface (Supports Ollama, OpenAI API, ...)

★ 152821 2026-08-09
prompts.chat 开源

海量好提示词,抄了就能让 AI 更听话

f.k.a. Awesome ChatGPT Prompts. Share, discover, and collect prompts from the commun···

★ 170999 2026-08-09
elia 开源

终端里用键盘快速聊 AI,多模型切换不打断思路

A snappy, keyboard-centric terminal user interface for interacting with large langua···

★ 2479 2026-08-09
NextChat 开源

一个界面聊遍所有主流AI模型,支持全平台部署,轻快又私密。

✨ Zero-config AI chat assistant. No API key needed — sign up and instantly chat wi···

★ 88802 2026-08-09