ShareGPT4Video

用GPT-4V生成高质量视频描述,提升视频理解与生成效果

ShareGPT4Video 是一个由 NeurIPS 2024 收录的开源项目,旨在通过生成高质量的视频描述文本来提升视频理解与生成模型的性能。它解决了当前视频数据集中描述文本质量低下、信息不完整的问题,提出了一种利用 GPT-4V 等大型多模态模型自动生成精细、丰富、语义对齐的视频描述的方法。项目核心能力包括:构建了包含 40K 高质量视频-描述对的数据集,并在此基础上训练出强大的视频描述生成器,能够为任意视频生成详细且准确的文本描述;同时,该描述生成器可无缝集成到现有视频生成和视频理解模型中,显著提升其性能。项目提供了完整的训练代码、推理脚本和数据集,方便研究者复现和扩展,是视频理解与生成领域的重要基础设施。

开源 unknown 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1095
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类视频生成
开发团队ShareGPT4Omni
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议
主要语言Python
技术栈/模型chatgpt,gpt,gpt-4v,large-language-models,large-multimodal-models,large-video-language-models,large-vision-language-models,sora,text-to-video
GitHub 星标★ 1095
30天Star增速
HF 下载量
上线时间2024-06-06 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

难度:进阶 约 20 分钟 部署方式:命令行工具 7 步

环境要求

  • 已安装 git 与 conda(README 使用 conda 创建环境)
  • Python 3.10(README 指定 conda create python=3.10)
  • 可联网,以便 pip 安装依赖并下载 HuggingFace 模型权重 Lin-Chen/sharegpt4video-8b
  • 编译 flash-attn 需具备 CUDA 编译环境(README 只给出 --no-build-isolation 安装方式)

安装与启动步骤

  1. 1克隆项目仓库

    从 GitHub 拉取 ShareGPT4Video 源码到本地,之后所有命令都在仓库目录内执行。

    git clone https://github.com/ShareGPT4Omni/ShareGPT4Video
  2. 2创建 conda 环境

    按 README 指定的 Python 3.10 创建名为 share4video 的独立环境并激活,避免污染系统环境。

    conda create -n share4video python=3.10 -y
    conda activate share4video
  3. 3安装项目依赖

    进入仓库目录,先升级 pip,再以可编辑模式安装主包与 train 附加依赖。

    cd ShareGPT4Video
    pip install --upgrade pip
    pip install -e .
    pip install -e ".[train]"
  4. 4安装 flash-attn

    README 指定的 flash-attn 安装命令,不加 --no-build-isolation 会编译失败,需耐心等待编译。

    pip install flash-attn --no-build-isolation
  5. 5命令行视频对话

    用 8B 模型对示例视频生成描述,把 --video 换成自己的视频路径即可描述任意视频。

    python run.py --model-path Lin-Chen/sharegpt4video-8b --video examples/yoga.mp4 --query "Describe this video in detail."
  6. 6启动 ShareGPT4Video 演示

    在仓库根目录启动本地 Gradio 演示页面,与 ShareGPT4Video-8B 交互(端口以终端输出为准)。

    python app.py
  7. 7启动 Captioner 演示

    切换到 captioner 子目录后启动 ShareCaptioner-Video 的本地演示页面。

    cd captioner
    python app.py

关键配置

配置项必填说明示例
--model-path是模型权重路径或 HuggingFace 仓库标识Lin-Chen/sharegpt4video-8b
--video是待描述视频文件的本地路径examples/yoga.mp4
--query是向模型提出的问题或指令文本Describe this video in detail.

如何确认成功

执行 run.py 后终端打印出模型对该视频的详细描述文本;执行 app.py 后终端输出本地访问地址,浏览器打开即为演示页面。

常见问题

Q:能描述自己的视频吗?

A:可以,把 --video 参数换成本地视频文件路径即可,其余参数保持不变。

Q:可以换成中文提问吗?

A:--query 参数就是提问文本,替换成任意指令(包括中文)即可,README 未限制语言。

Q:flash-attn 安装失败怎么办?

A:README 只提供 pip install flash-attn --no-build-isolation 这一种方式,失败通常是缺少 CUDA 编译环境,请先确认显卡驱动与 CUDA 工具链可用。

Q:两个 app.py 有什么区别?

A:根目录 app.py 启动 ShareGPT4Video-8B 对话演示;captioner/app.py 启动 ShareCaptioner-Video 演示,需先 cd captioner。

注意事项

  • 每条命令执行前都要确保已 conda activate share4video,否则依赖找不到
  • pip install -e . 等命令必须在 ShareGPT4Video 仓库目录内执行
  • 首次运行 run.py 会从 HuggingFace 下载 sharegpt4video-8b 权重,耗时较长且需保证磁盘与网络充足
  • README 未给出演示页面的具体端口和最低显存要求,实际以终端输出和自身硬件为准

核心亮点

  • 提供40K高质量视频-描述对数据集,直接可用,大幅节省数据标注成本
  • 基于GPT-4V的自动标注流程,可扩展至任意视频,生成描述语义丰富
  • 集成到现有视频生成模型后,能显著提升生成质量,效果有论文数据支撑

不足之处

  • 依赖GPT-4V等商业API,生成描述成本较高,且存在数据隐私风险
  • 文档/社区待观察,项目尚在成长中,生态和工具链可能不完善

适用场景

  • 视频生成模型训练:用高质量描述文本作为条件,提升生成视频的语义一致性
  • 视频理解任务:为视频分类、检索、问答等提供更丰富的文本监督信号
  • 视频数据集构建:自动化生成大规模视频描述,替代人工标注

替代项目

VideoChat、Video-LLaMA、InternVideo

项目介绍

ShareGPT4Video 是数据集领域的开源项目,由 ShareGPT4Omni 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,095)位列前 30%,在数据集分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。从国内网络环境看,可直接访问。

它主要面向的使用场景是:视频生成模型训练:用高质量描述文本作为条件,提升生成视频的语义一致性。同类可对比的替代方案包括 VideoChat、Video-LLaMA、InternVideo。

上一篇:civitai-mirror-list

下一篇:OpenS2V-Nexus

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09