VBench

给视频生成模型打分,16个维度看清谁强谁弱

VBench 是一个专为视频生成模型设计的综合评估基准,由 CVPR 2024 Highlight 论文提出。它解决了视频生成领域缺乏统一、细粒度、自动化评估标准的问题,为研究人员和开发者提供了一套可复现的评测工具。其核心能力包括:定义 16 个细粒度维度(如动态程度、多对象、空间关系、时序一致性等)来全面评估生成视频的质量;提供分层提示词体系,覆盖 8 大主流视频生成场景;支持与人类偏好高度对齐的自动化评分,减少人工评估成本;并附带可扩展的评估工具包,方便用户对新模型进行标准化测试。VBench 旨在推动视频生成技术向更高质量、更可控的方向发展。

开源 free 图像生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1792
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类图像生成
开发团队Vchitect
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型aigc,benchmark,dataset,evaluation-kit,gen-ai,stable-diffusion,text-to-video,video-generation
GitHub 星标★ 1792
30天Star增速
HF 下载量
上线时间2023-11-27 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

难度:进阶 约 20 分钟 部署方式:库/依赖 6 步

环境要求

  • Python 环境(pip 可正常使用)
  • CUDA 版本需 <= 12.1(detectron2 仅支持 CUDA 12.1 或 11.X)
  • 需要安装 PyTorch 与 torchvision
  • 部分评估维度依赖 detectron2
  • 运行目录下需有 VBench_full_info.json 以读取提示词套件

安装与启动步骤

  1. 1安装 PyTorch

    按 README 指定方式安装带 CUDA 的 PyTorch 与 torchvision,也可换成其他满足 CUDA<=12.1 的版本。

    pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118
  2. 2安装 vbench

    通过 pip 直接安装 vbench 包,这是最简安装方式;安装完成后即可在 Python 中调用评估能力。

    pip install vbench
  3. 3安装 detectron2

    评估部分视频生成能力维度时需要 detectron2,用 README 给出的 git 地址安装。

    pip install detectron2@git+https://github.com/facebookresearch/detectron2.git
  4. 4下载提示词套件

    把 VBench_full_info.json 手动下载到你的运行目录,用于读取标准基准提示词列表;README 未提供下载命令。

  5. 5(可选)源码克隆安装

    如不想用 pip 方式,可先克隆仓库再本地安装 VBench,注意需同样先装好 PyTorch。

    git clone https://github.com/Vchitect/VBench.git
    pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118
    pip install VBench
  6. 6评估自己的视频

    默认在标准 VBench 提示词上评估以保证公平;要评自己的视频就把模式设为 custom_input。

关键配置

配置项必填说明示例
mode是评估模式,默认使用标准 VBench 提示词列表;自定义视频时改为 custom_input。custom_input
VBench_full_info.json是提示词套件文件,需放在运行目录中供程序读取基准提示词。/your/path/VBench_full_info.json

如何确认成功

pip 安装过程无报错,且运行目录中已存在 VBench_full_info.json,即可按 README 用法开始评估。

常见问题

Q:detectron2 安装报错怎么办?

A:请查阅 detectron2 官方安装文档(detectron2.readthedocs.io 的 install 教程)。注意 detectron2 仅兼容 CUDA 12.1 或 11.X。

Q:可以用别的 PyTorch 版本吗?

A:可以,README 说明可换成其他任意版本,只要对应 CUDA<=12.1 即可。

Q:如何评估自己生成的视频?

A:把 mode 设置为 custom_input,即可评估不属于 VBench 提示词套件的自有视频与提示词。

Q:运行时提示缺少某个视频?

A:这是正常的警告:VBench 默认强制在标准 VBench 提示词列表上评估,以保证不同模型之间的公平比较。

注意事项

  • 默认在标准 VBench 提示词列表上评估,以保证不同视频生成模型间的公平比较。
  • 缺少必需视频时会给出警告,属于设计行为,不一定是环境错误。
  • detectron2 仅支持 CUDA 12.1 或 11.X,请先确认 CUDA 版本。
  • README 未给出具体评估命令与端口等参数,实际调用方式请以官方 Usage 章节和代码为准。

核心亮点

  • 首个覆盖16个细粒度维度的视频生成评估基准,远超单一指标
  • 提供分层提示词库和自动化评分,结果与人类偏好高度对齐
  • 官方工具包易用,支持自定义模型接入,社区活跃

不足之处

  • 评估维度虽多,但部分维度(如时序一致性)的自动化度量仍有局限
  • 文档/社区待观察

适用场景

  • 对比不同视频生成模型(如SVD、AnimateDiff)的优劣
  • 在模型开发迭代中,快速定位生成短板并针对性优化
  • 学术研究或工业评测中,作为标准化的视频生成质量报告依据

替代项目

VideoScore、EvalCrafter、T2VScore

项目介绍

VBench 是评测安全领域的开源项目,由 Vchitect 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,792)位列前 30%,在评测安全分类的 458 个项目里位列前 14%。

近 45 天,它的 GitHub 星标从 1,725 增加到 1,792,净增 67。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:对比不同视频生成模型(如SVD、AnimateDiff)的优劣。同类可对比的替代方案包括 VideoScore、EvalCrafter、T2VScore。

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24