physics-IQ-benchmark

测测视频模型懂不懂物理,量化物理常识短板

这是一个用于评估生成式视频模型物理理解能力的基准测试工具。它通过设计一系列物理场景和任务,测试视频生成模型是否真正理解物体的运动规律、碰撞、重力等物理现象,而不仅仅是生成视觉上连贯的片段。项目提供标准化的测试集和评分方法,帮助研究者和开发者量化模型在物理常识方面的表现,从而推动视频生成模型从“看起来像”向“理解物理”进化。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 348
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队google-deepmind
所属国家
定价模式free
价格说明开源基准测试项目,提供在线网页展示,无收费计划,完全免费使用。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型benchmark,generative-models,physical-understanding,video-generation
GitHub 星标★ 348
30天Star增速
HF 下载量
上线时间2024-12-14 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 首个专注视频生成物理理解的公开基准,填补评估空白
  • 测试场景覆盖碰撞、重力、运动轨迹等核心物理规则,维度清晰
  • 提供标准化评分脚本,便于横向对比不同视频生成模型

不足之处

  • 项目早期,测试集规模有限,覆盖物理场景不够全面
  • 文档/社区待观察

适用场景

  • 对比评估不同视频生成模型的物理合理性
  • 指导视频生成模型在物理常识方面的迭代优化
  • 学术研究中量化生成视频的物理可信度

替代项目

VBench、EvalCrafter、VideoPhy

项目介绍

physics-IQ-benchmark 是评测安全领域的开源项目,由 google-deepmind 开发,2024 年首次发布。

它收录于评测安全分类,该分类目前共有 467 个项目,GitHub 星标数为 348。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源基准测试项目,提供在线网页展示,无收费计划,完全免费使用。从国内网络环境看,可直接访问。

它主要面向的使用场景是:对比评估不同视频生成模型的物理合理性。同类可对比的替代方案包括 VBench、EvalCrafter、VideoPhy。

上一篇:MIND

下一篇:Apple-PI

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12