SpatialVID

给视频加空间标注,让 AI 生成时懂几何、懂运动

SpatialVID 是一个面向视频生成与空间智能研究的大规模视频数据集,由 CVPR 2026 论文提出。它解决了现有视频数据集缺乏空间标注、难以支撑 4D 生成与重建任务的问题。该数据集为每个视频帧提供丰富的空间注释,包括相机位姿、深度图、物体轨迹和 3D 结构信息,使模型能够学习视频中的几何与运动关系。核心能力包括:支持 3D/4D 生成与重建、视频生成中的空间一致性约束、以及多模态时空理解。该数据集旨在推动视频生成从 2D 像素走向 3D 空间感知,为自动驾驶、机器人、AR/VR 等需要空间智能的领域提供训练基础。项目提供数据加载与处理工具,兼容主流深度学习框架,并附带基准评估协议。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 601
维护状态 低维护
是否开源
定价模式 free

项目数据

分类视频生成
开发团队NJU-3DV
所属国家
定价模式free
价格说明开源数据集项目,Apache-2.0 许可证,完全免费,需自行部署或下载使用。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型3d-generation,3d-reconstruction,4d-generation,4d-reconstruction,spatial-intelligence,video-dataset,video-generation,video-reasoning,vision-language-model,world-models
GitHub 星标★ 601
30天Star增速
HF 下载量
上线时间2025-09-10 00:00:00
最近更新2026-09-10 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • 提供大规模视频空间标注(深度、位姿、轨迹),远超同类数据集
  • 直接面向 4D 生成与重建,填补视频数据在空间智能上的空白
  • 附有基准评估协议,便于公平对比不同模型

不足之处

  • 数据集规模与标注质量尚待社区验证,文档/社区待观察
  • 当前仅提供 Python 工具链,对非 Python 用户不友好

适用场景

  • 训练视频生成模型,使其生成内容具备空间一致性
  • 用于 4D 场景重建与动态物体跟踪研究
  • 为自动驾驶或机器人提供带空间标注的视频训练数据

替代项目

KITTI、nuScenes、ScanNet

项目介绍

SpatialVID 是数据集领域的开源项目,由 NJU-3DV 开发,2025 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 601。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-10。开源数据集项目,Apache-2.0 许可证,完全免费,需自行部署或下载使用。

它主要面向的使用场景是:训练视频生成模型,使其生成内容具备空间一致性。同类可对比的替代方案包括 KITTI、nuScenes、ScanNet。

上一篇:DataClaw0

下一篇:OmniWorld

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09