GeometryForcing

给视频扩散装上3D骨架,生成时空一致的交互世界

GeometryForcing 是一个将视频扩散模型与 3D 表示相结合的统一世界建模框架,旨在解决视频生成中时空一致性问题。它通过引入几何约束(如深度、点云等)来引导扩散模型的生成过程,使生成的视频不仅外观逼真,而且符合物理世界的几何规律,支持交互式视频生成和相机控制。该项目提供了完整的训练和推理代码,基于 PyTorch 实现,适用于研究与应用场景。其核心创新在于将 3D 几何信息与 2D 视频扩散模型深度融合,从而在生成过程中显式地保持多视角一致性和运动连贯性,为世界模型、自动驾驶仿真、虚拟内容创作等提供基础技术支撑。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 226
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队CIntellifusion
所属国家
定价模式free
价格说明开源项目,代码公开,可自行部署使用,无收费计划。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型diffusion-models,interactive-video,video-generation,world-models
GitHub 星标★ 226
30天Star增速
HF 下载量
上线时间2025-07-14 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 提出几何强制机制,将深度/点云等3D先验注入扩散过程,显著提升视频时空一致性
  • 支持交互式视频生成,用户可控制相机路径或对象运动,生成结果更可控
  • 官方实现,代码结构清晰,基于成熟PyTorch生态,便于二次开发

不足之处

  • 项目处于早期阶段,文档和社区支持待观察
  • 训练和推理资源需求较高,普通硬件难以复现

适用场景

  • 自动驾驶场景仿真,生成多视角一致的动态世界
  • 影视与游戏内容创作,快速生成可交互的3D场景视频
  • 机器人或具身智能训练,提供几何一致的环境模拟

替代项目

Video Diffusion Models (VDM)、Sora、Genie

项目介绍

GeometryForcing 是视频领域的开源项目,由 CIntellifusion 开发,2025 年首次发布。

它收录于视频分类,该分类目前共有 472 个项目,GitHub 星标数为 225。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。代码公开,可自行部署使用,无收费计划。

它主要面向的使用场景是:自动驾驶场景仿真,生成多视角一致的动态世界。同类可对比的替代方案包括 Video Diffusion Models (VDM)、Sora、Genie。

上一篇:SeedVR2

下一篇:EvoWorld

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
auto-subs 开源

在剪辑软件里直接生成字幕,省去导出导入的麻烦

On-device subtitle generation that connects directly to DaVinci Resolve, Premiere, a···

★ 4266 2026-08-10