TesserAct

让机器人看懂并预测4D世界,实现具身智能

TesserAct 是 ICCV 2025 收录的 4D 具身世界模型项目,旨在解决机器人或具身智能体对动态三维世界的理解与预测问题。它通过将视频生成与 3D/4D 表示学习结合,构建一个可交互的时空世界模型,使智能体不仅能观察当前场景,还能预测未来状态并规划动作。核心能力包括:从多视角视频中学习 4D 场景表征、生成连贯的未来帧序列、支持动作条件生成,以及为机器人控制提供潜在规划空间。项目代码基于 Python 实现,技术栈涉及 3D 视觉、视频生成和具身智能,适合研究世界模型、机器人感知与决策的开发者。目前处于早期阶段,星标 405,但提供了官方实现和演示,便于复现论文结果。

开源 unknown 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 408
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类视频生成
开发团队UMass-Embodied-AGI
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型3d,4d,embodied-ai,robotics,video-generation,world-models
GitHub 星标★ 408
30天Star增速
HF 下载量
上线时间2025-04-29 00:00:00
最近更新2026-09-03 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

核心亮点

  • 首次将4D场景学习与视频生成统一到具身世界模型框架
  • 支持动作条件生成,可直接用于机器人规划
  • ICCV 2025 论文官方实现,代码结构清晰,便于研究复现

不足之处

  • 项目处于早期,文档和社区支持待观察
  • 对计算资源要求高,普通设备难以跑通完整训练

适用场景

  • 机器人操作任务中的视觉预测与规划
  • 自动驾驶场景的未来帧生成与风险评估
  • 具身智能体的仿真训练与交互学习

替代项目

World Models、DreamerV3、Genie

项目介绍

TesserAct 是计算机视觉领域的开源项目,由 UMass-Embodied-AGI 开发,2025 年首次发布。

它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 408。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-03。从国内网络环境看,可直接访问。

它主要面向的使用场景是:机器人操作任务中的视觉预测与规划。同类可对比的替代方案包括 World Models、DreamerV3、Genie。

上一篇:gcd

下一篇:ShowAnything

同类项目推荐

modlens 开源

给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。

The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···

★ 4019 2026-08-19
opencv 开源

开箱即用的视觉算法库,搞定图像视频处理与识别

Open Source Computer Vision Library

★ 90930 2026-08-10
OpenCVTutorials 开源

中文 OpenCV 教程,从入门到实战,边看边跑代码

OpenCV-Python4.1 中文文档

★ 1430 2026-08-20
Olympus 开源

一个路由搞定所有视觉任务,免去逐个微调

[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Comput···

★ 427 2026-08-09