TesserAct 是计算机视觉领域的开源项目,由 UMass-Embodied-AGI 开发,2025 年首次发布。
它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 408。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-03。从国内网络环境看,可直接访问。
它主要面向的使用场景是:机器人操作任务中的视觉预测与规划。同类可对比的替代方案包括 World Models、DreamerV3、Genie。

让机器人看懂并预测4D世界,实现具身智能
TesserAct 是 ICCV 2025 收录的 4D 具身世界模型项目,旨在解决机器人或具身智能体对动态三维世界的理解与预测问题。它通过将视频生成与 3D/4D 表示学习结合,构建一个可交互的时空世界模型,使智能体不仅能观察当前场景,还能预测未来状态并规划动作。核心能力包括:从多视角视频中学习 4D 场景表征、生成连贯的未来帧序列、支持动作条件生成,以及为机器人控制提供潜在规划空间。项目代码基于 Python 实现,技术栈涉及 3D 视觉、视频生成和具身智能,适合研究世界模型、机器人感知与决策的开发者。目前处于早期阶段,星标 405,但提供了官方实现和演示,便于复现论文结果。
World Models、DreamerV3、Genie
TesserAct 是计算机视觉领域的开源项目,由 UMass-Embodied-AGI 开发,2025 年首次发布。
它收录于计算机视觉分类,该分类目前共有 447 个项目,GitHub 星标数为 408。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-03。从国内网络环境看,可直接访问。
它主要面向的使用场景是:机器人操作任务中的视觉预测与规划。同类可对比的替代方案包括 World Models、DreamerV3、Genie。
上一篇:gcd
下一篇:ShowAnything
modlens
开源
给纯文本编码代理装上眼睛,粘贴图片即刻获得结构化视觉证据。
The first vision plugin for DeepSeek Harness, and the vision bridge for every text-o···
opencv
开源
开箱即用的视觉算法库,搞定图像视频处理与识别
Open Source Computer Vision Library
OpenCVTutorials
开源
中文 OpenCV 教程,从入门到实战,边看边跑代码
OpenCV-Python4.1 中文文档
Olympus
开源
一个路由搞定所有视觉任务,免去逐个微调
[CVPR 2025 Highlight] Official code for "Olympus: A Universal Task Router for Comput···