unified_video_action

一个模型同时生成视频和动作,让机器人看得懂未来、动得准。

unified_video_action 是 RSS 2025 论文的官方 PyTorch 实现,旨在统一视频生成与机器人动作预测。该项目解决机器人操作中视觉生成与动作控制割裂的问题,通过一个联合模型同时生成未来视频帧和对应的动作序列,提升策略学习的泛化性与数据效率。核心能力包括:基于扩散模型的视频-动作联合生成、多任务统一框架、以及支持真实机器人数据集的训练与评估。项目代码结构清晰,提供预训练模型和推理脚本,适合机器人学习与视频生成交叉领域的研究者快速上手。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 413
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类视频生成
开发团队ShuangLI59
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型robotics,video-generation
GitHub 星标★ 413
30天Star增速
HF 下载量
上线时间2025-03-04 00:00:00
最近更新2026-09-23 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 统一视频生成与动作预测,减少模块级联误差
  • 基于扩散模型,生成质量高且支持多模态条件
  • 提供官方实现与预训练权重,复现门槛低

不足之处

  • 文档/社区待观察
  • 依赖机器人数据集,通用视频生成场景适配有限

适用场景

  • 机器人操作技能学习(如抓取、堆叠)
  • 视频预测驱动的视觉-运动联合建模
  • 多任务机器人策略的预训练与微调

替代项目

GR-1、UniPi、VideoGPT

项目介绍

unified_video_action 是视频领域的开源项目,由 ShuangLI59 开发,2025 年首次发布。

它收录于视频分类,该分类目前共有 473 个项目,GitHub 星标数为 413。

项目仍在小幅维护中,最近一次代码更新于 2026-09-23。MIT许可证,完全免费,需自行部署。

它主要面向的使用场景是:机器人操作技能学习(如抓取、堆叠)。同类可对比的替代方案包括 GR-1、UniPi、VideoGPT。

上一篇:vmem

下一篇:Awesome-Controllable-Video-Diffusion

同类项目推荐

MoneyPrinterTurbo 开源

输入一句话,高清短视频自动出炉,文案配音全包了

利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short ···

★ 125106 2026-08-09
seedance-2.0-api 开源

快速上手字节Seedance 2.0,文本/图片一键生成视频

Seedance 2.0 API — text-to-video and image-to-video examples

★ 332 2026-08-26
openscreen 开源

免费无水印录屏做演示,替代 Screen Studio

Record your screen, ship a demo. Free and open-source, GPU-accelerated, no watermark···

★ 3185 2026-08-10
MagicDance 开源

一张图+任意动作,生成身份不变的逼真人物视频

[ICML 2024] MagicPose(also known as MagicDance): Realistic Human Poses and Facial Ex···

★ 777 2026-08-09