Motus

一个模型同时生成视频和控制机器人,让机器人从视频中学习世界规律。

Motus 是一个统一潜在动作世界模型,用于视频生成和机器人操作。它基于扩散模型,将视觉、语言和动作融合到一个潜在空间中,通过预测未来的视频帧来学习世界的动态规律。该模型能够根据文本指令或视觉观察生成连贯的视频序列,并直接输出机器人的动作指令,实现视觉-语言-动作的端到端学习。Motus 的核心能力在于统一了视频生成和机器人控制两个任务,使模型能够从视频数据中学习通用的世界知识,并将其迁移到具体的操作任务中。它解决了机器人学习中的数据稀缺和泛化问题,通过大规模视频预训练和动作微调,提升了机器人在复杂环境中的操作能力。项目提供了官方代码和预训练模型,支持多种机器人操作场景,为具身智能和世界模型研究提供了新的思路。

开源 free 视频生成
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1293
维护状态 低维护
是否开源
定价模式 free

项目数据

分类视频生成
开发团队thu-ml
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,代码公开,可自行部署使用,无付费版本。
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型diffusion-model,robotic-manipulation,robotics,unidiffuser,video-generation,vision-language-action-model,world-model
GitHub 星标★ 1293
30天Star增速
HF 下载量
上线时间2025-12-12 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:进阶 约 30 分钟 部署方式:本地安装 6 步

环境要求

  • Python 环境(README 未指定最低版本,需能使用 pip 安装 PyTorch 2.7.1)
  • 支持 CUDA 12.8 的 NVIDIA GPU(torch 与 flash-attn 均按 cu128 安装)
  • 已安装 pip,并能访问 PyPI 与 PyTorch 官方源 download.pytorch.org
  • 预训练权重需从 Hugging Face 的 motus-robotics 组织获取

安装与启动步骤

  1. 1获取项目代码

    从 GitHub 克隆 Motus 仓库到本地,后续所有安装命令都在仓库根目录执行。

    git clone https://github.com/thu-ml/Motus.git
    cd Motus
  2. 2安装 PyTorch

    按 README 指定版本安装 CUDA 12.8 版 torch 2.7.1 与 torchvision 0.22.1,注意 --index-url 不能省。

    pip install torch==2.7.1 torchvision==0.22.1 --index-url https://download.pytorch.org/whl/cu128
  3. 3安装 FlashAttention

    安装 flash-attn,README 要求加 --no-build-isolation,否则编译常报错,编译耗时较长。

    pip install flash-attn --no-build-isolation
  4. 4安装项目依赖

    安装仓库根目录 requirements.txt 中列出的 Motus 运行依赖。

    pip install -r requirements.txt
  5. 5可选装 LeRobot

    仅在需要 LeRobot 相关数据/环境时执行,先 --no-deps 装本体,再装其附加依赖。

    pip install --no-deps lerobot==0.3.2
    pip install -r requirements/lerobot.txt
  6. 6运行推理

    README 指向 INFERENCE.md 获取详细推理流程;RoboTwin 2.0 评测与真机推理各有子目录说明。

如何确认成功

各步 pip 安装均无报错,且 `import torch` 后 torch.cuda.is_available() 返回 True。

常见问题

Q:flash-attn 安装编译失败怎么办?

A:确认已加 --no-build-isolation,并保证 torch 先装好、CUDA 版本为 12.8;该包需要本地编译,耗时较长属正常现象。

Q:能不能只装 CPU 版 PyTorch?

A:README 只给出 cu128 的安装命令,未提供 CPU 版本说明,使用 CPU 环境可能无法按文档正常运行。

Q:必须安装 lerobot 吗?

A:不是。README 标注该步骤为 Optional,仅在需要 LeRobot 相关依赖时才安装。

Q:推理命令在哪里?

A:README 未在正文给出推理命令,请查看仓库中的 INFERENCE.md,以及 inference/robotwin/Motus/README.md。

注意事项

  • 所有 pip 安装命令需在克隆下来的 Motus 仓库根目录执行,requirements 路径才能正确解析。
  • flash-attn 需要本地编译,建议预留足够时间和磁盘空间。
  • README 节选未包含 Requirements 与 Model Checkpoints 的完整内容,环境版本与权重下载方式请以仓库原文为准。
  • RoboTwin 2.0 与真机推理的流程差异较大,请分别参考对应子目录文档。

核心亮点

  • 统一视频生成和机器人动作预测,实现视觉-语言-动作端到端学习
  • 基于扩散模型,生成视频质量高,动作预测更精准
  • 提供官方预训练模型和代码,易于复现和二次开发

不足之处

  • 模型训练和推理计算资源需求高,部署门槛不低
  • 文档/社区待观察

适用场景

  • 机器人操作技能学习,如抓取、放置等
  • 视频生成与预测,用于模拟环境或数据增强
  • 具身智能研究,探索世界模型与决策结合

替代项目

UniPi、GR-1、RoboFlamingo

项目介绍

Motus 是行业应用领域的开源项目,由 thu-ml 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,293)位列前 30%,在行业应用分类中处于中上游。

近 45 天,它的 GitHub 星标从 1,220 增加到 1,293,净增 73。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,代码公开,可自行部署使用,无付费版本。

它主要面向的使用场景是:机器人操作技能学习,如抓取、放置等。同类可对比的替代方案包括 UniPi、GR-1、RoboFlamingo。

上一篇:Endora

下一篇:Epona

同类项目推荐

xmgai-like 开源

换脸、艺术二维码随手玩,副业灵感一包带走。

本开源 AI 副业搞钱项目集成了强大功能,包括 AI 艺术二维码生成、AI 换脸、Delle3 绘画等···

★ 60 2026-08-09
spoken-to-signed-translation 开源

把口语文本一路转成手语视频的流水线

a text-to-gloss-to-pose-to-video pipeline for spoken to signed language translation

★ 102 2026-09-11
LiveTranslate 开源

直播看片实时翻译,字幕秒出,跨语言无压力

Real-time audio translation, captures system audio + mic, runs ASR (Whisper/SenseVoi···

★ 691 2026-08-13