genrl

用语言或视频直接指挥机器人,先看效果再训练。

GenRL 是一个基于多模态基础世界模型的强化学习框架,旨在将自然语言和视频提示转化为具体可执行的动作序列。它通过将语言和视频输入编码为潜在世界模型状态序列,再利用解码器生成预期行为的可视化,从而在训练智能体之前先预览其行为。该项目解决了多模态提示与具身智能体之间的鸿沟,使非专家用户也能通过自然语言或视频指导智能体完成复杂任务。核心能力包括多模态提示理解、世界模型状态序列生成、行为可视化和策略学习。其创新点在于利用基础模型的世界模型能力,实现跨模态的意图传递和动作规划,为具身智能提供了一种新的交互范式。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 86
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队mazpie
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型embodied-agent,embodied-ai,foundation-models,multimodal,reinforcement-learning,world-models
GitHub 星标★ 86
30天Star增速
HF 下载量
上线时间2024-06-25 00:00:00
最近更新2026-09-17 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 将语言和视频统一为潜在状态序列,实现真正的多模态指令理解。
  • 支持行为预可视化,训练前即可预览智能体预期动作,降低试错成本。
  • 基于NeurIPS 2024论文,学术前沿,方法有理论支撑。

不足之处

  • 项目处于早期,星标仅87,社区和文档尚不完善。
  • 依赖多模态基础模型,推理和训练资源需求较高。

适用场景

  • 机器人操作任务的自然语言指令执行。
  • 基于视频演示的智能体行为克隆与泛化。
  • 多模态交互式强化学习环境中的策略学习。

替代项目

VPT (Video PreTraining)、GATO (DeepMind)、RT-2 (Google)

项目介绍

genrl 是智能体领域的开源项目,由 mazpie 开发,2024 年首次发布。

它收录于智能体分类,该分类目前共有 2,499 个项目,GitHub 星标数为 86。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-17。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:机器人操作任务的自然语言指令执行。同类可对比的替代方案包括 VPT (Video PreTraining)、GATO (DeepMind)、RT-2 (Google)。

上一篇:Medea

下一篇:cactus

同类项目推荐

xinchao-dynamic-mind 开源

给 AI 装上疲惫和欲望,让交互更真实

独立、可自托管的 AI 动态心智状态引擎:驱动力、念头池、疲惫、睡眠与意图。

★ 199 2026-08-09
deepseek-harness 开源

把 AI 能力拆成乐高积木,拼出你的专属智能体。

DeepSeek Harness: Everything is a Plugin.

★ 233327 2026-08-15
AutoGPT 开源

开箱即用的 AI 员工,交代任务就自己干完

AutoGPT is the vision of accessible AI for everyone, to use and to build on. Our mis···

★ 187492 2026-08-09
EvoAgentX 开源

让 AI 智能体自己迭代变强,越用越聪明

EvoAgentX: Building a Self-Evolving Ecosystem of AI Agents

★ 3351 2026-09-12