XR-1

统一视觉与运动表征,让机器人模型学会跨任务泛化

XR-1是一个开源的多模态视觉-语言-动作模型,旨在通过统一的视觉-运动表征学习,实现机器人操作任务的通用泛化能力。该项目解决的是机器人学习领域中模型泛化性差、数据利用率低的问题,核心能力包括:将视觉、语言和动作信号映射到统一表征空间,支持跨任务、跨场景的迁移学习;提供端到端的模型训练与推理框架,兼容多种机器人硬件接口;内置数据预处理与增强工具,支持从真实或仿真环境采集的多模态数据。项目基于Python实现,采用Transformer架构,强调从视觉和运动数据中学习联合表征,以提升模型对未见过任务和环境的适应能力。目前处于早期阶段,代码库和文档正在完善中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 184
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队Open-X-Humanoid
所属国家
官网地址
定价模式free
价格说明开源模型,可自行部署,无在线服务,完全免费。
访问状态
是否开源是
开源协议NOASSERTION
主要语言Python
技术栈/模型diffusion-policy,embodied-ai,foundation-models,vision-language-action,vla-model
GitHub 星标★ 184
30天Star增速
HF 下载量
上线时间2025-12-18 00:00:00
最近更新2026-09-01 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数4

使用教程

核心亮点

  • 提出统一的视觉-运动表征学习框架,直接解决多模态对齐难题
  • 支持跨任务迁移,减少对大规模标注数据的依赖
  • 代码结构清晰,基于主流深度学习框架,易于二次开发

不足之处

  • 项目处于早期阶段,文档和示例尚不完善
  • 缺乏大规模预训练权重,实际部署需要自行训练

适用场景

  • 机器人操作技能学习,如抓取、堆叠等
  • 跨场景的视觉-语言导航任务
  • 仿真到真实的迁移学习研究

替代项目

RT-2、Octo、OpenVLA

项目介绍

XR-1 是开源模型领域的开源项目,由 Open-X-Humanoid 开发,2025 年首次发布。

它收录于开源模型分类,该分类目前共有 422 个项目,GitHub 星标数为 184。

项目仍在小幅维护中,最近一次代码更新于 2026-09-01。可自行部署,无在线服务,完全免费。

它主要面向的使用场景是:机器人操作技能学习,如抓取、堆叠等。同类可对比的替代方案包括 RT-2、Octo、OpenVLA。

上一篇:FLAIR

下一篇:FRoM-W1

同类项目推荐

Machine-Learning 开源

跟着博客笔记,边看边跑机器学习代码

All content related to machine learning from my blog

★ 115 2026-08-09
CoreML-Models 开源

下载即用的苹果端 AI 模型库,免去转换烦恼

Core ML model zoo for iOS/macOS — PyTorch models converted to ready-to-use .mlpacka···

★ 1873 2026-08-10