embodied-ai

本站收录 39 个带「embodied-ai」标签的 AI 开源项目

OtterOtter是一个基于OpenFlamingo的多模态模型,旨在提升视觉-语言任务的指令跟随和上下文学习能力。它针对DeepMind Flamingo的开源版本进★ 3,443awesome-llm-powered-agent这是一个精心整理的关于大语言模型驱动智能体的资源列表,收录了相关论文、开源仓库、博客文章等。它旨在帮助开发者和研究者快速了解LLM Agent领域的最新进展和核★ 2,251unrealcvUnrealCV 是一个将计算机视觉与虚幻引擎(UE4/UE5)连接起来的开源工具,旨在为视觉研究提供高保真的虚拟世界数据生成平台。它解决了真实数据采集成本高、★ 2,218Awesome-World-ModelsAwesome-World-Models 是一个围绕“世界模型”主题的论文与资源合集,系统整理了世界模型的定义、发展脉络,以及它在通用视频生成、具身智能和自动驾★ 2,027Awesome-Embodied-Robotics-and-Agent这是一个精选资源列表,汇集了“具身智能”或“机器人+大语言模型”方向的前沿研究。它系统梳理了将LLM应用于机器人操控、导航、任务规划、场景理解等核心领域的论文、★ 1,893awesome-3d-4d-world-models这是一个关于3D和4D世界建模的综述性资源列表,收录了TPAMI 2026论文《3D and 4D World Modeling: A Survey》中引用的相★ 993VoxPoserVoxPoser 是一个将大语言模型(LLM)与机器人操作相结合的框架,旨在让机器人仅通过自然语言指令就能完成复杂的物理操作任务。它解决了传统机器人编程需要专业★ 838Autoregressive-Models-in-Vision-Survey这是一份关于视觉自回归模型(AR models)的综述论文项目,发表于TMLR 2025。它系统梳理了自回归模型在计算机视觉领域的研究进展,涵盖图像生成、视频预★ 808DriveAGIDriveAGI 是一个基于 CVPR 2024 Highlight 论文 GenAD 实现的开源自动驾驶预测模型。它旨在通过大规模视频数据预训练一个通用的驾驶★ 807VLA-HandbookVLA-Handbook 是一份面向算法工程师的全中文学习与面试手册,聚焦 VLA(Vision-Language-Action)这一具身智能核心方向。它解决的★ 657inspect-robotsinspect-robots 是一个面向物理 AI(具身智能)的开源评测框架,目标是把机器人策略与视觉-语言-动作(VLA)模型的评估标准化。它解决的核心问题是★ 627AetherAether 是一个面向具身智能与空间智能的统一世界模型,核心解决视频生成中几何一致性缺失的问题。它通过融合4D重建与生成技术,在生成视频的同时显式建模场景的几★ 612raiRAI 是一个面向物理 AI 机器人的厂商无关智能体框架,基于 ROS 2 工具构建,旨在让机器人通过大语言模型完成复杂任务。它解决的核心问题是:传统机器人开发★ 597awesome-vla-for-ad这是一个聚焦视觉-语言-动作模型(VLA)在自动驾驶领域应用的精选资源列表,系统梳理了该方向从过去到未来的研究脉络。项目解决了自动驾驶领域研究者难以快速获取VL★ 483TesserActTesserAct 是 ICCV 2025 收录的 4D 具身世界模型项目,旨在解决机器人或具身智能体对动态三维世界的理解与预测问题。它通过将视频生成与 3D/★ 409PhysiClawPhysiClaw 是一个具身智能体项目,旨在让 AI 不仅停留在数字世界,还能通过物理设备(如机械臂、手机等)与真实世界交互。它解决了传统 AI 助手无法操作★ 378EasyWAMEasyWAM 是一个面向具身智能与机器人领域的统一训练框架,专注于 World Action Model(世界动作模型)的构建。它把世界模型与视觉-语言-动作★ 377UniGoalUniGoal 是一个面向通用零样本目标导向导航的框架,发表于 CVPR 2025。它解决的是智能体在未知环境中根据自然语言指令或目标类别进行导航的问题,无需针★ 367SG-NavSG-Nav 是一个面向机器人导航的零样本目标定位框架,核心解决大型语言模型(LLM)在未知环境中无法直接理解3D场景结构的问题。它通过在线构建3D场景图(Sc★ 354Book-of-MLM《多模态大模型:新一代人工智能技术范式》一书的官方配套教学资源库,由中国人民大学高瓴人工智能学院长聘副教授卢志武团队维护。项目旨在为读者和研究者提供系统性的多模★ 328Awesome-LLM-Reasoning-with-NeSyAwesome-LLM-Reasoning-with-NeSy 是一个精选资源列表,专注于神经符号学习(NeSy)与大语言模型(LLM)结合的最新进展。该项目系★ 328Awesome-Physics-Cognition-based-Video-Generation这是一个聚焦视频生成中物理认知方向的论文列表,旨在系统梳理该交叉领域的研究进展。它解决了研究者难以快速获取物理感知视频生成相关论文、代码和资源的问题。项目按主题★ 327language-plannerlanguage-planner 是论文《Language Models as Zero-Shot Planners》的官方代码,旨在利用大型语言模型(LLM)★ 281minimal-embodiment这是一个极简的软硬件架构,旨在为大型语言模型(LLM)提供闭环的物理具身,使其具备自我感知循环。项目用C++实现,核心是构建一个最小化的硬件-软件系统,让LLM★ 279UniActUniAct是CVPR 2025收录的官方实现,提出“通用动作”概念,旨在增强具身基础模型(如机器人操作模型)的能力。它解决的是具身智能中动作表示不统一、模型泛★ 245GenAI4ADGenAI4AD 是一个系统梳理生成式人工智能(GenAI)在自动驾驶全栈中应用的开源项目。它并非一个可直接运行的模型,而是一份深度综述与知识图谱,覆盖从感知、★ 233world-in-worldworld-in-world 是一个基于闭环世界模型(Closed-Loop World Models)的视频生成开源项目,核心论文发表于 ICLR'26 并获★ 209FRoM-W1FRoM-W1 是一个面向通用人形机器人全身控制的开源模型,基于 arXiv 论文实现,旨在通过自然语言指令驱动机器人完成复杂的全身动作。它解决了人形机器人控制★ 194XR-1XR-1是一个开源的多模态视觉-语言-动作模型,旨在通过统一的视觉-运动表征学习,实现机器人操作任务的通用泛化能力。该项目解决的是机器人学习领域中模型泛化性差、★ 184OceanGymOceanGym 是一个面向水下具身智能体的基准测试环境,旨在解决水下机器人(如AUV、ROV)在复杂海洋环境中进行导航、操控和决策时缺乏标准化评估平台的问题。★ 146Awesome-Embodied-AI-Safety这是一个关于具身AI安全领域的综述性开源项目,汇集了500多篇相关论文,系统梳理了具身AI在感知、认知、规划、交互和智能体系统等层面面临的风险、攻击与防御方法。★ 144DataClaw0DataClaw 是一个面向多模态数据智能处理的开源项目,核心目标是解决原始数据流到高质量训练数据的自动化加工问题。它通过 Agentic 方式,结合视觉语言模★ 115PhysInOnePhysInOne 是一个基于 Python 的物理感知视频生成与动态重建框架,相关论文被 CVPR 2026 接收。它旨在解决视频生成中物理规律缺失、动态场景★ 111LabVLALabVLA是一个面向科学实验室场景的视觉-语言-动作(VLA)模型开源项目。它旨在解决机器人在科研实验室中执行复杂操作任务时,缺乏对专业仪器、试剂和流程理解的★ 104ReVidgenReVidgen 是一个面向具身智能世界的视频生成模型基准与评估工具包,由 ICML 2026 论文提出。它重新思考了视频生成模型在机器人、自动驾驶等具身场景中★ 99PActPAct 是一个面向单张图像的三维关节物体生成项目,被 SIGGRAPH Asia 2026 条件接收。它解决的是从单一视角图片中重建出带有可活动部件(如机械臂★ 87genrlGenRL 是一个基于多模态基础世界模型的强化学习框架,旨在将自然语言和视频提示转化为具体可执行的动作序列。它通过将语言和视频输入编码为潜在世界模型状态序列,再★ 86GC-VLNGC-VLN 是一个面向视觉-语言导航(VLN)任务的训练-free 方法,由 CoRL 2025 论文提出。它解决的是智能体在未知环境中,仅依赖自然语言指令和★ 84EVAEVA 是一个将视频生成模型与机器人动作执行对齐的开源项目,核心思路是利用逆动力学奖励来训练视频世界模型,使其不仅能预测未来帧,还能根据视频内容生成可执行的机器★ 64