vision-language-action

本站收录 10 个带「vision-language-action」标签的 AI 开源项目

alpamayoalpamayo 是 NVIDIA 开源的 10B 参数推理型 VLA(视觉-语言-动作)模型,专为自动驾驶设计。它把驾驶轨迹预测与 Chain-of-Caus★ 2,030VLA-HandbookVLA-Handbook 是一份面向算法工程师的全中文学习与面试手册,聚焦 VLA(Vision-Language-Action)这一具身智能核心方向。它解决的★ 657inspect-robotsinspect-robots 是一个面向物理 AI(具身智能)的开源评测框架,目标是把机器人策略与视觉-语言-动作(VLA)模型的评估标准化。它解决的核心问题是★ 627awesome-vla-for-ad这是一个聚焦视觉-语言-动作模型(VLA)在自动驾驶领域应用的精选资源列表,系统梳理了该方向从过去到未来的研究脉络。项目解决了自动驾驶领域研究者难以快速获取VL★ 483EasyWAMEasyWAM 是一个面向具身智能与机器人领域的统一训练框架,专注于 World Action Model(世界动作模型)的构建。它把世界模型与视觉-语言-动作★ 377UniActUniAct是CVPR 2025收录的官方实现,提出“通用动作”概念,旨在增强具身基础模型(如机器人操作模型)的能力。它解决的是具身智能中动作表示不统一、模型泛★ 245alpamayo-recipesalpamayo-recipes 是 NVIDIA Alpamayo 的开发者中心,面向自动驾驶与物理 AI 场景,提供一整套可直接运行的模型配方。它解决的核心★ 193XR-1XR-1是一个开源的多模态视觉-语言-动作模型,旨在通过统一的视觉-运动表征学习,实现机器人操作任务的通用泛化能力。该项目解决的是机器人学习领域中模型泛化性差、★ 184Awesome-Embodied-AI-Safety这是一个关于具身AI安全领域的综述性开源项目,汇集了500多篇相关论文,系统梳理了具身AI在感知、认知、规划、交互和智能体系统等层面面临的风险、攻击与防御方法。★ 144Awesome-AVIAwesome-AVI 是一个关于音频-视觉智能(Audio-Visual Intelligence)的精选资源列表,旨在系统梳理该领域的前沿研究、工具和数据集★ 90