
inspect-robots
一套接口,把任意 VLA 模型放到任意机器人上跑分
inspect-robots 是一个面向物理 AI(具身智能)的开源评测框架,目标是把机器人策略与视觉-语言-动作(VLA)模型的评估标准化。它解决的核心问题是:机器人领域缺少像 NLP 那样统一、可复现的评测流程,不同实验室各自造轮子,导致模型之间难以横向比较。项目提供统一接口,让你可以把任意 LLM 或 VLA 模型接到任意机械臂或人形机器人上,并在真实环境或仿真基准中运行测试。它内置任务定义、环境适配、轨迹记录与可视化(基于 rerun)等能力,支持批量跑分与结果对比。整体定位类似机器人界的 lm-evaluation-harness,强调可扩展与可复现,方便研究者快速验证新模型在新硬件上的表现,也便于团队建立内部评测基线。
项目数据
使用教程
核心亮点
- 统一模型与硬件接口,换机器人或换模型只需改配置,不用重写评测代码
- 支持真实与仿真两类基准,覆盖 sim-to-real 对比需求
- 内置 rerun 可视化,轨迹与失败案例可直接回放排查
不足之处
- 项目处于早期,星标 460,生态与预置基准数量有限
- 真实机器人接入依赖具体硬件驱动,开箱即用程度待验证
适用场景
- 研究团队横向对比多个 VLA 模型在同一机械臂上的成功率
- 开发者把新训练的 LLM 策略快速接入现有仿真基准跑分
- 实验室建立内部机器人评测基线并长期追踪模型迭代效果
替代项目
robosuite、robomimic、AI2-THOR
项目介绍
上一篇:convex-evals
下一篇:aiewf-eval
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents