
sim-evals
把机器人策略丢进仿真跑分,省下真机评测的麻烦
sim-evals 是一个面向 DROID 机器人操作数据集的仿真评测平台,用 Python 实现。它解决的核心问题是:机器人策略在真实环境评测成本高、不可复现,而现有仿真评测又缺乏统一标准。该平台把策略放进仿真环境里跑标准任务,自动计算成功率等指标,让不同模型可以在同一套规则下对比。核心能力包括:对接 DROID 数据格式、批量运行策略、记录轨迹与指标、输出可比较的评测报告。适合做模仿学习、VLA 模型的研究者快速验证效果,也方便团队做模型选型。项目目前处于早期,星标约 241,生态和文档还在建设中,但方向明确,填补了 DROID 生态缺少统一仿真评测的空白。
项目数据
使用教程
核心亮点
- 针对 DROID 数据集做了适配,评测流程可直接复用
- 用仿真替代真机,降低评测成本和硬件门槛
- 自动记录指标与轨迹,方便横向对比不同策略
不足之处
- 项目早期,文档和示例可能不完整
- 仿真与真机存在差距,评测结论需谨慎外推
适用场景
- 机器人模仿学习研究者快速验证新策略效果
- 团队在多个 VLA 模型之间做选型对比
- 论文投稿前补充仿真评测实验数据
替代项目
robomimic、LIBERO
项目介绍
上一篇:evals-skills
下一篇:next-evals-oss
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents