sim-evals

把机器人策略丢进仿真跑分,省下真机评测的麻烦

sim-evals 是一个面向 DROID 机器人操作数据集的仿真评测平台,用 Python 实现。它解决的核心问题是:机器人策略在真实环境评测成本高、不可复现,而现有仿真评测又缺乏统一标准。该平台把策略放进仿真环境里跑标准任务,自动计算成功率等指标,让不同模型可以在同一套规则下对比。核心能力包括:对接 DROID 数据格式、批量运行策略、记录轨迹与指标、输出可比较的评测报告。适合做模仿学习、VLA 模型的研究者快速验证效果,也方便团队做模型选型。项目目前处于早期,星标约 241,生态和文档还在建设中,但方向明确,填补了 DROID 生态缺少统一仿真评测的空白。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 242
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队arhanjain
所属国家
官网地址
定价模式free
价格说明开源免费,无定价信息
访问状态
是否开源
开源协议
主要语言Python
技术栈/模型
GitHub 星标★ 242
30天Star增速
HF 下载量
上线时间2025-05-23 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

核心亮点

  • 针对 DROID 数据集做了适配,评测流程可直接复用
  • 用仿真替代真机,降低评测成本和硬件门槛
  • 自动记录指标与轨迹,方便横向对比不同策略

不足之处

  • 项目早期,文档和示例可能不完整
  • 仿真与真机存在差距,评测结论需谨慎外推

适用场景

  • 机器人模仿学习研究者快速验证新策略效果
  • 团队在多个 VLA 模型之间做选型对比
  • 论文投稿前补充仿真评测实验数据

替代项目

robomimic、LIBERO

项目介绍

sim-evals 是一个评测安全领域的开源项目,官方简介:A simulation evaluation platform for DROID。项目使用 Python 开发,在 GitHub 上获得 241 星标。

上一篇:evals-skills

下一篇:next-evals-oss

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24