evals

用真实 React Native 任务,测出 AI 编码真本事。

evals 是一个用于评估编码模型解决真实 React Native 任务能力的基准测试套件。它通过一系列实际开发场景,自动化测试 AI 编码助手或智能体在 React Native 项目中的表现,帮助开发者量化模型在代码生成、问题修复、功能实现等方面的能力。该项目解决了 AI 编码工具在移动端领域缺乏标准化评估的问题,提供了可重复、可对比的测试流程。核心能力包括任务定义、运行环境搭建、结果评分与报告生成,支持自定义任务扩展。对于研究 AI 编程效率或选择移动端 AI 工具的团队,evals 提供了客观的衡量依据。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 110
维护状态 维护中
是否开源 是
定价模式 unknown

项目数据

分类评测安全
开发团队callstackincubator
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议MIT
主要语言TypeScript
技术栈/模型agents,ai,evals,react-native
GitHub 星标★ 110
30天Star增速
HF 下载量
上线时间2026-02-05 00:00:00
最近更新2026-09-19 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数6

使用教程

核心亮点

  • 聚焦真实 React Native 场景,评估结果贴近实际开发
  • 自动化基准测试,支持横向对比不同 AI 模型
  • 基于 TypeScript,易于扩展自定义评估任务

不足之处

  • 项目早期,社区和文档待观察
  • 仅覆盖 React Native,场景相对单一

适用场景

  • 评估 AI 编码助手在移动端开发中的表现
  • 对比不同模型在 React Native 任务上的能力
  • 作为 AI 编程工具选型的参考依据

替代项目

SWE-bench、HumanEval、MBPP

项目介绍

evals 是评测安全领域的开源项目,由 callstackincubator 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 110。

项目仍在小幅维护中,最近一次代码更新于 2026-09-19。从国内网络环境看,当前已无法正常访问。

它主要面向的使用场景是:评估AI编码助手在移动端开发中的表现。同类可对比的替代方案包括 SWE-bench、HumanEval、MBPP。

上一篇:openbench

下一篇:deepeval

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12