evals 是评测安全领域的开源项目,由 callstackincubator 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 110。
项目仍在小幅维护中,最近一次代码更新于 2026-09-19。从国内网络环境看,当前已无法正常访问。
它主要面向的使用场景是:评估AI编码助手在移动端开发中的表现。同类可对比的替代方案包括 SWE-bench、HumanEval、MBPP。

用真实 React Native 任务,测出 AI 编码真本事。
evals 是一个用于评估编码模型解决真实 React Native 任务能力的基准测试套件。它通过一系列实际开发场景,自动化测试 AI 编码助手或智能体在 React Native 项目中的表现,帮助开发者量化模型在代码生成、问题修复、功能实现等方面的能力。该项目解决了 AI 编码工具在移动端领域缺乏标准化评估的问题,提供了可重复、可对比的测试流程。核心能力包括任务定义、运行环境搭建、结果评分与报告生成,支持自定义任务扩展。对于研究 AI 编程效率或选择移动端 AI 工具的团队,evals 提供了客观的衡量依据。
SWE-bench、HumanEval、MBPP
evals 是评测安全领域的开源项目,由 callstackincubator 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 110。
项目仍在小幅维护中,最近一次代码更新于 2026-09-19。从国内网络环境看,当前已无法正常访问。
它主要面向的使用场景是:评估AI编码助手在移动端开发中的表现。同类可对比的替代方案包括 SWE-bench、HumanEval、MBPP。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.