evals

给 AI Agent 做统一考试,改一版测一版

evals 是一个面向 AI Agent 与 LLM 应用的综合评测框架,用 Python 编写,核心目标是解决大模型应用上线前缺乏统一、可复现评测标准的问题。它提供从数据集加载、任务编排、指标计算到结果对比的完整流水线,支持对 Agent 的多步推理、工具调用、最终答案质量进行端到端打分,而不仅是单轮问答准确率。框架内置多种常见评测指标与 LLM-as-Judge 模式,允许自定义评分器与数据集,方便团队把评测接入 CI,持续跟踪模型或提示词改动带来的效果波动。项目与 strands-agents 生态相关,适合需要系统化衡量 Agent 行为、做版本回归和选型对比的开发者,目前处于早期阶段,星标约 194。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 201
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队strands-agents
所属国家
定价模式free
价格说明开源免费,定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型agentic,agentic-ai,ai,evaluation,machine-learning,python,strands-agents
GitHub 星标★ 201
30天Star增速
HF 下载量
上线时间2025-07-31 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0

使用教程

核心亮点

  • 覆盖 Agent 多步推理与工具调用等端到端评测,不止单轮问答
  • 支持自定义数据集、评分器与 LLM-as-Judge,可接入 CI 做回归
  • Python 实现,与 strands-agents 生态衔接,便于融入现有工程

不足之处

  • 项目处于早期,星标较少,生态与社区案例有限
  • 内置指标与文档完善度可能不足,复杂 Agent 场景需自行扩展

适用场景

  • Agent 提示词或工具链改动后做版本回归对比
  • 模型选型时横向评测多个 LLM 在相同任务上的表现
  • 把评测流程接入 CI,持续监控线上 Agent 质量波动

替代项目

promptfoo、DeepEval

项目介绍

evals 是一个评测安全领域的开源项目,官方简介:A comprehensive evaluation framework for AI agents and LLM applications.。项目使用 Python 开发,在 GitHub 上获得 194 星标。

上一篇:SREGym

下一篇:evals

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24