
evals
给 AI Agent 做统一考试,改一版测一版
evals 是一个面向 AI Agent 与 LLM 应用的综合评测框架,用 Python 编写,核心目标是解决大模型应用上线前缺乏统一、可复现评测标准的问题。它提供从数据集加载、任务编排、指标计算到结果对比的完整流水线,支持对 Agent 的多步推理、工具调用、最终答案质量进行端到端打分,而不仅是单轮问答准确率。框架内置多种常见评测指标与 LLM-as-Judge 模式,允许自定义评分器与数据集,方便团队把评测接入 CI,持续跟踪模型或提示词改动带来的效果波动。项目与 strands-agents 生态相关,适合需要系统化衡量 Agent 行为、做版本回归和选型对比的开发者,目前处于早期阶段,星标约 194。
开源
free
评测安全
GitHub 星标
★ 201
维护状态
活跃
是否开源
是
定价模式
free
项目数据
分类评测安全
开发团队strands-agents
所属国家
定价模式free
价格说明开源免费,定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agentic,agentic-ai,ai,evaluation,machine-learning,python,strands-agents
GitHub 星标★ 201
30天Star增速
HF 下载量
上线时间2025-07-31 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-14
浏览次数0
使用教程
核心亮点
- 覆盖 Agent 多步推理与工具调用等端到端评测,不止单轮问答
- 支持自定义数据集、评分器与 LLM-as-Judge,可接入 CI 做回归
- Python 实现,与 strands-agents 生态衔接,便于融入现有工程
不足之处
- 项目处于早期,星标较少,生态与社区案例有限
- 内置指标与文档完善度可能不足,复杂 Agent 场景需自行扩展
适用场景
- Agent 提示词或工具链改动后做版本回归对比
- 模型选型时横向评测多个 LLM 在相同任务上的表现
- 把评测流程接入 CI,持续监控线上 Agent 质量波动
替代项目
promptfoo、DeepEval
项目介绍
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents