agentevals 是评测安全领域的开源项目,由 agentevals-dev 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 162。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。从国内网络环境看,可直接访问。
它主要面向的使用场景是:评估多步骤智能体任务完成质量。同类可对比的替代方案包括 LangSmith、Braintrust、Promptfoo。

用追踪数据评估智能体,无需绑定框架
agentevals 是一个与框架无关的 LLM 智能体评估解决方案,它基于 OpenTelemetry 追踪数据来工作。该项目解决的核心问题是:在复杂的智能体应用中,如何利用已有的可观测性数据(traces)来系统化地评估智能体的行为表现,而无需绑定特定开发框架。它提供了一套评估工具和库,能够从 OpenTelemetry 追踪中提取关键信息,支持 LLM-as-judge 等评估模式,帮助开发者量化智能体的决策质量、任务完成度等指标。其核心能力包括:基于追踪的自动化评估、与主流可观测性生态集成、灵活的评估逻辑定义。作为一个早期项目(154 星),它代表了将可观测性与评估结合的新方向,适合需要深度评估智能体行为的开发者。
LangSmith、Braintrust、Promptfoo
agentevals 是评测安全领域的开源项目,由 agentevals-dev 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 162。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。从国内网络环境看,可直接访问。
它主要面向的使用场景是:评估多步骤智能体任务完成质量。同类可对比的替代方案包括 LangSmith、Braintrust、Promptfoo。
上一篇:AutomationBench
下一篇:AgentEval
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···