agentevals

用追踪数据评估智能体,无需绑定框架

agentevals 是一个与框架无关的 LLM 智能体评估解决方案,它基于 OpenTelemetry 追踪数据来工作。该项目解决的核心问题是:在复杂的智能体应用中,如何利用已有的可观测性数据(traces)来系统化地评估智能体的行为表现,而无需绑定特定开发框架。它提供了一套评估工具和库,能够从 OpenTelemetry 追踪中提取关键信息,支持 LLM-as-judge 等评估模式,帮助开发者量化智能体的决策质量、任务完成度等指标。其核心能力包括:基于追踪的自动化评估、与主流可观测性生态集成、灵活的评估逻辑定义。作为一个早期项目(154 星),它代表了将可观测性与评估结合的新方向,适合需要深度评估智能体行为的开发者。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 162
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类评测安全
开发团队agentevals-dev
所属国家
官网地址https://aevals.ai
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agentevals,agents,evals,evaluation,genai,llm,llm-as-judge,opentelemetry,otel,tracing
GitHub 星标★ 162
30天Star增速
HF 下载量
上线时间2026-02-24 00:00:00
最近更新2026-09-20 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数6

使用教程

核心亮点

  • 基于 OpenTelemetry 追踪,天然适配可观测性生态,数据来源标准化
  • 框架无关设计,可评估 LangChain、LlamaIndex 等任意框架的智能体
  • 支持 LLM-as-judge 等灵活评估模式,适应复杂行为判断

不足之处

  • 早期项目,文档和社区生态尚待完善
  • 依赖 OpenTelemetry 追踪数据,未接入追踪的现有项目需改造

适用场景

  • 评估多步骤智能体任务完成质量
  • 在 CI/CD 中集成智能体回归测试
  • 对比不同提示词或模型对智能体行为的影响

替代项目

LangSmith、Braintrust、Promptfoo

项目介绍

agentevals 是评测安全领域的开源项目,由 agentevals-dev 开发,是 2026 年新上线的项目。

它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 162。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-20。从国内网络环境看,可直接访问。

它主要面向的使用场景是:评估多步骤智能体任务完成质量。同类可对比的替代方案包括 LangSmith、Braintrust、Promptfoo。

上一篇:AutomationBench

下一篇:AgentEval

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24