judgeval 是评测安全领域的开源项目,由 JudgmentLabs 开发,2024 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(1,063)位列前 30%,在评测安全分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。
它主要面向的使用场景是:Agent开发团队需要持续监控线上行为并定位失败案例。同类可对比的替代方案包括 LangSmith、Promptfoo、DeepEval。

给 AI Agent 装上持续评测仪表盘,让改进有据可依
judgeval 是一个面向 AI Agent 的持续改进与评测平台,旨在解决 Agent 在生产环境中缺乏系统性评估与监控的问题。它提供了丰富的评测数据集和评估工具,支持对 Agent 的性能、安全性和可靠性进行持续监测与优化。核心能力包括:内置多种评测指标(如准确性、鲁棒性)、支持与主流框架(LangChain、LlamaIndex)集成、提供可视化仪表盘和自动化回归测试。通过将评测嵌入开发流程,judgeval 帮助团队快速定位 Agent 的薄弱环节,并利用反馈数据驱动模型迭代,实现从开发到生产的闭环改进。
1安装 SDK
在终端执行 pip 安装 judgeval,建议在独立虚拟环境中安装以避免依赖冲突。
pip install judgeval2设置凭证
从 Judgment Labs 控制台获取 API Key 与组织 ID,写入环境变量,供 SDK 自动读取。
export JUDGMENT_API_KEY=sk-xxxxxxxx
export JUDGMENT_ORG_ID=your-org-id3初始化 Tracer
在代码入口调用 Tracer.init 并指定项目名,所有追踪数据会归到该项目下。
from judgeval import Tracer
Tracer.init(project_name="my-project")4包装 OpenAI 客户端
用 wrap 包装 OpenAI 客户端,SDK 会自动采集模型调用、输入输出与 token 用量。
from openai import OpenAI
from judgeval import wrap
client = wrap(OpenAI())5装饰业务函数
用 @Tracer.observe 装饰需要观测的函数,并用 span_type 标明它是工具还是 Agent。
@Tracer.observe(span_type="tool")
def search(query: str) -> str:
results = vector_db.search(query)
return results
@Tracer.observe(span_type="agent")
def run_agent(question: str) -> str:
context = search(question)
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": f"{context}
{question}"}],
)
return response.choices[0].message.content6运行并上报追踪
执行一次 Agent 调用,数据会自动上报到平台,可在仪表盘中查看运行轨迹。
run_agent("What is the capital of the United States?")| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
JUDGMENT_API_KEY | 是 | 访问 Judgment Labs 平台的 API 密钥,用于上报追踪数据 | sk-xxxxxxxx |
JUDGMENT_ORG_ID | 是 | 所属组织 ID,用于将数据归属到正确团队 | your-org-id |
project_name | 是 | Tracer.init 中的项目名,追踪数据按项目分组 | my-project |
span_type | 否 | @Tracer.observe 的标签,区分工具、Agent 等调用类型 | tool |
运行 run_agent 后无报错返回结果,并能在 Judgment Labs 仪表盘对应项目下看到该次运行的追踪记录。
Q:必须配置 OPENAI_API_KEY 吗?
A:README 示例通过 wrap(OpenAI()) 调用 OpenAI 模型,因此需要 OpenAI 官方所需的凭证;若换用其他模型客户端,可参考官方文档调整。
Q:JUDGMENT_API_KEY 从哪里获取?
A:README 未给出获取路径,需前往官网 judgmentlabs.ai 或其文档 docs.judgmentlabs.ai 注册并生成凭证。
Q:Tracer.init 放在哪里调用?
A:应在程序启动的最早位置调用一次,保证后续被装饰的函数都能被追踪到,避免重复初始化。
Q:可以追踪非 OpenAI 的调用吗?
A:可以,README 说明追踪基于 OpenTelemetry,任何函数都可用 @Tracer.observe 装饰;LLM token 用量则依赖被包装的客户端。
LangSmith、Promptfoo、DeepEval
judgeval 是评测安全领域的开源项目,由 JudgmentLabs 开发,2024 年首次发布。
在全站 13,090 个收录项目中,它的 GitHub 星标数(1,063)位列前 30%,在评测安全分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。
它主要面向的使用场景是:Agent开发团队需要持续监控线上行为并定位失败案例。同类可对比的替代方案包括 LangSmith、Promptfoo、DeepEval。
上一篇:uqlm
下一篇:verifywise
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.