judgeval

给 AI Agent 装上持续评测仪表盘,让改进有据可依

judgeval 是一个面向 AI Agent 的持续改进与评测平台,旨在解决 Agent 在生产环境中缺乏系统性评估与监控的问题。它提供了丰富的评测数据集和评估工具,支持对 Agent 的性能、安全性和可靠性进行持续监测与优化。核心能力包括:内置多种评测指标(如准确性、鲁棒性)、支持与主流框架(LangChain、LlamaIndex)集成、提供可视化仪表盘和自动化回归测试。通过将评测嵌入开发流程,judgeval 帮助团队快速定位 Agent 的薄弱环节,并利用反馈数据驱动模型迭代,实现从开发到生产的闭环改进。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1063
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类评测安全
开发团队JudgmentLabs
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agent,agentic-ai,agents,grpo,langchain,langgraph,llama-index,llm,llm-evaluation,llm-observability,open-source,openai,prompt-engineering,reinforcement-learning,rl
GitHub 星标★ 1063
30天Star增速
HF 下载量
上线时间2024-10-25 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 6 步

环境要求

  • Python 环境(可通过 pip 安装依赖)
  • OpenAI API 可用(示例使用 gpt-4o-mini,需自行配置访问凭证)
  • 从 Judgment Labs 获取 JUDGMENT_API_KEY
  • 从 Judgment Labs 获取 JUDGMENT_ORG_ID

安装与启动步骤

  1. 1安装 SDK

    在终端执行 pip 安装 judgeval,建议在独立虚拟环境中安装以避免依赖冲突。

    pip install judgeval
  2. 2设置凭证

    从 Judgment Labs 控制台获取 API Key 与组织 ID,写入环境变量,供 SDK 自动读取。

    export JUDGMENT_API_KEY=sk-xxxxxxxx
    export JUDGMENT_ORG_ID=your-org-id
  3. 3初始化 Tracer

    在代码入口调用 Tracer.init 并指定项目名,所有追踪数据会归到该项目下。

    from judgeval import Tracer
    
    Tracer.init(project_name="my-project")
  4. 4包装 OpenAI 客户端

    用 wrap 包装 OpenAI 客户端,SDK 会自动采集模型调用、输入输出与 token 用量。

    from openai import OpenAI
    from judgeval import wrap
    
    client = wrap(OpenAI())
  5. 5装饰业务函数

    用 @Tracer.observe 装饰需要观测的函数,并用 span_type 标明它是工具还是 Agent。

    @Tracer.observe(span_type="tool")
    def search(query: str) -> str:
        results = vector_db.search(query)
        return results
    
    @Tracer.observe(span_type="agent")
    def run_agent(question: str) -> str:
        context = search(question)
        response = client.chat.completions.create(
            model="gpt-4o-mini",
            messages=[{"role": "user", "content": f"{context}
    
    {question}"}],
        )
        return response.choices[0].message.content
  6. 6运行并上报追踪

    执行一次 Agent 调用,数据会自动上报到平台,可在仪表盘中查看运行轨迹。

    run_agent("What is the capital of the United States?")

关键配置

配置项必填说明示例
JUDGMENT_API_KEY是访问 Judgment Labs 平台的 API 密钥,用于上报追踪数据sk-xxxxxxxx
JUDGMENT_ORG_ID是所属组织 ID,用于将数据归属到正确团队your-org-id
project_name是Tracer.init 中的项目名,追踪数据按项目分组my-project
span_type否@Tracer.observe 的标签,区分工具、Agent 等调用类型tool

如何确认成功

运行 run_agent 后无报错返回结果,并能在 Judgment Labs 仪表盘对应项目下看到该次运行的追踪记录。

常见问题

Q:必须配置 OPENAI_API_KEY 吗?

A:README 示例通过 wrap(OpenAI()) 调用 OpenAI 模型,因此需要 OpenAI 官方所需的凭证;若换用其他模型客户端,可参考官方文档调整。

Q:JUDGMENT_API_KEY 从哪里获取?

A:README 未给出获取路径,需前往官网 judgmentlabs.ai 或其文档 docs.judgmentlabs.ai 注册并生成凭证。

Q:Tracer.init 放在哪里调用?

A:应在程序启动的最早位置调用一次,保证后续被装饰的函数都能被追踪到,避免重复初始化。

Q:可以追踪非 OpenAI 的调用吗?

A:可以,README 说明追踪基于 OpenTelemetry,任何函数都可用 @Tracer.observe 装饰;LLM token 用量则依赖被包装的客户端。

注意事项

  • README 中的 export 写法为占位符,请替换为真实密钥与组织 ID,不要提交到代码仓库。
  • 示例用 vector_db 是未定义的占位变量,实际使用时需替换为你自己的检索实现。
  • Tracer.init 建议只调用一次,重复调用可能产生非预期的项目归属。
  • 更多用法请查阅官方文档 docs.judgmentlabs.ai。

核心亮点

  • 内置丰富的评测数据集和指标,覆盖准确性、安全等多维度,开箱即用
  • 与 LangChain、LlamaIndex 等主流 Agent 框架深度集成,接入成本低
  • 支持 GRPO 等强化学习优化策略,直接助力模型迭代

不足之处

  • 项目仍处于成长阶段,文档和社区生态尚待完善
  • 对非 Python 技术栈的支持有限,跨语言场景可能受限

适用场景

  • Agent 开发团队需要持续监控线上行为并定位失败案例
  • 企业构建 Agent 安全合规评测体系,满足审计要求
  • 研究机构对比不同 Agent 框架或模型的性能差异

替代项目

LangSmith、Promptfoo、DeepEval

项目介绍

judgeval 是评测安全领域的开源项目,由 JudgmentLabs 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,063)位列前 30%,在评测安全分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。

它主要面向的使用场景是:Agent开发团队需要持续监控线上行为并定位失败案例。同类可对比的替代方案包括 LangSmith、Promptfoo、DeepEval。

上一篇:uqlm

下一篇:verifywise

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12