OpenJudge

给AI智能体当裁判,量化每一步质量,训练更靠谱的Agent。

OpenJudge 是一个用于智能体全面评估与质量奖励的统一框架。它解决的核心问题是:当前大模型智能体评估往往只关注最终结果,而忽略过程质量,且评估标准碎片化。OpenJudge 提供了一套标准化的评估流程和奖励机制,能够对智能体的行为进行细粒度、多维度的评分,包括任务完成度、步骤合理性、技能使用正确性等。其核心能力包括:支持多种评估场景(如技能调用、多轮对话、工具使用)、可自定义评估规则、输出结构化质量报告,并可与强化学习(RLHF)流程集成,为智能体训练提供质量奖励信号。项目基于 Python,采用模块化设计,便于扩展。

开源 unknown 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 851
维护状态 较活跃
是否开源 是
定价模式 unknown

项目数据

分类智能体
开发团队agentscope-ai
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型agent,agent-skills,ai-agent,alignment,evaluation,grader,llm,reward,reward-model,rlhf,skill-md,skills
GitHub 星标★ 851
30天Star增速
HF 下载量
上线时间2025-07-08 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

核心亮点

  • 提供统一的评估框架,覆盖结果与过程质量,避免单一指标偏差
  • 支持细粒度技能级评估,可针对特定Agent技能定制奖励规则
  • 与RLHF流程集成,可直接用于智能体强化学习训练的质量信号

不足之处

  • 项目处于早期阶段(775星),文档和社区生态尚不成熟
  • 评估规则定义可能依赖人工配置,自动化程度待提升

适用场景

  • 智能体开发者在训练前评估模型能力短板
  • RLHF训练中自动生成过程质量奖励信号
  • 对比不同Agent框架或技能方案的质量差异

替代项目

OpenAI Evals、LangChain Benchmarks、AgentBench

项目介绍

OpenJudge 是评测安全领域的开源项目,由 agentscope-ai 开发,2025 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(851)位列前 30%,在评测安全分类中处于中上游。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。

它主要面向的使用场景是:智能体开发者在训练前评估模型能力短板。同类可对比的替代方案包括 OpenAI Evals、LangChain Benchmarks、AgentBench。

上一篇:WindowsAgentArena

下一篇:awesome-ai-leaderboard

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12