WorfBench 是评测安全领域的开源项目,由 zjunlp 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 157。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:学术研究:对比不同LLM在工作流生成上的能力。同类可对比的替代方案包括 AgentBench、ToolBench、APIGen。

给AI工作流生成能力打分,让模型编排更靠谱
WorfBench 是一个用于评测和生成智能体工作流(Agentic Workflow)的基准测试框架,由 ICLR 2025 论文提出。它解决的核心问题是:当前大语言模型在生成复杂工作流(如多步骤任务编排、工具调用序列)时缺乏统一、可量化的评测标准。WorfBench 提供了一套标准化的任务集、评测指标和参考实现,能够自动评估模型生成的工作流在正确性、效率、鲁棒性等方面的表现。其核心能力包括:支持多种工作流表示格式、提供细粒度的错误分析、以及可扩展的评测接口。该框架旨在推动智能体工作流生成领域的研究进展,帮助开发者客观比较不同模型或方法的效果。
AgentBench、ToolBench、APIGen
WorfBench 是评测安全领域的开源项目,由 zjunlp 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 458 个项目,GitHub 星标数为 157。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。MIT许可证,完全免费,可自行部署使用。
它主要面向的使用场景是:学术研究:对比不同LLM在工作流生成上的能力。同类可对比的替代方案包括 AgentBench、ToolBench、APIGen。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···