appworld 是评测安全领域的开源项目,由 StonyBrookNLP 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 519。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。
它主要面向的使用场景是:学术研究:对比不同智能体在函数调用和交互编码上的表现。同类可对比的替代方案包括 ToolBench、API-Bank、Gorilla。

在真实模拟世界里,测试你的 AI 智能体会不会办事。
AppWorld 是一个用于评估函数调用与交互式编码智能体的可控应用与人物世界基准测试平台,源自 ACL 2024 最佳资源论文。它解决了当前智能体评测环境缺乏真实交互性和可控性的问题,通过模拟包含 9 个日常应用(如健康、出行、购物等)和 457 个 API 的虚拟环境,支持执行复杂多步骤任务,如‘帮我把明天的会议改到下午并预订餐厅’。核心能力包括:提供高保真模拟环境、支持交互式代码执行、内置自动评估机制,以及涵盖 750 个任务的多层次基准。其设计强调环境可控性和任务真实性,能有效衡量智能体在真实场景中的规划与工具调用能力。
ToolBench、API-Bank、Gorilla
appworld 是评测安全领域的开源项目,由 StonyBrookNLP 开发,2024 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 519。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。
它主要面向的使用场景是:学术研究:对比不同智能体在函数调用和交互编码上的表现。同类可对比的替代方案包括 ToolBench、API-Bank、Gorilla。
上一篇:TravelPlanner
下一篇:chatgpt-failures
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.