appworld

在真实模拟世界里,测试你的 AI 智能体会不会办事。

AppWorld 是一个用于评估函数调用与交互式编码智能体的可控应用与人物世界基准测试平台,源自 ACL 2024 最佳资源论文。它解决了当前智能体评测环境缺乏真实交互性和可控性的问题,通过模拟包含 9 个日常应用(如健康、出行、购物等)和 457 个 API 的虚拟环境,支持执行复杂多步骤任务,如‘帮我把明天的会议改到下午并预订餐厅’。核心能力包括:提供高保真模拟环境、支持交互式代码执行、内置自动评估机制,以及涵盖 750 个任务的多层次基准。其设计强调环境可控性和任务真实性,能有效衡量智能体在真实场景中的规划与工具调用能力。

开源 unknown 智能体
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 519
维护状态 较活跃
是否开源 是
定价模式 unknown

项目数据

分类智能体
开发团队StonyBrookNLP
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型acl-2024,ai-agents,ai-apis,ai-assistants,ai-environment,ai-planning,autonomous-agents,coding-agents,function-calling,interactive-coding,llm,llm-agents,nlp-datasets,nlp-machine-learning,tool-usage
GitHub 星标★ 519
30天Star增速
HF 下载量
上线时间2024-06-23 00:00:00
最近更新2026-09-23 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 基于 ACL 最佳论文,学术权威性高,评测方法经过同行评审
  • 模拟 9 个真实日常应用和 457 个 API,任务场景贴近生活,非玩具级
  • 支持交互式代码执行,能评估智能体多步规划和动态纠错能力

不足之处

  • 模拟环境与真实世界仍有差距,应用种类有限,可能无法覆盖所有真实场景
  • 文档/社区待观察,项目较新,生态和教程可能不够丰富

适用场景

  • 学术研究:对比不同智能体在函数调用和交互编码上的表现
  • 模型开发:在发布前测试和调优 AI 助手的工具使用能力
  • 教育评估:作为课程或培训中智能体能力的标准化测试集

替代项目

ToolBench、API-Bank、Gorilla

项目介绍

appworld 是评测安全领域的开源项目,由 StonyBrookNLP 开发,2024 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 519。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-23。从国内网络环境看,可直接访问。

它主要面向的使用场景是:学术研究:对比不同智能体在函数调用和交互编码上的表现。同类可对比的替代方案包括 ToolBench、API-Bank、Gorilla。

上一篇:TravelPlanner

下一篇:chatgpt-failures

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12