tau2-bench

测测你的AI智能体,会不会在真实客服场景中翻车

τ-Bench 是一个用于评估工具调用型智能体(Tool-Agent)在真实世界领域中人机交互能力的基准测试框架。它针对当前大模型智能体在复杂业务场景中需要与用户、工具进行多轮交互的挑战,提供了一套标准化的测试环境和评估指标。该基准包含两个核心领域:零售和航空,模拟了客服、订票等真实任务,要求智能体不仅要正确调用工具,还要理解用户意图、处理模糊信息、遵循业务规则,并在多轮对话中保持连贯性。τ-Bench 通过定义用户模拟器、工具集和评分规则,能够自动评估智能体的任务完成率、工具调用准确性和对话效率,从而帮助开发者量化比较不同模型或智能体系统的性能。其核心能力在于提供了一个可复现、可扩展的评估平台,支持研究者快速验证和迭代他们的智能体设计。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2099
维护状态 活跃
是否开源
定价模式 free

项目数据

分类开源模型
开发团队sierra-research
所属国家
定价模式free
价格说明开源基准测试项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型ai,benchmark,conversational-agents,language-model-agent,llm
GitHub 星标★ 2099
30天Star增速
HF 下载量
上线时间2025-06-09 00:00:00
最近更新2026-09-23 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:进阶 约 10 分钟 部署方式:本地安装 7 步

环境要求

  • 已安装 uv 包管理器(README 指明必须使用 uv,未指定 Python 版本)
  • 可用的 LLM API 密钥(用于 --agent-llm / --user-llm 指定的模型)
  • 如需语音功能,需额外系统依赖:macOS 上 brew install portaudio ffmpeg
  • git,用于克隆仓库

安装与启动步骤

  1. 1克隆仓库

    从 GitHub 拉取 tau2-bench 源码并进入项目目录,后续所有命令都在该目录执行。

    git clone https://github.com/sierra-research/tau2-bench
    cd tau2-bench
  2. 2安装核心依赖

    README 指定的标准安装方式,安装后支持 text-mode 的 airline、retail、telecom、mock 领域。

    uv sync
  3. 3按需安装可选功能

    只装自己用得到的扩展:语音、banking_knowledge、gym RL 接口、开发工具,也可用 --all-extras 全装。

    uv sync --extra voice
    uv sync --extra knowledge
    uv sync --extra gym
    uv sync --extra dev
  4. 4配置 API 密钥

    复制示例环境变量文件生成 .env,再按 README 提示在其中填入模型 API 密钥(README 未列出具体变量名)。

    cp .env.example .env
  5. 5查看可用命令

    运行内置介绍命令,快速了解可用领域、命令和示例,确认安装是否正常。

    tau2 intro
  6. 6运行一次评估

    在 airline 领域上用 gpt-4.1 同时作为 agent 与用户模拟模型,跑 1 次试验、5 个任务。

    tau2 run --domain airline --agent-llm gpt-4.1 --user-llm gpt-4.1 --num-trials 1 --num-tasks 5
  7. 7查看评估结果

    评估结果自动保存到 data/simulations/,用 view 命令浏览已生成的模拟记录。

    tau2 view

关键配置

配置项必填说明示例
.env存放模型 API 密钥的配置文件,由 .env.example 复制而来cp .env.example .env
--domain指定评估领域,如 airline、retail、telecom、banking_knowledge 等airline
--agent-llm被评估智能体所使用的模型gpt-4.1
--user-llm用户模拟器所使用的模型gpt-4.1
--num-trials每个任务重复试验次数,README 示例为 11
--num-tasks本次评估运行的任务数量,README 示例为 55

如何确认成功

tau2 run 执行完成后,结果文件出现在 data/simulations/ 目录,且能用 tau2 view 正常浏览,即表示环境配置成功。

常见问题

Q:语音(voice)相关功能安装失败怎么办?

A:语音特性除 uv sync --extra voice 外还需系统依赖,macOS 上执行 brew install portaudio ffmpeg,其他系统参见官方完整安装指南 docs/getting-started.md。

Q:为什么跑不了 banking_knowledge 知识检索领域?

A:该领域属于可选依赖,需要先执行 uv sync --extra knowledge 安装检索流水线相关组件,仅 uv sync 只包含 text-mode 领域。

Q:旧的评估结果还能和新版本对比吗?

A:不能。v1.0.1 修复了 banking_knowledge 的任务错误,1.0.1 之前版本产生的分数与 1.0.1 及以后不可比;旧结果文件可用 tau2 evaluate-trajs --fresh-tasks 重新评分。

Q:结果保存在哪里、怎么看?

A:结果写入 data/simulations/,直接运行 tau2 view 即可浏览;tau2 intro 可查看可用领域、命令与示例。

注意事项

  • README 明确要求使用 uv 进行依赖管理,不要改用 pip 手动安装。
  • 只有参与贡献才需要安装 --extra dev(pytest、ruff、pre-commit)。
  • 若需复现 1.0.1 修复前的行为,可切换到 pre-v1.0.1 标签版本。
  • README 未给出具体的环境变量名称与 Python 版本,配置密钥时请以 .env.example 和 docs/getting-started.md 为准。

核心亮点

  • 基于真实零售和航空场景,任务设计贴近实际业务,评估结果更有说服力
  • 提供完整的用户模拟器和自动化评分工具,无需人工参与即可批量测试
  • 支持多轮对话和工具调用评估,能有效暴露智能体在复杂交互中的短板

不足之处

  • 领域覆盖有限,目前仅包含零售和航空,其他行业场景需自行扩展
  • 文档和社区生态相对较新,示例和最佳实践有待丰富

适用场景

  • 大模型智能体开发者在发布前进行自动化回归测试
  • 企业评估不同AI客服或业务助手模型的选型参考
  • 学术研究用于对比不同工具调用策略或提示词设计

替代项目

ToolBench、API-Bank、BFCL

项目介绍

tau2-bench 是评测安全领域的开源项目,由 sierra-research 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,099)位列前 30%,在评测安全分类的 458 个项目里位列前 12%。

近 42 天,它的 GitHub 星标从 1,785 增加到 2,099,净增 314。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-23。开源基准测试项目,MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:大模型智能体开发者在发布前进行自动化回归测试。同类可对比的替代方案包括 ToolBench、API-Bank、BFCL。

上一篇:Awesome-LM-SSP

下一篇:awesome-llm-security

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24