harbor

在真实终端里给智能体打分,让改进有据可依

Harbor 是一个用于评估和改进智能体(agents)的框架,主要面向终端环境下的任务。它提供了一套标准化的评测流程和强化学习环境,帮助开发者量化智能体在真实终端操作中的表现,并基于评测结果进行迭代优化。其核心能力包括:构建可复现的评测基准、模拟终端交互环境、集成多种智能体策略、以及提供详细的性能报告。Harbor 解决了智能体开发中缺乏统一评估标准、难以在真实场景中验证效果的问题,使得从研究到落地的过程更加高效和可靠。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 5502
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类评测安全
开发团队harbor-framework
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型evals,rl-environments,terminal-bench
GitHub 星标★ 5502
30天Star增速
HF 下载量
上线时间2025-08-04 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数6

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 8 步

环境要求

  • Python 环境(可用 pip 安装)或 uv 工具
  • 本地运行基准需要 Docker(README 说明默认在本地用 Docker 启动)
  • 至少一个模型提供商的 API Key,如 ANTHROPIC_API_KEY
  • 如需在云端并行运行,需要对应 provider 的密钥,如 DAYTONA_API_KEY

安装与启动步骤

  1. 1安装 Harbor

    README 提供两种方式,任选其一:uv tool install 或 pip install,装完后即可使用 harbor 命令。

    pip install harbor
  2. 2(可选)用 uv 安装

    已使用 uv 的用户可以用 uv tool install 方式安装,效果与 pip 安装一致。

    uv tool install harbor
  3. 3设置模型密钥

    运行评测前先导出 ANTHROPIC_API_KEY,把示例值换成你自己的真实密钥。

    export ANTHROPIC_API_KEY=sk-ant-xxxxxxxx
  4. 4本地跑 Terminal-Bench

    运行官方基准 Terminal-Bench-2.0,默认在本地用 Docker 启动,--n-concurrent 控制并发数。

    harbor run --dataset terminal-bench@2.0 
       --agent claude-code 
       --model anthropic/claude-opus-4-1 
       --n-concurrent 4
  5. 5查看全部参数

    想了解支持哪些智能体和其他选项,查看帮助信息,据此调整 agent 与 model 参数。

    harbor run --help
  6. 6浏览可用数据集

    列出所有支持的第三方基准(如 SWE-Bench、Aider Polyglot),拿到可用的 dataset@version。

    harbor datasets list
  7. 7用通用命令评测

    把数据集、模型、智能体三个占位符换成实际名称,例如 -d "terminal-bench@2.0" -m "anthropic/claude-opus-4-1" -a "claude-code"。

    harbor run -d "" -m "" -a ""
  8. 8切换到云端运行

    导出 DAYTONA_API_KEY 并加 --env daytona,即可在 Daytona 等 provider 上大规模并行运行。

    export ANTHROPIC_API_KEY=sk-ant-xxxxxxxx
    export DAYTONA_API_KEY=xxxxxxxx
    harbor run --dataset terminal-bench@2.0 
       --agent claude-code 
       --model anthropic/claude-opus-4-1 
       --n-concurrent 100 
       --env daytona

关键配置

配置项必填说明示例
ANTHROPIC_API_KEYAnthropic 模型密钥,评测 Claude Code 等智能体时必需sk-ant-xxxxxxxx
DAYTONA_API_KEY使用 Daytona 云端 provider 并行运行基准时需要xxxxxxxx
--dataset / -d指定评测数据集及版本terminal-bench@2.0
--agent / -a指定被测智能体,如 claude-code、OpenHands、Codex CLIclaude-code
--model / -m指定驱动智能体的模型anthropic/claude-opus-4-1
--env指定运行环境 provider,不填则本地用 Docker 运行daytona

如何确认成功

安装后执行 harbor run --help 与 harbor datasets list,能正常打印帮助和数据集列表即表示安装成功并可运行。

常见问题

Q:pip 和 uv 两种安装方式要都执行吗?

A:不需要,二选一即可。已用 uv 管理工具链的选 uv tool install harbor,其他情况用 pip install harbor。

Q:本地跑基准还需要额外装什么?

A:README 说明默认在本地通过 Docker 启动基准环境,因此本机需可用 Docker,并提前导出所用模型的 API Key。

Q:如何让评测在云端大规模并行?

A:加 --env 参数指定 provider(如 --env daytona),并导出对应的 API Key(如 DAYTONA_API_KEY),同时可调大 --n-concurrent。

Q:怎么换数据集、模型和智能体?

A:用 harbor datasets list 查看可用数据集,再用 harbor run -d "" -m "" -a "" 指定具体组合。

注意事项

  • README 示例中的 都是占位符,执行前必须替换为真实值,否则命令会失败。
  • --n-concurrent 决定并发数,本地受 Docker 资源限制,大规模并发(如 100)建议改用云端 provider。
  • 项目提供 Harbor Cookbook 仓库,包含端到端示例与指南,可作为进阶参考。
  • Harbor 是 Terminal-Bench-2.0 的官方 harness,评测结果可进一步用于生成 RL 优化所需的 rollout。

核心亮点

  • 提供标准化的终端任务评测集,结果可复现
  • 内置强化学习环境,支持策略迭代优化
  • 与 terminal-bench 集成,覆盖真实命令行场景

不足之处

  • 文档/社区待观察
  • 主要聚焦终端场景,对其他类型智能体支持有限

适用场景

  • 评估终端操作智能体的任务完成度
  • 在强化学习训练中作为环境反馈
  • 对比不同智能体框架的性能差异

替代项目

OpenAI Evals、DeepEval、Ragas

项目介绍

harbor 是评测安全领域的开源项目,由 harbor-framework 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(5,502)位列前 8%,在评测安全分类的 458 个项目里位列前 5%。

近 44 天,它的 GitHub 星标从 4,069 增加到 5,502,净增 1,433。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:评估终端操作智能体的任务完成度。同类可对比的替代方案包括 OpenAI Evals、DeepEval、Ragas。

上一篇:anonymeter

下一篇:awesome-evals

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24