
workshop
让编码代理自己写评测、跑评测,回归验证不再靠手测
workshop 是一个面向 AI 编码代理的评测工具,帮助开发者让 coding agent 具备编写和运行 agent 评测的能力。它解决的核心问题是:当开发者用 Claude Code、Cursor 等编码代理构建 LLM 应用时,往往缺乏系统化验证代理行为的手段,只能靠人工试错。workshop 提供了一套可编程的评测框架,让代理能自动生成测试用例、执行评测、追踪调用链路,并输出可对比的结果。项目基于 TypeScript 构建,集成了 LLM 调用、Raindrop 追踪等能力,支持对代理的输入输出、工具调用、多步推理过程进行断言和打分。开发者可以用它来回归测试提示词改动、比较不同模型表现、监控代理在生产环境中的行为漂移,从而把评测从一次性脚本升级为可持续的工程实践。
项目数据
使用教程
环境要求
- macOS / Linux 等可执行 bash 的环境
- 能访问 https://raindrop.sh/install 的网络
- 已安装 Claude Code 等 AI 编码代理(用于执行 /instrument-agent)
- 本地需可运行常驻守护进程(默认占用 5899 端口)
安装与启动步骤
-
1一键安装 Workshop
README 明确指出无需 clone、无需构建,一条命令即可完成安装并运行本地守护进程。注意此步骤会执行 raindrop setup 并启动本地 daemon。
curl -fsSL https://raindrop.sh/install | bash -
2给代理埋点
在你的代码仓库中打开常用的编码代理,执行 /instrument-agent,它会为代理接入 Raindrop tracing 并自动在浏览器中打开 Workshop。
/instrument-agent -
3查看实时追踪
代理一运行,每个 token、工具调用和 span 都会实时流入 Workshop UI,无需轮询或刷新页面。
-
4可选:连接 Raindrop 云
如果想用 Raindrop Cloud 而不是本地守护进程,可在安装脚本后加 --cloud,此时执行 raindrop cloud setup 且不启动任何 daemon。
curl -fsSL https://raindrop.sh/install | bash -s -- --cloud -
5可选:回放生产轨迹
执行 /setup-agent-replay,脚手架会生成一个 HTTP 端点,把生产环境中的 trace 回放到你真实的代理代码上。
/setup-agent-replay
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
RAINDROP_WORKSHOP_PORT | 否 | Workshop 的 HTTP + WebSocket 端口 | 5899 |
RAINDROP_WORKSHOP_DB_PATH | 否 | SQLite 数据库文件存放路径 | ~/.raindrop/raindrop_workshop.db |
RAINDROP_LOCAL_DEBUGGER | 否 | SDK 侧参数,指定 trace 镜像到哪里,默认不设置 | unset |
如何确认成功
本地访问 http://localhost:5899(默认端口)能看到 Workshop UI,且代理运行后 trace 实时流入界面即成功。
常见问题
Q:需要先把仓库 clone 下来再构建吗?
A:不需要。README 明确说明安装只有一条命令,没有东西需要 clone 或 build;从源码构建仅适用于开发 Workshop 本身的人。
Q:本地 Workshop 和 Raindrop Cloud 会冲突吗?
A:不会。两者使用不同的 MCP 服务名(workshop 与 raindrop)以及各自独立的安装注册表,不会互相覆盖,可以共存。
Q:--cloud 模式下还会启动本地守护进程吗?
A:不会。带 --cloud 时执行的是 raindrop cloud setup,不启动任何 daemon;不带该参数才会运行 raindrop setup 并启动本地 Workshop daemon。
Q:怎么让代理自己帮我装?
A:README 建议直接把安装命令交给 AI 编码代理执行即可,不要为了试用去从源码 clone 构建。
注意事项
- README 未提供卸载、Windows 原生安装等说明,请勿自行改写安装命令。
- 默认端口为 5899,如被占用可通过 RAINDROP_WORKSHOP_PORT 修改。
- 安装脚本来自第三方地址 https://raindrop.sh/install,执行前请自行确认来源可信。
核心亮点
- 把评测能力直接交给 coding agent,代理可自动生成并执行测试用例,减少人工编写评测脚本的成本
- 集成 Raindrop 追踪,能对代理的多步推理和工具调用链路做细粒度断言,而非只看最终输出
- 基于 TypeScript,与主流 LLM 应用技术栈一致,便于嵌入现有工程流程做回归测试
不足之处
- 项目仍处早期,文档和示例覆盖度有限,上手需要一定探索成本
- 生态和社区规模较小,遇到问题可参考的案例和讨论较少
适用场景
- 修改提示词或切换模型后,自动跑一遍评测集,确认代理行为没有退化
- 为多步工具调用的代理编写断言,验证中间推理步骤是否符合预期
- 在 CI 中集成评测,每次提交代码时自动检测代理输出质量变化
替代项目
promptfoo、braintrust
项目介绍
上一篇:next-evals-oss
下一篇:vitest-evals
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents