alpaca_eval

自动评估指令跟随模型,快、便宜、且靠谱。

alpaca_eval 是一个用于自动评估指令跟随语言模型的工具。它解决了人工评估成本高、速度慢、难以规模化的问题,提供了一种廉价、快速且经过人类验证的自动评估方法。其核心能力包括:基于高质量的人类偏好数据集,通过成对比较的方式,让强大的模型(如 GPT-4)作为裁判,对候选模型与基准模型的输出进行打分,从而得出胜率等指标。它支持多种模型,提供简单易用的命令行接口和 Python API,并附带可视化报告。该工具旨在帮助研究人员和开发者快速、客观地比较不同指令微调模型的性能,推动模型迭代。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2016
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队tatsu-lab
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Jupyter Notebook
技术栈/模型deep-learning,evaluation,foundation-models,instruction-following,large-language-models,leaderboard,nlp,rlhf
GitHub 星标★ 2016
30天Star增速
HF 下载量
上线时间2023-05-25 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 6 步

环境要求

  • Python 环境与 pip(用于安装 alpaca-eval)
  • 一个 OpenAI API Key(用于调用 GPT-4 裁判模型)
  • 待评估模型的输出 JSON 文件,每条记录含 instruction 和 output 两个键

安装与启动步骤

  1. 1安装 alpaca-eval

    安装稳定版即可满足快速上手;如需最新 nightly 版本改用 git 方式安装,二者选其一。

    pip install alpaca-eval
  2. 2安装 nightly 版(可选)

    仅在你需要最新特性时执行,与上一步的稳定版安装二选一,不要重复装。

    pip install git+https://github.com/tatsu-lab/alpaca_eval
  3. 3配置 OpenAI 密钥

    把密钥导出为环境变量 OPENAI_API_KEY;若用 Azure 或其他客户端,需参考 client_configs/README.md。

    export OPENAI_API_KEY=sk-xxxxxxxx
  4. 4准备模型输出文件

    准备一个 JSON 文件(README 示例为 example/outputs.json),每条记录须包含 instruction 和 output 键。

  5. 5运行自动评估

    把模型输出文件路径传给 --model_outputs,脚本会调用裁判模型打分并在控制台打印排行榜。

    alpaca_eval --model_outputs 'example/outputs.json'
  6. 6查看可用命令

    用 --help 查看 evaluate、evaluate_from_model、make_leaderboard、analyze_evaluators 等子命令说明。

    alpaca_eval -- --help

关键配置

配置项必填说明示例
OPENAI_API_KEY是调用 OpenAI 裁判模型所需的密钥,通过环境变量导出sk-xxxxxxxx
model_outputs是待评估模型输出的 JSON 文件路径,每条含 instruction 和 outputexample/outputs.json
annotators_config否选择裁判标注器,默认 weighted_alpaca_eval_gpt4_turboweighted_alpaca_eval_gpt4_turbo
reference_outputs否参考模型输出,AlpacaEval 2.0 默认使用 gpt4_turbogpt4_turbo
output_path否保存标注结果与排行榜的路径,默认与 model_outputs 同目录example/
IS_ALPACA_EVAL_2否设为 False 可回退使用旧版 AlpacaEvalFalse

如何确认成功

控制台会打印排行榜,同时排行榜与标注结果会保存到 model_outputs 文件所在目录中。

常见问题

Q:没有现成的模型输出文件怎么办?

A:可使用 evaluate_from_model,传入 HuggingFace 模型名或本地路径,也支持 OpenAI、Anthropic、Cohere、google 等标准 API 的模型。

Q:想用旧版 AlpacaEval 怎么切换?

A:设置环境变量 IS_ALPACA_EVAL_2=False,默认使用的仍是 AlpacaEval 2.0。

Q:评估一次大概要多久、花多少钱?

A:AlpacaEval 2.0 使用长度控制胜率,成本低于 10 美元 OpenAI 额度,运行时间少于 3 分钟。

Q:想评估多个模型怎么批量处理?

A:使用 make_leaderboard 子命令,可为给定数据集/评估器/模型生成集合预计算并保存整张排行榜。

注意事项

  • AlpacaEval 2.0 默认启用长度控制胜率,与 ChatBot Arena 的 Spearman 相关性达 0.98。
  • 如需使用 Azure 或其他客户端等更复杂配置,请参考仓库中的 client_configs/README.md。
  • 每个子命令的详细参数可用 alpaca_eval -- --help 查看。

核心亮点

  • 基于人类验证的偏好数据,评估结果更贴近真实人类判断
  • 使用 GPT-4 等模型作为裁判,成本远低于人工评估,速度快
  • 提供标准化评估集和简洁的 CLI/API,上手简单,结果可复现

不足之处

  • 依赖强裁判模型(如 GPT-4),存在偏见和稳定性风险
  • 评估集和指标主要针对指令跟随,对其他能力覆盖有限

适用场景

  • 快速对比多个微调模型的指令跟随能力
  • 在模型迭代中持续监控性能变化
  • 作为论文或产品发布时的模型性能基准

替代项目

MT-Bench、Chatbot Arena、LMSYS Chatbot Arena

项目介绍

alpaca_eval 是评测安全领域的开源项目,由 tatsu-lab 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(2,016)位列前 30%,在评测安全分类的 458 个项目里位列前 13%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:快速对比多个微调模型的指令跟随能力。同类可对比的替代方案包括 MT-Bench、Chatbot Arena、LMSYS Chatbot Arena。

上一篇:DSBench

下一篇:llm-srbench

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12