LiveBench 是评测安全领域的开源项目,由 LiveBench 开发,2024 年首次发布。
在全站 12,753 个收录项目中,它的 GitHub 星标数(1,323)位列前 30%,在评测安全分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-17。开源免费使用。
它主要面向的使用场景是:模型发布前做无污染的能力体检。同类可对比的替代方案包括 MMLU、Chatbot Arena、HELM。

每月换新题,测出模型真实水平
LiveBench 是一个面向大语言模型的评测基准,核心卖点是「无污染」与「持续更新」。传统静态基准(如 MMLU、GSM8K)的题目常被模型训练数据提前收录,导致分数虚高、无法反映真实能力。LiveBench 的做法是:从最新发布的数学竞赛、arXiv 论文、新闻、数据集等来源自动生成题目,并按月滚动更新题库,让模型无法通过记忆刷分。它覆盖数学、推理、编码、数据分析、指令遵循、语言理解等多类任务,题目多为客观可自动判分的形式,支持对闭源与开源模型统一打分。项目提供命令行评测脚本与公开排行榜,方便研究者快速接入新模型、复现结果。对需要横向对比模型真实能力、或担心自家模型被基准污染的团队来说,它是一个更可信的评测选项。
1创建虚拟环境
README 建议使用虚拟环境安装 LiveBench,先建 venv 并激活。
python -m venv .venv
source .venv/bin/activate2安装 LiveBench
进入 LiveBench 目录后以可编辑模式安装,用于生成 API 模型答案与判分。
cd LiveBench
pip install -e .3安装编码任务依赖
只评测 code_completion、code_generation 等编码任务时,需额外装依赖。
cd livebench/code_runner
pip install -r requirements_eval.txt4确认 Docker 可用
评测 agentic coding 题目需要 Docker,运行前会检查该命令是否可用。
docker --version5运行完整评测
run_livebench.py 一体化完成推理、评分与结果展示;示例评 gpt-4o 的 coding 子集。
cd livebench
python run_livebench.py --model gpt-4o --bench-name live_bench/coding --livebench-release-option 2024-11-256查看全部参数
不确定可用选项时,先看帮助了解 bench-name、api-base、并发等参数。
python run_livebench.py --help| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--model | 是 | 指定要评测的模型名称 | gpt-4o |
--bench-name | 否 | 选择题库子集,live_bench 为全部题目 | live_bench/coding |
--livebench-release-option | 否 | 按指定 LiveBench 发布版本评测题目 | 2024-11-25 |
--max-tokens | 否 | 模型回复最大 token 数,默认 4096 | 4096 |
--api-base | 否 | OpenAI 兼容服务的自定义 API 地址 | http://localhost:8000/v1 |
--api-key-name | 否 | 存放 API Key 的环境变量名,OpenAI 模型默认 OPENAI_API_KEY | OPENAI_API_KEY |
脚本跑完输出各任务得分与汇总结果即评测成功;可先用 --help 确认参数生效。
Q:可以用本地模型推理吗?
A:README 说明本地模型推理已不再维护,推荐用 vllm 把模型部署成 OpenAI 兼容 API,再用 run_livebench.py 做推理。
Q:评测 agentic coding 时提示 Docker 问题?
A:该任务需要先构建专用 Docker 镜像,且必须保证 docker --version 能正常运行,镜像全部存储可能占用约 150GB 空间。
Q:最新版本的题目不全怎么办?
A:当前发布版 2025-04-25 的题目并未全部公开,想评测全部类别需给脚本传 --livebench-release-option 2024-11-25。
Q:评测中途中断了怎么办?
A:可加 --resume 从上次中断处继续;如还有失败题目,可再加 --retry-failures 重试。
MMLU、Chatbot Arena、HELM
LiveBench 是评测安全领域的开源项目,由 LiveBench 开发,2024 年首次发布。
在全站 12,753 个收录项目中,它的 GitHub 星标数(1,323)位列前 30%,在评测安全分类中处于中上游。
项目目前处于活跃维护状态,最近一次代码更新于 2026-09-17。开源免费使用。
它主要面向的使用场景是:模型发布前做无污染的能力体检。同类可对比的替代方案包括 MMLU、Chatbot Arena、HELM。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents