LiveBench

每月换新题,测出模型真实水平

LiveBench 是一个面向大语言模型的评测基准,核心卖点是「无污染」与「持续更新」。传统静态基准(如 MMLU、GSM8K)的题目常被模型训练数据提前收录,导致分数虚高、无法反映真实能力。LiveBench 的做法是:从最新发布的数学竞赛、arXiv 论文、新闻、数据集等来源自动生成题目,并按月滚动更新题库,让模型无法通过记忆刷分。它覆盖数学、推理、编码、数据分析、指令遵循、语言理解等多类任务,题目多为客观可自动判分的形式,支持对闭源与开源模型统一打分。项目提供命令行评测脚本与公开排行榜,方便研究者快速接入新模型、复现结果。对需要横向对比模型真实能力、或担心自家模型被基准污染的团队来说,它是一个更可信的评测选项。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1323
维护状态 活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队LiveBench
所属国家
官网地址
定价模式free
价格说明开源免费使用
访问状态
是否开源
开源协议NOASSERTION
主要语言Python
技术栈/模型
GitHub 星标★ 1323
30天Star增速
HF 下载量
上线时间2024-06-12 00:00:00
最近更新2026-09-17 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数1

使用教程

难度:进阶 约 20 分钟 部署方式:本地安装 6 步

环境要求

  • Python 环境(README 用 python -m venv 创建虚拟环境)
  • 可用的 pip,用于执行 pip install -e .
  • 模型 API Key(OpenAI 模型默认读取 OPENAI_API_KEY 环境变量)
  • Docker(仅评测 agentic coding 任务时需要,docker --version 可执行)

安装与启动步骤

  1. 1创建虚拟环境

    README 建议使用虚拟环境安装 LiveBench,先建 venv 并激活。

    python -m venv .venv
    source .venv/bin/activate
  2. 2安装 LiveBench

    进入 LiveBench 目录后以可编辑模式安装,用于生成 API 模型答案与判分。

    cd LiveBench
    pip install -e .
  3. 3安装编码任务依赖

    只评测 code_completion、code_generation 等编码任务时,需额外装依赖。

    cd livebench/code_runner
    pip install -r requirements_eval.txt
  4. 4确认 Docker 可用

    评测 agentic coding 题目需要 Docker,运行前会检查该命令是否可用。

    docker --version
  5. 5运行完整评测

    run_livebench.py 一体化完成推理、评分与结果展示;示例评 gpt-4o 的 coding 子集。

    cd livebench
    python run_livebench.py --model gpt-4o --bench-name live_bench/coding --livebench-release-option 2024-11-25
  6. 6查看全部参数

    不确定可用选项时,先看帮助了解 bench-name、api-base、并发等参数。

    python run_livebench.py --help

关键配置

配置项必填说明示例
--model指定要评测的模型名称gpt-4o
--bench-name选择题库子集,live_bench 为全部题目live_bench/coding
--livebench-release-option按指定 LiveBench 发布版本评测题目2024-11-25
--max-tokens模型回复最大 token 数,默认 40964096
--api-baseOpenAI 兼容服务的自定义 API 地址http://localhost:8000/v1
--api-key-name存放 API Key 的环境变量名,OpenAI 模型默认 OPENAI_API_KEYOPENAI_API_KEY

如何确认成功

脚本跑完输出各任务得分与汇总结果即评测成功;可先用 --help 确认参数生效。

常见问题

Q:可以用本地模型推理吗?

A:README 说明本地模型推理已不再维护,推荐用 vllm 把模型部署成 OpenAI 兼容 API,再用 run_livebench.py 做推理。

Q:评测 agentic coding 时提示 Docker 问题?

A:该任务需要先构建专用 Docker 镜像,且必须保证 docker --version 能正常运行,镜像全部存储可能占用约 150GB 空间。

Q:最新版本的题目不全怎么办?

A:当前发布版 2025-04-25 的题目并未全部公开,想评测全部类别需给脚本传 --livebench-release-option 2024-11-25。

Q:评测中途中断了怎么办?

A:可加 --resume 从上次中断处继续;如还有失败题目,可再加 --retry-failures 重试。

注意事项

  • README 未给出本地模型的具体安装命令,本地推理路径不受支持。
  • agentic coding 任务的 Docker 镜像推理和评测都要用,存储占用可能高达 150GB。
  • 评测编码任务前必须额外安装 livebench/code_runner 下的 requirements_eval.txt。
  • 仓库中包含 LiveCodeBench 与 IFEval 的代码。

核心亮点

  • 题目按月从最新竞赛、论文、新闻自动生成,避免训练数据污染
  • 覆盖数学、推理、编码、数据分析、指令遵循等多类任务,维度较全
  • 提供公开排行榜与统一评测脚本,便于横向对比不同模型

不足之处

  • 题目持续更新导致不同时间点的分数不可直接比较
  • 部分任务依赖外部数据源与自动判分,稳定性受上游影响

适用场景

  • 模型发布前做无污染的能力体检
  • 研究者横向对比闭源与开源模型的真实差距
  • 跟踪模型能力随时间的变化趋势

替代项目

MMLU、Chatbot Arena、HELM

项目介绍

LiveBench 是评测安全领域的开源项目,由 LiveBench 开发,2024 年首次发布。

在全站 12,753 个收录项目中,它的 GitHub 星标数(1,323)位列前 30%,在评测安全分类中处于中上游。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-17。开源免费使用。

它主要面向的使用场景是:模型发布前做无污染的能力体检。同类可对比的替代方案包括 MMLU、Chatbot Arena、HELM。

上一篇:llm-coding-benchmark

下一篇:optimum-benchmark

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1518 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24