opencompass

一站式评测大模型,百个数据集横向对比,快速选出最强模型。

OpenCompass 是一个大语言模型评估平台,旨在解决 LLM 评测标准不一、流程复杂的问题。它支持超过 100 个公开数据集(如 MMLU、C-Eval、GSM8K 等),覆盖知识、推理、代码、数学、中文理解等多维度能力,并兼容 Llama、Qwen、GLM、GPT-4、Claude 等主流模型及 HuggingFace 格式的自定义模型。核心能力包括:分布式评测加速(支持多机多卡)、灵活的任务配置(YAML 定义评测集)、一键生成可视化报告,以及模型间横向对比。平台还提供 API 评测模式,方便接入闭源模型。其设计强调可扩展性,用户可自定义数据集和评测指标,适合研究机构和企业进行模型选型、版本迭代验证。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 7467
维护状态 活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队open-compass
所属国家
定价模式free
价格说明开源平台,提供在线评估服务,核心功能免费,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型benchmark,evaluation,large-language-model,llm,llm-eval
GitHub 星标★ 7467
30天Star增速
HF 下载量
上线时间2023-06-15 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数5

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 7 步

环境要求

  • conda(README 强烈推荐用 conda 管理 Python 环境)
  • Python 3.12(常规与完整安装支持)
  • 若评测依赖 pyext 的代码执行数据集,需改用 Python 3.10
  • pip(用于安装 opencompass 包)
  • git(仅源码安装时需要)

安装与启动步骤

  1. 1创建虚拟环境

    用 conda 新建名为 opencompass 的 Python 3.12 环境,避免污染系统环境;如需 pyext 数据集请把版本改成 3.10。

    conda create --name opencompass python=3.12 -y
  2. 2激活虚拟环境

    激活刚创建的环境,后续所有安装与运行命令都要在这个环境下执行。

    conda activate opencompass
  3. 3pip 安装主包

    通过 pip 安装 opencompass,-U 表示升级到最新版本,适合只想快速体验常规评测的用户。

    pip install -U opencompass
  4. 4按需安装扩展

    需要更多数据集时装 full;调用闭源 API 评测时装 api;加速框架建议单独建环境安装。

    pip install "opencompass[full]"
  5. 5源码安装方式

    想用最新特性或做二次开发时,克隆仓库后以可编辑模式安装,后续改动可直接生效。

    git clone https://github.com/open-compass/opencompass opencompass
    cd opencompass
    pip install -e .
  6. 6列出评测配置

    用内置脚本查看框架自带的所有配置,确认安装成功并了解可用的模型与数据集组合。

    python tools/list_configs.py
  7. 7筛选配置

    按关键字过滤配置,例如只看 llama 与 mmlu 相关的评测配置,便于挑选要跑的任务。

    python tools/list_configs.py llama mmlu

如何确认成功

在激活的 opencompass 环境中执行 python tools/list_configs.py,能正常打印出配置列表即安装成功。

常见问题

Q:Python 版本该选 3.12 还是 3.10?

A:默认用 3.12 即可,常规与完整安装都支持。若评测依赖 pyext 的代码执行数据集(APPS、TACO、LiveCodeBench 代码生成),需改用 Python 3.10,因为 pyext==0.7 在 Python 3.11 及以上会被跳过。

Q:如何支持更多数据集?

A:安装完整版:pip install "opencompass[full]";源码安装则用 pip install -e ".[full]"。

Q:评测闭源 API 模型要装什么?

A:安装 API 评测相关依赖:pip install "opencompass[api]",例如 OpenAI、Qwen 等接口评测。

Q:多个加速框架可以装在同一个环境吗?

A:不建议。lmdeploy、vllm 等加速框架之间通常存在依赖冲突,README 建议用不同的虚拟环境分别安装。

Q:想用最新功能怎么办?

A:从源码安装:git clone 仓库后进入目录执行 pip install -e .,即可使用最新特性或开发新功能。

注意事项

  • README 强烈推荐使用 conda 管理 Python 环境。
  • 缺少 pyext 时,APPS(apps、apps_mini)、TACO、LiveCodeBench 代码生成不可用。
  • 加速框架(lmdeploy、vllm)之间存在依赖冲突,务必分环境安装。
  • 官方安装文档:https://opencompass.readthedocs.io/en/latest/get_started/installation.html

核心亮点

  • 支持 100+ 主流数据集,覆盖知识、推理、代码等维度,评测全面
  • 分布式评测加速,多机多卡并行,大幅缩短评测时间
  • 配置灵活,YAML 定义任务,支持自定义数据集和模型,扩展性强

不足之处

  • 文档偏学术化,新手快速上手有一定门槛
  • 评测结果可视化依赖外部工具,内置图表较基础

适用场景

  • 对比不同开源大模型在中文、英文任务上的综合能力
  • 在模型迭代中回归测试,确保新版本性能不下降
  • 为业务场景筛选最合适的模型,如代码生成或数学推理

替代项目

lm-evaluation-harness、SuperCLUE、C-Eval

项目介绍

opencompass 是评测安全领域的开源项目,由 open-compass 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(7,467)位列前 7%,在评测安全分类的 466 个项目里位列前 4%。

近 41 天,它的 GitHub 星标从 7,297 增加到 7,467,净增 170。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。开源平台,提供在线评估服务,核心功能免费,无付费版本。从国内网络环境看,可直接访问。

它主要面向的使用场景是:对比不同开源大模型在中文、英文任务上的综合能力。同类可对比的替代方案包括 lm-evaluation-harness、SuperCLUE、C-Eval。

上一篇:agentic_security

下一篇:awesome-llm-unlearning

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12