LLM-eval-survey

一张图看懂大模型评估,从基准到方法全覆盖

LLM-eval-survey 是大语言模型评估领域权威综述论文《A Survey on Evaluation of Large Language Models》的官方 GitHub 页面。该项目系统梳理了 LLM 评估的完整框架,涵盖评估任务(如知识问答、推理、代码生成等)、评估方法(如人工评估、自动评估、混合评估)、评估基准(如 MMLU、HELM、Big-Bench 等)以及评估中的关键挑战(如数据污染、偏见、鲁棒性等)。它通过结构化的分类体系和丰富的论文引用,帮助研究者快速了解 LLM 评估的全貌,定位研究空白,并提供了评估相关资源的持续更新列表。对于刚进入该领域的研究者,这是一个极佳的入门地图;对于资深从业者,它也是查找最新评估工具和基准的参考手册。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1612
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队MLGroupJLU
所属国家
官网地址
定价模式free
价格说明开源项目,无在线服务,需自行部署,完全免费。
访问状态
是否开源是
开源协议
主要语言
技术栈/模型benchmark,evaluation,large-language-models,llm,llms,model-assessment
GitHub 星标★ 1612
30天Star增速
HF 下载量
上线时间2023-07-02 00:00:00
最近更新2026-09-22 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:本地安装 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问 GitHub 的网络环境
  • 已安装 git 命令行工具
  • 能查看 Markdown 文件的编辑器或浏览器

安装与启动步骤

  1. 1克隆仓库到本地

    把 LLM-eval-survey 仓库完整下载到本地,便于离线查阅论文与资源列表。

    git clone https://github.com/MLGroupJLU/LLM-eval-survey.git
  2. 2进入仓库目录

    切换到克隆下来的目录,后续所有查阅操作都在此目录内进行。

    cd LLM-eval-survey
  3. 3查看目录内容

    列出仓库文件,确认 README 及资源文件位置。README 未给出其他命令,请以实际目录为准。

    ls
  4. 4阅读资源列表

    打开 README.md,按综述的章节结构浏览评估任务、方法、基准与挑战相关论文列表。

    cat README.md
  5. 5阅读综述原文

    README 指向官方综述论文 arXiv 页面,按需在线阅读以了解完整框架。

如何确认成功

能在本地目录看到 README.md,并在其中找到论文与资源列表即表示获取成功。

常见问题

Q:需要安装依赖或运行代码吗?

A:不需要。README 未提供任何安装或运行说明,本仓库是综述论文配套的论文与资源清单,仅需阅读。

Q:为什么论文内容与仓库不一致?

A:README 明确说明 arXiv 论文无法实时更新,最新内容以本仓库为准,论文可能会后续更新。

Q:可以贡献内容吗?

A:可以。README 欢迎通过 pull request 或 issue 提交补充与修正,帮助完善该综述资源列表。

Q:综述论文在哪里获取?

A:README 给出标题 《A Survey on Evaluation of Large Language Models》及 arXiv 链接 https://arxiv.org/abs/2307.03109。

注意事项

  • README 中没有任何安装、运行或配置命令,本教程只覆盖仓库获取与阅读流程。
  • 该仓库为论文与资源列表,不含可执行的评估代码或模型权重。
  • 官方综述论文链接:https://arxiv.org/abs/2307.03109,仓库更新优先于论文版本。

核心亮点

  • 系统梳理了 LLM 评估的多个维度,分类清晰,便于快速建立知识框架
  • 整合了数百篇相关论文和评估基准,是查找资源的便捷入口
  • 来自权威综述论文,内容经过同行评审,可信度高

不足之处

  • 项目以论文配套资料为主,代码和工具较少,偏理论梳理
  • 更新频率可能随论文发表周期波动,部分最新进展可能滞后

适用场景

  • 科研入门:快速了解 LLM 评估领域的研究脉络和关键问题
  • 基准选型:为特定任务选择合适的评估基准和方法
  • 综述写作:查找 LLM 评估相关的核心论文和引用

替代项目

lm-evaluation-harness、HELM、OpenCompass

项目介绍

LLM-eval-survey 是评测安全领域的开源项目,由 MLGroupJLU 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,612)位列前 30%,在评测安全分类的 466 个项目里位列前 15%。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-22。无在线服务,需自行部署,完全免费。

它主要面向的使用场景是:科研入门:快速了解LLM评估领域的研究脉络和关键问题。同类可对比的替代方案包括 lm-evaluation-harness、HELM、OpenCompass。

上一篇:safe-rlhf

下一篇:Awesome-Jailbreak-on-LLMs

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12