chinese-llm-benchmark

看中文大模型谁最强,查百万缺陷库避坑

这是一个持续更新的中文AI大模型能力评测项目,旨在为社区提供客观、全面的模型对比参考。它解决了大模型选型时缺乏统一中文基准的问题,通过标准化测试评估模型在中文语境下的真实能力。项目核心能力包括:一是构建了覆盖374个模型的排行榜,涵盖ChatGPT、GPT-5.4、Gemini-3.1-Pro、Claude-4.6、文心ERNIE、通义千问、DeepSeek、Llama、GLM等主流商用与开源模型;二是提供规模超200万的大模型缺陷库,方便研究者分析模型短板并针对性改进。评测体系名为ReLE,由非线智能维护,数据实时更新,帮助开发者快速定位最适合业务场景的模型。

开源 unknown 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 6450
维护状态 活跃
是否开源 是
定价模式 unknown

项目数据

分类评测安全
开发团队jeinlee1991
所属国家
定价模式unknown
价格说明官网为 nonelinear.com,提供在线评测排行榜和缺陷库,但未明确收费信息,定价待确认。
访问状态
是否开源是
开源协议
主要语言
技术栈/模型agentic-ai,artificial-intelligence,llm-agent,llm-evaluation
GitHub 星标★ 6450
30天Star增速
HF 下载量
上线时间2023-06-04 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-10
浏览次数7

使用教程

难度:入门 约 10 分钟 部署方式:云服务 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 能正常访问 GitHub(https://github.com/jeinlee1991/chinese-llm-benchmark)
  • 能访问官网 https://nonelinear.com 查看在线排行榜
  • 本机安装 git(仅在需要把仓库克隆到本地时使用)
  • 可访问 arXiv 阅读技术报告(可选)

安装与启动步骤

  1. 1打开官网看榜单

    直接在浏览器访问 nonelinear.com,查看 ReLE 最新排行榜,无需安装任何软件。

  2. 2浏览 GitHub 仓库

    打开项目主页,阅读 README 了解评测领域划分、排行榜分类与最近更新。

  3. 3克隆仓库到本地

    若想在本地查看 README、榜单说明等文件,可用 git 把仓库克隆下来。

    git clone https://github.com/jeinlee1991/chinese-llm-benchmark.git
  4. 4阅读技术报告

    README 给出 ReLE 论文链接,可了解评测系统设计与300个细分维度的定义。

  5. 5申请免费评测

    README 注明可为私有大模型提供免费评测,需按仓库说明联系非线智能团队。

如何确认成功

浏览器能打开 nonelinear.com 并看到 ReLE 排行榜(多模态、综合、教育等分类表格),即表示可用。

常见问题

Q:这个项目需要本地部署模型才能用吗?

A:不需要。ReLE 是评测与排行榜项目,README 未提供本地部署说明,直接看官网排行榜即可,仅克隆仓库属于可选的查看方式。

Q:怎么让自己的私有大模型参加评测?

A:README 写明为非线智能 ReLE benchmark 团队提供免费评测服务,需按仓库中的“联系我们”说明添加团队微信沟通。

Q:超200万的大模型缺陷库怎么获取?

A:README 只说明提供该缺陷库,未给出具体下载地址或接口,可通过官网或联系团队咨询获取方式。

Q:排行榜包含哪些模型和领域?

A:README 称已囊括398个大模型,覆盖教育、医疗与心理健康、金融、法律与行政公务、推理与数学计算、语言与指令遵从、agent与工具调用等7个领域。

Q:榜单数据多久更新一次?

A:README 标注为“持续更新”的实时评测项目,具体更新频率未在节选中说明,建议以官网显示的最新数据为准。

注意事项

  • README 节选中没有安装、配置或运行命令,本教程步骤均为查看与获取类操作,未包含任何未验证的部署指令。
  • 项目主体是评测结果与排行榜,不是可直接安装运行的软件包,请勿臆造 pip/npm 安装命令。
  • 引用的模型数量、维度数量等数据随版本更新会变化,请以仓库和官网最新内容为准。

核心亮点

  • 覆盖374个模型,商用开源一网打尽,选型参考价值高
  • 200万+缺陷库,直接定位模型弱点,便于针对性优化
  • 持续更新,紧跟最新模型发布,时效性强

不足之处

  • 评测标准和方法论公开程度有限,难以复现验证
  • 文档/社区待观察

适用场景

  • 企业选型:对比中文能力,挑选合适大模型
  • 模型改进:利用缺陷库分析常见错误,优化训练
  • 学术研究:跟踪中文大模型能力演进趋势

替代项目

OpenCompass、C-Eval、SuperCLUE

项目介绍

chinese-llm-benchmark 是评测安全领域的开源项目,由 jeinlee1991 开发,2023 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(6,450)位列前 7%,在评测安全分类的 458 个项目里位列前 5%。

近 44 天,它的 GitHub 星标从 6,360 增加到 6,450,净增 90。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。官网为 nonelinear.com,提供在线评测排行榜和缺陷库,但未明确收费信息,定价。从国内网络环境看,可直接访问。

它主要面向的使用场景是:企业选型:对比中文能力,挑选合适大模型。同类可对比的替代方案包括 OpenCompass、C-Eval、SuperCLUE。

上一篇:iFixAi

下一篇:uqlm

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1362 2026-08-24