SuperCLUE

测一测中文大模型哪家强,榜单见分晓

SuperCLUE 是一个面向中文通用大模型的综合性评测基准,旨在系统评估基础模型在中文场景下的能力。它解决了当前大模型评测中缺乏中文深度覆盖、维度单一、标准不统一的问题。核心能力包括:多维度能力测试(如语言理解、知识问答、逻辑推理、长文本处理等)、自动化评测流程、以及公开的排行榜。项目提供详细的评测方法论、数据集和工具,帮助研究者与开发者客观对比不同模型的优劣,推动中文大模型的发展。

开源 unknown 对话助手
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 3301
维护状态 低维护
是否开源 是
定价模式 unknown

项目数据

分类对话助手
开发团队CLUEbenchmark
所属国家
定价模式unknown
价格说明官网存在但定价信息不明确,需进一步确认。
访问状态
是否开源是
开源协议
主要语言
技术栈/模型chatgpt,chinese,evaluation,foundation-models,gpt-4
GitHub 星标★ 3301
30天Star增速
HF 下载量
上线时间2023-05-02 00:00:00
最近更新2026-09-21 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:云服务 5 步

⚠ 该项目 README 未提供完整安装说明,以下步骤为通用流程,请以官方文档为准。

环境要求

  • 可访问公网的浏览器环境,用于打开 SuperCLUE 官网与报告链接
  • 本地已安装 Git,用于克隆项目仓库查阅资料(非必需)

安装与启动步骤

  1. 1克隆项目仓库

    把 SuperCLUE 仓库拉到本地,仓库内主要是榜单、报告与技术说明,不是可安装的软件包。

    git clone https://github.com/CLUEbenchmark/SuperCLUE.git
  2. 2打开官网看榜单

    README 给出的官方入口是 www.SuperClueAI.com,可在其中查看最新一期中文大模型榜单与测评结果。

  3. 3阅读年度报告

    README 提供 2025 年年度报告与 State Of Chinese AI 2025 两个链接,用于了解当期评测结论与维度。

  4. 4查阅技术报告

    README 指向 arXiv 论文 2307.15020,其中说明 SuperCLUE 的评测方法论与能力象限设计。

  5. 5查看子基准页面

    README 另给出 SuperCLUE-Agent 与 SuperCLUE-Safety 两个子基准的独立链接,可按需前往了解智能体与安全评测。

如何确认成功

浏览器能正常打开 www.superclueai.com,并能从 README 链接进入年度报告与 arXiv 论文页面,即说明资料可用。

常见问题

Q:怎么在本地跑 SuperCLUE 评测?

A:README 未提供任何安装或运行命令,只给出榜单、报告与论文链接。当前需以官网公布的评测方案为准,不能凭 README 完成本地评测。

Q:榜单结果怎么复现?

A:README 未给出复现步骤或脚本。请参考技术报告中的评测方法论,并关注官网后续是否放出数据集与工具。

Q:想单独看智能体或安全评测?

A:README 中给出了 SuperCLUE-Agent 与 SuperCLUE-Safety 的独立页面与仓库链接,可从这些入口单独查看对应基准。

注意事项

  • README 内容以榜单发布、报告链接和评测维度介绍为主,没有任何安装命令,本教程中的命令仅有仓库克隆一项。
  • 评测覆盖语言理解与生成、专业技能与知识、Agent 智能体、安全性四个能力象限,细化为 12 项基础能力。
  • 榜单与报告会持续更新,实际以官网 www.superclueai.com 的最新发布为准。

核心亮点

  • 覆盖中文多维度能力,评测体系全面
  • 提供公开榜单,模型对比直观
  • 自动化评测工具,降低使用门槛

不足之处

  • 评测数据集和工具文档有待完善
  • 社区活跃度一般,更新频率待观察

适用场景

  • 研究者评估中文大模型综合能力
  • 开发者选择合适的中文基座模型
  • 企业进行模型选型与技术调研

替代项目

C-Eval、CLUE Benchmark、OpenCompass

项目介绍

SuperCLUE 是评测安全领域的开源项目,由 CLUEbenchmark 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(3,301)位列前 30%,在评测安全分类的 466 个项目里位列前 9%。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。官网存在但定价信息不明确,需进一步确认。从国内网络环境看,可直接访问。

它主要面向的使用场景是:研究者评估中文大模型综合能力。同类可对比的替代方案包括 C-Eval、CLUE Benchmark、OpenCompass。

上一篇:AgentBench

下一篇:bigcodebench

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12