helm

一站式跑分对比大模型,多维度评测可复现

HELM 是斯坦福 CRFM 团队开源的 Python 评测框架,用于对大语言模型和多模态基础模型做全面、可复现、透明的评估。它解决的核心问题是:模型评测往往口径不一、结果难以复现、只覆盖单一指标。HELM 把评测拆成场景、任务、指标、模型适配器四层结构,内置大量标准数据集与任务(如问答、摘要、推理、安全、公平性、偏见等),并统一用自动化流程跑分,输出多维度对比结果。用户可以用它横向比较不同模型在准确率、鲁棒性、校准度、效率、公平性等维度的表现,也能自定义任务和模型接入。框架强调可复现性,评测配置和原始结果可追踪,适合研究机构和企业做模型选型与风险审查。

开源 free 评测安全
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 2911
维护状态 较活跃
是否开源
定价模式 free

项目数据

分类评测安全
开发团队stanford-crfm
所属国家
定价模式free
价格说明开源免费,遵循相应开源许可证
访问状态
是否开源
开源协议Apache-2.0
主要语言Python
技术栈/模型
GitHub 星标★ 2911
30天Star增速
HF 下载量
上线时间2021-11-29 00:00:00
最近更新2026-09-17 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-15
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:命令行工具 3 步

环境要求

  • Python 3 环境与 pip(README 未指定最低版本)
  • 可访问 PyPI 的网络,用于安装 crfm-helm
  • 若评测 OpenAI、Anthropic Claude、Google Gemini 等在线模型,需具备对应提供商的访问凭证(README 未给出具体配置方式)
  • 本地需有足够磁盘空间存放数据集与评测结果

安装与启动步骤

  1. 1安装 HELM 包

    README 的 Quick Start 直接给出从 PyPI 安装 crfm-helm,建议在虚拟环境中执行,避免污染系统 Python。

    pip install crfm-helm
  2. 2确认命令可用

    安装完成后检查 helm-run 是否已进入 PATH;若提示找不到命令,说明安装环境与当前 shell 不是同一个 Python 环境。

    helm-run --help
  3. 3运行评测

    用 --run-entries 指定任务与模型,--suite 给本次评测套件命名,--max-eval-instances 限制样本数以便快速试跑。

    helm-run --run-entries mmlu:subject=philosophy,model=openai/gpt2 --suite my-suite --max-eval-instances 10

关键配置

配置项必填说明示例
--run-entries指定要跑的任务条目,格式为 任务:参数=值,模型=提供商/模型名mmlu:subject=philosophy,model=openai/gpt2
--suite本次评测套件的名称,用于归集与区分不同批次的运行结果my-suite
--max-eval-instances限制参与评测的样本数量,调小可加快试跑速度10

如何确认成功

命令正常执行结束且无报错,即表示 helm-run 已按套件 my-suite 完成这次试跑(README 未说明具体输出目录)。

常见问题

Q:HELM 支持评测哪些模型?

A:README 说明可通过统一接口访问多家提供商的模型,例如 OpenAI 模型、Anthropic Claude、Google Gemini,并可自定义接入。具体可用模型清单请查官方文档。

Q:HELM 包含哪些数据集和指标?

A:内置标准化格式的数据集与基准(如 MMLU-Pro、GPQA、IFEval、WildBench),指标不限于准确率,还覆盖效率、偏见、毒性等维度。

Q:可以查看单条 prompt 和模型的回答吗?

A:可以。README 提到框架提供 Web UI,用于查看单条 prompt 与对应回答(README 节选中该部分内容不完整,未给出具体启动命令)。

Q:项目还在持续更新吗?

A:README 注明 HELM 已于 2026 年 6 月 1 日进入维护模式,详见官方文档的 Maintenance Mode Policy 页面。

注意事项

  • README 节选里的 Quick Start 内容被截断,完整的后续步骤(如结果汇总、Web 界面启动)请查看官方文档 https://crfm-helm.readthedocs.io/en/latest/。
  • 示例中的 --max-eval-instances 10 只跑 10 条样本,仅适合验证流程,正式评测需去掉或调大该参数。
  • 评测在线模型会产生调用费用,正式跑全量任务前建议先用小样本试跑确认配置。
  • 本教程仅覆盖 README 中明确出现的命令,未出现的参数、端口和路径一律未做推测。

核心亮点

  • 覆盖准确率、鲁棒性、公平性、偏见、效率等多维指标,评测维度比多数框架更全
  • 内置大量标准场景与数据集,开箱即可横向对比多个主流模型
  • 强调可复现与透明,评测配置和结果可追踪,适合研究与合规审查

不足之处

  • 完整评测计算量大、成本高,跑全量基准对算力和预算要求较高
  • 配置和依赖较重,新手上手门槛比轻量评测脚本高
  • 部分数据集和模型接口需要额外申请或配置,离线复现不够方便

适用场景

  • 研究团队横向对比多个 LLM 的综合能力并撰写评测报告
  • 企业做模型选型前的安全、公平性与鲁棒性审查
  • 论文或项目中需要可复现的标准基准跑分

替代项目

lm-evaluation-harness、OpenCompass、BIG-bench

项目介绍

helm 是一个评测安全领域的开源项目,官方简介:Holistic Evaluation of Language Models (HELM) is an open source Python framework created by the Center for Research on Foundation Models (CRFM) at Stanford for holistic, reproducible and transparent evaluation of foundation models, including large language models (LLMs) and multimodal models.。项目使用 Python 开发,在 GitHub 上获得 2908 星标。

上一篇:MLLM-Token-Compression

下一篇:llm_chess

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1516 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
Tracely-ai 开源

把生产事故变成回归测试,合并前自动拦截 AI 故障

Trace-native CI/CD for AI agents — production failures become regression tests that···

★ 1403 2026-08-24