
helm
一站式跑分对比大模型,多维度评测可复现
HELM 是斯坦福 CRFM 团队开源的 Python 评测框架,用于对大语言模型和多模态基础模型做全面、可复现、透明的评估。它解决的核心问题是:模型评测往往口径不一、结果难以复现、只覆盖单一指标。HELM 把评测拆成场景、任务、指标、模型适配器四层结构,内置大量标准数据集与任务(如问答、摘要、推理、安全、公平性、偏见等),并统一用自动化流程跑分,输出多维度对比结果。用户可以用它横向比较不同模型在准确率、鲁棒性、校准度、效率、公平性等维度的表现,也能自定义任务和模型接入。框架强调可复现性,评测配置和原始结果可追踪,适合研究机构和企业做模型选型与风险审查。
项目数据
使用教程
环境要求
- Python 3 环境与 pip(README 未指定最低版本)
- 可访问 PyPI 的网络,用于安装 crfm-helm
- 若评测 OpenAI、Anthropic Claude、Google Gemini 等在线模型,需具备对应提供商的访问凭证(README 未给出具体配置方式)
- 本地需有足够磁盘空间存放数据集与评测结果
安装与启动步骤
-
1安装 HELM 包
README 的 Quick Start 直接给出从 PyPI 安装 crfm-helm,建议在虚拟环境中执行,避免污染系统 Python。
pip install crfm-helm -
2确认命令可用
安装完成后检查 helm-run 是否已进入 PATH;若提示找不到命令,说明安装环境与当前 shell 不是同一个 Python 环境。
helm-run --help -
3运行评测
用 --run-entries 指定任务与模型,--suite 给本次评测套件命名,--max-eval-instances 限制样本数以便快速试跑。
helm-run --run-entries mmlu:subject=philosophy,model=openai/gpt2 --suite my-suite --max-eval-instances 10
关键配置
| 配置项 | 必填 | 说明 | 示例 |
|---|---|---|---|
--run-entries | 是 | 指定要跑的任务条目,格式为 任务:参数=值,模型=提供商/模型名 | mmlu:subject=philosophy,model=openai/gpt2 |
--suite | 是 | 本次评测套件的名称,用于归集与区分不同批次的运行结果 | my-suite |
--max-eval-instances | 否 | 限制参与评测的样本数量,调小可加快试跑速度 | 10 |
如何确认成功
命令正常执行结束且无报错,即表示 helm-run 已按套件 my-suite 完成这次试跑(README 未说明具体输出目录)。
常见问题
Q:HELM 支持评测哪些模型?
A:README 说明可通过统一接口访问多家提供商的模型,例如 OpenAI 模型、Anthropic Claude、Google Gemini,并可自定义接入。具体可用模型清单请查官方文档。
Q:HELM 包含哪些数据集和指标?
A:内置标准化格式的数据集与基准(如 MMLU-Pro、GPQA、IFEval、WildBench),指标不限于准确率,还覆盖效率、偏见、毒性等维度。
Q:可以查看单条 prompt 和模型的回答吗?
A:可以。README 提到框架提供 Web UI,用于查看单条 prompt 与对应回答(README 节选中该部分内容不完整,未给出具体启动命令)。
Q:项目还在持续更新吗?
A:README 注明 HELM 已于 2026 年 6 月 1 日进入维护模式,详见官方文档的 Maintenance Mode Policy 页面。
注意事项
- README 节选里的 Quick Start 内容被截断,完整的后续步骤(如结果汇总、Web 界面启动)请查看官方文档 https://crfm-helm.readthedocs.io/en/latest/。
- 示例中的 --max-eval-instances 10 只跑 10 条样本,仅适合验证流程,正式评测需去掉或调大该参数。
- 评测在线模型会产生调用费用,正式跑全量任务前建议先用小样本试跑确认配置。
- 本教程仅覆盖 README 中明确出现的命令,未出现的参数、端口和路径一律未做推测。
核心亮点
- 覆盖准确率、鲁棒性、公平性、偏见、效率等多维指标,评测维度比多数框架更全
- 内置大量标准场景与数据集,开箱即可横向对比多个主流模型
- 强调可复现与透明,评测配置和结果可追踪,适合研究与合规审查
不足之处
- 完整评测计算量大、成本高,跑全量基准对算力和预算要求较高
- 配置和依赖较重,新手上手门槛比轻量评测脚本高
- 部分数据集和模型接口需要额外申请或配置,离线复现不够方便
适用场景
- 研究团队横向对比多个 LLM 的综合能力并撰写评测报告
- 企业做模型选型前的安全、公平性与鲁棒性审查
- 论文或项目中需要可复现的标准基准跑分
替代项目
lm-evaluation-harness、OpenCompass、BIG-bench
项目介绍
下一篇:llm_chess
同类项目推荐
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
Tracely-ai
开源
把生产事故变成回归测试,合并前自动拦截 AI 故障
Trace-native CI/CD for AI agents — production failures become regression tests that···
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents