evaluation-guidebook 是评测安全领域的开源项目,由 huggingface 开发,2024 年首次发布。
在全站 13,014 个收录项目中,它的 GitHub 星标数(2,147)位列前 30%,在评测安全分类的 458 个项目里位列前 12%。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-21。无在线服务,需自行部署,完全免费。
它主要面向的使用场景是:研究者在设计新模型时,需要选择合适的评估基准和指标。同类可对比的替代方案包括 lm-evaluation-harness、OpenCompass、HELM。




