Awesome-LLM-Eval 是评测安全领域的开源项目,由 onejune2018 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 657。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。完全免费,无付费版本。
它主要面向的使用场景是:研究者调研LLM评测基准,设计实验方案。同类可对比的替代方案包括 lm-evaluation-harness、OpenCompass、HELM。

一站式找全 LLM 评测资源,快速选型不踩坑
Awesome-LLM-Eval 是一个精选资源列表,专注于大语言模型(LLM)的评测领域。它系统性地整理了评测工具、数据集/基准、演示、排行榜、论文、文档和模型,旨在帮助研究者和开发者全面了解并选择适合的评测方案。项目覆盖了从传统基准(如 BERT)到前沿模型(如 ChatGPT、ChatGLM、LLaMA)的评测资源,并持续更新以追踪生成式 AI 的技术边界。其核心价值在于降低信息检索成本,为 LLM 评测提供一站式导航,解决评测标准分散、资源难找的问题。
lm-evaluation-harness、OpenCompass、HELM
Awesome-LLM-Eval 是评测安全领域的开源项目,由 onejune2018 开发,2023 年首次发布。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 657。
项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。完全免费,无付费版本。
它主要面向的使用场景是:研究者调研LLM评测基准,设计实验方案。同类可对比的替代方案包括 lm-evaluation-harness、OpenCompass、HELM。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.