评测安全

汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。

共收录 474 个开源项目

evals 开源

给 AI Agent 做统一考试,改一版测一版

evals 是一个面向 AI Agent 与 LLM 应用的综合评测框架,用 Python 编写,核心目标是解决大模型应用···

★ 210 评分 2025-07-31
any-guardrail 开源

一个接口切换多种大模型安全护栏,评测对比不再改代码

any-guardrail 是一个面向大模型安全评测的 Python 工具库,目标是让研究者和工程实践者用统一接口···

★ 123 评分 2025-07-18
InferenceX 开源

多模型多硬件推理压测,一键跑出可比性能数据

InferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性···

★ 1763 评分 2025-07-12
OpenJudge 开源

给AI智能体当裁判,量化每一步质量,训练更靠谱的Agent。

OpenJudge 是一个用于智能体全面评估与质量奖励的统一框架。它解决的核心问题是:当前大模型智能体···

★ 855 评分 2025-07-08
AlgoTune 开源

写更快的代码,用154道题检验你的算法优化能力

AlgoTune 是 NeurIPS 2025 推出的基准测试,包含 154 道数学、物理和计算机科学问题。其目标不仅是···

★ 117 评分 2025-07-02
ArtifactsBenchmark 开源

一键跑分,量化 AI 生成工件质量

ArtifactsBenchmark 是一个用于评估和比较 AI 生成工件(如代码、文档、设计稿等)质量的基准测试框···

★ 279 评分 2025-06-26
DreamLayer-Eval 开源

一键自动化评测扩散模型,告别手动调参和结果不可复现。

DreamLayer-Eval 是一个面向扩散模型的自动化评测基准工具,旨在解决图像生成模型评估过程繁琐、结···

★ 412 评分 2025-06-22
OceanGym 开源

打造水下机器人的“健身房”,让智能体在仿真洋流中练就真本事。

OceanGym 是一个面向水下具身智能体的基准测试环境,旨在解决水下机器人(如AUV、ROV)在复杂海洋环···

★ 144 评分 2025-06-17
tau2-bench 开源

测测你的AI智能体,会不会在真实客服场景中翻车

τ-Bench 是一个用于评估工具调用型智能体(Tool-Agent)在真实世界领域中人机交互能力的基准测试框···

★ 2109 评分 2025-06-09
llm-eval 开源

一站式跑分,快速对比大模型与 RAG 效果

llm-eval 是一个面向大语言模型的评估平台,旨在解决模型性能难以量化、对比缺乏标准的问题。它支持···

★ 98 评分 2025-06-07
search-arena 开源

量化分析搜索增强大模型,看清能力边界

Search Arena 是一个用于分析搜索增强型大语言模型(LLM)的开源工具,源自 ICLR 2026 论文的官方代···

★ 59 评分 2025-06-04
TAB 开源

统一评测时间序列异常检测方法,公平对比选最优

TAB 是一个面向时间序列异常检测(TSAD)方法的统一基准测试框架,相关论文被 PVLDB 2025 接收。它···

★ 144 评分 2025-06-02
secure-ai-tooling 开源

给AI系统做安全体检,用统一框架识别和缓解风险

secure-ai-tooling 是 CoSAI(人工智能安全联盟)推出的风险图谱框架,旨在帮助团队识别、分析和缓···

★ 97 评分 2025-05-30
CUREBench 开源

给AI看病决策打分,推动医疗AI更靠谱

CUREBench 是一个面向 AI 治疗决策推理能力的基准测试平台,论文发表于 NeurIPS 2025。它旨在系统评···

★ 136 评分 2025-05-28
SECA 开源

用语义等价攻击,自动逼出 LLM 的幻觉破绽

SECA 是一个针对大语言模型(LLM)幻觉问题的对抗性攻击框架,发表于 NeurIPS 2025。它通过生成语义···

★ 73 评分 2025-05-27
RiOSWorld 开源

测出你的电脑智能体有多“手贱”,防翻车必备

RiOSWorld 是 NeurIPS 2025 官方发布的基准测试项目,用于评估多模态计算机操作智能体的风险。它基···

★ 125 评分 2025-05-23
sim-evals 开源

把机器人策略丢进仿真跑分,省下真机评测的麻烦

sim-evals 是一个面向 DROID 机器人操作数据集的仿真评测平台,用 Python 实现。它解决的核心问题是···

★ 242 评分 2025-05-23
Awesome-LLM-Empathy 开源

一站式收录 LLM 共情论文,快速把握研究全貌

Awesome-LLM-Empathy 是一个关于大语言模型(LLM)共情能力的论文列表项目,系统整理了该领域的研究···

★ 82 评分 2025-05-21
ChineseHarm-bench 开源

测一测你的模型对中文有害内容有多能扛

ChineseHarm-Bench 是一个面向中文场景的有害内容检测基准测试集,旨在评估和比较各类模型(包括开···

★ 68 评分 2025-05-21
PromptMe 开源

10 个动手挑战,亲手打穿 LLM 安全漏洞

PromptMe 是一个面向大语言模型安全的教育型开源项目,围绕 OWASP LLM Top 10 设计了 10 个动手挑战···

★ 111 评分 2025-05-20
SREGym 开源

用真实生产事故考题,测出 AI Agent 会不会排障

SREGym 是一个面向 AI Agent 的评测基准,专门用来回答“AI 智能体能不能真正处理生产环境事故”这···

★ 305 评分 2025-05-19
PhyX 开源

测测你的AI有没有物理常识,一测便知

PhyX 是一个专注于物理推理能力评估的开源基准测试项目,旨在回答“你的模型是否具备物理推理的‘智···

★ 55 评分 2025-05-15
hackagent 开源

给 AI 智能体做安全体检,提前发现漏洞防攻击

HackAgent 是一个开源的 AI 智能体安全检测工具包,专门用于发现和验证 AI Agent 的漏洞。它主要解···

★ 520 评分 2025-05-14
vistorybench 开源

给AI故事配图能力打分,让模型叙事更连贯

ViStoryBench 是一个面向 AI 故事可视化任务的基准测试集,由 CVPR 2026 论文提出。它解决的核心问···

★ 172 评分 2025-05-13