evals
开源
给 AI Agent 做统一考试,改一版测一版
evals 是一个面向 AI Agent 与 LLM 应用的综合评测框架,用 Python 编写,核心目标是解决大模型应用···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
evals
开源
给 AI Agent 做统一考试,改一版测一版
evals 是一个面向 AI Agent 与 LLM 应用的综合评测框架,用 Python 编写,核心目标是解决大模型应用···
any-guardrail
开源
一个接口切换多种大模型安全护栏,评测对比不再改代码
any-guardrail 是一个面向大模型安全评测的 Python 工具库,目标是让研究者和工程实践者用统一接口···
InferenceX
开源
多模型多硬件推理压测,一键跑出可比性能数据
InferenceX 是一个开源的持续推理基准研究平台,专注在大规模 LLM 推理场景下做可复现、可持续的性···
OpenJudge
开源
给AI智能体当裁判,量化每一步质量,训练更靠谱的Agent。
OpenJudge 是一个用于智能体全面评估与质量奖励的统一框架。它解决的核心问题是:当前大模型智能体···
AlgoTune
开源
写更快的代码,用154道题检验你的算法优化能力
AlgoTune 是 NeurIPS 2025 推出的基准测试,包含 154 道数学、物理和计算机科学问题。其目标不仅是···
ArtifactsBenchmark
开源
一键跑分,量化 AI 生成工件质量
ArtifactsBenchmark 是一个用于评估和比较 AI 生成工件(如代码、文档、设计稿等)质量的基准测试框···
DreamLayer-Eval
开源
一键自动化评测扩散模型,告别手动调参和结果不可复现。
DreamLayer-Eval 是一个面向扩散模型的自动化评测基准工具,旨在解决图像生成模型评估过程繁琐、结···
OceanGym
开源
打造水下机器人的“健身房”,让智能体在仿真洋流中练就真本事。
OceanGym 是一个面向水下具身智能体的基准测试环境,旨在解决水下机器人(如AUV、ROV)在复杂海洋环···
tau2-bench
开源
测测你的AI智能体,会不会在真实客服场景中翻车
τ-Bench 是一个用于评估工具调用型智能体(Tool-Agent)在真实世界领域中人机交互能力的基准测试框···
llm-eval
开源
一站式跑分,快速对比大模型与 RAG 效果
llm-eval 是一个面向大语言模型的评估平台,旨在解决模型性能难以量化、对比缺乏标准的问题。它支持···
search-arena
开源
量化分析搜索增强大模型,看清能力边界
Search Arena 是一个用于分析搜索增强型大语言模型(LLM)的开源工具,源自 ICLR 2026 论文的官方代···
TAB
开源
统一评测时间序列异常检测方法,公平对比选最优
TAB 是一个面向时间序列异常检测(TSAD)方法的统一基准测试框架,相关论文被 PVLDB 2025 接收。它···
secure-ai-tooling
开源
给AI系统做安全体检,用统一框架识别和缓解风险
secure-ai-tooling 是 CoSAI(人工智能安全联盟)推出的风险图谱框架,旨在帮助团队识别、分析和缓···
CUREBench
开源
给AI看病决策打分,推动医疗AI更靠谱
CUREBench 是一个面向 AI 治疗决策推理能力的基准测试平台,论文发表于 NeurIPS 2025。它旨在系统评···
SECA
开源
用语义等价攻击,自动逼出 LLM 的幻觉破绽
SECA 是一个针对大语言模型(LLM)幻觉问题的对抗性攻击框架,发表于 NeurIPS 2025。它通过生成语义···
RiOSWorld
开源
测出你的电脑智能体有多“手贱”,防翻车必备
RiOSWorld 是 NeurIPS 2025 官方发布的基准测试项目,用于评估多模态计算机操作智能体的风险。它基···
sim-evals
开源
把机器人策略丢进仿真跑分,省下真机评测的麻烦
sim-evals 是一个面向 DROID 机器人操作数据集的仿真评测平台,用 Python 实现。它解决的核心问题是···
Awesome-LLM-Empathy
开源
一站式收录 LLM 共情论文,快速把握研究全貌
Awesome-LLM-Empathy 是一个关于大语言模型(LLM)共情能力的论文列表项目,系统整理了该领域的研究···
ChineseHarm-bench
开源
测一测你的模型对中文有害内容有多能扛
ChineseHarm-Bench 是一个面向中文场景的有害内容检测基准测试集,旨在评估和比较各类模型(包括开···
PromptMe
开源
10 个动手挑战,亲手打穿 LLM 安全漏洞
PromptMe 是一个面向大语言模型安全的教育型开源项目,围绕 OWASP LLM Top 10 设计了 10 个动手挑战···
SREGym
开源
用真实生产事故考题,测出 AI Agent 会不会排障
SREGym 是一个面向 AI Agent 的评测基准,专门用来回答“AI 智能体能不能真正处理生产环境事故”这···
PhyX
开源
测测你的AI有没有物理常识,一测便知
PhyX 是一个专注于物理推理能力评估的开源基准测试项目,旨在回答“你的模型是否具备物理推理的‘智···
hackagent
开源
给 AI 智能体做安全体检,提前发现漏洞防攻击
HackAgent 是一个开源的 AI 智能体安全检测工具包,专门用于发现和验证 AI Agent 的漏洞。它主要解···
vistorybench
开源
给AI故事配图能力打分,让模型叙事更连贯
ViStoryBench 是一个面向 AI 故事可视化任务的基准测试集,由 CVPR 2026 论文提出。它解决的核心问···