评测安全

汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。

共收录 474 个开源项目

AlignBench 开源

测中文大模型对齐能力,多维打分看清模型强弱

AlignBench 是一个专为中文大模型设计的多维度对齐评测基准,由智谱AI推出并发表于ACL 2024。它旨在···

★ 431 评分 2023-11-23
MMMU 开源

用大学级多模态考题,测出 AI 的真实专家水平

MMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能···

★ 598 评分 2023-11-23
InfiniteBench 开源

测出大模型在10万字长文本下的真实水平

InfiniteBench 是论文《∞Bench: Extending Long Context Evaluation Beyond 100K Tokens》的官方代···

★ 393 评分 2023-11-22
athina-evals 开源

给 LLM 响应做质检,快速发现模型输出问题

athina-evals 是一个用于评估大语言模型(LLM)生成响应的 Python SDK。它解决了开发者在构建 LLM ···

★ 302 评分 2023-11-22
hallucination-index 开源

测出哪个AI最会胡说八道,选模型不再踩坑

这是一个评估和排名主流大语言模型(LLM)幻觉倾向的开源项目。它针对常见的任务类型(如问答、摘要···

★ 115 评分 2023-11-15
inspect_ai 开源

统一跑大模型评测,结果可复现可回放

Inspect 是英国人工智能安全研究所(UK AISI)开源的大模型评测框架,用 Python 编写,目标是让开发···

★ 2866 评分 2023-11-14
UHGEval 开源

一键测出大模型胡说八道,量化幻觉风险

UHGEval 是一个面向大语言模型幻觉评估的用户友好型框架,由 ACL 2024 论文提出。它旨在解决 LLM 在···

★ 182 评分 2023-11-06
LooGLE 开源

测长文本模型真实力,看它能否抓住长文关键

LooGLE 是 ACL 2024 发布的面向长上下文语言模型的评测基准,旨在系统评估模型对超长文档的理解与生···

★ 200 评分 2023-11-02
hallucination-leaderboard 开源

看哪个大模型摘要最不容易瞎编

hallucination-leaderboard 是一个用于评估大语言模型在短文档摘要任务中产生幻觉(即生成与原文不···

★ 3313 评分 2023-10-31
FollowBench 开源

用多级细粒度约束,精准测出大模型指令遵循的真实水平

FollowBench 是一个用于评估大型语言模型(LLM)遵循细粒度指令能力的基准测试集,由 ACL 2024 论文···

★ 121 评分 2023-10-31
tonic_validate 开源

给RAG应用打分,量化回答质量,快速定位问题

tonic_validate 是一个用于评估检索增强生成(RAG)应用响应质量的 Python 库。它提供了一套标准化···

★ 327 评分 2023-10-23
HallusionBench 开源

测出多模态模型的视觉幻觉,看清谁在瞎猜

HallusionBench 是一个针对多模态大语言模型(如 GPT-4V、LLaVA-1.5)的图像上下文推理基准测试集,···

★ 343 评分 2023-10-22
llm-jp-eval 开源

一键跑通日语 LLM 多任务评测,结果可对比

llm-jp-eval 是日本 LLM-jp 组织开发的大语言模型评测工具,专门面向日语能力评估。它把多个日语 N···

★ 169 评分 2023-10-19
XLingEval 开源

测测大模型用不同语言回答医疗问题的靠谱程度

XLingEval 是一个用于跨语言评估大型语言模型(LLM)在医疗健康查询场景中表现的开源工具包,源自同···

★ 249 评分 2023-10-18
Diffusion-MU-Attack 开源

快速攻破遗忘扩散模型,测出安全漏洞

Diffusion-MU-Attack 是 ECCV'24 论文的官方实现,针对安全导向的“遗忘学习”(unlearned)扩散模···

★ 89 评分 2023-10-17
OSWorld 开源

让 AI 学会像人一样操作电脑,真实环境跑分评测

OSWorld 是一个用于评估多模态 AI 智能体在真实计算机环境中执行开放式任务能力的基准测试平台,发···

★ 3156 评分 2023-10-16
DSG 开源

用场景图细粒度检验文生图,让评估更靠谱

DSG(Davidsonian Scene Graph)是一个用于文本到图像生成评估的开源项目,发表于ICLR 2024。它针对···

★ 109 评分 2023-10-12
MathVista 开源

测测AI看图算数行不行,一套基准见分晓

MathVista 是一个专注于视觉数学推理的开源项目,提供数据集、代码和评估工具,用于测试和提升 AI ···

★ 367 评分 2023-10-04
benchmarks 开源

跑分选型,用数据说话,避免MLOps工具踩坑。

这是一个用于主流AI模型上MLOps引擎、框架和语言性能对比的基准测试项目。它通过统一的测试脚本和标···

★ 142 评分 2023-10-02
Woodpecker 开源

给多模态模型装上纠错器,让AI描述图片不再瞎编。

Woodpecker 是一个针对多模态大语言模型(MLLM)的幻觉纠正工具。它通过训练一个轻量级的纠正器,在···

★ 650 评分 2023-09-26
watchtower 开源

扫描AI模型漏洞,守护AI供应链安全

AIShield Watchtower 是一个用于AI模型洞察与漏洞扫描的开源工具,旨在帮助开发者和安全团队深入理···

★ 203 评分 2023-09-21
ANeurIPS2024_SPV-MIA 开源

用自提示校准精准识别训练数据,评估大模型隐私泄露风险

SPV-MIA 是 NeurIPS 2024 收录的针对微调大语言模型的成员推理攻击方法。它解决的核心问题是:当大···

★ 184 评分 2023-09-15
LLM-Agent-Paper-List 开源

一键掌握LLM智能体领域核心论文,快速入门不迷路

这是一个关于大语言模型智能体(LLM Agent)的论文清单,源自一篇发表在《中国科学:信息科学》封面···

★ 8221 评分 2023-09-12
spelltest 开源

用 AI 模拟用户,自动测试你的 LLM 应用,提前发现坑

spelltest 是一个面向 LLM 应用的 AI-to-AI 测试与模拟框架,旨在解决大语言模型应用在开发、测试和···

★ 138 评分 2023-09-12