评测安全

汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。

共收录 474 个开源项目

SpatialEval 开源

测出大模型空间推理真实水平,选模型不再靠猜

SpatialEval 是一个用于评估多模态大语言模型(MLLMs)和纯语言模型(LLMs)空间推理能力的基准测试···

★ 61 评分 2024-10-23
vulnhuntr 开源

让LLM自动帮你扫代码找漏洞,零样本开箱即用

vulnhuntr 是一个利用大型语言模型进行零样本漏洞发现的开源工具。它解决的是传统静态分析工具依赖···

★ 2776 评分 2024-10-15
Awesome-Video-Reasoning-Landscape 开源

一张图看懂视频推理,快速上手最新研究

这是一个关于视频推理领域的开源综述项目,旨在系统梳理视频推理的最新任务、范式和基准。它解决了···

★ 191 评分 2024-10-11
confabulations 开源

测出RAG系统胡说八道,用人工验证问答对量化幻觉

confabulations 是一个用于评估 RAG(检索增强生成)系统幻觉(或称虚构)问题的文档型基准测试集。···

★ 250 评分 2024-10-10
Modality-Integration-Rate 开源

量化视觉-语言模型跨模态对齐,诊断融合短板

Modality-Integration-Rate 是 ICCV 2025 论文的官方代码,提出了一种名为“模态整合率”(Modalit···

★ 113 评分 2024-10-09
evaluation-guidebook 开源

学透 LLM 评估,避开 benchmark 陷阱,科学选模型。

这是一个关于大语言模型评估的指南仓库,源自 Hugging Face 团队在维护 Open LLM Leaderboard 和设···

★ 2147 评分 2024-10-09
rhesis 开源

让领域专家给AI当教练,用标注反馈驱动智能体快速进化

Rhesis 是一个面向 AI 团队的协作层基础设施,旨在连接领域专家与工程师,共同优化智能体(Agent)···

★ 396 评分 2024-10-09
ScienceAgentBench 开源

用102个真实科研任务,严格检验AI科学智能体成色

ScienceAgentBench 是一个面向数据驱动科学发现的语言智能体评估基准,由加州大学等机构在 ICLR 20···

★ 173 评分 2024-10-02
inspect_evals 开源

一行命令跑齐大模型能力与安全评测

inspect_evals 是英国 AI 安全研究院(UK AISI)为 Inspect AI 框架提供的官方评测集合,解决大模型···

★ 684 评分 2024-10-02
Deco 开源

让多模态模型少说瞎话,动态纠错解码即插即用

Deco 是一个针对多模态大语言模型(MLLM)的幻觉缓解工具,核心方法为动态校正解码(Dynamic Corre···

★ 147 评分 2024-09-29
WorfBench 开源

给AI工作流生成能力打分,让模型编排更靠谱

WorfBench 是一个用于评测和生成智能体工作流(Agentic Workflow)的基准测试框架,由 ICLR 2025 论···

★ 157 评分 2024-09-29
VideoGen-Eval 开源

给视频生成模型打分,自动评测多维度质量

VideoGen-Eval 是一个基于智能体的视频生成评估系统,旨在解决视频生成模型评测标准缺失、评估维度···

★ 269 评分 2024-09-28
llm_chess 开源

让大模型下棋,测出推理和守规则的真实水平

llm_chess 是一个通过模拟国际象棋对局来评测大语言模型推理与指令遵循能力的开源项目。它不依赖传···

★ 132 评分 2024-09-28
MGDebugger 开源

像调试传统代码一样调试大模型,快速定位推理错误根因。

MGDebugger 是一个面向大语言模型的多粒度调试工具,源自 ICSE 2026 论文。它解决 LLM 推理过程中错···

★ 101 评分 2024-09-27
langfair 开源

给LLM做公平性体检,防偏见翻车

LangFair 是一个用于大语言模型(LLM)偏见与公平性评估的 Python 库,专注于用例级别的评估。它解···

★ 262 评分 2024-09-20
ai-llm-comparison 开源

并排对比所有AI模型,快速选出最适合你的那个

这是一个用于对比各类AI模型的网站,旨在帮助用户直观了解不同大语言模型的能力差异。它解决了AI模···

★ 424 评分 2024-09-18
DSBench 开源

测测你的AI助手能不能像数据科学家一样干活

DSBench 是一个面向数据科学智能体的基准测试框架,旨在评估大语言模型驱动的智能体在真实数据科学···

★ 128 评分 2024-09-12
XRAG 开源

给 RAG 系统做全面体检,量化每个核心模块的真实实力

XRAG 是一个专注于评估高级检索增强生成(RAG)系统中核心组件模块的基准测试工具。它解决了当前 R···

★ 380 评分 2024-09-07
llm-leaderboard 开源

一站式对比LLM基准分数和价格,快速选型

这是一个已废弃的LLM基准测试排行榜项目,曾汇总各大语言模型的基准测试分数和提供商价格。它旨在帮···

★ 356 评分 2024-09-07
Awesome-Multimodal-LLM-for-Code 开源

一页看全多模态代码生成论文与数据集

这是一个面向多模态代码生成研究的论文清单与资源汇总项目,对应 TMLR 2026 论文《Multimodal Larg···

★ 278 评分 2024-09-06
llamator 开源

给聊天机器人找茬,提前揪出安全漏洞

llamator 是一个用于测试聊天机器人和生成式 AI 系统的红队(Red Teaming)Python 框架。它主要解决···

★ 223 评分 2024-09-05
awesome_LLM-harmful-fine-tuning-pape··· 开源

一页看全有害微调攻防论文,快速摸清 LLM 安全风险

这是一个聚焦大语言模型有害微调攻击的论文综述仓库,对应一篇被 ACM Computing Surveys 收录的综述···

★ 248 评分 2024-09-04
model-leaderboard 开源

目标检测模型谁最强?排行榜按小大物体直接比。

model-leaderboard 是一个面向目标检测模型的评测排行榜工具,用 TypeScript 编写。它解决的核心问···

★ 110 评分 2024-09-03
Awesome-LLMs-for-Vulnerability-Detec··· 开源

一站式追踪LLM漏洞检测前沿论文与数据集

这是一个持续更新的开源索引,专门收录大语言模型(LLM)在软件漏洞检测领域的研究成果。项目按函数···

★ 1424 评分 2024-09-02