评测安全

汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。

共收录 474 个开源项目

One-Eval 开源

用 agent 自动跑完 LLM 评测全流程,省去手工配数据与打分

One-Eval 是一个面向大语言模型评测的自动化系统,核心思路是用 agent 来驱动整个评测流程。传统 L···

★ 164 评分 2025-11-10
empirica 开源

给 AI 装上可靠性仪表盘,让每次输出可测量、可拦截、可信赖。

empirica 是一个面向 AI 智能体与工作流的可靠性测量与保障框架,旨在解决 LLM 应用中的幻觉、记忆···

★ 250 评分 2025-11-01
SemBench 开源

给语义查询引擎跑分,选型不再靠猜

SemBench 是一个用于评测语义查询处理引擎的开源基准测试工具。它针对知识图谱、图数据库和语义数据···

★ 66 评分 2025-11-01
Awesome-KV-Cache-Optimization 开源

一页看懂 KV Cache 优化全景,快速选对推理加速方案

这是一个面向大模型推理服务的 KV Cache 优化综述仓库,对应 ACL 2026 论文《Towards Efficient La···

★ 412 评分 2025-10-29
BEAM 开源

百万级上下文下,科学评测并增强大模型长期记忆

BEAM 是一个针对大语言模型长期记忆能力的基准测试与增强框架,由 ICLR 2026 论文提出。它解决了现···

★ 145 评分 2025-10-28
WormGPT 开源

模拟攻击场景,测试大模型安全漏洞

WormGPT 是一个实验性 AI 项目,仅用于教育、网络安全研究和防御性测试。它旨在帮助开发者、研究人···

★ 57 评分 2025-10-27
LLM4Pentest 开源

让大模型真刀真枪打渗透,测出真实攻防水平

LLM4Pentest 是一个面向大语言模型渗透测试能力评测的开源项目,主要解决如何系统化衡量 LLM 在真实···

★ 363 评分 2025-10-25
lmring 开源

自建 LLM 竞技场,让真实用户投票选出最强模型

lmring 是一个开源的、可自托管的 LLM 竞技场(Arena)平台,旨在解决大模型评测中缺乏真实用户反馈···

★ 221 评分 2025-10-21
next-evals-oss 开源

给 AI 出 Next.js 考题,看它到底会不会写

next-evals-oss 是 Vercel 开源的评测套件,专门用来衡量 AI 模型对 Next.js(覆盖到 15.5.6 版本)···

★ 320 评分 2025-10-21
every_eval_ever 开源

把散落各处的 AI 评测结果统一成可比较的公共数据库

Every Eval Ever 是一个面向 AI 评测领域的共享元数据规范与众包评测数据库。它要解决的核心问题是···

★ 131 评分 2025-10-08
Rules.txt 开源

用指令集撬开AI黑盒,审计推理与偏见

Rules.txt 是一个针对大型语言模型(LLM)的对齐与越狱(jailbreak)研究项目,提供一套指令集,用···

★ 103 评分 2025-10-03
heretic 开源

一键去除模型审查,解锁无限制回答

heretic 是一个针对语言模型的全自动审查移除工具,旨在消除模型输出中的内容限制。它通过分析模型···

★ 32394 评分 2025-09-21
openai-guardrails-js 开源

给 LLM 应用加一道输入输出安检门,拦截越狱与敏感内容

openai-guardrails-js 是 OpenAI 官方 Guardrails 的 TypeScript/JavaScript 实现,用于在 LLM 应用···

★ 102 评分 2025-09-17
memorybench 开源

一套基准跑遍对话记忆与 RAG,选型不再靠拍脑袋

memorybench 是一个面向对话记忆与 RAG 系统的统一评测基准框架,用 TypeScript 编写。它要解决的问···

★ 319 评分 2025-09-17
GenExam 开源

用跨学科考题给文生图模型打分,测出真实知识水平。

GenExam 是一个面向多学科文生图模型的评测基准,旨在系统评估文本到图像生成模型在跨学科知识理解···

★ 72 评分 2025-09-15
meta-agents-research-environments 开源

在动态仿真环境中,逼真考验AI智能体的适应力与决策力。

Meta Agents Research Environments 是一个用于评估 AI 智能体的动态仿真平台。与静态基准测试不同···

★ 558 评分 2025-09-11
Auditor 开源

自动化安全审计,快速发现项目漏洞与风险

Auditor 是一个专注于安全审计的工具,其核心定位是作为 TheAuditor 的发布渠道。TheAuditor 旨在帮···

★ 548 评分 2025-09-07
FDAbench 开源

给数据智能体打分,看谁更会分析异构数据

FDABench 是一个用于评估数据智能体(Data Agents)在异构数据上执行分析查询能力的基准测试平台,···

★ 82 评分 2025-09-01
Gym 开源

把模型丢进环境里跑,边评测边改进智能体

Gym 是一个用于评估和改进模型与智能体的环境框架,核心思路是把评测从静态数据集搬到可交互的环境···

★ 1211 评分 2025-08-25
Awesome-LLM-Reasoning-Failures 开源

一库看懂大模型推理翻车现场与原因

这是一个围绕《Large Language Model Reasoning Failures》论文整理的开源资源库,系统收集大语言模···

★ 223 评分 2025-08-18
GitTaskBench 开源

用真实仓库任务,测出代码代理的真实水平

GitTaskBench 是一个面向真实世界代码代理的仓库级基准测试平台,旨在全面评估 AI 编程助手在复杂软···

★ 259 评分 2025-08-17
ASTRA 开源

实战对抗攻击,一键测出 AI 模型的安全漏洞

ASTRA 是亚马逊 Nova AI 安全挑战赛的冠军项目,作为攻击方团队,在实时对抗评估中击败了来自全球顶···

★ 77 评分 2025-08-13
Omni-SafetyBench 开源

给音视频大模型做安全体检,发现隐藏风险

Omni-SafetyBench 是一个用于评估音视频大语言模型(AV-LLMs)安全性的基准测试工具,源自 ACM MM ···

★ 115 评分 2025-08-10
harbor 开源

在真实终端里给智能体打分,让改进有据可依

Harbor 是一个用于评估和改进智能体(agents)的框架,主要面向终端环境下的任务。它提供了一套标准···

★ 5626 评分 2025-08-04