评测安全

汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。

共收录 474 个开源项目

AI-Surface 开源

PR 阶段扫出 AI 资产与风险,离线免费

AI-Surface 是一个面向应用代码的 AI 攻击面发现与治理工具,核心思路是在代码提交(PR)阶段就识别···

★ 133 评分 2026-05-12
skill-up 开源

给 Agent 技能做体检,自动评估并迭代优化,让智能体更靠谱

skill-up 是阿里巴巴开源的一款 Agent Skills 评估与进化工具,专门用于测试和提升 AI 智能体技能的···

★ 1088 评分 2026-05-09
agent-skills-eval 开源

跑一遍测试,就知道你的 AI 技能行不行

agent-skills-eval 是一个用于测试 AI 智能体技能(Agent Skills)的测试运行器,灵感来自 agentsk···

★ 795 评分 2026-05-06
Semia 开源

装 AI 技能前先扫一遍,把危险命令挡在门外

Semia 是一个面向 AI Agent 技能(skills)的安全审计工具,用 Python 编写。随着 Claude Code、Co···

★ 609 评分 2026-05-05
Workspace-Bench 开源

在真实文件海洋中,检验智能体自我进化能力

Workspace-Bench 是一个用于评测自我进化智能体在真实大规模文件工作空间中表现的基准测试平台。它···

★ 76 评分 2026-05-04
awesome-ai-testing 开源

一页清单看懂 AI 测试工具,选型不再东拼西凑

awesome-ai-testing 是一个面向 QA 工程师的精选资源清单,系统整理了 AI 驱动的测试工具、框架与学···

★ 117 评分 2026-05-02
workshop 开源

让编码代理自己写评测、跑评测,回归验证不再靠手测

workshop 是一个面向 AI 编码代理的评测工具,帮助开发者让 coding agent 具备编写和运行 agent 评···

★ 1100 评分 2026-05-01
evals 开源

像写单测一样评测大模型,改提示词不再靠感觉

evals 是一个用 TypeScript 编写的开源评测框架,目标是让开发者像写单元测试一样编写和运行大模型···

★ 137 评分 2026-04-30
iFixAi 开源

120秒快速审计AI Agent,确保它按预期干活

iFixAi 是一个面向 AI Agent 的独立审计工具,旨在快速回答 AI Agent 经济中最关键的问题:Agent 是···

★ 15704 评分 2026-04-27
future-agi 开源

一站式评估、观测和优化你的 AI 智能体,提升可靠性和安全性。

Future AGI 是一个开源的端到端平台,用于评估、观测和优化 LLM 及 AI 智能体应用。它集成了追踪、···

★ 2081 评分 2026-04-23
gbrain-evals 开源

给 AI Agent 建可复现的自动评分,改提示词不怕退化

gbrain-evals 是一个用 TypeScript 编写的开源评测框架,面向 AI Agent 与工具调用场景,帮助开发者···

★ 429 评分 2026-04-22
VEFX-Bench 开源

给视频编辑和特效模型打分,选型不再靠感觉

VEFX-Bench 是一个面向通用视频编辑与视觉特效(VFX)的综合性基准测试项目。它旨在解决视频编辑和···

★ 175 评分 2026-04-20
ADR 开源

给企业 AI 智能体装上安全监控与威胁拦截系统

ADR 是一个面向企业级 AI 智能体的安全防护框架,由 Uber 部署并开源。它解决的核心问题是:随着 A···

★ 1585 评分 2026-04-19
ClawBench 开源

测测你的浏览器AI智能体,日常任务完成得怎么样

ClawBench 是一个开源的浏览器 AI 智能体基准测试项目,专注于评估 AI 智能体在真实日常任务中的表···

★ 873 评分 2026-04-10
ParseBench 开源

给AI文档解析打分,选型不踩坑

ParseBench 是一个面向 AI Agent 的文档解析基准测试工具,旨在解决 LLM 应用中文档解析能力难以量···

★ 591 评分 2026-04-10
llm-as-a-verifier 开源

给任意 agent 加个 LLM 裁判,不训练也能细粒度打分

llm-as-a-verifier 是一个通用型验证框架,用大语言模型充当智能体行为的裁判,无需额外训练即可对···

★ 3275 评分 2026-04-09
agent-opfor 开源

给AI智能体做安全体检,模拟攻击找漏洞

agent-opfor 是一个开源的 AI 智能体对抗模拟工具,专注于对 AI 智能体和 MCP 服务器进行红队测试。···

★ 581 评分 2026-04-06
AgentHound 开源

像 BloodHound 一样测绘 AI 智能体攻击路径,快速发现安全弱点。

AgentHound 是一个针对 AI 智能体基础设施的进攻性安全框架,旨在解决 AI 代理、MCP 服务、A2A 协议···

★ 441 评分 2026-04-05
llm-coding-benchmark 开源

自动跑编码题,横向比出哪个大模型写代码更强

llm-coding-benchmark 是一个用 Python 编写的轻量级评测工具,专门用来横向对比主流开源与商用大模···

★ 338 评分 2026-04-05
Video-MME-v2 开源

评测视频大模型,从看懂片段到理解长视频全场景。

Video-MME-v2 是一个面向全面视频理解的新一代评测基准项目。它旨在解决现有视频理解基准在任务多样···

★ 370 评分 2026-04-03
hol-guard 开源

给 AI 代理装杀毒软件,实时拦截危险操作和攻击

hol-guard 是一个面向 AI 智能体的开源防病毒工具,旨在解决 AI 代理在运行时面临的多类安全威胁。···

★ 670 评分 2026-03-28
Awesome-Embodied-AI-Safety 开源

一网打尽具身AI安全研究,500+论文系统梳理

这是一个关于具身AI安全领域的综述性开源项目,汇集了500多篇相关论文,系统梳理了具身AI在感知、认···

★ 143 评分 2026-03-27
eva 开源

一套框架,全面衡量语音代理表现,快速定位短板。

eva 是一个用于评估语音代理(Voice Agents)的全新端到端框架。它解决的核心问题是:语音代理系统···

★ 219 评分 2026-03-24
mcp-observatory 开源

在智能体接入前,自动给 MCP 服务器做安全体检

mcp-observatory 是一个面向 MCP(模型上下文协议)服务器的 CI 原生安全测试工具。它解决了 AI 智···

★ 139 评分 2026-03-19