AI-Surface
开源
PR 阶段扫出 AI 资产与风险,离线免费
AI-Surface 是一个面向应用代码的 AI 攻击面发现与治理工具,核心思路是在代码提交(PR)阶段就识别···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
AI-Surface
开源
PR 阶段扫出 AI 资产与风险,离线免费
AI-Surface 是一个面向应用代码的 AI 攻击面发现与治理工具,核心思路是在代码提交(PR)阶段就识别···
skill-up
开源
给 Agent 技能做体检,自动评估并迭代优化,让智能体更靠谱
skill-up 是阿里巴巴开源的一款 Agent Skills 评估与进化工具,专门用于测试和提升 AI 智能体技能的···
agent-skills-eval
开源
跑一遍测试,就知道你的 AI 技能行不行
agent-skills-eval 是一个用于测试 AI 智能体技能(Agent Skills)的测试运行器,灵感来自 agentsk···
Semia
开源
装 AI 技能前先扫一遍,把危险命令挡在门外
Semia 是一个面向 AI Agent 技能(skills)的安全审计工具,用 Python 编写。随着 Claude Code、Co···
Workspace-Bench
开源
在真实文件海洋中,检验智能体自我进化能力
Workspace-Bench 是一个用于评测自我进化智能体在真实大规模文件工作空间中表现的基准测试平台。它···
awesome-ai-testing
开源
一页清单看懂 AI 测试工具,选型不再东拼西凑
awesome-ai-testing 是一个面向 QA 工程师的精选资源清单,系统整理了 AI 驱动的测试工具、框架与学···
workshop
开源
让编码代理自己写评测、跑评测,回归验证不再靠手测
workshop 是一个面向 AI 编码代理的评测工具,帮助开发者让 coding agent 具备编写和运行 agent 评···
evals
开源
像写单测一样评测大模型,改提示词不再靠感觉
evals 是一个用 TypeScript 编写的开源评测框架,目标是让开发者像写单元测试一样编写和运行大模型···
iFixAi
开源
120秒快速审计AI Agent,确保它按预期干活
iFixAi 是一个面向 AI Agent 的独立审计工具,旨在快速回答 AI Agent 经济中最关键的问题:Agent 是···
future-agi
开源
一站式评估、观测和优化你的 AI 智能体,提升可靠性和安全性。
Future AGI 是一个开源的端到端平台,用于评估、观测和优化 LLM 及 AI 智能体应用。它集成了追踪、···
gbrain-evals
开源
给 AI Agent 建可复现的自动评分,改提示词不怕退化
gbrain-evals 是一个用 TypeScript 编写的开源评测框架,面向 AI Agent 与工具调用场景,帮助开发者···
VEFX-Bench
开源
给视频编辑和特效模型打分,选型不再靠感觉
VEFX-Bench 是一个面向通用视频编辑与视觉特效(VFX)的综合性基准测试项目。它旨在解决视频编辑和···
ADR
开源
给企业 AI 智能体装上安全监控与威胁拦截系统
ADR 是一个面向企业级 AI 智能体的安全防护框架,由 Uber 部署并开源。它解决的核心问题是:随着 A···
ClawBench
开源
测测你的浏览器AI智能体,日常任务完成得怎么样
ClawBench 是一个开源的浏览器 AI 智能体基准测试项目,专注于评估 AI 智能体在真实日常任务中的表···
ParseBench
开源
给AI文档解析打分,选型不踩坑
ParseBench 是一个面向 AI Agent 的文档解析基准测试工具,旨在解决 LLM 应用中文档解析能力难以量···
llm-as-a-verifier
开源
给任意 agent 加个 LLM 裁判,不训练也能细粒度打分
llm-as-a-verifier 是一个通用型验证框架,用大语言模型充当智能体行为的裁判,无需额外训练即可对···
agent-opfor
开源
给AI智能体做安全体检,模拟攻击找漏洞
agent-opfor 是一个开源的 AI 智能体对抗模拟工具,专注于对 AI 智能体和 MCP 服务器进行红队测试。···
AgentHound
开源
像 BloodHound 一样测绘 AI 智能体攻击路径,快速发现安全弱点。
AgentHound 是一个针对 AI 智能体基础设施的进攻性安全框架,旨在解决 AI 代理、MCP 服务、A2A 协议···
llm-coding-benchmark
开源
自动跑编码题,横向比出哪个大模型写代码更强
llm-coding-benchmark 是一个用 Python 编写的轻量级评测工具,专门用来横向对比主流开源与商用大模···
Video-MME-v2
开源
评测视频大模型,从看懂片段到理解长视频全场景。
Video-MME-v2 是一个面向全面视频理解的新一代评测基准项目。它旨在解决现有视频理解基准在任务多样···
hol-guard
开源
给 AI 代理装杀毒软件,实时拦截危险操作和攻击
hol-guard 是一个面向 AI 智能体的开源防病毒工具,旨在解决 AI 代理在运行时面临的多类安全威胁。···
Awesome-Embodied-AI-Safety
开源
一网打尽具身AI安全研究,500+论文系统梳理
这是一个关于具身AI安全领域的综述性开源项目,汇集了500多篇相关论文,系统梳理了具身AI在感知、认···
eva
开源
一套框架,全面衡量语音代理表现,快速定位短板。
eva 是一个用于评估语音代理(Voice Agents)的全新端到端框架。它解决的核心问题是:语音代理系统···
mcp-observatory
开源
在智能体接入前,自动给 MCP 服务器做安全体检
mcp-observatory 是一个面向 MCP(模型上下文协议)服务器的 CI 原生安全测试工具。它解决了 AI 智···