ResearchClawBench
开源
给AI科研智能体打分,从复现实验到发现新知识
ResearchClawBench 是一个用于评估 AI 智能体在自动化科研任务中能力的基准测试平台,覆盖从“重新···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
ResearchClawBench
开源
给AI科研智能体打分,从复现实验到发现新知识
ResearchClawBench 是一个用于评估 AI 智能体在自动化科研任务中能力的基准测试平台,覆盖从“重新···
ClawdSecbot
开源
给 AI Bot 装上实时安全盾牌,防注入、防攻击、可审计。
ClawdSecbot 是一款面向 AI Bot 应用的专业安全防护工具,基于 Go 语言开发。它主要解决 AI 应用面···
claw-eval
开源
接入模型跑人工校验任务,快速量化智能体能力
claw-eval 是一个面向 LLM 智能体(LLM as agents)的评测框架(evaluation harness),核心目标是···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
XSafeClaw 是复旦大学开源的多智能体安全评测平台,专注于检测和防御针对 LLM 智能体的安全威胁。它···
myclaw-bench
开源
给 OpenClaw 智能体打分,45 个任务看清实力
myclaw-bench 是一个针对 OpenClaw 智能体的基准测试项目,由 MyClaw.ai 提供支持。它旨在解决 AI ···
AutoControl-Arena
开源
自动给AI找茬,提前暴露危险行为
AutoControl-Arena 是一个面向前沿 AI 的风险自动发现平台,旨在系统性地评估和暴露大语言模型在自···
valqore
开源
给 AI 运维操作装上安全气囊,防止误操作搞垮云环境
valqore 是一个面向 AI 驱动云和 Kubernetes 运维的安全护栏框架。它解决的是当 AI 或自动化脚本直···
Aegis
开源
给 AI 代理加装安全护栏,零代码实现审计、审批和紧急停机。
Aegis 是一个面向 AI 代理的运行时策略执行引擎,旨在解决 AI 代理在自主执行任务时缺乏安全管控的···
agentseal
开源
给 AI 智能体做安全体检,防投毒防注入
AgentSeal 是一个面向 AI 智能体的安全工具包,主要解决 AI Agent 在运行时面临的安全风险,包括恶···
evalstats
开源
小样本评测也能算出模型差异是否真实
evalstats 是一个面向 AI 评测场景的 Python 统计推断库,专门解决小样本条件下模型对比与评测结论···
ATM-Bench
开源
测测AI能否记住你4年前的琐事
ATM-Bench 是一个用于评估 AI 智能体长期个性化记忆能力的基准测试平台。它解决了当前 AI 在跨长时···
evals-skills
开源
跟着课程搭 LLM 评测体系,把主观质量变成可复现指标
evals-skills 是面向 AI 评测领域的技能集合,配套《AI Evals For Engineers & PMs》课程使用,帮助···
lintlang
开源
上线前扫一遍,AI 智能体配置不踩坑
lintlang 是一个针对 AI 智能体配置的静态分析工具,专注于在运行时之前发现工具描述模糊、缺少停止···
arksim
开源
模拟真实用户对话,上线前自动揪出智能体错误。
arksim 是一个用于对话式 AI 智能体的开源评估与模拟测试框架。它通过模拟真实用户与智能体进行交互···
node9-proxy
开源
给AI代理装上安全阀,敏感操作先审批再执行
node9-proxy 是一个面向 AI Agent 时代的执行安全层,为自主 AI 代理提供确定性的“Sudo”治理和审···
Jailbreak-Foundry
开源
把越狱论文变成可跑的攻击测试,实时更新基准
Jailbreak-Foundry 是一个将越狱研究论文转化为可运行攻击与基准测试的系统,旨在解决 AI 安全研究···
guardian-sdk
开源
给 AI 应用装上安全气囊,防住提示注入和越狱攻击。
Guardian SDK 是 Ethicore Engine™ 的开源组件,一个专注于 AI 安全、伦理与合规的防护平台。它通···
agentevals
开源
用追踪数据评估智能体,无需绑定框架
agentevals 是一个与框架无关的 LLM 智能体评估解决方案,它基于 OpenTelemetry 追踪数据来工作。该···
AutomationBench
开源
测测你的AI智能体,能不能搞定真实业务流程
AutomationBench 是一个用于评估 AI 智能体在真实业务流程中表现的基准测试框架。它由 Prime Intel···
EnterpriseRAG-Bench
开源
用真实企业文档评测你的RAG系统,告别通用测试集偏差
EnterpriseRAG-Bench 是一个专为企业内部文档场景设计的 RAG(检索增强生成)评测基准与数据集。它···
pi-guardrails
开源
给 AI 代理装刹车,危险命令和环境文件先拦下
pi-guardrails 是给 Pi 编程代理加的一层安全钩子(security hooks)。当 AI 代理自动执行命令、读···
Aegis
开源
给AI代理装上监控摄像头,实时盯住它的每一个动作。
Aegis 是一个面向 AI 智能体的开源端点检测与响应(EDR)工具,专门监控自主 AI 代理的进程、文件、···
www-project-agent-memory-guard
开源
给AI智能体记忆加把锁,防投毒防操控
Agent Memory Guard 是 OWASP 基金会下的一个开源项目,专注于解决 AI 智能体(Agent)的记忆安全问···
humanbound
开源
给 AI 智能体找茬,自动发现安全漏洞和逻辑缺陷。
Humanbound 是一个开源的对抗性测试引擎,为 AI 智能体提供 SDK 和命令行工具,用于发现和修复智能···