Cognitive-Core-Skills 是评测安全领域的开源项目,由 eli-labz 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 158。
项目仍在小幅维护中,最近一次代码更新于 2026-09-18。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:AI模型能力评估与横向对比。同类可对比的替代方案包括 BIG-bench、HELM、OpenAI Evals。

一套标准,量化AI的认知核心技能,让模型能力可比较。
这是一个面向大模型、小模型、AI智能体及世界模型的认知核心技能通用分类体系。它不依赖特定行业,提供了一套涵盖感知、记忆、推理、规划、行动、验证、学习和治理等八大类别的标准化框架。项目包含JSON Schema定义、159张技能卡片、基准测试以及持续集成(CI)支持,旨在为AI系统提供可量化、可评估的认知能力衡量标准。它解决了当前AI能力评估碎片化、缺乏统一标准的问题,使得不同模型和智能体之间的认知能力可以横向比较,并为AI安全与治理提供基础。核心能力包括:定义清晰的技能分类法、提供结构化的技能描述、构建评估基准以及支持自动化测试。
BIG-bench、HELM、OpenAI Evals
Cognitive-Core-Skills 是评测安全领域的开源项目,由 eli-labz 开发,是 2026 年新上线的项目。
它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 158。
项目仍在小幅维护中,最近一次代码更新于 2026-09-18。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:AI模型能力评估与横向对比。同类可对比的替代方案包括 BIG-bench、HELM、OpenAI Evals。
akto
开源
给 AI 应用做安全体检,防提示注入和数据泄露
Akto is the fastest growing AI Security platform for your teams to secure AI agents,···
XSafeClaw
开源
给 AI 智能体装上安全盾,自动红队测试找漏洞
Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University
fast-llm-security-guardrails
开源
给 AI Agent 加一道快速安全闸门,防提示注入和隐私泄露
The fastest Trust Layer for AI Agents
deepteam
开源
自动模拟越狱攻击,提前测出 LLM 安全漏洞
DeepTeam is a framework to red team LLMs and AI agents.