One-Eval
开源
用 agent 自动跑完 LLM 评测全流程,省去手工配数据与打分
One-Eval 是一个面向大语言模型评测的自动化系统,核心思路是用 agent 来驱动整个评测流程。传统 L···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
One-Eval
开源
用 agent 自动跑完 LLM 评测全流程,省去手工配数据与打分
One-Eval 是一个面向大语言模型评测的自动化系统,核心思路是用 agent 来驱动整个评测流程。传统 L···
empirica
开源
给 AI 装上可靠性仪表盘,让每次输出可测量、可拦截、可信赖。
empirica 是一个面向 AI 智能体与工作流的可靠性测量与保障框架,旨在解决 LLM 应用中的幻觉、记忆···
SemBench
开源
给语义查询引擎跑分,选型不再靠猜
SemBench 是一个用于评测语义查询处理引擎的开源基准测试工具。它针对知识图谱、图数据库和语义数据···
Awesome-KV-Cache-Optimization
开源
一页看懂 KV Cache 优化全景,快速选对推理加速方案
这是一个面向大模型推理服务的 KV Cache 优化综述仓库,对应 ACL 2026 论文《Towards Efficient La···
BEAM
开源
百万级上下文下,科学评测并增强大模型长期记忆
BEAM 是一个针对大语言模型长期记忆能力的基准测试与增强框架,由 ICLR 2026 论文提出。它解决了现···
WormGPT
开源
模拟攻击场景,测试大模型安全漏洞
WormGPT 是一个实验性 AI 项目,仅用于教育、网络安全研究和防御性测试。它旨在帮助开发者、研究人···
LLM4Pentest
开源
让大模型真刀真枪打渗透,测出真实攻防水平
LLM4Pentest 是一个面向大语言模型渗透测试能力评测的开源项目,主要解决如何系统化衡量 LLM 在真实···
lmring
开源
自建 LLM 竞技场,让真实用户投票选出最强模型
lmring 是一个开源的、可自托管的 LLM 竞技场(Arena)平台,旨在解决大模型评测中缺乏真实用户反馈···
next-evals-oss
开源
给 AI 出 Next.js 考题,看它到底会不会写
next-evals-oss 是 Vercel 开源的评测套件,专门用来衡量 AI 模型对 Next.js(覆盖到 15.5.6 版本)···
every_eval_ever
开源
把散落各处的 AI 评测结果统一成可比较的公共数据库
Every Eval Ever 是一个面向 AI 评测领域的共享元数据规范与众包评测数据库。它要解决的核心问题是···
Rules.txt
开源
用指令集撬开AI黑盒,审计推理与偏见
Rules.txt 是一个针对大型语言模型(LLM)的对齐与越狱(jailbreak)研究项目,提供一套指令集,用···
heretic
开源
一键去除模型审查,解锁无限制回答
heretic 是一个针对语言模型的全自动审查移除工具,旨在消除模型输出中的内容限制。它通过分析模型···
openai-guardrails-js
开源
给 LLM 应用加一道输入输出安检门,拦截越狱与敏感内容
openai-guardrails-js 是 OpenAI 官方 Guardrails 的 TypeScript/JavaScript 实现,用于在 LLM 应用···
memorybench
开源
一套基准跑遍对话记忆与 RAG,选型不再靠拍脑袋
memorybench 是一个面向对话记忆与 RAG 系统的统一评测基准框架,用 TypeScript 编写。它要解决的问···
GenExam
开源
用跨学科考题给文生图模型打分,测出真实知识水平。
GenExam 是一个面向多学科文生图模型的评测基准,旨在系统评估文本到图像生成模型在跨学科知识理解···
meta-agents-research-environments
开源
在动态仿真环境中,逼真考验AI智能体的适应力与决策力。
Meta Agents Research Environments 是一个用于评估 AI 智能体的动态仿真平台。与静态基准测试不同···
Auditor
开源
自动化安全审计,快速发现项目漏洞与风险
Auditor 是一个专注于安全审计的工具,其核心定位是作为 TheAuditor 的发布渠道。TheAuditor 旨在帮···
FDAbench
开源
给数据智能体打分,看谁更会分析异构数据
FDABench 是一个用于评估数据智能体(Data Agents)在异构数据上执行分析查询能力的基准测试平台,···
Gym
开源
把模型丢进环境里跑,边评测边改进智能体
Gym 是一个用于评估和改进模型与智能体的环境框架,核心思路是把评测从静态数据集搬到可交互的环境···
Awesome-LLM-Reasoning-Failures
开源
一库看懂大模型推理翻车现场与原因
这是一个围绕《Large Language Model Reasoning Failures》论文整理的开源资源库,系统收集大语言模···
GitTaskBench
开源
用真实仓库任务,测出代码代理的真实水平
GitTaskBench 是一个面向真实世界代码代理的仓库级基准测试平台,旨在全面评估 AI 编程助手在复杂软···
ASTRA
开源
实战对抗攻击,一键测出 AI 模型的安全漏洞
ASTRA 是亚马逊 Nova AI 安全挑战赛的冠军项目,作为攻击方团队,在实时对抗评估中击败了来自全球顶···
Omni-SafetyBench
开源
给音视频大模型做安全体检,发现隐藏风险
Omni-SafetyBench 是一个用于评估音视频大语言模型(AV-LLMs)安全性的基准测试工具,源自 ACM MM ···
harbor
开源
在真实终端里给智能体打分,让改进有据可依
Harbor 是一个用于评估和改进智能体(agents)的框架,主要面向终端环境下的任务。它提供了一套标准···