coir
开源
给代码检索模型做全面体检,一张卷子测出真实力。
coir 是一个面向代码信息检索(Code Information Retrieval)的综合基准测试集,发表于 ACL 2025 M···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
coir
开源
给代码检索模型做全面体检,一张卷子测出真实力。
coir 是一个面向代码信息检索(Code Information Retrieval)的综合基准测试集,发表于 ACL 2025 M···
TSB-AD
开源
一套接口跑通时序异常检测算法与数据集评测
TSB-AD 是一个面向时间序列异常检测的开源基准与工具箱,提供统一的算法实现、数据集加载和评测流程···
Video-MME
开源
测一测你的多模态模型,视频理解能力到底行不行
Video-MME 是首个专门用于评估多模态大语言模型(LLMs)在视频分析任务中表现的综合基准测试集,发···
ICSFSurvey
开源
一图看懂大模型自我修正与推理增强全领域
ICSFSurvey 是一个聚焦大语言模型自我修正与推理增强技术的开源综述项目。它系统梳理了 Self-Corre···
MixEval
开源
动态更新评测数据,让模型分数不再虚高
MixEval 是一个大语言模型评估套件,提供动态更新的评测数据集和标准化评估流程。它解决传统静态基···
TaskMeAnything
开源
自动生成多模态任务,全面评估模型能力
TaskMeAnything是一个用于多模态语言模型(如视觉语言模型)的任务生成与模型评估系统,发表于Neur···
RWKU
开源
给大模型做“记忆清除手术”,并验证效果是否达标
RWKU是一个针对大语言模型(LLM)的“知识遗忘”基准测试框架,源自NeurIPS 2024论文。它解决的是大···
VelLMes-AI-Deception-Framework
开源
用AI伪装成AI,让攻击者自投罗网
VelLMes 是一个构建交互式、动态且逼真的 LLM 蜜罐的开源框架,旨在通过部署伪装成真实 AI 服务的诱···
AdvUnlearn
开源
对抗训练让概念擦除更抗攻击,生成更安全
AdvUnlearn 是 NeurIPS'24 论文《Defensive Unlearning with Adversarial Training for Robust Con···
MisguidedAttention
开源
用误导性提示词,测出大模型推理的短板
MisguidedAttention 是一个专门用于挑战大语言模型推理能力的提示词集合,旨在测试模型在面对误导性···
xFinder
开源
用AI自动评估AI,让模型评测更可靠、更省力
xFinder是一个用于大语言模型评估的自动化评测框架,核心思路是让LLM本身充当评估器,以替代传统的···
MarkLLM
开源
给AI文本打上隐形烙印,一键识别机器生成内容
MarkLLM 是一个面向大语言模型(LLM)水印技术的开源工具包,在 EMNLP 2024 上作为 Demo 发布。它旨···
awesome-security-for-ai
开源
一站式导航AI安全工具,快速选型不踩坑
这是一个精选列表,收录了用于保护AI系统安全的产品与资源,涵盖开源和商业方案,并附带一张采用CC···
fusion_bench
开源
一站式评估和实现深度模型融合,快速对比多种融合算法效果
FusionBench 是一个专注于深度模型融合的综合性基准测试与工具包。它解决了深度学习领域中多个独立···
S-Eval
开源
一键自动化评估大模型安全,覆盖多风险场景
S-Eval 是一个面向大型语言模型(LLM)的自动化、综合性安全评估框架。它旨在解决当前 LLM 安全评估···
crab
开源
跨环境测试你的AI智能体,看它真实干活行不行
CRAB 是一个面向多模态语言模型智能体的跨环境基准测试框架,由 CAMEL-AI 团队开发。它旨在解决当前···
bergen
开源
给RAG系统做体检,量化对比谁更强
bergen 是一个专注于 RAG(检索增强生成)系统的基准测试库。它解决了 RAG 应用开发中缺乏标准化评···
LLM-for-misinformation-research
开源
一键速览大模型打假研究全景,找论文不迷路
这是一个关于利用(多模态)大语言模型进行 misinformation(错误信息)研究的论文列表项目。它系统···
HacxGPT-Jailbreak-prompts
开源
一键解锁 AI 模型隐藏能力,突破限制自由对话
HacxGPT-Jailbreak-prompts 是一个专门收集和分享 AI 模型越狱提示词(Jailbreak prompts)的开源项···
CS-Eval
开源
给网络安全大模型打分,快速找出安全能力短板
CS-Eval 是一个专为网络安全领域基础模型或大语言模型设计的综合评估套件。它解决的核心问题是:当···
awesome-ai-leaderboard
开源
一榜在手,AI模型强弱全看透
这是一个精选AI领域排行榜资源的开源列表,旨在帮助开发者、研究者和产品经理快速找到各类AI模型、···
bigcodebench
开源
用真实编程难题,测出大模型代码能力的真实天花板
BigCodeBench 是一个面向代码生成任务的基准测试框架,旨在评估和推动大语言模型在真实编程场景中的···
awesome-language-model-analysis
开源
一份论文清单,帮你快速摸清大模型分析的研究脉络。
这是一个聚焦大语言模型(LLM)理论与实证分析的论文清单项目。它系统整理了关于语言模型学习行为、···
prometheus-eval
开源
用 Prometheus 或 GPT-4 自动给 LLM 回复打分,快速筛选最佳模型。
Prometheus-Eval 是一个用于评估大语言模型(LLM)回复质量的工具,基于 Prometheus 模型和 GPT-4 ···