AlignBench
开源
测中文大模型对齐能力,多维打分看清模型强弱
AlignBench 是一个专为中文大模型设计的多维度对齐评测基准,由智谱AI推出并发表于ACL 2024。它旨在···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
AlignBench
开源
测中文大模型对齐能力,多维打分看清模型强弱
AlignBench 是一个专为中文大模型设计的多维度对齐评测基准,由智谱AI推出并发表于ACL 2024。它旨在···
MMMU
开源
用大学级多模态考题,测出 AI 的真实专家水平
MMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能···
InfiniteBench
开源
测出大模型在10万字长文本下的真实水平
InfiniteBench 是论文《∞Bench: Extending Long Context Evaluation Beyond 100K Tokens》的官方代···
athina-evals
开源
给 LLM 响应做质检,快速发现模型输出问题
athina-evals 是一个用于评估大语言模型(LLM)生成响应的 Python SDK。它解决了开发者在构建 LLM ···
hallucination-index
开源
测出哪个AI最会胡说八道,选模型不再踩坑
这是一个评估和排名主流大语言模型(LLM)幻觉倾向的开源项目。它针对常见的任务类型(如问答、摘要···
inspect_ai
开源
统一跑大模型评测,结果可复现可回放
Inspect 是英国人工智能安全研究所(UK AISI)开源的大模型评测框架,用 Python 编写,目标是让开发···
UHGEval
开源
一键测出大模型胡说八道,量化幻觉风险
UHGEval 是一个面向大语言模型幻觉评估的用户友好型框架,由 ACL 2024 论文提出。它旨在解决 LLM 在···
LooGLE
开源
测长文本模型真实力,看它能否抓住长文关键
LooGLE 是 ACL 2024 发布的面向长上下文语言模型的评测基准,旨在系统评估模型对超长文档的理解与生···
hallucination-leaderboard
开源
看哪个大模型摘要最不容易瞎编
hallucination-leaderboard 是一个用于评估大语言模型在短文档摘要任务中产生幻觉(即生成与原文不···
FollowBench
开源
用多级细粒度约束,精准测出大模型指令遵循的真实水平
FollowBench 是一个用于评估大型语言模型(LLM)遵循细粒度指令能力的基准测试集,由 ACL 2024 论文···
tonic_validate
开源
给RAG应用打分,量化回答质量,快速定位问题
tonic_validate 是一个用于评估检索增强生成(RAG)应用响应质量的 Python 库。它提供了一套标准化···
HallusionBench
开源
测出多模态模型的视觉幻觉,看清谁在瞎猜
HallusionBench 是一个针对多模态大语言模型(如 GPT-4V、LLaVA-1.5)的图像上下文推理基准测试集,···
llm-jp-eval
开源
一键跑通日语 LLM 多任务评测,结果可对比
llm-jp-eval 是日本 LLM-jp 组织开发的大语言模型评测工具,专门面向日语能力评估。它把多个日语 N···
XLingEval
开源
测测大模型用不同语言回答医疗问题的靠谱程度
XLingEval 是一个用于跨语言评估大型语言模型(LLM)在医疗健康查询场景中表现的开源工具包,源自同···
Diffusion-MU-Attack
开源
快速攻破遗忘扩散模型,测出安全漏洞
Diffusion-MU-Attack 是 ECCV'24 论文的官方实现,针对安全导向的“遗忘学习”(unlearned)扩散模···
OSWorld
开源
让 AI 学会像人一样操作电脑,真实环境跑分评测
OSWorld 是一个用于评估多模态 AI 智能体在真实计算机环境中执行开放式任务能力的基准测试平台,发···
DSG
开源
用场景图细粒度检验文生图,让评估更靠谱
DSG(Davidsonian Scene Graph)是一个用于文本到图像生成评估的开源项目,发表于ICLR 2024。它针对···
MathVista
开源
测测AI看图算数行不行,一套基准见分晓
MathVista 是一个专注于视觉数学推理的开源项目,提供数据集、代码和评估工具,用于测试和提升 AI ···
benchmarks
开源
跑分选型,用数据说话,避免MLOps工具踩坑。
这是一个用于主流AI模型上MLOps引擎、框架和语言性能对比的基准测试项目。它通过统一的测试脚本和标···
Woodpecker
开源
给多模态模型装上纠错器,让AI描述图片不再瞎编。
Woodpecker 是一个针对多模态大语言模型(MLLM)的幻觉纠正工具。它通过训练一个轻量级的纠正器,在···
watchtower
开源
扫描AI模型漏洞,守护AI供应链安全
AIShield Watchtower 是一个用于AI模型洞察与漏洞扫描的开源工具,旨在帮助开发者和安全团队深入理···
ANeurIPS2024_SPV-MIA
开源
用自提示校准精准识别训练数据,评估大模型隐私泄露风险
SPV-MIA 是 NeurIPS 2024 收录的针对微调大语言模型的成员推理攻击方法。它解决的核心问题是:当大···
LLM-Agent-Paper-List
开源
一键掌握LLM智能体领域核心论文,快速入门不迷路
这是一个关于大语言模型智能体(LLM Agent)的论文清单,源自一篇发表在《中国科学:信息科学》封面···
spelltest
开源
用 AI 模拟用户,自动测试你的 LLM 应用,提前发现坑
spelltest 是一个面向 LLM 应用的 AI-to-AI 测试与模拟框架,旨在解决大语言模型应用在开发、测试和···