SpatialEval
开源
测出大模型空间推理真实水平,选模型不再靠猜
SpatialEval 是一个用于评估多模态大语言模型(MLLMs)和纯语言模型(LLMs)空间推理能力的基准测试···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
SpatialEval
开源
测出大模型空间推理真实水平,选模型不再靠猜
SpatialEval 是一个用于评估多模态大语言模型(MLLMs)和纯语言模型(LLMs)空间推理能力的基准测试···
vulnhuntr
开源
让LLM自动帮你扫代码找漏洞,零样本开箱即用
vulnhuntr 是一个利用大型语言模型进行零样本漏洞发现的开源工具。它解决的是传统静态分析工具依赖···
Awesome-Video-Reasoning-Landscape
开源
一张图看懂视频推理,快速上手最新研究
这是一个关于视频推理领域的开源综述项目,旨在系统梳理视频推理的最新任务、范式和基准。它解决了···
confabulations
开源
测出RAG系统胡说八道,用人工验证问答对量化幻觉
confabulations 是一个用于评估 RAG(检索增强生成)系统幻觉(或称虚构)问题的文档型基准测试集。···
Modality-Integration-Rate
开源
量化视觉-语言模型跨模态对齐,诊断融合短板
Modality-Integration-Rate 是 ICCV 2025 论文的官方代码,提出了一种名为“模态整合率”(Modalit···
evaluation-guidebook
开源
学透 LLM 评估,避开 benchmark 陷阱,科学选模型。
这是一个关于大语言模型评估的指南仓库,源自 Hugging Face 团队在维护 Open LLM Leaderboard 和设···
rhesis
开源
让领域专家给AI当教练,用标注反馈驱动智能体快速进化
Rhesis 是一个面向 AI 团队的协作层基础设施,旨在连接领域专家与工程师,共同优化智能体(Agent)···
ScienceAgentBench
开源
用102个真实科研任务,严格检验AI科学智能体成色
ScienceAgentBench 是一个面向数据驱动科学发现的语言智能体评估基准,由加州大学等机构在 ICLR 20···
inspect_evals
开源
一行命令跑齐大模型能力与安全评测
inspect_evals 是英国 AI 安全研究院(UK AISI)为 Inspect AI 框架提供的官方评测集合,解决大模型···
Deco
开源
让多模态模型少说瞎话,动态纠错解码即插即用
Deco 是一个针对多模态大语言模型(MLLM)的幻觉缓解工具,核心方法为动态校正解码(Dynamic Corre···
WorfBench
开源
给AI工作流生成能力打分,让模型编排更靠谱
WorfBench 是一个用于评测和生成智能体工作流(Agentic Workflow)的基准测试框架,由 ICLR 2025 论···
VideoGen-Eval
开源
给视频生成模型打分,自动评测多维度质量
VideoGen-Eval 是一个基于智能体的视频生成评估系统,旨在解决视频生成模型评测标准缺失、评估维度···
llm_chess
开源
让大模型下棋,测出推理和守规则的真实水平
llm_chess 是一个通过模拟国际象棋对局来评测大语言模型推理与指令遵循能力的开源项目。它不依赖传···
MGDebugger
开源
像调试传统代码一样调试大模型,快速定位推理错误根因。
MGDebugger 是一个面向大语言模型的多粒度调试工具,源自 ICSE 2026 论文。它解决 LLM 推理过程中错···
langfair
开源
给LLM做公平性体检,防偏见翻车
LangFair 是一个用于大语言模型(LLM)偏见与公平性评估的 Python 库,专注于用例级别的评估。它解···
ai-llm-comparison
开源
并排对比所有AI模型,快速选出最适合你的那个
这是一个用于对比各类AI模型的网站,旨在帮助用户直观了解不同大语言模型的能力差异。它解决了AI模···
DSBench
开源
测测你的AI助手能不能像数据科学家一样干活
DSBench 是一个面向数据科学智能体的基准测试框架,旨在评估大语言模型驱动的智能体在真实数据科学···
XRAG
开源
给 RAG 系统做全面体检,量化每个核心模块的真实实力
XRAG 是一个专注于评估高级检索增强生成(RAG)系统中核心组件模块的基准测试工具。它解决了当前 R···
llm-leaderboard
开源
一站式对比LLM基准分数和价格,快速选型
这是一个已废弃的LLM基准测试排行榜项目,曾汇总各大语言模型的基准测试分数和提供商价格。它旨在帮···
Awesome-Multimodal-LLM-for-Code
开源
一页看全多模态代码生成论文与数据集
这是一个面向多模态代码生成研究的论文清单与资源汇总项目,对应 TMLR 2026 论文《Multimodal Larg···
llamator
开源
给聊天机器人找茬,提前揪出安全漏洞
llamator 是一个用于测试聊天机器人和生成式 AI 系统的红队(Red Teaming)Python 框架。它主要解决···
awesome_LLM-harmful-fine-tuning-pape···
开源
一页看全有害微调攻防论文,快速摸清 LLM 安全风险
这是一个聚焦大语言模型有害微调攻击的论文综述仓库,对应一篇被 ACM Computing Surveys 收录的综述···
model-leaderboard
开源
目标检测模型谁最强?排行榜按小大物体直接比。
model-leaderboard 是一个面向目标检测模型的评测排行榜工具,用 TypeScript 编写。它解决的核心问···
Awesome-LLMs-for-Vulnerability-Detec···
开源
一站式追踪LLM漏洞检测前沿论文与数据集
这是一个持续更新的开源索引,专门收录大语言模型(LLM)在软件漏洞检测领域的研究成果。项目按函数···