tool-retrieval-benchmark
开源
测测你的检索模型会不会挑工具,让LLM用对工具
这是一个用于评估大语言模型工具检索能力的基准测试框架,源自ACL2025论文。它解决了当前检索模型在···
汇聚全球AI评测与安全项目,模型评估、基准测试、安全对齐、护栏工具大全。
共收录 474 个开源项目
tool-retrieval-benchmark
开源
测测你的检索模型会不会挑工具,让LLM用对工具
这是一个用于评估大语言模型工具检索能力的基准测试框架,源自ACL2025论文。它解决了当前检索模型在···
openevals
开源
几行代码给 LLM 应用打分,快速比出哪个版本更好
openevals 是 LangChain 生态下的一套开箱即用的 LLM 应用评测器集合,面向需要评估大模型应用输出···
llm_benchmark
开源
跑一遍评测,快速发现大模型安全短板
llm_benchmark 是一个面向大语言模型的安全与能力评测开源项目,主要解决模型在真实使用中可能出现···
llm-srbench
开源
测测大模型能不能发现科学公式,一测便知
LLM-SRBench 是一个用于评估大语言模型在科学方程发现任务上能力的基准测试,发表于 ICML 2025 Ora···
benchflow
开源
一键搭建 RL 训练与评测流水线,省去重复造轮子
benchflow 是一个面向强化学习(RL)研究的开源基础设施,旨在简化 RL 环境的创建、后训练(post-t···
convex-evals
开源
给 Convex 后端做功能与安全体检,部署前拦住越权和逻辑错。
convex-evals 是一个面向 Convex 后端平台的评测与安全测试工具集,用 TypeScript 编写。它解决的核···
AI-Infra-Guard
开源
一键扫描AI全链路,提前揪出安全漏洞
AI-Infra-Guard 是一个全栈 AI 红队测试平台,旨在系统性评估和加固 AI 生态系统的安全性。它解决了···
VLABench
开源
一站式公平评测VLA与具身智能模型,让模型实力一目了然
VLABench 是一个大规模基准测试平台,专为公平评估视觉-语言-动作模型(VLA)、具身智能体及视觉语···
dingo
开源
一键评测AI数据与模型质量,自动出报告
Dingo 是一个面向 AI 数据、模型与应用的质量评测工具,用 Python 编写。它要解决的问题是:大模型···
TrustEval-toolkit
开源
一键评估生成模型可信度,量化风险更安心
TrustEval-toolkit 是一个用于评估生成式基础模型可信度的开源工具包和基准测试集,相关论文已被 I···
physics-IQ-benchmark
开源
测测视频模型懂不懂物理,量化物理常识短板
这是一个用于评估生成式视频模型物理理解能力的基准测试工具。它通过设计一系列物理场景和任务,测···
Video-Bench
开源
用AI自动给视频生成模型打分,快速比出谁更强
Video-Bench 是一个视频生成领域的评测基准项目,旨在系统评估视频生成模型的质量。它解决的核心问···
Awesome-Video-MLLMs
开源
一站式追踪视频多模态大模型前沿,快速找到所需模型和基准。
Awesome-Video-MLLMs 是一个专注于视频多模态大模型(MLLMs)及其基准测试的资源汇总项目,覆盖短视···
FuzzyAI
开源
自动给 LLM 做安全体检,找出越狱漏洞
FuzzyAI 是一个自动化的大语言模型模糊测试工具,旨在帮助开发者和安全研究人员发现并缓解其 LLM A···
llm-self-correction-papers
开源
一页看尽LLM自我纠正论文,快速跟上研究热点
这是一个关于大语言模型(LLM)自我纠正(Self-Correction)方向的论文列表项目,旨在系统收集和整···
Awesome-MLLM-Uncertainty
开源
一页看尽多模态模型不确定性研究,快速定位关键论文
这是一个精选多模态大语言模型(MLLM)不确定性研究论文的列表项目,旨在系统梳理该领域的最新进展···
open-rag-eval
开源
免标注黄金答案,自动评估RAG检索与生成质量
open-rag-eval 是一个用于评估检索增强生成(RAG)系统的开源工具,核心特点是无需人工标注的“黄金···
awesome-direct-preference-optimizati···
开源
一网打尽DPO论文与代码,快速入门偏好对齐
这是一个关于直接偏好优化(Direct Preference Optimization, DPO)的精选资源列表,旨在系统梳理该···
UltraEval-Audio
开源
一站式音频模型评测,快速对比知己知彼
UltraEval-Audio 是一个面向音频领域的统一评测基准框架,旨在为 ASR(语音识别)、TTS(语音合成)···
Awesome-LLM-Red-Teaming
开源
一站式收集 LLM 红队测试资源,快速上手安全攻防
Awesome-LLM-Red-Teaming 是一个精选资源列表,专注于大语言模型(LLM)的红队测试领域。它系统整理···
Oversight
开源
模块化拆解 LLM,自动红队测试,发现漏洞
Oversight 是一个完全模块化的 LLM 逆向工程、红队测试与漏洞研究框架。它主要面向安全研究人员和 ···
Awesome-LMMs-Mechanistic-Interpretab···
开源
一站式读懂多模态模型内部工作原理
这是一个聚焦大型多模态模型(LMMs)机制可解释性(MI)的资源精选仓库,专门收集与LMMs内部工作机···
contextcheck
开源
用 YAML 配置测试用例,把 LLM 测试塞进 CI 流水线,自动跑完收工。
contextcheck 是一个基于 MIT 许可的开源框架,用于测试大型语言模型(LLM)、检索增强生成(RAG)···
judgeval
开源
给 AI Agent 装上持续评测仪表盘,让改进有据可依
judgeval 是一个面向 AI Agent 的持续改进与评测平台,旨在解决 Agent 在生产环境中缺乏系统性评估···