evaluation-framework
本站收录 19 个带「evaluation-framework」标签的 AI 开源项目
promptfoopromptfoo 是一个开源的 LLM 评估与红队测试框架,用于系统化测试提示词、智能体(agents)和 RAG 应用。它解决了 AI 应用开发中缺乏标准化★ 25,560
deepevalDeepEval 是一个开源的 LLM(大语言模型)评测框架,旨在帮助开发者系统化地测试和评估基于 LLM 的应用。它解决了 LLM 应用质量难以量化、回归测试★ 18,504
KilnKiln 是一个面向 AI 系统的全流程开发平台,旨在解决从数据准备到模型优化过程中工具链割裂、协作困难的问题。它提供数据集管理、人工标注与协作、评估(eval★ 5,130
future-agiFuture AGI 是一个开源的端到端平台,用于评估、观测和优化 LLM 及 AI 智能体应用。它集成了追踪、评测、模拟、数据集管理、网关和护栏等核心功能,帮★ 2,102
continuous-evalcontinuous-eval 是一个面向 LLM 应用的、数据驱动的评估工具。它解决的是 LLM 应用在开发迭代过程中缺乏客观、可量化评估标准的问题,帮助开发★ 517
PySODEvalToolkitPySODEvalToolkit 是一个基于 Python 的显著性目标检测(SOD)与伪装目标检测(COD)评测工具箱。该领域论文中常用 MAE、F-meas★ 354
tonic_validatetonic_validate 是一个用于评估检索增强生成(RAG)应用响应质量的 Python 库。它提供了一套标准化的指标,帮助开发者量化 RAG 系统在回答★ 327
athina-evalsathina-evals 是一个用于评估大语言模型(LLM)生成响应的 Python SDK。它解决了开发者在构建 LLM 应用时难以系统化、自动化评估输出质量★ 302
evaleval 是 FrontierHarness 项目的评测结果与任务定义公开仓库,专注于大语言模型(LLM)在真实编码环境中的能力评估。它解决的核心问题是:传统基★ 282
XLingEvalXLingEval 是一个用于跨语言评估大型语言模型(LLM)在医疗健康查询场景中表现的开源工具包,源自同名论文。它主要解决非英语用户在向LLM提出医疗问题时,★ 265
benchmark-radarbenchmark-radar 是一个面向 AI 评测领域的数据聚合工具,它从 37 个公开来源持续抓取并整理超过 11,923 条与 AI benchmark★ 263
MixEvalMixEval 是一个大语言模型评估套件,提供动态更新的评测数据集和标准化评估流程。它解决传统静态基准测试因数据泄露和过拟合导致模型分数虚高的问题,通过混合多种★ 254
evaeva 是一个用于评估语音代理(Voice Agents)的全新端到端框架。它解决的核心问题是:语音代理系统(如语音助手、对话机器人)在真实场景中的表现难以全面★ 220
evaeva 是一个面向肿瘤学基础模型的评估框架,旨在系统化、标准化地评测各类癌症相关AI模型(如病理图像、基因组学或临床数据模型)的性能。它解决了肿瘤学领域模型评估★ 172
empiricalempirical 是一个用于测试和评估大语言模型(LLM)及其配置的开源基础设施工具。它帮助开发者在应用开发过程中,针对所有关键场景对模型进行系统性的测试和评★ 166
awesome-ai-eval这是一个关于AI评估领域的精选资源清单,旨在帮助开发者和研究者系统性地了解如何评估AI系统在真实应用中的可靠性。项目汇集了各类工具、方法和平台,覆盖评估框架、指★ 116
RWKURWKU是一个针对大语言模型(LLM)的“知识遗忘”基准测试框架,源自NeurIPS 2024论文。它解决的是大模型在预训练中可能记住敏感、过时或侵权知识,导致★ 102
Coding-TutorCoding-Tutor 是一个面向对话式编程教学场景的研究项目,核心是训练逐轮验证器(turn-by-turn verifier)来提升大语言模型作为编程导师★ 91
Diffusion-MU-AttackDiffusion-MU-Attack 是 ECCV'24 论文的官方实现,针对安全导向的“遗忘学习”(unlearned)扩散模型,提出一种快速有效的攻击方法★ 89