evaluation-metrics

本站收录 21 个带「evaluation-metrics」标签的 AI 开源项目

deepevalDeepEval 是一个开源的 LLM(大语言模型)评测框架,旨在帮助开发者系统化地测试和评估基于 LLM 的应用。它解决了 LLM 应用质量难以量化、回归测试★ 18,504agentopsAgentOps 是一个面向 AI 智能体(Agent)的 Python 监控与可观测性 SDK,旨在解决 LLM 应用开发中调试困难、成本不可控、性能难以评估★ 5,847tiny-universetiny-universe 是一个以 Jupyter Notebook 形式呈现的大模型教学项目,旨在通过从零手搓的方式,帮助学习者深入理解大模型的内部工作原理★ 5,080evaluation-guidebook这是一个关于大语言模型评估的指南仓库,源自 Hugging Face 团队在维护 Open LLM Leaderboard 和设计 lighteval 过程中的★ 2,149continuous-evalcontinuous-eval 是一个面向 LLM 应用的、数据驱动的评估工具。它解决的是 LLM 应用在开发迭代过程中缺乏客观、可量化评估标准的问题,帮助开发★ 517Awesome-Evaluation-of-Visual-Generation这是一个聚焦视觉生成模型评测领域的精选资源列表,系统整理了相关的评估指标、评估模型和评估系统。它解决了视觉生成领域缺乏统一、全面评测参考的问题,为研究人员和工程★ 464DreamLayer-EvalDreamLayer-Eval 是一个面向扩散模型的自动化评测基准工具,旨在解决图像生成模型评估过程繁琐、结果难以复现的问题。它通过自动化管理评估流程、随机种子★ 413open-rag-evalopen-rag-eval 是一个用于评估检索增强生成(RAG)系统的开源工具,核心特点是无需人工标注的“黄金答案”即可进行评测。它通过自动生成合成查询和评估指★ 412PySODEvalToolkitPySODEvalToolkit 是一个基于 Python 的显著性目标检测(SOD)与伪装目标检测(COD)评测工具箱。该领域论文中常用 MAE、F-meas★ 354tonic_validatetonic_validate 是一个用于评估检索增强生成(RAG)应用响应质量的 Python 库。它提供了一套标准化的指标,帮助开发者量化 RAG 系统在回答★ 327athina-evalsathina-evals 是一个用于评估大语言模型(LLM)生成响应的 Python SDK。它解决了开发者在构建 LLM 应用时难以系统化、自动化评估输出质量★ 302LRV-InstructionLRV-Instruction 是一个用于缓解大型多模态模型(LMM)幻觉问题的开源项目,其核心方法是通过鲁棒的指令微调来提升模型对视觉内容的忠实度。项目针对当★ 297evaleval 是 FrontierHarness 项目的评测结果与任务定义公开仓库,专注于大语言模型(LLM)在真实编码环境中的能力评估。它解决的核心问题是:传统基★ 282foundation-model-benchmarking-tool这是一个用于基础模型(大模型)基准测试的开源工具,旨在帮助用户在 AWS 云平台上运行任意模型,并对比不同实例类型和服务栈(serving stack)的性能表★ 256unitxtUnitxt 是一个面向企业级 AI 性能评估的 Python 库,提供全球最大的工具和数据目录,用于端到端的 AI 基准测试。它解决了 AI 评估流程中数据准★ 216content-debiased-fvdcontent-debiased-fvd 是 CVPR 2024 论文《On the Content Bias in Fréchet Video Distanc★ 148faster_coco_evalfaster_coco_eval 是已废弃项目 fast-coco-eval 的延续维护版本,用 Python 重写并加速了 COCO 数据集的目标检测/实例分★ 147language-ai-engineering-labLanguage AI Engineering Lab 是一个专注于语言AI工程实践的开源学习仓库,旨在帮助开发者从基础原理到生产部署,系统性地理解和构建现代语★ 127awesome-ai-eval这是一个关于AI评估领域的精选资源清单,旨在帮助开发者和研究者系统性地了解如何评估AI系统在真实应用中的可靠性。项目汇集了各类工具、方法和平台,覆盖评估框架、指★ 116semantic-object-accuracy-for-generative-text-to-image-synthesis这是一个用于生成式文本到图像合成任务的语义对象准确率评估工具,对应TPAMI 2020论文。它解决的是传统评估指标(如IS、FID)无法有效衡量生成图像中语义对★ 106ErrorAnalysis_PromptErrorAnalysis_Prompt 是一个专为 ChatGPT 设计的机器翻译(MT)评估提示词项目,旨在通过结构化提示引导 ChatGPT 对翻译结果进★ 91