evaluation
本站收录 102 个带「evaluation」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)
langfuseLangfuse 是一个开源的 AI 工程平台,专注于 LLM 应用的可观测性、评估与提示词管理。它解决了 LLM 应用开发中调试困难、质量评估主观、提示词迭代★ 35,205
WeKnora腾讯开源的 LLM 知识平台,将原始文档转化为可查询的 RAG、自主推理 Agent 与自动维护的 Wiki。构建企业级知识中枢,让知识自动沉淀、检索与推理,助★ 31,212
mlflow面向 Agent、LLM 与机器学习模型的开源 AI 工程平台,帮助团队完成调试、评估、监控与优化生产级 AI 应用的全流程管理,同时兼顾成本控制与模型、数据的★ 28,183
promptfoopromptfoo 是一个开源的 LLM 评估与红队测试框架,用于系统化测试提示词、智能体(agents)和 RAG 应用。它解决了 AI 应用开发中缺乏标准化★ 25,560
opikOpik 是一个开源的大语言模型(LLM)应用可观测性与评估平台,旨在帮助开发者调试、评估和监控基于 LLM 的应用,包括 RAG 系统和智能体工作流。它通过全★ 22,289
ragasragas 是一个专注于 LLM 应用评估的开源 Python 框架。它解决的是大语言模型应用(如 RAG 系统、对话机器人)在开发过程中缺乏系统化、自动化评估★ 15,880
oumioumi 是一个专注于开源大语言模型(LLM)微调、评估和部署的全流程工具包。它旨在简化从模型选择到生产部署的复杂流程,支持 Qwen、Gemma、Llama ★ 9,392
opencompassOpenCompass 是一个大语言模型评估平台,旨在解决 LLM 评测标准不一、流程复杂的问题。它支持超过 100 个公开数据集(如 MMLU、C-Eval、★ 7,485
coze-loopcoze-loop 是一个面向 AI Agent 的全生命周期优化平台,旨在解决 Agent 开发中调试难、评估缺、监控弱的问题。它提供从开发、调试、评估到监控★ 5,752
KilnKiln 是一个面向 AI 系统的全流程开发平台,旨在解决从数据准备到模型优化过程中工具链割裂、协作困难的问题。它提供数据集管理、人工标注与协作、评估(eval★ 5,130
langwatchLangWatch是一个面向LLM评估与AI智能体测试的开源平台,旨在解决大模型应用开发中评估难、调试烦、监控弱的问题。它提供从数据采集、数据集管理、评估实验到★ 4,888
lmms-evallmms-eval 是一个面向多模态大模型的一站式评测工具包,支持文本、图像、视频和音频任务的统一评估。它解决了多模态模型评测标准不一、任务分散、复现困难的问题★ 4,437
VLMEvalKitVLMEvalKit 是一个开源的大语言多模态模型(LMMs)评估工具包,旨在解决多模态模型评测标准不统一、评测流程繁琐的问题。它支持 220 多个主流 LMM★ 4,418
evalscopeevalscope 是一个面向大语言模型(LLM)、视觉语言模型(VLM)和生成式 AI(AIGC)的评估与性能基准测试框架。它旨在解决模型评测流程繁琐、标准不★ 3,490
SuperCLUESuperCLUE 是一个面向中文通用大模型的综合性评测基准,旨在系统评估基础模型在中文场景下的能力。它解决了当前大模型评测中缺乏中文深度覆盖、维度单一、标准不★ 3,302
lmnrLaminar 是一个专为 AI 智能体(Agent)设计的开源可观测性平台,来自 YC S24。它解决了 AI 应用在生产环境中调试困难、追踪复杂的问题,提供★ 3,287
ChainForgeChainForge 是一个开源的视觉编程环境,专为测试和评估大语言模型(LLM)的提示词而设计。它允许用户通过拖拽节点的方式构建提示词流程,并同时向多个模型(★ 3,033
promptbenchPromptBench 是一个面向大语言模型的统一评估框架,旨在解决当前 LLM 评估碎片化、缺乏标准化的问题。它提供了一套模块化、可扩展的工具,支持对模型进行★ 2,822
yao-meta-skillYAO(Yielding AI Outcomes)是一个面向可复用智能体技能(Agent Skills)的工程化、评估、治理与可移植性系统。它解决的是当前AI ★ 2,686
evaluateEvaluate 是 Hugging Face 推出的机器学习评估库,用于统一、便捷地评测模型与数据集。它把常见指标(准确率、F1、BLEU、ROUGE、困惑度★ 2,486
uptrainUpTrain 是一个开源的统一平台,用于评估和改进生成式 AI 应用。它提供 20 多种预配置检查项,覆盖语言、代码、嵌入等场景,可为 LLM 输出打分,并对★ 2,365
fable-methodFable Method 是一个将 Claude Fable 5 的工作流程提炼为可执行技能的开源项目,旨在让任何模型都能运行“思考/行动/证明”的循环。它解决★ 2,297
inspectorinspector 是一个用于测试和评估 MCP(模型上下文协议)服务器、MCP 应用及 ChatGPT 应用的调试与验证平台。它主要解决开发者在构建基于 MC★ 2,230
Awesome-LLM-Long-Context-ModelingAwesome-LLM-Long-Context-Modeling 是一个精选资源列表,聚焦于大语言模型的长上下文建模技术。它系统整理了相关论文、博客和开源工具★ 2,175
evaluation-guidebook这是一个关于大语言模型评估的指南仓库,源自 Hugging Face 团队在维护 Open LLM Leaderboard 和设计 lighteval 过程中的★ 2,149
alpaca_evalalpaca_eval 是一个用于自动评估指令跟随语言模型的工具。它解决了人工评估成本高、速度慢、难以规模化的问题,提供了一种廉价、快速且经过人类验证的自动评估★ 2,018
trpc-agent-gotrpc-agent-go 是一个基于 Go 语言的生产级智能体(Agent)开发框架,旨在解决企业级 AI Agent 系统构建中的工程化难题。它提供图工作流★ 1,835
WFGYWFGY 是一个面向 AI 推理、RAG、智能体及真实世界工作流的开源项目,正迈向 5.0 Polaris Protocol 重大版本。它提供问题地图(Prob★ 1,791
EmoLLMEmoLLM 是一个专注于心理健康领域的大语言模型项目,旨在通过微调开源基座模型(如 InternLM、Qwen、Baichuan、DeepSeek 等)来提供★ 1,788
ragbitsragbits 是一个用于快速构建生成式 AI 应用的 Python 开发框架,提供模块化的构建块,帮助开发者高效组合检索增强生成(RAG)、智能体(Agent★ 1,669
LLM-eval-surveyLLM-eval-survey 是大语言模型评估领域权威综述论文《A Survey on Evaluation of Large Language Models★ 1,611
TracelyTracely 是一个面向 AI 智能体的原生 CI/CD 工具,旨在解决 LLM 应用在生产环境中失败后难以复现和回归测试的问题。它能自动检测生产环境中的 A★ 1,421
Tracely-aiTracely-ai 是一个面向 AI 代理(agent)的 CI/CD 原生可观测与评测工具,旨在解决 AI 应用在生产环境中出现故障后难以复现和回归测试的问★ 1,421
intellagentIntellAgent 是一个面向智能体(Agent)的全面诊断与优化框架。它通过模拟真实场景下的合成交互数据,帮助开发者系统性地评估和调优基于大语言模型的智能★ 1,259
GymGym 是一个用于评估和改进模型与智能体的环境框架,核心思路是把评测从静态数据集搬到可交互的环境中。传统 benchmark 通常只给固定题目和标准答案,难以衡★ 1,210
prometheus-evalPrometheus-Eval 是一个用于评估大语言模型(LLM)回复质量的工具,基于 Prometheus 模型和 GPT-4 作为评判标准。它解决了 LLM★ 1,117
langsmith-sdklangsmith-sdk 是 LangChain 官方推出的 LangSmith 平台客户端 SDK,提供 Python 与 JavaScript 实现。它解★ 1,064
ClawBenchClawBench 是一个开源的浏览器 AI 智能体基准测试项目,专注于评估 AI 智能体在真实日常任务中的表现。它解决了当前浏览器智能体缺乏统一、贴近真实场景★ 904
deepfabricdeepfabric 是一个面向 AI 数据工程的一体化流水线工具,旨在解决高质量合成数据生成、模型训练、评估与蒸馏的割裂问题。它提供从数据生成到模型优化的完整★ 886
OpenJudgeOpenJudge 是一个用于智能体全面评估与质量奖励的统一框架。它解决的核心问题是:当前大模型智能体评估往往只关注最终结果,而忽略过程质量,且评估标准碎片化。★ 860
ClawProBenchClawProBench 是一个面向 LLM Agent 的评测基准框架,专门针对 OpenClaw 运行时环境设计。它解决的核心问题是:当前多数 Agent ★ 824
RAG-FiTRAG-FiT 是一个用于增强大语言模型在检索增强生成(RAG)任务中表现的微调框架。它解决了通用微调方法未针对 RAG 场景优化、导致模型在检索上下文利用和答★ 767
LightCompressLightCompress 是一个面向大模型压缩的开源工具包,由 EMNLP 2024 和 AAAI 2026 论文支撑,支持对 LLM(大语言模型)、VLM(★ 749
long-form-factuality这是一个用于评估大语言模型长文本事实性(long-form factuality)的基准测试工具,来自论文《Long-form factuality in la★ 693
Awesome-LLM-EvalAwesome-LLM-Eval 是一个精选资源列表,专注于大语言模型(LLM)的评测领域。它系统性地整理了评测工具、数据集/基准、演示、排行榜、论文、文档和模★ 658
TrustLLMTrustLLM 是一个针对大语言模型可信度的系统性研究项目,源自 ICML 2024 论文。它定义了一个包含真实性、安全性、公平性、鲁棒性、隐私性、机器伦理与★ 633
awesome-llm-unlearning这是一个关于大语言模型机器遗忘(Machine Unlearning)的资源列表仓库,旨在系统整理该领域的前沿论文、基准数据集、评估指标和开源工具。它解决的核心★ 627
inspect-robotsinspect-robots 是一个面向物理 AI(具身智能)的开源评测框架,目标是把机器人策略与视觉-语言-动作(VLA)模型的评估标准化。它解决的核心问题是★ 627
MMMUMMMU 是一个大规模多学科多模态理解与推理基准测试集,旨在评估和推动 AI 模型在专家级通用人工智能(AGI)方向上的能力。它包含来自艺术、工程、科学等六大领★ 597