llm-evaluation

本站收录 71 个带「llm-evaluation」标签的 AI 开源项目(按 GitHub 星标从高到低,此处展示前 50 个)

langfuseLangfuse 是一个开源的 AI 工程平台,专注于 LLM 应用的可观测性、评估与提示词管理。它解决了 LLM 应用开发中调试困难、质量评估主观、提示词迭代★ 35,205mlflow面向 Agent、LLM 与机器学习模型的开源 AI 工程平台,帮助团队完成调试、评估、监控与优化生产级 AI 应用的全流程管理,同时兼顾成本控制与模型、数据的★ 28,183promptfoopromptfoo 是一个开源的 LLM 评估与红队测试框架,用于系统化测试提示词、智能体(agents)和 RAG 应用。它解决了 AI 应用开发中缺乏标准化★ 25,560opikOpik 是一个开源的大语言模型(LLM)应用可观测性与评估平台,旨在帮助开发者调试、评估和监控基于 LLM 的应用,包括 RAG 系统和智能体工作流。它通过全★ 22,289deepevalDeepEval 是一个开源的 LLM(大语言模型)评测框架,旨在帮助开发者系统化地测试和评估基于 LLM 的应用。它解决了 LLM 应用质量难以量化、回归测试★ 18,504iFixAiiFixAi 是一个面向 AI Agent 的独立审计工具,旨在快速回答 AI Agent 经济中最关键的问题:Agent 是否在按预期工作?它支持由人类或 A★ 16,623phoenixPhoenix 是一个面向 AI 应用的可观测性与评估平台,由 Arize AI 开发。它解决了 LLM 应用在生产环境中难以调试、评估和优化的问题,为开发者提★ 11,654garakgarak 是一个用于检测大语言模型(LLM)漏洞的开源扫描器,由 NVIDIA 团队维护。它通过自动生成大量攻击性提示(如提示注入、越狱、数据泄露、幻觉诱导等★ 9,385AI-Infra-GuardAI-Infra-Guard 是一个全栈 AI 红队测试平台,旨在系统性评估和加固 AI 生态系统的安全性。它解决了 AI 应用从模型、代理、技能到基础设施各层★ 6,636chinese-llm-benchmark这是一个持续更新的中文AI大模型能力评测项目,旨在为社区提供客观、全面的模型对比参考。它解决了大模型选型时缺乏统一中文基准的问题,通过标准化测试评估模型在中文语★ 6,457heliconeHelicone 是一个开源的 LLM 可观测性平台,旨在帮助开发者监控、评估和优化大语言模型应用。它通过一行代码集成,即可捕获所有 LLM 请求的日志、成本、★ 6,188ouroborosOuroboros 是一个面向 AI 智能体的操作系统(Agent OS),核心理念是“停止提示,开始指定”。它解决了传统提示工程中用户需要反复用自然语言描述意★ 6,138giskard-ossGiskard 是一个面向 LLM 智能体和应用的自动化评估与测试开源库。它解决了大模型应用上线前缺乏系统性质量保障的问题,提供从单元测试到红队攻击的全链路测试★ 5,846LLM-Engineers-Handbook《LLM工程师手册》是一份面向大语言模型(LLM)工程实践的开源指南,旨在帮助开发者从零基础掌握LLM的核心概念,并进阶到在AWS云平台上部署高级LLM与RAG★ 5,354lmms-evallmms-eval 是一个面向多模态大模型的一站式评测工具包,支持文本、图像、视频和音频任务的统一评估。它解决了多模态模型评测标准不一、任务分散、复现困难的问题★ 4,437AI-Engineer-HeadquartersAI-Engineer-Headquarters 是一个面向 AI 工程师的知识库与工具集,以 Jupyter Notebook 形式组织,汇集了构建机器学习模★ 3,689trulensTruLens 是一个面向 LLM 实验和 AI Agent 的评估与追踪工具,旨在解决大模型应用开发中‘效果难衡量、问题难定位’的痛点。它提供了一套统一的反馈★ 3,579lmnrLaminar 是一个专为 AI 智能体(Agent)设计的开源可观测性平台,来自 YC S24。它解决了 AI 应用在生产环境中调试困难、追踪复杂的问题,提供★ 3,287generative-aigenerative-ai 是一个综合性的生成式 AI 学习资源库,旨在帮助开发者系统掌握从基础到进阶的生成式 AI 技能。项目包含详细的学习路线图、实战项目、★ 2,644future-agiFuture AGI 是一个开源的端到端平台,用于评估、观测和优化 LLM 及 AI 智能体应用。它集成了追踪、评测、模拟、数据集管理、网关和护栏等核心功能,帮★ 2,102agentic_securityAgentic Security 是一个面向 LLM 应用的漏洞扫描与 AI 红队工具包。它解决的是大模型应用上线前的安全评估问题,通过自动化模糊测试和攻击模拟★ 2,013aisheetsaisheets 是一个基于 TypeScript 的开源工具,让用户无需编写代码即可用 AI 模型构建、丰富和转换数据集。它把表格界面与 LLM 能力结合,用★ 1,647FuzzyAIFuzzyAI 是一个自动化的大语言模型模糊测试工具,旨在帮助开发者和安全研究人员发现并缓解其 LLM API 中的潜在越狱漏洞。它通过生成大量恶意或边界输入,★ 1,580TracelyTracely 是一个面向 AI 智能体的原生 CI/CD 工具,旨在解决 LLM 应用在生产环境中失败后难以复现和回归测试的问题。它能自动检测生产环境中的 A★ 1,421Tracely-aiTracely-ai 是一个面向 AI 代理(agent)的 CI/CD 原生可观测与评测工具,旨在解决 AI 应用在生产环境中出现故障后难以复现和回归测试的问★ 1,421promptyPrompty 是一个面向 LLM 提示词工程的开源框架,旨在简化提示词的创建、管理、调试和评估流程。它定义了一种名为 Prompty 的资产类格式,将提示词、★ 1,276uqlmUQLM 是一个专注于大语言模型(LLM)不确定性量化的 Python 包,源自 JMLR 2026 论文。它解决的核心问题是:LLM 在生成文本时经常产生幻觉★ 1,205judgevaljudgeval 是一个面向 AI Agent 的持续改进与评测平台,旨在解决 Agent 在生产环境中缺乏系统性评估与监控的问题。它提供了丰富的评测数据集和评★ 1,063FinSight-AIFinSight-AI 是一个基于 Java/Spring Boot 构建的 AI 股票研究智能体,旨在为金融分析师提供自动化、可追溯的股权研究报告生成能力。它★ 1,061awesome-evals这是一个由 BenchFlow 维护的精选资源列表,专注于 AI 智能体的构建与评估。它汇集了论文、博客、演讲、工具和基准测试等高质量资源,旨在为开发者提供一份★ 936ClawBenchClawBench 是一个开源的浏览器 AI 智能体基准测试项目,专注于评估 AI 智能体在真实日常任务中的表现。它解决了当前浏览器智能体缺乏统一、贴近真实场景★ 904agent-skills-evalagent-skills-eval 是一个用于测试 AI 智能体技能(Agent Skills)的测试运行器,灵感来自 agentskills.io。它解决的核★ 798SkillCorpusSkillCorpus 是一个开源基础设施,旨在将分散的 SKILL.md 文件转化为经过整理、可直接用于检索的智能体技能语料库。它解决了 AI 智能体在技能管★ 673Awesome-LLM-EvalAwesome-LLM-Eval 是一个精选资源列表,专注于大语言模型(LLM)的评测领域。它系统性地整理了评测工具、数据集/基准、演示、排行榜、论文、文档和模★ 658Awesome-LLM-in-Social-Science这是一个收录大语言模型(LLM)在社会科学领域应用的论文精选列表。项目旨在解决社会科学研究者难以系统追踪LLM相关前沿研究的问题,通过分类整理相关学术论文,帮助★ 648EnterpriseRAG-BenchEnterpriseRAG-Bench 是一个专为企业内部文档场景设计的 RAG(检索增强生成)评测基准与数据集。它解决的核心问题是:通用 RAG 评测集(如自★ 576continuous-evalcontinuous-eval 是一个面向 LLM 应用的、数据驱动的评估工具。它解决的是 LLM 应用在开发迭代过程中缺乏客观、可量化评估标准的问题,帮助开发★ 517keystone-benchkeystone-bench 是一个面向临床决策支持的评测基准,基于 OpenAI 的 HealthBench 构建。它要解决的问题是:医疗问答里模型给出的答案★ 453selfstarterselfstarter 是一个面向编码智能体的自主任务执行框架,核心思路是让开发者给智能体一份任务简报(brief)而非进行多轮对话,智能体便能跨会话持续工作直★ 387verifywiseVerifyWise 是一个面向 AI 治理与 LLM 评估的开源平台,旨在帮助组织应对日益复杂的 AI 法规和标准。它解决了企业在 AI 系统开发、部署和运营★ 359llm-leaderboard这是一个已废弃的LLM基准测试排行榜项目,曾汇总各大语言模型的基准测试分数和提供商价格。它旨在帮助开发者快速对比不同模型在各类任务上的表现,并了解各API服务的★ 356palico-aiPalico AI 是一个面向 AI 应用开发的全生命周期管理平台,旨在帮助开发者构建、优化性能并将 AI 应用推向生产环境。它解决了 AI 应用从原型到生产过★ 343llms-toolsllms-tools 是一个精选的 LLM(大型语言模型)工具与项目清单,旨在帮助开发者、研究者和产品经理快速发现和了解 AI 领域内的优质开源资源。它按类别整★ 328UltraEval-AudioUltraEval-Audio 是一个面向音频领域的统一评测基准框架,旨在为 ASR(语音识别)、TTS(语音合成)、音频编解码器以及音频大语言模型提供标准化、★ 325athina-evalsathina-evals 是一个用于评估大语言模型(LLM)生成响应的 Python SDK。它解决了开发者在构建 LLM 应用时难以系统化、自动化评估输出质量★ 302benchmark-radarbenchmark-radar 是一个面向 AI 评测领域的数据聚合工具,它从 37 个公开来源持续抓取并整理超过 11,923 条与 AI benchmark★ 263langfairLangFair 是一个用于大语言模型(LLM)偏见与公平性评估的 Python 库,专注于用例级别的评估。它解决了当前 LLM 应用中缺乏系统化、可操作公平性★ 262KADATHKADATH 是一个基于进化算法的多智能体运行时框架,旨在通过可复现的迭代周期来培育、评估并持续改进自主智能体,从而逐步逼近并优化预设目标。它解决了传统单一智能★ 261MixEvalMixEval 是一个大语言模型评估套件,提供动态更新的评测数据集和标准化评估流程。它解决传统静态基准测试因数据泄露和过拟合导致模型分数虚高的问题,通过混合多种★ 254myclaw-benchmyclaw-bench 是一个针对 OpenClaw 智能体的基准测试项目,由 MyClaw.ai 提供支持。它旨在解决 AI 智能体在真实任务中缺乏标准化评★ 223