ai-evaluation

本站收录 11 个带「ai-evaluation」标签的 AI 开源项目

iFixAiiFixAi 是一个面向 AI Agent 的独立审计工具,旨在快速回答 AI Agent 经济中最关键的问题:Agent 是否在按预期工作?它支持由人类或 A★ 16,623openlitOpenLIT 是一个面向 AI 工程的开源可观测性平台,基于 OpenTelemetry 原生标准,帮助开发者监控、评估和优化 LLM 应用。它解决 AI 应★ 2,804uqlmUQLM 是一个专注于大语言模型(LLM)不确定性量化的 Python 包,源自 JMLR 2026 论文。它解决的核心问题是:LLM 在生成文本时经常产生幻觉★ 1,205confabulationsconfabulations 是一个用于评估 RAG(检索增强生成)系统幻觉(或称虚构)问题的文档型基准测试集。它提供了一系列经过人工验证的问题和答案,专门设计★ 250EvalForgeEvalForge 是一个面向 AI/LLM 应用的评测与质量门禁工具,用 Python 编写。它解决的核心问题是:团队在 CI 中评测模型或 RAG 系统时,★ 211agentic-ai这是一个精选的智能体AI资源列表,汇集了跨24个领域的研究论文、基准测试、框架和工具。项目旨在为开发者、研究者和爱好者提供一个系统化的入口,帮助他们快速了解智能★ 159every_eval_everEvery Eval Ever 是一个面向 AI 评测领域的共享元数据规范与众包评测数据库。它要解决的核心问题是:当前 AI 评测结果散落在各类排行榜、学术论文★ 132evalstatsevalstats 是一个面向 AI 评测场景的 Python 统计推断库,专门解决小样本条件下模型对比与评测结论不可靠的问题。它把蒙特卡洛模拟验证过的统计方法★ 127AICompareAICompare 是一个极简的浏览器工具,通过一键操作同时打开多个主流 AI 对话站点(如 ChatGPT、Claude、Gemini、Perplexity、★ 126awesome-ai-eval这是一个关于AI评估领域的精选资源清单,旨在帮助开发者和研究者系统性地了解如何评估AI系统在真实应用中的可靠性。项目汇集了各类工具、方法和平台,覆盖评估框架、指★ 116ai-eval-platform这是一个开源的 AI 应用评测平台,专注于解决 RAG、AI Agent、多轮对话等复杂场景的评估难题。它提供 LLM-as-Judge、接口评测、评测报告和人★ 11