llm-eval

本站收录 10 个带「llm-eval」标签的 AI 开源项目

promptfoopromptfoo 是一个开源的 LLM 评估与红队测试框架,用于系统化测试提示词、智能体(agents)和 RAG 应用。它解决了 AI 应用开发中缺乏标准化★ 25,560phoenixPhoenix 是一个面向 AI 应用的可观测性与评估平台,由 Arize AI 开发。它解决了 LLM 应用在生产环境中难以调试、评估和优化的问题,为开发者提★ 11,654opencompassOpenCompass 是一个大语言模型评估平台,旨在解决 LLM 评测标准不一、流程复杂的问题。它支持超过 100 个公开数据集(如 MMLU、C-Eval、★ 7,485giskard-ossGiskard 是一个面向 LLM 智能体和应用的自动化评估与测试开源库。它解决了大模型应用上线前缺乏系统性质量保障的问题,提供从单元测试到红队攻击的全链路测试★ 5,846trulensTruLens 是一个面向 LLM 实验和 AI Agent 的评估与追踪工具,旨在解决大模型应用开发中‘效果难衡量、问题难定位’的痛点。它提供了一套统一的反馈★ 3,579uptrainUpTrain 是一个开源的统一平台,用于评估和改进生成式 AI 应用。它提供 20 多种预配置检查项,覆盖语言、代码、嵌入等场景,可为 LLM 输出打分,并对★ 2,365verifywiseVerifyWise 是一个面向 AI 治理与 LLM 评估的开源平台,旨在帮助组织应对日益复杂的 AI 法规和标准。它解决了企业在 AI 系统开发、部署和运营★ 359athina-evalsathina-evals 是一个用于评估大语言模型(LLM)生成响应的 Python SDK。它解决了开发者在构建 LLM 应用时难以系统化、自动化评估输出质量★ 302parea-sdk-pyParea AI 是一个面向 LLM 应用的开发工具链,提供 Python SDK 来支持实验、测试、评估和监控。它解决的是 LLM 应用开发中缺乏系统化测试与★ 82circle-guard-benchcircle-guard-bench 是首个专门评估大语言模型(LLM)防护系统(包括 guardrails 和 safeguards)能力的 AI 基准测试框★ 81