rag-evaluation

本站收录 10 个带「rag-evaluation」标签的 AI 开源项目

giskard-ossGiskard 是一个面向 LLM 智能体和应用的自动化评估与测试开源库。它解决了大模型应用上线前缺乏系统性质量保障的问题,提供从单元测试到红队攻击的全链路测试★ 5,846future-agiFuture AGI 是一个开源的端到端平台,用于评估、观测和优化 LLM 及 AI 智能体应用。它集成了追踪、评测、模拟、数据集管理、网关和护栏等核心功能,帮★ 2,102haiku.raghaiku.rag 是一个基于 LanceDB、Pydantic AI 和 Docling 构建的 agentic RAG(检索增强生成)框架,主打“有主见”(★ 615EnterpriseRAG-BenchEnterpriseRAG-Bench 是一个专为企业内部文档场景设计的 RAG(检索增强生成)评测基准与数据集。它解决的核心问题是:通用 RAG 评测集(如自★ 576MimirQMimirQ 是一个面向中文企业场景的 RAG 知识库解决方案,核心解决企业文档解析难、检索不准、引用不可控的问题。它提供从文档解析、数据治理、智能切块到混合检★ 558open-rag-evalopen-rag-eval 是一个用于评估检索增强生成(RAG)系统的开源工具,核心特点是无需人工标注的“黄金答案”即可进行评测。它通过自动生成合成查询和评估指★ 412Awesome-RAGAwesome-RAG 是一个精选的检索增强生成(RAG)相关资源列表,旨在帮助开发者、研究者和产品经理快速了解 RAG 领域的最新论文、工具、库和最佳实践。它★ 382llamatorllamator 是一个用于测试聊天机器人和生成式 AI 系统的红队(Red Teaming)Python 框架。它主要解决 LLM 应用在安全性和可靠性方面的★ 223chunkychunky 是一个面向可靠 RAG(检索增强生成)管道的开源工具包,主要解决文档处理与分块环节中的痛点。它提供从 PDF 到 Markdown 的转换、文档清★ 182ai-eval-platform这是一个开源的 AI 应用评测平台,专注于解决 RAG、AI Agent、多轮对话等复杂场景的评估难题。它提供 LLM-as-Judge、接口评测、评测报告和人★ 11