open-rag-eval

免标注黄金答案,自动评估RAG检索与生成质量

open-rag-eval 是一个用于评估检索增强生成(RAG)系统的开源工具,核心特点是无需人工标注的“黄金答案”即可进行评测。它通过自动生成合成查询和评估指标,帮助开发者衡量 RAG 管道的检索质量和生成质量,解决传统评估依赖昂贵人工标注、难以规模化的问题。项目提供命令行接口和 Python API,支持自定义数据集和评估维度,能够快速集成到现有开发流程中。其核心能力包括自动生成测试问题、计算检索相关性(如命中率、MRR)和生成答案的忠实度、完整性等指标,并输出结构化报告。目前处于早期阶段,但设计思路新颖,适合需要快速迭代验证 RAG 效果的团队。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 410
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队vectara
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型evaluation-metrics,metrics,rag,rag-evaluation,retrieval-augmented-generation,vectara
GitHub 星标★ 410
30天Star增速
HF 下载量
上线时间2024-11-26 00:00:00
最近更新2026-09-20 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

核心亮点

  • 无需人工标注黄金答案,大幅降低评估成本
  • 自动生成合成查询,覆盖多样场景
  • 提供检索和生成的多维度量化指标,便于定位问题

不足之处

  • 早期项目,文档和社区支持待观察
  • 合成查询可能无法完全模拟真实用户提问的复杂性

适用场景

  • 快速验证 RAG 系统在迭代中的效果变化
  • 对比不同检索器或生成模型的性能
  • 在缺乏标注数据时进行初步质量评估

替代项目

RAGAS、TruLens、LangSmith

项目介绍

open-rag-eval 是评测安全领域的开源项目,由 vectara 开发,2024 年首次发布。

它收录于评测安全分类,该分类目前共有 466 个项目,GitHub 星标数为 410。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-20。Apache-2.0 许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:快速验证RAG系统在迭代中的效果变化。同类可对比的替代方案包括 RAGAS、TruLens、LangSmith。

上一篇:EnterpriseRAG-Bench

下一篇:tonic_validate

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12