ragas

给 LLM 应用打分,快速定位 RAG 短板

ragas 是一个专注于 LLM 应用评估的开源 Python 框架。它解决的是大语言模型应用(如 RAG 系统、对话机器人)在开发过程中缺乏系统化、自动化评估手段的问题。核心能力包括:提供一套基于参考的评估指标(如忠实度、答案相关性、上下文相关性等),支持端到端的评估流程,能自动生成测试数据集,并集成多种 LLM 作为评估器。ragas 通过将评估过程标准化,帮助开发者量化模型输出质量,快速定位 RAG 链路中的薄弱环节,从而加速迭代优化。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 15824
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队vibrantlabsai
所属国家
定价模式free
价格说明开源项目,Apache-2.0 许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型evaluation,llm,llmops
GitHub 星标★ 15824
30天Star增速
HF 下载量
上线时间2023-05-08 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数2

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 4 步

环境要求

  • Python 环境(README 未标注具体版本要求)
  • 可用的 pip 包管理工具
  • 一个可调用的 LLM 服务(README 示例中通过 AsyncOpenAI 客户端接入)
  • 能访问 PyPI 或 GitHub 的网络环境

安装与启动步骤

  1. 1安装 ragas

    官方推荐方式,直接从 PyPI 安装 ragas 包。建议在虚拟环境中执行,避免与系统全局包冲突。

    pip install ragas
  2. 2或从源码安装

    如需最新代码,可用 pip 直接从 GitHub 仓库安装。与上一步二选一,不必重复执行。

    pip install git+https://github.com/vibrantlabsai/ragas
  3. 3初始化 LLM 评估器

    README 快速开始示例:用 AsyncOpenAI 创建客户端,再通过 llm_factory 指定模型名生成评估用 LLM。模型名可替换为 gpt-4o。

    from openai import AsyncOpenAI
    from ragas.llms import llm_factory
    
    client = AsyncOpenAI()
    llm = llm_factory("gpt-4o", client=client)
  4. 4查阅对比文档与示例

    README 提供了 Documentation、Quick start、Discord、Blog 等入口,遇到用法问题请先看官网文档。

关键配置

配置项必填说明示例
OPENAI_API_KEY是AsyncOpenAI 客户端默认从该环境变量读取密钥,README 未显式提及但示例依赖它sk-xxxxxxxxxxxxxxxx

如何确认成功

在 Python 中执行 import ragas 无报错,且 llm_factory("gpt-4o", client=client) 能成功返回评估器实例。

常见问题

Q:pip install ragas 和从源码安装有什么区别?

A:前者安装 PyPI 上的稳定发布版;后者用 pip install git+https://github.com/vibrantlabsai/ragas 拉取 GitHub 仓库代码,适合需要最新改动时使用。

Q:没有现成的测试数据集怎么办?

A:README 提到 ragas 提供智能测试生成能力,可在没有数据集时自动生成;具体用法请查阅官方文档 https://docs.ragas.io。

Q:安装后导入报错如何排查?

A:先确认 pip 与运行代码使用的是同一个 Python 环境(可用虚拟环境隔离),再参照官方文档的 Quick start 检查依赖与版本。

注意事项

  • README 未给出 Python 版本、端口、路径等具体参数,本教程只覆盖其明确写出的安装与初始化命令。
  • 评估过程需要调用外部 LLM 作为评估器,会产生相应 API 调用费用。
  • 异步客户端 AsyncOpenAI 需要提前安装并配置好 openai 相关依赖与密钥。
  • 更多指标、数据集生成等用法请以官网 https://docs.ragas.io 为准。

核心亮点

  • 提供开箱即用的 RAG 专用评估指标(忠实度、相关性等),无需自研
  • 支持自动生成测试集,减少人工标注成本
  • 与主流框架(LangChain、LlamaIndex)集成良好,上手快

不足之处

  • 依赖 LLM 作为评估器,评估成本较高且结果受所选模型影响
  • 自定义指标扩展需要一定学习成本

适用场景

  • RAG 系统上线前质量评估与回归测试
  • 对比不同 prompt 或检索策略的效果
  • 持续监控生产环境 LLM 应用输出质量

替代项目

DeepEval、Promptfoo、LangSmith

项目介绍

ragas 是评测安全领域的开源项目,由 vibrantlabsai 开发,2023 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(15,824)位列前 3%,在评测安全分类的 466 个项目里位列前 2%。

近 41 天,它的 GitHub 星标从 15,291 增加到 15,824,净增 533。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。Apache-2.0 许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:RAG系统上线前质量评估与回归测试。同类可对比的替代方案包括 DeepEval、Promptfoo、LangSmith。

上一篇:L1B3RT4S

下一篇:cai

同类项目推荐

akto 开源

给 AI 应用做安全体检,防提示注入和数据泄露

Akto is the fastest growing AI Security platform for your teams to secure AI agents,···

★ 1517 2026-08-20
XSafeClaw 开源

给 AI 智能体装上安全盾,自动红队测试找漏洞

Introducing XSafeClaw: The Open-Source Agent Safety Platform from Fudan University

★ 164 2026-08-10
deepteam 开源

自动模拟越狱攻击,提前测出 LLM 安全漏洞

DeepTeam is a framework to red team LLMs and AI agents.

★ 2937 2026-09-12