ragbuilder

自动评估并调优 RAG 配置,快速上线生产级问答系统

ragbuilder 是一个用于构建生产级检索增强生成(RAG)系统的 Python 工具包,旨在帮助开发者快速为自有数据搭建最优的 RAG 配置。它解决了 RAG 开发中常见的配置复杂、调优困难、难以从原型过渡到生产环境等问题。核心能力包括:自动评估不同 RAG 配置(如嵌入模型、检索策略、分块大小等)的效果,提供可视化比较;支持多种向量数据库和 LLM 集成;内置数据加载与预处理管道;提供配置模板和最佳实践建议。通过自动化实验和评估,ragbuilder 帮助用户避免手动试错,显著缩短从数据到可用 RAG 应用的时间,并确保系统在准确性和性能上达到生产要求。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1539
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队KruxAI
所属国家
定价模式free
价格说明开源工具包,Apache-2.0 许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型developer-tools,genai,rag
GitHub 星标★ 1539
30天Star增速
HF 下载量
上线时间2024-06-24 00:00:00
最近更新2026-09-11 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 7 步

环境要求

  • Python 环境(README 使用 uv 管理虚拟环境)
  • 已安装 uv 工具(README 的安装命令基于 uv)
  • 在代码中调用时需准备 LLM 与嵌入模型(如 Azure OpenAI)的凭据
  • 需要一个数据目录 input_source,可选一份测试数据集

安装与启动步骤

  1. 1创建虚拟环境

    README 使用 uv 创建名为 ragbuilder 的虚拟环境,会在当前目录生成同名文件夹。

    uv venv ragbuilder
  2. 2激活虚拟环境

    激活刚创建的虚拟环境,激活后后续安装的包才会装进该环境。

    source ragbuilder/bin/activate
  3. 3安装 ragbuilder

    用 uv pip 安装 ragbuilder 包;更多安装方式见官方文档 quickstart 页。

    uv pip install ragbuilder
  4. 4用默认配置构建

    不用写复杂参数,只要给出数据路径即可创建 RAGBuilder 实例,测试数据集可选。

    from ragbuilder import RAGBuilder
    
    builder = RAGBuilder.from_source_with_defaults(
        input_source='path/to/your/data',
        test_dataset='path/to/test/data'  # Optional
    )
  5. 5自定义模型配置

    需要指定 LLM 与嵌入模型时,可在构造 RAGBuilder 时传入对应组件与数据摄入配置。

    builder = RAGBuilder(
        data_ingest_config=data_ingest_config,
        default_llm=AzureChatOpenAI(model="gpt-4o", temperature=0.0),
        default_embeddings=AzureOpenAIEmbeddings(model="text-embedding-3-large")
    )
  6. 6运行参数优化

    可分别对数据摄入、检索、生成三部分做模块级优化,并读取优化结果。

    from ragbuilder.config import (
        DataIngestOptionsConfig,
        RetrievalOptionsConfig,
        GenerationOptionsConfig
    )
    
    builder.optimize_data_ingest()
    builder.optimize_retrieval(retrieval_config)
    builder.optimize_generation(gen_config)
    
    results = builder.optimization_results
  7. 7查询与部署 API

    用 invoke 直接跑查询;或调用 serve 把 RAG 流水线部署成 API 服务对外提供。

    response = results.invoke("What is HNSW?")
    
    builder.serve(host="0.0.0.0", port=8000)

关键配置

配置项必填说明示例
input_source是数据来源路径,RAGBuilder 会基于该数据构建 RAG 流水线path/to/your/data
test_dataset否用于评估各配置效果的测试数据集路径path/to/test/data
default_llm否默认使用的生成模型,自定义配置时传入AzureChatOpenAI(model="gpt-4o", temperature=0.0)
default_embeddings否默认使用的嵌入模型,用于向量化文档AzureOpenAIEmbeddings(model="text-embedding-3-large")
n_trials否优化实验的尝试次数,次数越多搜索越充分20
ENABLE_ANALYTICS否是否上报匿名使用统计,设为 False 可关闭False

如何确认成功

Python 中执行 results.invoke("What is HNSW?") 能返回答案,或部署后 POST /query 请求成功返回结果,即表示运行正常。

常见问题

Q:安装时需要手动创建虚拟环境吗?

A:README 是先 uv venv ragbuilder 创建虚拟环境,再 source 激活,最后 uv pip install ragbuilder 安装,按此顺序执行即可。

Q:不想用默认配置怎么办?

A:可以直接构造 RAGBuilder,传入 data_ingest_config、default_llm、default_embeddings,按需自定义每个环节。

Q:怎么评估哪种 RAG 配置更好?

A:提供 test_dataset(或让工具生成合成数据集),再调用 optimize_data_ingest / optimize_retrieval / optimize_generation 做优化,从 optimization_results 取结果。

Q:如何关闭匿名使用数据上报?

A:在 .env 中设置 ENABLE_ANALYTICS=False。README 说明只收集优化运行次数和成功失败率,不收集个人或业务数据。

Q:部署成服务后怎么调用?

A:执行 builder.serve(host="0.0.0.0", port=8000) 后,通过 POST /query 接口把查询打进 RAG 流水线。

注意事项

  • README 中的安装命令基于 uv,若本机没有 uv 需先自行准备该工具。
  • 构造 RAGBuilder 时需要自行提供 LLM 与嵌入模型的配置和凭据,README 未给出具体 Key 的填写位置。
  • 步骤中的 path/to/your/data 等路径是占位示例,请替换为你的真实数据路径。
  • 部分安装选项与更完整文档在 https://docs.ragbuilder.io/quickstart/ 上。

核心亮点

  • 自动评估多种 RAG 配置组合,用数据驱动选型,避免拍脑袋
  • 提供可视化对比报告,直观展示不同配置的检索与生成效果
  • 内置数据加载与预处理管道,支持常见文档格式,上手快

不足之处

  • 文档/社区待观察
  • 依赖较多外部服务(如向量库、LLM API),本地部署成本偏高

适用场景

  • 企业知识库问答系统开发,需要快速验证不同 RAG 方案
  • RAG 应用从原型走向生产,需要系统化调优和评估
  • 数据科学家或工程师构建垂直领域问答助手,希望减少手动实验

替代项目

LlamaIndex、LangChain、Haystack

项目介绍

ragbuilder 是搜索知识领域的开源项目,由 KruxAI 开发,2024 年首次发布。

在全站 13,090 个收录项目中,它的 GitHub 星标数(1,539)位列前 30%,在搜索知识分类中处于中上游。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-11。Apache-2.0 许可证,可免费使用和部署。

它主要面向的使用场景是:企业知识库问答系统开发,需要快速验证不同RAG方案。同类可对比的替代方案包括 LlamaIndex、LangChain、Haystack。

上一篇:Controllable-RAG-Agent

下一篇:rag-from-scratch

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09