raptor

把文档建树,检索时既能看细节又能看全局

RAPTOR 是论文《Recursive Abstractive Processing for Tree-Organized Retrieval》的官方实现,提出了一种全新的检索增强生成(RAG)方法。传统 RAG 只做块级检索,难以处理跨段落或全局性的问题。RAPTOR 通过递归地对文本块进行聚类、摘要和嵌入,构建一棵多层次树状索引。检索时,系统根据查询语义在树的不同层级选择最相关的节点,既能获取细粒度细节,也能捕获全局上下文。核心能力包括:递归摘要生成、基于聚类的树构建、以及结合查询的自适应检索策略。该实现支持多种嵌入模型和聚类算法,并提供了与 LangChain 集成的示例。它解决了长文档问答中信息分散、上下文丢失的问题,显著提升了对整体性问题的回答质量。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 1761
维护状态 低维护
是否开源
定价模式 free

项目数据

分类搜索知识
开发团队parthsarthi03
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,需自行部署使用。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型agents,clustering,framework,language-model,llm,machine-learning,rag,retrieval,retrieval-augmented-generation,vector-database
GitHub 星标★ 1761
30天Star增速
HF 下载量
上线时间2024-02-27 00:00:00
最近更新2026-09-22 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 3.8 或更高版本
  • pip 包管理工具
  • 可用的 OpenAI API Key(用于调用语言模型)
  • 能访问 GitHub 与 PyPI 的网络环境

安装与启动步骤

  1. 1克隆 RAPTOR 仓库

    把官方仓库下载到本地,命令执行后会生成 raptor 目录。

    git clone https://github.com/parthsarthi03/raptor.git
  2. 2进入项目目录

    切换到刚克隆下来的仓库根目录,后续命令都在此目录执行。

    cd raptor
  3. 3安装依赖

    按 requirements.txt 一次性安装项目所需的全部 Python 依赖包。

    pip install -r requirements.txt
  4. 4配置 OpenAI 密钥

    在代码中通过环境变量写入你的 OpenAI API Key,否则调用模型会失败。

    import os
    os.environ["OPENAI_API_KEY"] = "sk-xxxxxxxxxxxxxxxx"
  5. 5初始化并调用

    导入 RetrievalAugmentation 并使用默认配置实例化,即完成基本接入。

    from raptor import RetrievalAugmentation
    
    RA = RetrievalAugmentation()

关键配置

配置项必填说明示例
OPENAI_API_KEYOpenAI API 密钥,RAPTOR 调用语言模型生成摘要与嵌入时使用sk-xxxxxxxxxxxxxxxx

如何确认成功

在 Python 中执行 from raptor import RetrievalAugmentation 并创建 RA = RetrievalAugmentation(),无报错即接入成功。

常见问题

Q:Python 版本有要求吗?

A:README 明确要求 Python 3.8 及以上,版本过低会导致依赖安装或导入失败,建议使用 3.8+ 环境。

Q:没有 OpenAI API Key 能用吗?

A:README 的示例以 OpenAI 密钥为前提,未提供密钥时初始化与后续摘要、嵌入调用会报错,需自行准备可用密钥。

Q:pip install 失败怎么办?

A:先确认网络可访问 PyPI,并在虚拟环境(如 venv/conda)中安装;依赖冲突时可先升级 pip 再重试。

Q:高级配置该怎么做?

A:README 说明高级配置文档仍在编写中(WIP),当前可按默认配置初始化,或直接阅读仓库源码了解参数。

注意事项

  • 项目的官方论文链接为 https://arxiv.org/abs/2401.18059,建议结合论文理解树状索引与检索策略。
  • 使用默认配置会调用 OpenAI 的模型,会产生 API 费用,请留意密钥额度。
  • README 中的高级配置文档标注为 WIP,遇到参数问题以仓库源码为准。

核心亮点

  • 官方实现,算法与论文一致,可信度高
  • 树状结构支持多粒度检索,兼顾局部和全局信息
  • 提供 LangChain 集成示例,便于快速接入现有流程

不足之处

  • 文档和社区支持相对薄弱,示例有限
  • 对超长文档构建树的计算开销较大,性能待优化

适用场景

  • 长文档问答,需回答跨章节综合问题
  • 知识库检索,需同时满足精确匹配和主题概括
  • 学术论文阅读,快速定位核心论点与支持证据

替代项目

LlamaIndex、Haystack、LangChain

项目介绍

raptor 是搜索知识领域的开源项目,由 parthsarthi03 开发,2024 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(1,761)位列前 30%,在搜索知识分类中处于中上游。

近 42 天,它的 GitHub 星标从 1,741 增加到 1,761,净增 20。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-22。MIT许可证,完全免费,需自行部署使用。

它主要面向的使用场景是:长文档问答,需回答跨章节综合问题。同类可对比的替代方案包括 LlamaIndex、Haystack、LangChain。

上一篇:bm25s

下一篇:AgenticRAG-Survey

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09