PageIndex

不靠向量靠推理,让 RAG 检索更聪明

PageIndex 是一个面向 RAG(检索增强生成)场景的文档索引框架,核心思路是放弃传统向量检索,转而通过推理(reasoning)来定位信息。它解决的问题是:向量检索依赖语义相似度,难以处理逻辑复杂、需要多步推理或跨文档关联的查询。PageIndex 将文档组织为可推理的结构,让 LLM 在检索时进行上下文推理,从而更精准地找到答案。其核心能力包括:构建支持推理的文档索引、提供无向量检索的 RAG 流水线、以及集成 agentic AI 能力,使检索过程更智能。项目用 Python 实现,适合需要高精度、可解释检索的场景。

开源 unknown 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 35806
维护状态 活跃
是否开源
定价模式 unknown

项目数据

分类搜索知识
开发团队VectifyAI
所属国家
定价模式unknown
价格说明定价信息待确认
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型agentic-ai,agents,ai,ai-agents,context-engineering,information-retrieval,llm,rag,reasoning,retrieval,retrieval-augmented-generation,vector-database
GitHub 星标★ 35806
30天Star增速
HF 下载量
上线时间2025-04-01 00:00:00
最近更新2026-09-22 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数3

使用教程

难度:入门 约 10 分钟 部署方式:库/依赖 5 步

环境要求

  • Python 环境(README 使用 pip 安装)
  • 可用的 OpenAI API Key
  • 待索引的文档,例如 PDF 文件(示例为 report.pdf)

安装与启动步骤

  1. 1安装 PageIndex SDK

    使用 pip 安装最新版 pageindex 包,安装后即可在本地 Python 代码中导入使用。

    pip install -U pageindex
  2. 2配置 LLM 密钥

    把 OpenAI API Key 写入环境变量 OPENAI_API_KEY,示例值需替换为你自己的真实密钥。

    import os
    os.environ["OPENAI_API_KEY"] = "your-openai-key"
  3. 3初始化客户端

    创建 PageIndexClient,index 指定构建树索引的模型,chat 指定检索树的模型。

    from pageindex import PageIndexClient
    
    client = PageIndexClient(
        index="gpt-5.6-luna",   # model to build the tree index
        chat="gpt-5.6-sol",     # model to search the tree
    )
  4. 4提交文档建索引

    调用 submit_document 传入本地文档路径,返回结果中的 doc_id 用于后续检索,需妥善保存。

    doc_id = client.submit_document("report.pdf")["doc_id"]
  5. 5提问验证检索

    用 client.chat 针对该 doc_id 提问,返回结果即推理式检索得到的答案。

    answer = client.chat("What was the 2023 operating margin?", doc_id=doc_id)
    print(answer)

关键配置

配置项必填说明示例
OPENAI_API_KEY本地模式调用 LLM 的密钥,写入环境变量后客户端读取your-openai-key
indexPageIndexClient 参数,指定构建树索引所用的模型gpt-5.6-luna
chatPageIndexClient 参数,指定检索树时所用的模型gpt-5.6-sol

如何确认成功

运行提问脚本后能正常 print 出 answer 答案内容、无报错,即表示索引与检索流程跑通。

常见问题

Q:需要向量数据库或做分块吗?

A:不需要。README 明确说明 PageIndex 是 Vectorless, Reasoning-based RAG,无需向量库、无需分块。

Q:必须用 OpenAI 的密钥吗?

A:README 的本地模式示例使用 OPENAI_API_KEY;同时提到同一客户端可指向 PageIndex Cloud,配 API Key 使用,具体见官方文档。

Q:index 和 chat 可以是同一个模型吗?

A:README 示例中分别用 gpt-5.6-luna 建索引、gpt-5.6-sol 检索,两个参数可分别指定不同模型。

Q:支持哪些文档格式?

A:README 提到 PageIndex Flash 面向 text-based PDF(文本型 PDF),示例文档为 report.pdf。

注意事项

  • 文档索引需调用你指定的 LLM,会产生相应的 API 调用与费用
  • 请勿把真实 API Key 硬编码上传到公开仓库
  • 更多云端与开发者用法见官方文档 docs.pageindex.ai

核心亮点

  • 创新性地用推理替代向量检索,在复杂逻辑查询上准确率更高
  • 支持 agentic AI 集成,检索过程可动态调整策略
  • 文档索引结构设计合理,便于扩展自定义推理规则

不足之处

  • 推理式检索延迟可能高于向量检索,不适合超低延迟场景
  • 文档/社区待观察

适用场景

  • 法律合同条款的关联查询与推理
  • 科研论文中跨章节的结论溯源
  • 企业内部知识库的复杂决策支持

替代项目

LlamaIndex、Haystack、LangChain

项目介绍

PageIndex 是搜索知识领域的开源项目,由 VectifyAI 开发,2025 年首次发布。

在全站 13,014 个收录项目中,它的 GitHub 星标数(35,806)位列前 2%,在搜索知识分类的 581 个项目里位列前 3%。

近 44 天,它的 GitHub 星标从 35,098 增加到 35,806,净增 708。

项目目前处于活跃维护状态,最近一次代码更新于 2026-09-22。从国内网络环境看,可直接访问。

它主要面向的使用场景是:法律合同条款的关联查询与推理。同类可对比的替代方案包括 LlamaIndex、Haystack、LangChain。

上一篇:graphrag

下一篇:onyx

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09