EpsteinFiles-RAG

用自然语言检索海量文档,快速获得精准答案

EpsteinFiles-RAG 是一个基于 Hugging Face 上 Teyler 发布的 'Epstein Files 20K' 数据集构建的 RAG(检索增强生成)流水线实现。该项目旨在解决对大规模、非结构化文档集进行高效问答和知识检索的问题。它通过将文档切块、嵌入、存储到向量数据库,并集成大语言模型进行生成,使用户能够用自然语言查询特定文档内容。核心能力包括文档加载与预处理、向量索引构建、语义检索、以及基于检索结果的生成式回答。项目采用 Python 编写,适合作为学习 RAG 架构和进行特定领域文档分析的参考实现。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 388
维护状态 低维护
是否开源
定价模式 free

项目数据

分类搜索知识
开发团队AnkitNayak-dev
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,可自由使用和部署,无付费版本。
访问状态
是否开源
开源协议MIT
主要语言Python
技术栈/模型epstein,epstein-files,rag,rag-chatbot,rag-pipeline
GitHub 星标★ 388
30天Star增速
HF 下载量
上线时间2026-02-10 00:00:00
最近更新2026-09-14 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 基于真实公开数据集,可直接体验 RAG 完整流程
  • 代码结构清晰,适合学习 RAG 核心组件(切分、嵌入、检索、生成)
  • 支持自定义文档集,可扩展到其他知识库场景

不足之处

  • 数据集内容敏感,可能引发伦理和法律风险
  • 文档/社区待观察

适用场景

  • 法律与调查文档的快速检索分析
  • 学术研究中的大规模文档问答
  • 企业私有知识库的 RAG 原型搭建

替代项目

LangChain、LlamaIndex、Haystack

项目介绍

EpsteinFiles-RAG 是搜索知识领域的开源项目,由 AnkitNayak-dev 开发,是 2026 年新上线的项目。

它收录于搜索知识分类,该分类目前共有 581 个项目,GitHub 星标数为 388。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-14。MIT许可证,可自由使用和部署,无付费版本。

它主要面向的使用场景是:法律与调查文档的快速检索分析。同类可对比的替代方案包括 LangChain、LlamaIndex、Haystack。

上一篇:blog

下一篇:Awesome-RAG

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
qiaomu-youtube-ai-podcast 开源

一站式索引AI播客,快速找到有文字稿和总结的节目

AI 播客索引:整理 AI 播客、中文简介、Transcript 状态和总结入口 | Curated AI podcast ···

★ 69 2026-08-09