warc-gpt

把历史网页变成可问答的知识库

warc-gpt 是一个实验性的检索增强生成(RAG)流水线,专门用于处理 Web 归档集合(WARC 格式)。它解决的是如何从海量历史网页快照中提取知识并用于问答的问题。核心能力包括:解析 WARC 文件、清洗网页内容、分块存储到向量数据库、通过嵌入模型建立索引,并利用大语言模型进行检索式问答。项目基于 Python 构建,支持自定义数据源和模型,适合研究人员、档案管理员或开发者探索将 AI 应用于网络存档分析。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 281
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队harvard-lil
所属国家
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型ai,rag,warc,webarchiving
GitHub 星标★ 281
30天Star增速
HF 下载量
上线时间2023-10-23 00:00:00
最近更新2026-09-17 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数0

使用教程

核心亮点

  • 直接解析 WARC 格式,无需预处理转换,简化归档数据接入
  • 模块化流水线设计,便于替换嵌入模型或向量库
  • 提供端到端示例,快速上手从存档到问答的完整流程

不足之处

  • 早期项目,文档和社区支持尚不完善
  • 对大规模 WARC 文件的性能优化有限

适用场景

  • 数字档案馆的智能检索与问答
  • 历史网页内容的学术研究辅助
  • 机构内部网络归档的知识挖掘

替代项目

txtai、LangChain、Haystack

项目介绍

warc-gpt 是搜索知识领域的开源项目,由 harvard-lil 开发,2023 年首次发布。

它收录于搜索知识分类,该分类目前共有 581 个项目,GitHub 星标数为 281。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-17。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:数字档案馆的智能检索与问答。同类可对比的替代方案包括 txtai、LangChain、Haystack。

上一篇:MinerU-HTML

下一篇:NanoSage

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09