markdown-crawler

一键把整个网站变成 Markdown,喂给 AI 做知识库

markdown-crawler 是一个用 Python 实现的多线程网络爬虫,能够递归抓取整个网站,并将每个页面转换为结构清晰的 Markdown 文件。它专为 LLM RAG(检索增强生成)场景设计,解决了传统爬虫输出 HTML 或纯文本导致的内容解析困难、信息密度低的问题。核心能力包括:多线程并发抓取提升效率、自动提取页面正文并去除导航/广告等噪音、按 URL 结构生成对应的 Markdown 文件目录、支持自定义抓取深度和域名限制。输出结果可直接用于构建知识库、训练语料或作为 RAG 系统的文档源,方便后续分块、向量化和检索。项目处于早期阶段,但设计思路明确,代码简洁,易于二次开发和集成。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 472
维护状态 维护中
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队paulpierre
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,无付费版本。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型html-to-markdown,html-to-markdown-converter,html2md,llm,llmops,markdown,markdown-crawler,markdown-parser,markdown-scraper,md-crawler,rag,web-scraper
GitHub 星标★ 472
30天Star增速
HF 下载量
上线时间2023-10-24 00:00:00
最近更新2026-09-18 00:00:00
维护状态维护中
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 多线程抓取,速度比单线程爬虫快数倍
  • 输出干净的 Markdown,直接适配 RAG 分块和向量化
  • 递归抓取并保留网站目录结构,方便管理大量页面

不足之处

  • 文档/社区待观察
  • 对 JavaScript 渲染的页面支持有限,可能抓不到动态内容

适用场景

  • 为 LLM 应用构建网站知识库
  • 离线备份网站内容为易读文本
  • 批量抓取文档站生成训练语料

替代项目

crawl4ai、Scrapy、Firecrawl

项目介绍

markdown-crawler 是搜索知识领域的开源项目,由 paulpierre 开发,2023 年首次发布。

它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 472。

项目仍在小幅维护中,最近一次代码更新于 2026-09-18。MIT许可证,完全免费,无付费版本。

它主要面向的使用场景是:为LLM应用构建网站知识库。同类可对比的替代方案包括 crawl4ai、Scrapy、Firecrawl。

上一篇:rag-all-techniques

下一篇:awesome-rag

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09