markdown-crawler 是搜索知识领域的开源项目,由 paulpierre 开发,2023 年首次发布。
它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 472。
项目仍在小幅维护中,最近一次代码更新于 2026-09-18。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:为LLM应用构建网站知识库。同类可对比的替代方案包括 crawl4ai、Scrapy、Firecrawl。

一键把整个网站变成 Markdown,喂给 AI 做知识库
markdown-crawler 是一个用 Python 实现的多线程网络爬虫,能够递归抓取整个网站,并将每个页面转换为结构清晰的 Markdown 文件。它专为 LLM RAG(检索增强生成)场景设计,解决了传统爬虫输出 HTML 或纯文本导致的内容解析困难、信息密度低的问题。核心能力包括:多线程并发抓取提升效率、自动提取页面正文并去除导航/广告等噪音、按 URL 结构生成对应的 Markdown 文件目录、支持自定义抓取深度和域名限制。输出结果可直接用于构建知识库、训练语料或作为 RAG 系统的文档源,方便后续分块、向量化和检索。项目处于早期阶段,但设计思路明确,代码简洁,易于二次开发和集成。
crawl4ai、Scrapy、Firecrawl
markdown-crawler 是搜索知识领域的开源项目,由 paulpierre 开发,2023 年首次发布。
它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 472。
项目仍在小幅维护中,最近一次代码更新于 2026-09-18。MIT许可证,完全免费,无付费版本。
它主要面向的使用场景是:为LLM应用构建网站知识库。同类可对比的替代方案包括 crawl4ai、Scrapy、Firecrawl。
下一篇:awesome-rag
firecrawl
开源
网页抓取像喝水一样简单,开发者省下整周加班
The web data API to search, scrape, and interact at scale.
contoso-chat
开源
一键跑通 Azure RAG 应用,从代码到评估部署全流程
This sample has the full End2End process of creating RAG application with Prompty an···
graphify
开源
整个代码库画成一张图,找问题一眼定位
Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···
ragflow
开源
让大模型用上你的私有知识,搭建可靠的企业级RAG应用
RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···