html-to-markdown
本站收录 14 个带「html-to-markdown」标签的 AI 开源项目
firecrawl面向 AI 时代的上下文 API,提供大规模网页搜索、抓取与交互能力,让开发者轻松把互联网数据接入智能体应用,是 RAG 和 AI 工作流的数据入口利器。★ 186,524
trafilaturaTrafilatura 是一个用 Python 编写的网页文本与元数据抓取工具,同时提供命令行接口。它解决的核心问题是:从杂乱无章的 HTML 页面中精准提取正★ 6,890
AnyCrawlAnyCrawl 是一个基于 Node.js/TypeScript 的开源爬虫工具,主要解决将网站内容转化为大语言模型(LLM)可用的结构化数据,以及从 Goo★ 3,464
webclawwebclaw 是一个用 Rust 编写的本地优先网页内容提取工具,专为 LLM 设计。它解决的是大模型应用开发中网页数据获取难、格式杂乱的问题,能将网页高效转★ 2,366
crwcrw 是一个用 Rust 编写的轻量级网络爬虫、抓取与搜索 API,旨在作为 Firecrawl 和 Tavily 的高性能替代品。它解决了 AI 智能体在获★ 1,091
crwcrw 是一个用 Rust 编写的轻量级网页抓取、爬取与搜索 API,定位为 Firecrawl 和 Tavily 的开源替代品。它解决的是 AI 智能体获取实★ 1,091
pdf-reader-mcppdf-reader-mcp 是一个基于 MCP(模型上下文协议)的 PDF 阅读工具,旨在为 AI 智能体提供“眼睛”,使其能够深入理解 PDF 文档。它通过★ 988
anymdanymd 是一个用 Rust 编写的本地文档转换工具,目标是把各种格式的文件统一转成干净的 Markdown,方便喂给 AI 智能体或大模型。它支持 PDF、★ 988
firecrawl-app-examplesFirecrawl 是一个将网站内容转换为 LLM 可读格式的爬虫服务,本仓库则收录了基于 Firecrawl 构建的完整应用示例,包括网站和其他项目。它解决了★ 826
readerReader 是一套面向 AI 应用的开源 Web 基础设施,主要解决大模型和智能体在获取网页内容时遇到的脏数据、反爬拦截和会话管理难题。它提供抓取、爬取和自动★ 560
markdown-crawlermarkdown-crawler 是一个用 Python 实现的多线程网络爬虫,能够递归抓取整个网站,并将每个页面转换为结构清晰的 Markdown 文件。它专★ 474
extractorextractor 是一个基于 TypeScript 的开源工具,利用大语言模型(LLM)从网页中稳健地提取结构化数据。它解决了传统网页爬虫依赖固定选择器、易受★ 321
teracrawlteracrawl 是一个专为大型语言模型(LLM)优化设计的高性能网页爬虫 API。它解决的核心问题是:LLM 应用需要从任意网站或搜索结果中提取干净、结构化★ 285
LexoidLexoid 是一个开源的通用适配器,旨在将杂乱无章的真实世界数据转化为干净、可供 AI 智能体直接使用的上下文。它解决了 LLM 应用中数据质量差、格式不统一★ 107