MinerU-HTML

用SLM从网页中提取干净正文,喂给AI应用

MinerU-HTML 是一个基于小型语言模型(SLM)的 HTML 主内容提取工具,能够从杂乱网页中提取干净的 HTML 正文。它解决的是网页内容解析中常见的导航、广告、脚本等噪声干扰问题,为深度研究代理、RAG 应用和训练数据生成提供高质量输入。核心能力包括:利用 SLM 智能识别并剔除无关元素,保留结构化正文;输出标准 HTML 格式,便于下游处理;轻量高效,适合集成到现有数据管道。项目处于早期阶段,API 和文档尚在完善中。

开源 free 搜索知识
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 292
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类搜索知识
开发团队opendatalab
所属国家
定价模式free
价格说明开源项目,Apache-2.0许可证,可免费使用和部署。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型article-extractor,corpus-tools,nlp,rag,scraping,text-extraction,trafilatura,web-scraping,webagent
GitHub 星标★ 292
30天Star增速
HF 下载量
上线时间2025-11-26 00:00:00
最近更新2026-09-23 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数1

使用教程

核心亮点

  • 基于SLM智能识别内容,比传统规则过滤更适应复杂页面
  • 输出标准HTML,直接对接RAG和训练数据流程
  • 轻量级设计,适合嵌入现有爬虫或数据处理管道

不足之处

  • 文档/社区待观察
  • 早期项目,API可能不稳定,需关注版本迭代

适用场景

  • 深度研究代理的数据采集预处理
  • RAG系统的文档清洗与索引构建
  • 大规模训练数据集的网页正文提取

替代项目

trafilatura、readability-lxml、boilerpy3

项目介绍

MinerU-HTML 是搜索知识领域的开源项目,由 opendatalab 开发,2025 年首次发布。

它收录于搜索知识分类,该分类目前共有 585 个项目,GitHub 星标数为 292。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-23。Apache-2.0许可证,可免费使用和部署。

它主要面向的使用场景是:深度研究代理的数据采集预处理。同类可对比的替代方案包括 trafilatura、readability-lxml、boilerpy3。

上一篇:code_qa

下一篇:warc-gpt

同类项目推荐

firecrawl 开源

网页抓取像喝水一样简单,开发者省下整周加班

The web data API to search, scrape, and interact at scale.

★ 183325 2026-08-09
contoso-chat 开源

一键跑通 Azure RAG 应用,从代码到评估部署全流程

This sample has the full End2End process of creating RAG application with Prompty an···

★ 766 2026-08-09
graphify 开源

整个代码库画成一张图,找问题一眼定位

Turn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable k···

★ 120493 2026-08-09
ragflow 开源

让大模型用上你的私有知识,搭建可靠的企业级RAG应用

RAGFlow is a leading open-source Retrieval-Augmented Generation (RAG) engine that fu···

★ 91170 2026-08-09