html-get

一行代码抓任意网页 HTML,自动渲染纠错还快

html-get 是一个 JavaScript 库,用于从任意网站抓取 HTML 内容,并针对纠错与速度做了专门优化。它解决的核心问题是:普通 fetch 或 request 只能拿到原始响应,遇到需要 JavaScript 渲染、重定向、编码异常或结构损坏的页面时容易失败。html-get 内置了 headless 浏览器预渲染能力,能处理动态页面,同时支持抓取图片、音频、视频、PDF 等资源类型,并自动修正不规范的 HTML 标记。项目基于 got 等成熟请求库构建,API 简洁,适合需要稳定获取网页源码的自动化流程。它面向爬虫、内容聚合、页面快照、SEO 分析等场景,让开发者不必自己处理渲染与容错细节,直接拿到可用的 HTML 结果。

开源 free 自动化工作流
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 103
维护状态 活跃
是否开源
定价模式 free

项目数据

分类自动化工作流
开发团队microlinkhq
所属国家
定价模式free
价格说明开源免费
访问状态
是否开源
开源协议MIT
主要语言JavaScript
技术栈/模型audio,fetch,get,got,headless,html,image,markup,pdf,prerender,request,video
GitHub 星标★ 103
30天Star增速
HF 下载量
上线时间2018-06-26 00:00:00
最近更新2026-09-16 00:00:00
维护状态活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-16
浏览次数1

使用教程

核心亮点

  • 内置 headless 预渲染,能抓取依赖 JavaScript 动态生成的页面内容
  • 对不规范 HTML 做自动纠错,输出更干净可解析的标记
  • 基于 got 等成熟库,支持图片、音视频、PDF 等多种资源类型抓取

不足之处

  • 星标仅 103,属于早期项目,社区生态和长期维护待观察
  • 文档与示例相对有限,复杂场景需自行阅读源码

适用场景

  • 爬虫或内容聚合时批量获取网页 HTML 源码
  • 对动态渲染页面做快照或 SEO 结构分析
  • 自动化流程中需要稳定抓取并修正网页标记

替代项目

puppeteer、playwright、cheerio

项目介绍

html-get 是一个自动化工作流领域的开源项目,官方简介:Get the HTML from any website, fine-tuned for correction & speed。项目使用 JavaScript 开发,在 GitHub 上获得 103 星标。

上一篇:dsh-tabbit

下一篇:research-units-pipeline-skills

同类项目推荐

n8n 开源

拖拽搭建自动化流程,轻松接入 AI 与 400+ 应用,搞定重复工作。

Fair-code workflow automation platform with native AI capabilities. Combine visual b···

★ 204578 2026-08-10
robotcode 开源

让 Robot Framework 拥有现代 IDE 体验,调试、补全、运行一气呵成。

Open Source Toolkit for Robot Framework, providing Language Server Protocol support,···

★ 299 2026-08-10
puppeteer 开源

用 JavaScript 轻松操控无头浏览器,搞定自动化测试与网页抓取。

JavaScript API for Chrome and Firefox

★ 95585 2026-08-10
customermates 开源

比 Pipedrive 直观 10 倍的现代开源 CRM,轻松管理客户与自动化流程。

Building a modern alternative to Pipedrive that is 10x more intuitive.

★ 227 2026-08-10