Craw4LLM

让爬虫懂LLM需求,抓取即训练语料

Craw4LLM 是一个面向大语言模型预训练的高效网页爬取工具,源自同名学术论文。它解决的是传统爬虫抓取网页时内容冗余、噪声大、与训练目标不匹配的问题,通过将爬取过程与LLM的预训练需求结合,自动筛选和提取高质量文本。核心能力包括:基于内容质量评估的智能抓取、针对预训练语料优化的文本清洗、以及支持大规模并行爬取的架构。其创新点在于利用LLM自身反馈指导爬取策略,从而在有限带宽和算力下获取更有效的训练数据。项目提供Python接口,便于集成到现有数据流水线中。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 665
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队cxcscmu
所属国家
官网地址
定价模式free
价格说明开源项目,MIT许可证,完全免费,可自行部署使用。
访问状态
是否开源是
开源协议MIT
主要语言Python
技术栈/模型crawler,crawling,large-language-models,llm,pre-training,pretraining,web-crawler,web-crawling
GitHub 星标★ 665
30天Star增速
HF 下载量
上线时间2025-02-17 00:00:00
最近更新2026-09-16 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数6

使用教程

核心亮点

  • 提出LLM驱动的爬取策略,显著提升抓取内容与预训练目标的相关性
  • 实现高效的文本去噪和过滤,减少冗余数据,节省存储和计算资源
  • 代码结构清晰,提供可复现的实验配置,便于学术研究和工程落地

不足之处

  • 项目处于早期阶段,文档和社区支持尚待完善
  • 依赖LLM推理反馈,可能增加计算开销,对硬件有一定要求

适用场景

  • 构建LLM预训练语料库,需要从海量网页中提取高质量文本
  • 针对特定领域(如医疗、法律)的垂直爬虫,需精准过滤无关内容
  • 数据清洗流水线中,作为预处理步骤提升下游训练效果

替代项目

Scrapy、Crawley、Trafilatura

项目介绍

Craw4LLM 是数据集领域的开源项目,由 cxcscmu 开发,2025 年首次发布。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 665。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-16。MIT许可证,完全免费,可自行部署使用。

它主要面向的使用场景是:构建LLM预训练语料库,需要从海量网页中提取高质量文本。同类可对比的替代方案包括 Scrapy、Crawley、Trafilatura。

上一篇:LLM-PuzzleTest

下一篇:LongICLBench

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09