data_io

一键构建HR预训练数据管道,快速产出高质量语料

data_io 是一个面向 HRM-Text(人力资源领域文本)预训练的数据管道项目,专注于构建和清洗用于训练 HR 相关大模型的高质量文本数据集。它解决了 HR 领域预训练数据稀缺、来源分散、格式不统一的问题,提供数据采集、清洗、去重、格式化等一系列流水线处理能力。核心功能包括从多种数据源抽取文本、过滤噪声信息、标准化字段结构,并输出适合预训练模型使用的语料。项目基于 Python 实现,模块化设计便于扩展和定制,适合 HR 技术团队或研究机构用于构建领域专属预训练数据集。

开源 free 开源模型
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 74
维护状态 低维护
是否开源 是
定价模式 free

项目数据

分类开源模型
开发团队sapientinc
所属国家
官网地址
定价模式free
价格说明开源项目,Apache-2.0 许可证,可自由使用,无付费版本。
访问状态
是否开源是
开源协议Apache-2.0
主要语言Python
技术栈/模型data,large-language-models,pretraining
GitHub 星标★ 74
30天Star增速
HF 下载量
上线时间2026-05-18 00:00:00
最近更新2026-09-04 00:00:00
维护状态低维护
中文支持
访问方式
移动端支持
综合评分
收录时间2026-08-09
浏览次数10

使用教程

核心亮点

  • 专注HR领域,解决通用数据管道在专业文本上的适配问题
  • 模块化设计,各处理环节可独立使用或替换
  • 代码简洁,易于二次开发和集成到现有训练流程

不足之处

  • 文档/社区待观察
  • 项目处于早期,功能覆盖可能不全面

适用场景

  • HR领域大模型预训练数据准备
  • 人力资源文本挖掘与清洗
  • 构建行业定制化NLP训练集

替代项目

Hugging Face Datasets、Apache Beam、Luigi

项目介绍

data_io 是数据集领域的开源项目,由 sapientinc 开发,是 2026 年新上线的项目。

它收录于数据集分类,该分类目前共有 279 个项目,GitHub 星标数为 74。

项目已超过三个月没有代码更新,维护节奏明显放缓,最近一次代码更新于 2026-09-04。Apache-2.0 许可证,可自由使用,无付费版本。

它主要面向的使用场景是:HR领域大模型预训练数据准备。同类可对比的替代方案包括 Hugging Face Datasets、Apache Beam、Luigi。

上一篇:StarryDivineSky

下一篇:freshqa

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10528 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1645 2026-09-20
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3398 2026-08-10
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09