ReadingBank 是数据集领域的开源项目,由 doc-analysis 开发,2021 年首次发布。
它收录于数据集分类,该分类目前共有 282 个项目,GitHub 星标数为 119。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-28。学术数据集,免费开放。
它主要面向的使用场景是:训练OCR后处理模型,自动还原多栏文档的阅读顺序。同类可对比的替代方案包括 PubLayNet、DocBank。

给 OCR 文字排个正确阅读顺序,训练文档理解模型
ReadingBank 是一个面向阅读顺序检测任务的基准数据集,由文档 AI 研究者构建。它要解决的问题是:在 OCR 识别出页面文字后,机器往往不知道人类应该按什么顺序阅读这些文本块,尤其是多栏排版、图文混排、表格与页眉页脚交错的复杂文档。ReadingBank 提供了带有人工标注阅读顺序的文档样本,覆盖论文、报告、杂志等真实版式,让模型可以学习从二维版面还原出一维阅读序列。核心能力包括:作为训练与评测的统一数据源,支持阅读顺序检测模型的监督学习;提供标准化的评估基准,方便不同方法横向对比;覆盖多种文档类型和版式复杂度,有助于检验模型的泛化能力。对于从事文档理解、版面分析、OCR 后处理的研究者和工程师来说,它填补了阅读顺序这一细分任务缺少公开标注数据的空白,让相关模型训练和评测有据可依。
PubLayNet、DocBank
ReadingBank 是数据集领域的开源项目,由 doc-analysis 开发,2021 年首次发布。
它收录于数据集分类,该分类目前共有 282 个项目,GitHub 星标数为 119。
项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-28。学术数据集,免费开放。
它主要面向的使用场景是:训练OCR后处理模型,自动还原多栏文档的阅读顺序。同类可对比的替代方案包括 PubLayNet、DocBank。
上一篇:chess-openings
下一篇:没有了!
X-AnyLabeling
开源
一站式AI辅助标注,图像视频文本通吃,导出格式随心配
X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···
aisheets
开源
像用表格一样批量调 AI,不写代码就能造和改数据集
Build, enrich, and transform datasets using AI models with no code
DataGen
开源
用大模型一键生成定制化训练数据,告别数据荒
[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models
distilabel
开源
基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。
Distilabel is a framework for synthetic data and AI feedback for engineers who need ···