ReadingBank

给 OCR 文字排个正确阅读顺序,训练文档理解模型

ReadingBank 是一个面向阅读顺序检测任务的基准数据集,由文档 AI 研究者构建。它要解决的问题是:在 OCR 识别出页面文字后,机器往往不知道人类应该按什么顺序阅读这些文本块,尤其是多栏排版、图文混排、表格与页眉页脚交错的复杂文档。ReadingBank 提供了带有人工标注阅读顺序的文档样本,覆盖论文、报告、杂志等真实版式,让模型可以学习从二维版面还原出一维阅读序列。核心能力包括:作为训练与评测的统一数据源,支持阅读顺序检测模型的监督学习;提供标准化的评估基准,方便不同方法横向对比;覆盖多种文档类型和版式复杂度,有助于检验模型的泛化能力。对于从事文档理解、版面分析、OCR 后处理的研究者和工程师来说,它填补了阅读顺序这一细分任务缺少公开标注数据的空白,让相关模型训练和评测有据可依。

开源 free 数据集
访问官网 ↗ GitHub ↗ 文档 ↗
GitHub 星标 ★ 119
维护状态 较活跃
是否开源 是
定价模式 free

项目数据

分类数据集
开发团队doc-analysis
所属国家
官网地址
定价模式free
价格说明学术数据集,免费开放
访问状态
是否开源是
开源协议
主要语言
技术栈/模型document-ai,document-intelligence,document-understanding,natural-language-processing,nlp,ocr
GitHub 星标★ 119
30天Star增速
HF 下载量
上线时间2021-07-10 00:00:00
最近更新2026-09-28 00:00:00
维护状态较活跃
中文支持
访问方式
移动端支持
综合评分
收录时间2026-09-30
浏览次数0

使用教程

核心亮点

  • 提供人工标注的阅读顺序真值,可直接用于监督训练
  • 覆盖多栏、图文混排等复杂真实版式,检验模型泛化
  • 作为公开基准,便于不同阅读顺序检测方法公平对比

不足之处

  • 项目早期星标较少,社区生态和工具链尚不成熟
  • 数据规模与版式覆盖范围可能有限,需关注后续更新

适用场景

  • 训练 OCR 后处理模型,自动还原多栏文档的阅读顺序
  • 评测版面分析算法在复杂版式下的阅读顺序准确率
  • 为文档问答、信息抽取系统提供正确的文本序列输入

替代项目

PubLayNet、DocBank

项目介绍

ReadingBank 是数据集领域的开源项目,由 doc-analysis 开发,2021 年首次发布。

它收录于数据集分类,该分类目前共有 282 个项目,GitHub 星标数为 119。

项目保持着较活跃的维护节奏,最近一次代码更新于 2026-09-28。学术数据集,免费开放。

它主要面向的使用场景是:训练OCR后处理模型,自动还原多栏文档的阅读顺序。同类可对比的替代方案包括 PubLayNet、DocBank。

上一篇:chess-openings

下一篇:没有了!

同类项目推荐

X-AnyLabeling 开源

一站式AI辅助标注,图像视频文本通吃,导出格式随心配

X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop applicat···

★ 10569 2026-08-10
aisheets 开源

像用表格一样批量调 AI,不写代码就能造和改数据集

Build, enrich, and transform datasets using AI models with no code

★ 1647 2026-09-20
DataGen 开源

用大模型一键生成定制化训练数据,告别数据荒

[ICLR'25] DataGen: Unified Synthetic Dataset Generation via Large Language Models

★ 69 2026-08-09
distilabel 开源

基于论文的合成数据流水线,快速生成高质量 AI 反馈数据。

Distilabel is a framework for synthetic data and AI feedback for engineers who need ···

★ 3401 2026-08-10