遇见数据集

READ-BAD

收藏
arXiv2017-12-11 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

READ-BAD数据集由罗斯托克大学和维也纳工业大学联合创建,包含2036页来自不同时间和地点的档案文档图像。该数据集挑战了文本行分割方法,因其包含多样的页面布局和退化情况。创建过程中,从9个不同的欧洲档案馆收集了近2000份文档,并通过DigiTexx进行文本区域和基线的标注。READ-BAD数据集的应用领域主要集中在历史文档的布局分析,旨在解决文本行检测和分割的难题,特别是在处理复杂布局和多种退化情况时。

The READ-BAD dataset, jointly developed by the University of Rostock and Vienna University of Technology, comprises 2036 archival document images sourced from diverse time periods and geographical locations. This dataset presents substantial challenges to text line segmentation methods, as it features varied page layouts and multiple document degradation scenarios. During the dataset's construction, nearly 2000 documents were collected from nine distinct European archives, with text regions and baselines annotated via DigiTexx. The primary application scope of the READ-BAD dataset lies in layout analysis for historical documents, where it aims to address the core difficulties in text line detection and segmentation, especially when handling complex layouts and diverse degradation conditions.

提供机构:
罗斯托克大学
创建时间:
2017-05-09
搜集汇总
数据集介绍
READ-BAD 数据集图片
构建方式
READ-BAD数据集由来自9个欧洲档案馆的2036张历史文档图像构成,时间跨度从1470年至1930年。每张图像均标注了基线(baseline)和文本区域,采用PAGE XML格式存储。数据集被划分为简单文档和复杂文档两个子集,前者仅包含简单页面布局,后者涵盖全页表格、多列文本及旋转文本行等复杂场景。每个子集进一步分为训练集和测试集,训练集从每个档案馆选取30张图像,最终简单文档训练集含216张,复杂文档训练集含270张。所有标注经过两轮独立审查以确保质量。
使用方法
数据集适用于基线检测算法的训练与评估,配套提供了基于基线的评价方案,通过R值(检测可靠性)和P值(布局结构准确性)量化算法性能。用户可直接使用公开的训练集进行模型训练,并在测试集上计算F值(R与P的调和平均)。评价工具已开源为Java命令行程序,支持多页面平均评估,且不依赖二值化或阅读顺序。建议研究者关注复杂子集以检验算法在表格、多列及旋转文本等场景下的分割能力。
背景与挑战
背景概述
文本行检测作为自动文本识别与关键词检索的关键预处理步骤,在文档分析领域中占据核心地位。然而,既有数据集多聚焦于现代、规整的手写文本或具有高度同质化页面布局的历史文档,难以涵盖真实档案文献中普遍存在的复杂退化与多样化版面结构。为填补这一空白,由罗斯托克大学计算智能技术实验室的Tobias Grüning与Roger Labahn,以及维也纳工业大学计算机视觉实验室的Markus Diem、Florian Kleber和Stefan Fiel等研究者,于2017年共同创建了READ-BAD数据集。该数据集汇聚了来自9个欧洲档案馆的2036幅历史文档图像,时间跨度自1470年至1930年,包含大量褪色墨迹、透印、旁注、倾斜及重叠文本行等复杂现象,并创新性地采用基线标注方案替代传统的像素级或多边形标注,显著降低了人工标注成本。该数据集已被ICDAR 2017基线检测竞赛与布局分析竞赛采纳,为历史文档文本行分割算法的鲁棒性评估提供了全新的基准平台。
当前挑战
READ-BAD数据集所应对的核心挑战在于历史档案文档文本行分割的极端复杂性。首先,文档图像普遍存在严重退化现象,如墨迹褪色、纸张透印、污渍噪声等,这些因素严重干扰了传统基于二值化或像素级分析的分割算法的性能。其次,页面布局高度异质,包含多栏文本、表格、旁注、旋转文本行以及不同文本行之间的接触与重叠,要求算法具备精准的版面理解能力以避免欠分割或误分割。此外,构建过程中亦面临显著挑战:从9个档案馆收集的原始图像需经过严格的质量与内容筛选,最终从2250幅缩减至2036幅,并由专业团队进行基线标注,再经双重独立审校以确保标注一致性,整个流程耗时且需大量人工干预。最终数据集被划分为简单与复杂两个子集,以分别评估算法在纯文本行检测与复杂版面场景下的表现,进一步凸显了该领域对鲁棒且通用分割方法的迫切需求。
常用场景
经典使用场景
READ-BAD数据集专为档案文献的基线检测任务而设计,广泛应用于文档布局分析领域。该数据集收录了来自9个欧洲档案馆的2036页历史文献图像,时间跨度从1470年至1930年,涵盖了丰富的页面布局类型与退化现象,如褪色墨迹、透印、旁注、倾斜及交叠文本行。研究者常利用该数据集训练和评估基线检测算法,以应对复杂布局下的文本行分割挑战。其经典使用场景包括在简单文档与复杂文档两个子集上验证算法的鲁棒性,其中复杂文档包含多栏文本、表格和旋转文本行,对算法的布局理解能力提出了更高要求。
解决学术问题
该数据集有效解决了现有文档分析基准中布局多样性不足与退化现象覆盖不全的学术问题。此前广泛使用的数据集如IAM-HistDB或Saint Gall等,主要包含现代或高度规整的手写文本,难以反映真实历史档案中的复杂情况。READ-BAD通过提供大量具有真实退化与复杂布局的标注图像,填补了该领域的空白。它促使研究者从仅关注文本行分割精度转向兼顾布局感知与退化鲁棒性,推动了更贴近实际应用的基线检测评估体系建立。其提出的基于基线的评估方案无需二值化处理,能够处理倾斜和旋转文本行,为文档分析社区提供了一个更高效、目标导向的评测工具。
实际应用
在实际应用中,READ-BAD数据集主要服务于历史文献的数字化与信息提取流程。它作为关键词检索与手写文本识别系统的前置处理模块,帮助提升文本行检测的准确性,从而改善后续识别任务的性能。档案机构、图书馆和文化遗产保护项目可利用基于该数据集训练的算法,自动处理大量历史手稿、教会登记簿、议会记录及私人信件等文献,实现高效的内容索引与全文转录。此外,该数据集也支持跨国合作项目如欧洲地平线2020计划中的READ项目,为大规模档案数字化提供技术支撑,显著降低了人工标注成本并提高了处理速度。
数据集最近研究
最新研究方向
在历史文档分析领域,文本行检测作为自动文本识别与关键词检索的核心预处理步骤,长期面临复杂版面与退化图像的严峻挑战。READ-BAD数据集应运而生,汇集了来自九个欧洲档案馆的2036幅跨越1470年至1930年的手稿图像,囊括多栏布局、旋转文本、墨迹渗透及边缘注释等极端情况,填补了现有数据集在多样性和复杂度上的空白。该数据集引入基于基线的标注方案,替代传统的像素级多边形标注,大幅降低了人工成本,并配套提出了一种无需二值化、可处理倾斜文本行的新型评估体系,该体系已在ICDAR 2017基线检测竞赛中得到验证。这一创新不仅推动了面向复杂历史文档的版面分析算法从简单场景向真实历史环境的迁移,更通过公开的评估工具和训练集,为深度学习方法在古籍数字化与文化遗产保护中的鲁棒性研究提供了坚实的基准平台。
相关研究论文
  • 1
    READ-BAD: A New Dataset and Evaluation Scheme for Baseline Detection in Archival Documents罗斯托克大学 · 2017年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务