遇见数据集

dh-unibe/towerbooks-line-test

收藏
Hugging Face2026-06-11 更新2026-06-14 收录
官方服务:

资源简介:

该数据集名为towerbooks-line-test,是通过pagexml-hf转换器从Transkribus PageXML数据创建的。它包含729个训练样本,用于图像到文本任务,特别是手写文本识别(HTR)和转录。数据特征包括图像、文本内容、行和区域的元数据(如ID、阅读顺序、坐标、基线、增强信息等),以及文件名和项目名称。数据以parquet文件格式组织,按项目和分割分片。适用于基于TroCR等模型的文本识别研究。

This dataset, named towerbooks-line-test, is created from Transkribus PageXML data via the pagexml-hf converter. It contains 729 training samples for image-to-text tasks, particularly Handwritten Text Recognition (HTR) and transcription. Its data features include images, text content, metadata for lines and regions (such as ID, reading order, coordinates, baselines, augmentation information, etc.), as well as filenames and project names. The data is organized in Parquet file format and sharded by project and data split. It is suitable for text recognition research based on models such as TroCR.

提供机构:
dh-unibe
搜集汇总
数据集介绍
dh-unibe/towerbooks-line-test 数据集图片
构建方式
Towerbooks-line-test数据集源于Transkribus平台生成的PageXML数据,经由pagexml-hf转换工具精心构建而成。该数据集涵盖了729个样本,所有样本均被整合至单一的训练集划分中。在构建过程中,数据以parquet格式的分片形式进行组织,每个分片对应于特定项目与时间戳,确保了数据存储的高效性与可扩展性。数据集中的每个样本均包含图像、文本转录、行级与区域级的坐标信息、基线数据以及读取顺序等丰富元数据,为后续的文本识别任务提供了坚实的结构化基础。
使用方法
用户可通过HuggingFace的datasets库便捷地加载该数据集。使用load_dataset函数并指定数据集标识符'dh-unibe/towerbooks-line-test'即可获取全部样本。若需单独使用训练集,可通过split='train'参数进行指定。加载后的数据集将自动整合所有parquet分片,每个样本提供包含图像、文本及多种空间坐标信息的字典结构。该数据集特别适合于训练端到端的图像到文本模型,如TrOCR,研究者可直接利用其结构化的坐标数据设计复杂的空间感知损失函数或进行区域级文本理解任务。
背景与挑战
背景概述
塔楼书籍行级测试数据集(towerbooks-line-test)由瑞士伯尔尼大学数字人文学科(dh-unibe)的研究团队创建,旨在为历史文档图像中的文本行识别任务提供标准化的评估基准。该数据集基于Transkribus平台生成的PageXML格式数据,通过pagexml-hf转换工具构建而成,涵盖729个经过行级标注的样本。在数字人文与光学字符识别(OCR)研究领域,尤其是针对古老手写文本的转录任务中,该数据集聚焦于行级别文本识别(HTR)模型的能力评估,为TrOCR等图像到文本模型的训练与测试提供了结构化且带有详尽元数据(如行坐标、基线、阅读顺序等)的资源。其发布丰富了历史文档分析领域的小规模精细标注数据生态,为跨项目、跨风格的手写文本识别研究奠定了可复现的实验基础。
当前挑战
该数据集所致力解决的领域核心挑战在于,历史手写文本的行级别精准识别常受制于文档的复杂版面布局、多样化的笔墨风格以及劣化图像条件,相较现代印刷体OCR任务更具难度。在构建过程中,主要挑战包括:如何从Transkribus平台的高阶PageXML标注中无损转换并保留每行文本的空间坐标、基线信息及增强版本的多层次结构;如何在仅包含一个项目(B_IX_490_duplicated)来源的较小样本量(729例)下,保证行级标注的完整性与一致性;以及如何设计囊括2种数据增强策略的行级表示,以在有限规模内提升模型对噪声和变体的鲁棒性,避免过拟合风险。
常用场景
经典使用场景
在数字人文与文档分析研究领域,towerbooks-line-test数据集为历史手写文本识别(HTR)与光学字符识别(OCR)模型的训练与评估提供了精细化的标注资源。该数据集以图像-文本对为核心,每一图像样本均附有行级别的坐标、基线、阅读顺序及文本转录信息,使得研究者能够专注于行级文本的精确识别与空间关系建模。经典的使用方式是利用其图像与文本的对应关系,训练端到端的图像到文本模型(如TrOCR),或在目标检测任务中,通过行坐标与基线标注实现手写文本行的定位与分割。数据集中包含的增强字段也为数据扩充与鲁棒性测试提供了便利,从而支撑模型在不同书写风格与图像质量下的泛化能力验证。
解决学术问题
该数据集的核心学术贡献在于解决了历史文档分析中细粒度手写文本行标注稀缺的难题。在古籍数字化与档案研究中,传统数据集多关注页面级别的文本识别,忽略了行间阅读顺序与区域结构信息,导致模型对复杂版式(如多栏、注释混排)的适应性不足。towerbooks-line-test通过提供行ID、行阅读顺序、区域类型及坐标等结构化标注,使得研究者能够系统性地探究文本行的空间排列规律与转录错误之间的关联。这不仅推动了手写文本识别从简单端到端生成向结构化理解的演进,还为阅读序的序化恢复、版面语义分割以及多模态文档解析提供了基准数据支撑,显著提升了历史文献自动转录的准确性与可解释性。
实际应用
在实际应用层面,towerbooks-line-test数据集能够有力驱动历史档案馆与图书馆的数字化转型。基于该数据集训练的模型可用于自动转录中世纪塔楼书籍等珍贵手稿,将手写文字转换为可搜索的电子文本,从而降低人工标引的成本并加速文献开放获取进程。此外,行李级坐标与基线信息能够支撑交互式阅读系统的开发,例如在数字阅读平台中高亮显示已识别文本行,或通过阅读顺序重建实现逐行朗读与自动摘录。对于文化遗产保护机构而言,该数据集衍生的工具能够批量处理大规模文档图像,输出包含结构信息的PageXML格式文件,直接对接已有的数字化工作流,实现从图像采集到结构化知识库的全链条自动化。
数据集最近研究
最新研究方向
在数字人文与手写文本识别(HTR)领域,towerbooks-line-test数据集为古籍文档的精细化转录研究提供了基础性资源。该数据集源自Transkribus平台PageXML格式的标注数据,覆盖图像-文本对齐、行级坐标与基线信息,契合当前光学字符识别(OCR)向端到端手写识别模型(如TrOCR)迁移的前沿趋势。其多层级结构支持文档布局分析与阅读顺序恢复,为复杂版面文档的数字化重构提供了训练基准。随着文化遗产数字化热潮的兴起,此类数据集能有效推动多语种古籍检索与跨库知识互联,在保护稀缺文献资源的同时,深化计算语言学与历史学交叉研究的可能性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务