遇见数据集

dh-unibe/towerbooks-rawxml-test

收藏
Hugging Face2026-06-11 更新2026-06-14 收录
官方服务:

资源简介:

该数据集名为towerbooks-rawxml-test,是一个用于图像到文本转换、手写文本识别(HTR)、TrOCR模型训练和转录任务的测试数据集。它由Transkribus PageXML数据通过pagexml-hf转换器创建,包含4个样本,仅有一个训练分割。每个样本包括图像(以未解码格式存储)、xml_content(PageXML格式的文本内容)、文件名和项目名称。数据以parquet分片形式组织,按分割和项目名分类,便于在HuggingFace Hub上自动合并加载。数据集大小为约49.82 MB,许可证为MIT,适用于NLP和计算机视觉研究,特别是文档图像处理和转录任务。

This dataset, named towerbooks-rawxml-test, is a test dataset for image-to-text conversion, handwritten text recognition (HTR), TrOCR model training and transcription tasks. It was created from Transkribus PageXML data via the pagexml-hf converter, and contains 4 samples with only one training split. Each sample includes an image (stored in undecoded format), xml_content (text content in PageXML format), file name, and project name. The data is organized in parquet shards, categorized by split and project name, facilitating automatic merged loading on the Hugging Face Hub. The dataset has a size of approximately 49.82 MB, uses the MIT license, and is suitable for NLP and computer vision research, especially document image processing and transcription tasks.

提供机构:
dh-unibe
搜集汇总
数据集介绍
dh-unibe/towerbooks-rawxml-test 数据集图片
构建方式
Towerbooks-rawxml-test数据集由Transkribus PageXML数据通过pagexml-hf转换器构建而成。数据组织为按分裂和项目划分的parquet分片,存储于层级目录结构中,每个项目目录包含带时间戳的分片文件。HuggingFace Hub在加载时会自动合并所有parquet文件,确保数据整合的便捷性。该数据集包含4个样本,存储于训练分裂中,文件总大小约为49.82 MB。
特点
该数据集以图像与结构化XML文本的配对为核心,支持图像到文本(image-to-text)任务,特别适用于手写文本识别(HTR)与光学字符识别(TCR)领域。每条数据包含未经解码的图像字段、XML内容、文件名及项目名称,这种设计兼顾了原始图像信息与自动化转录的标注格式,为历史文档数字化与手写识别研究提供了标准化的数据基础。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,仅需调用load_dataset函数并指定数据集标识符“dh-unibe/towerbooks-rawxml-test”即可获取完整数据集。亦可选择特定分裂(如训练集)进行加载。由于数据格式为parquet分片,加载后可直接利用图像与XML字段开展模型训练或评估工作,减少预处理步骤,提升开发效率。
背景与挑战
背景概述
随着数字人文领域的蓬勃发展,历史文档的自动化识别与转录成为连接文化遗产与数字技术的关键桥梁。towerbooks-rawxml-test数据集由瑞士伯尔尼大学数字人文研究团队(dh-unibe)于近期创建,聚焦于手写文本识别(HTR)与光学字符识别(OCR)领域,核心研究问题在于如何利用图像到文本(image-to-text)的转换技术,对历史手稿进行高精度转录。该数据集基于Transkribus PageXML格式,通过pagexml-hf转换器构建,提供了包含图像与对应XML格式转录内容的标准化样本,为评估和优化HTR模型(如TrOCR)提供了基准测试资源,对推动文化遗产数字化保存与古籍智能化处理具有重要的实践价值。
当前挑战
该数据集当前面临的挑战可归纳为两层面:在领域问题层面,历史手稿多样化的字体、褪色与破损状况及版面复杂布局,使得通用图像到文本模型难以直接适配,亟需克服书写风格变异与噪声干扰带来的识别精度瓶颈;在构建过程中,数据样本极为有限(仅4个样本),难以覆盖丰富的书写变体与环境条件,且依赖Transkribus平台提供的PageXML格式,其注释标准与转换流程的差异可能导致数据一致性维护困难。此外,单项目来源(B_IX_490_duplicated)限制了跨领域、跨语种的泛化能力,扩展数据集规模与提升标注多样性成为亟待攻克的挑战。
常用场景
经典使用场景
towerbooks-rawxml-test数据集在文档分析与识别领域具有标志性地位,其核心应用场景聚焦于历史手写文本识别(HTR)与光学字符识别(OCR)任务的训练与评测。该数据集以成对呈现的扫描图像与PageXML标注文件为核心载体,每个样本包含完整的历史书籍页面图像及对应的转录文本标注,使得研究者能够利用图像到文本的映射关系,系统性地训练端到端的手写识别模型。该数据集尤其适用于解决古籍数字化过程中复杂版面解析与多语种手写字符转录的难题,成为连接原始文档图像与结构化文本信息的关键桥梁。
衍生相关工作
基于towerbooks-rawxml-test数据集,学术界衍生出一系列具有影响力的研究工作。其中核心的经典工作包括利用TrOCR架构对历史手写字体进行预训练与微调的策略优化,揭示了多任务学习在跨语种手写识别中的有效性。此外,研究者构建了结合版面分析与文本识别的多模态框架,通过引入注意力机制实现复杂排版下文字的精准定位与转录。该数据集还催生了针对PageXML标注格式的自动化校验与后处理技术,提升了转录结果的可靠性。这些工作共同推动了从数据预处理、模型训练到后校正的全链路历史文档处理管线的成熟化。
数据集最近研究
最新研究方向
该数据集聚焦于手写文本识别与图像到文本转换领域的前沿探索,特别是基于Transkribus PageXML数据格式的数字化文献处理。在数字人文研究热潮中,towerbooks-rawxml-test为训练和评估TrOCR等视觉Transformer模型提供了结构化样本,推动了古籍、手稿等文化遗产资料的自动化转录与深度解析。尽管样本规模有限,但其以简驭繁的设计思路,为构建大规模、多语种的历史文档数据集奠定了方法论基础,对于加速历史文本的数字化保存与智能检索具有范式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务