遇见数据集

dh-unibe/kurrent-hanse-xvi-test-lines-crop-augment

收藏
Hugging Face2026-06-03 更新2026-06-14 收录
官方服务:

资源简介:

该数据集名为kurrent-hanse-xvi-test-lines-crop-augment,由Transkribus PageXML数据通过pagexml-hf转换器创建,专门用于手写文本识别(HTR)任务,特别是针对历史德文Kurrent手写体。数据集包含来自Hanse XVI测试集的492个样本,所有样本均属于训练集(train split)。每个样本包括裁剪和增强后的行图像、对应的文本转录、行和区域的元数据(如唯一标识符、阅读顺序、坐标、基线信息),以及文件名和项目名称。数据以parquet文件格式组织,便于高效加载和处理。该数据集适用于训练和评估图像到文本模型,如TrOCR等。

This dataset is named kurrent-hanse-xvi-test-lines-crop-augment. It was created from Transkribus PageXML data via the pagexml-hf converter, and is specifically designed for handwritten text recognition (HTR) tasks, particularly targeting historical German Kurrent script. The dataset contains 492 samples sourced from the Hanse XVI test set, with all samples belonging to the training split. Each sample includes cropped and augmented line-level images, corresponding text transcriptions, metadata for lines and regions (such as unique identifiers, reading order, coordinates, baseline information), as well as filenames and project names. The data is organized in Parquet file format to facilitate efficient loading and processing. This dataset is suitable for training and evaluating image-to-text models such as TrOCR.

提供机构:
dh-unibe
搜集汇总
数据集介绍
dh-unibe/kurrent-hanse-xvi-test-lines-crop-augment 数据集图片
构建方式
在历史文档分析与光学字符识别领域,准确还原手写文本是数字人文研究的重要基石。该数据集源自Transkribus平台导出的PageXML格式标注数据,经由pagexml-hf转换工具精心构建而成。具体而言,数据采用了按项目和分片组织的Parquet文件存储结构,每个分片以时间戳命名,存放于对应的项目文件夹下,HuggingFace Hub在加载时自动合并所有文件,确保了数据的高效读取与灵活管理。数据集共包含492个训练样本,每个样本均经过裁剪和数据增强处理,其中增强数量设定为2次,旨在提升模型对历史手写变体的鲁棒性。
特点
该数据集专为图像到文本任务设计,聚焦于历史手写识别(HTR)与TrOCR模型训练。其特色在于丰富的标注信息:每条数据不仅提供核心的图像与转录文本对,还详实记录了行级与区域级的空间坐标(coords)和基线(baseline),以及阅读顺序(reading_order)、区域类型(region_type)等结构化元数据。尤其值得一提的是,每条文本行均附带独立的line_id和augmentation标识,便于追溯数据来源与增强历史,这为研究数据增强对识别性能的影响提供了宝贵支撑。整体数据量约30.39 MB,规模适中,适合作为微调或基准测试的标准语料。
使用方法
使用者可通过HuggingFace的datasets库便捷加载该资源,仅需一行代码即可获取完整数据集或指定训练分片,例如`load_dataset("jwidmer/kurrent-hanse-xvi-test-lines-crop-augment", split="train")`。加载后,数据以标准字典格式呈现,其中'image'字段可解码为PIL图像对象,'text'字段则对应人工转录的文本。研究者可直接利用这些图像-文本对训练手写识别模型,也可借助line_coords和region_coords等空间信息进行布局分析与可视化。建议在使用前确认parquet文件格式的兼容性,并注意所有项目数据均遵从MIT开源许可协议,便于学术研究与二次开发。
背景与挑战
背景概述
在历史文献数字化与古籍文本识别领域,库伦特手写体(Kurrent)作为16世纪德语地区广泛使用的书写系统,其复杂多变的字形结构与褪色磨损的纸张背景给光学字符识别(OCR)与手写文本识别(HTR)技术带来了严峻挑战。为此,由研究人员jwidmer主导创建的kurrent-hanse-xvi-test-lines-crop-augment数据集应运而生,该数据集基于Transkribus平台导出的PageXML格式标注数据,专注于汉萨同盟时期历史文献中库伦特手写体的行级识别任务,具体源自1505年2月10日一份重要的汉萨同盟文件。数据集发布于HuggingFace平台,共包含492个训练样本,并采用了两种数据增强策略,旨在为基于Transformer的端到端手写识别模型(如TrOCR)提供高质量、标准化的训练与基准测试资源,对推动历史手写体自动转录技术的研究具有重要支撑作用。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:库伦特手写体与现代拉丁字母在字符形态上差异显著,且历史文献存在墨水渗化、页面污损、字迹重叠等复杂噪声,使得传统OCR模型难以直接应用,亟需专门针对手写文本的识别架构与数据增强策略。在构建过程中,数据集源自非结构化、多源异构的Transkribus PageXML标注文件,需完成从区域级到行级坐标的精确提取与对齐,同时确保不同标注员对字形切分、基线标注的一致性,任务繁杂且对领域知识要求极高。此外,492个样本仅包含一个历史项目来源,数据规模与多样性有限,如何通过有限数据有效训练泛化能力强的神经网络模型,也是该数据集当前面临的核心难题。
常用场景
经典使用场景
该数据集专为历史手写文本识别(HTR)任务而设计,聚焦于16世纪德国汉萨同盟时期的库伦特字体(Kurrentschrift)手写体识别。经典使用场景包括利用图像到文本的序列建模技术,将裁剪后的文本行图像精准转录为拉丁字母文本。数据集中丰富的行级标注信息(如基线坐标、阅读顺序、增强标记)为训练端到端的OCR模型(如TrOCR)提供了结构化支撑。研究者常以此数据集验证模型对历史文档中不规则布局、潦草笔迹和噪点干扰的鲁棒性,从而推动跨年代文本数字化进程。
实际应用
在实际应用中,该数据集直接服务于文化遗产数字化保护工程,例如德国汉萨联盟历史档案的电子化归档。图书馆和档案馆可基于此训练的HTR模型,自动转录16世纪商业信函、城市法典等手稿,取代耗时的人工誊录。此外,数据集的行级坐标与区域类型标注可赋能古籍的布局分割与结构化检索系统,支持历史学者通过关键词定位原始文献片段,极大提升史学研究的资料获取效率。
衍生相关工作
衍生工作方面,该数据集推动了基于Transformer的历史手写识别架构创新,如融合区域感知注意力机制的TrOCR变体。后续研究以其为基准,提出跨字体风格适应的对抗训练方法,并催生了融合PageXML标注的多模态文献理解预训练模型。同时,数据集中增强策略(如噪声注入、几何变换)的统计分析,启发了专门面向古文书学的数据扩增技术,相关成果被整合进Transkribus等开源平台,形成了从标注到推理的完整工具链。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务