遇见数据集

dh-unibe/kurrent-hanse-xvi-test-lines-crop-noaugment

收藏
Hugging Face2026-06-03 更新2026-06-14 收录
官方服务:

资源简介:

该数据集名为kurrent-hanse-xvi-test-lines-crop-noaugment,是一个用于手写文本识别(HTR)的测试数据集,专注于历史文档中的Kurrent字体(一种德文手写体)文本行。数据集包含164个样本,全部位于训练分割中,总大小约为10.13 MB。数据通过pagexml-hf转换器从Transkribus PageXML格式转换而来,组织为parquet文件。每个样本包括图像、转录文本、行和区域的标识符、阅读顺序、坐标、基线信息以及文件名和项目名称等特征。数据集未进行数据增强,适用于图像到文本转换、转录任务,特别是基于Transformer的OCR(如TrOCR)模型的测试和评估。包含的项目涉及历史文档,如1505年的汉萨同盟相关记录。

The dataset named kurrent-hanse-xvi-test-lines-crop-noaugment is a test dataset for Handwritten Text Recognition (HTR), focusing on text lines in historical documents using Kurrent script (a German handwriting style). It contains 164 samples, all in the train split, with a total size of approximately 10.13 MB. The data was converted from Transkribus PageXML format using the pagexml-hf converter and is organized as parquet files. Each sample includes features such as image, transcribed text, line and region identifiers, reading order, coordinates, baseline information, filename, and project name. The dataset has no augmentation applied and is suitable for image-to-text conversion, transcription tasks, particularly for testing and evaluating Transformer-based OCR models like TrOCR. Included projects involve historical documents, such as records related to the Hanseatic League from 1505.

提供机构:
dh-unibe
搜集汇总
数据集介绍
dh-unibe/kurrent-hanse-xvi-test-lines-crop-noaugment 数据集图片
构建方式
该数据集源自Transkribus平台生成的PageXML标注数据,通过pagexml-hf转换工具将其转化为适用于HuggingFace标准格式的结构化数据集。原始数据由历史文献图像及其对应的文本转录构成,经过裁剪与对齐操作,提取出每一行文本的独立图像及其坐标、基线等精细标注信息。数据以Parquet分片形式组织,按数据划分和项目名称分层存储,确保了大规模数据的高效读取与兼容性。
特点
本数据集聚焦于16世纪汉萨同盟的古德语手写体识别,包含164个训练样本,以图像到文本的核心任务为主导,特别适用于光学手写识别(HTR)和TrOCR等模型的训练与评估。每一条样本不仅提供裁剪后的行图像与转录文本,还包含了行编号、阅读顺序、区域类型及坐标等多维度结构化元信息,为细粒度的文本分析和版面理解提供了丰富的数据支撑。
使用方法
用户可通过HuggingFace的datasets库轻松加载本数据集,仅需一行代码即可获取全部或指定划分的数据。由于所有Parquet分片在加载时被自动合并,用户可无缝使用标准的图像-文本对进行模型训练。推荐配合Transformers库中的TrOCR或其他图像到文本的预训练模型进行微调,亦可利用数据集中包含的坐标与基线信息进行版面分析与文本重排等进阶处理。
背景与挑战
背景概述
在历史文档分析与识别领域,手写文本识别(Handwritten Text Recognition, HTR)一直是极具挑战性的研究方向,尤其是在处理如古德语库伦特体(Kurrent)等历史字体时,其复杂多变的笔画形态与语料稀缺性严重制约了模型的泛化能力。kurrent-hanse-xvi-test-lines-crop-noaugment数据集由研究者jwidmer基于Transkribus平台导出的PageXML数据构建,创建时间为近期,隶属于汉萨同盟时代历史文献数字化项目(如1505年吕贝克汉萨决议)。该数据集专注于16世纪库伦特手写体的文本行裁剪图像,共包含164个训练样本,旨在为图像到文本(image-to-text)的HTR任务提供无数据增强的基准测试集,对推动历史手写体识别模型的鲁棒性评估与跨域迁移研究具有重要的参考价值。
当前挑战
该数据集所解决的领域挑战主要聚焦于历史库伦特体手写文本的自动转录,其核心难点包括:1)历史手写体的高度变异性(如字母粘连、笔画粗细不均)与有限标注样本(仅164条)之间的矛盾,使得模型容易过拟合;2)无数据增强的原始图像直接用于训练,缺乏对噪声、倾斜等干扰的鲁棒性,加剧了识别难度。在构建过程中,挑战体现在:需从复杂的PageXML结构化标注(包含文本行坐标、基线、区域读序等层级信息)中精确提取并裁剪文本行图像,同时确保与转录文本的严格对齐;此外,跨项目的多源语料整合(如单一项目‘1505-02-10_Hanserezess’)导致数据分布狭窄,进一步限制了模型对多样化历史文档的泛化能力。
常用场景
经典使用场景
该数据集聚焦于历史手写文档识别领域,其核心用途是为光学字符识别(OCR)与手写文本识别(HTR)模型提供精细化的训练与评估数据。基于Transkribus平台导出的PageXML数据,该数据集精心裁剪了16世纪汉萨同盟时期(Kurrent字体)的德文手稿行图像,并附带了对应的转录文本、行坐标、基线位置及阅读顺序等结构化元信息。研究人员通常利用这些样本对Transformer架构的TrOCR模型进行微调,或对传统的CRNN+CTC模型进行性能测试,以提升模型对古老、潦草且带有风格化连笔的手写文字的辨识能力。
解决学术问题
该数据集有效解决了历史文档数字化的核心瓶颈——古文字(尤其是Kurrent字体)识别准确率低下的问题。在学术研究中,16世纪的手写文书因墨水晕染、纸张老化、字体变异等因素,常导致现代OCR系统失效率极高。该数据集通过提供标准化的行级裁剪图像和精确的人工转录文本,使得研究者能够定量探讨数据增强策略、序列建模深度以及注意力机制对稀有历史字体的影响。其存在推动了面向低资源历史文本的迁移学习与少样本学习方法的发展,对认识欧洲中世纪和近代早期的社会、经济与法律文本具有重要的文献学意义。
衍生相关工作
该数据集的发布催生了多类后续研究工作。一方面,它被用作基线基准,对比不同的图像预处理方法(如去噪、二值化)与文本归一化策略对古德语识别的影响。另一方面,研究者基于其精细的行级与区域级标注,开发了针对文档版面分析的端到端联合模型,即同时完成文本检测与转录。此外,部分工作探索了利用该数据集进行跨域迁移,将训练好的编码器知识迁移到识别同期的拉丁文手稿或17世纪印刷体上。其衍生的数据增强版本(如添加合成噪声、字形变形)也为提升模型鲁棒性提供了丰富的对比实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务