遇见数据集

dh-unibe/kurrent-hanse-xvi-test-lines-with-evaluation

收藏
Hugging Face2026-06-05 更新2026-06-14 收录
官方服务:

资源简介:

该数据集名为evaluation-hf-printed,是基于danameyer/evaluation-hf-printed数据集并经过推理结果增强的版本。它包含164个样本,仅用于测试分割。数据集主要用于图像到文本转换、手写文本识别(HTR)和TrOCR模型的推理评估。数据特征包括项目名称、文件名、区域ID、行ID、行增强信息、图像、文本、行阅读顺序、行坐标、行基线、区域阅读顺序、区域类型、区域坐标以及一个特定的推理结果列(例如inference_20260605_220242_149959_model_dh-unibe_trocr-kurrent-XVI-XVII)。数据以parquet格式组织,按分割和项目名称分片存储。评估结果显示字符错误率(CER)为0.435,评估时间戳为2026-06-06T00:37:26。数据集适用于NLP和计算机视觉任务,特别是历史文档或印刷文本的自动识别和评估。

This dataset, named evaluation-hf-printed, is derived from danameyer/evaluation-hf-printed and has been enriched with inference results. It contains 164 samples across a single test split. The dataset is designed for image-to-text conversion, handwritten text recognition (HTR), and TrOCR model inference evaluation. Features include project_name, filename, region_id, line_id, line_augmentation, image, text, line_reading_order, line_coords, line_baseline, region_reading_order, region_type, region_coords, and a specific inference column (e.g., inference_20260605_220242_149959_model_dh-unibe_trocr-kurrent-XVI-XVII). Data is organized in parquet format, sharded by split and project name. Evaluation results show a Character Error Rate (CER) of 0.435, with a timestamp of 2026-06-06T00:37:26. The dataset is suitable for NLP and computer vision tasks, particularly for automatic recognition and evaluation of historical documents or printed texts.

提供机构:
dh-unibe
搜集汇总
数据集介绍
dh-unibe/kurrent-hanse-xvi-test-lines-with-evaluation 数据集图片
构建方式
该数据集源自danameyer/evaluation-hf-printed,并在此基础上融入了推理结果,形成了一个专注于手写文本识别的测试集。数据集包含164个样本,仅设有一个test拆分,所有数据以Parquet格式存储于data/test目录下,由HuggingFace Hub自动整合。每个样本均附有详细的元数据,如项目名称、文件名、区域与行标识符、图像及其对应的转录文本,并额外提供了由特定TrOCR模型(dh-unibe_trocr-kurrent-XVI-XVII)生成的推理输出,以此构建起一个可用于评估手写识别性能的基准数据集。
特点
数据集的核心特点在于其融合了原始标注与模型推理结果的双重信息结构。除了标准的图像、文本及坐标(包括行坐标、基线坐标、区域坐标)等数据外,还特意纳入了模型推理的文本列,这使得该数据集天然适用于评估图像到文本任务的精度。全部样本来源于一份1505年的汉萨同盟决议文件,其历史文本的复杂性与古德语手写风格(Kurrent)为模型评估提供了极具挑战性的测试场景。同时,数据集提供了完整的评估报告,包含字符错误率(CER)等关键指标,便于研究者直接量化模型性能。
使用方法
使用者可通过HuggingFace的datasets库便捷加载该数据集。核心加载命令为load_dataset("danameyer/evaluation-hf-printed"),即可获取全部test拆分数据。若需指定拆分,可使用load_dataset("danameyer/evaluation-hf-printed", split="test")。加载后,数据集中的image字段支持图像解码,而inference字段则提供了对应文本行的模型预测结果。研究者可将预测文本(hypothesis)与真实文本(ground truth)进行比对,复现或优化CER等评估指标,亦可将该数据集作为测试基准,评估不同手写文本识别模型在历史文档上的表现。
背景与挑战
背景概述
该数据集由伯尔尼大学数字人文研究团队创建,聚焦于16世纪早期汉萨同盟手写文献的自动识别任务。具体而言,其收录了1505年2月10日一份吕贝克城市档案的抄本页面,通过精细的行级标注与基线坐标信息,为光学字符识别(OCR)与手写文本识别(HTR)模型提供了高度结构化的测试基准。作为“kurrent-hanse-xvi-test-lines”系列的扩充版本,该数据集特别引入了基于TrOCR模型的推理结果与CER评估指标,旨在推动面向历史德语草书(Kurrentschrift)的端到端图像到文本转换研究。其对数字人文领域中古文献的大规模自动转录与文本挖掘具有基础性支撑作用。
当前挑战
该数据集所面临的核心挑战首先在于领域问题层面:16世纪汉萨文献混合了晚期中古德语与早期新高地德语变体,加之手工书写的Kurrent字体具有高度连笔与个人化风格特征,使得通用HTR模型在该语料上的字符错误率(CER)高达43.5%,暴露出跨时代文本泛化能力的显著不足。其次,在构建层面,数据集的164个样本虽然提供了精准的行坐标与基线注记,但规模极小,难以充分覆盖近代早期手抄本中的污损、墨迹渗透与版面畸变等问题,限制了模型对真实档案复杂情境的鲁棒性学习。
常用场景
经典使用场景
该数据集专为历史手写体与早期印刷体文本的图像到文字转换任务而设计,聚焦于16世纪德文库伦特字体(Kurrentschrift)的识别。其核心用途在于评估和基准测试基于Transformer的光学字符识别模型(如TrOCR)在古文献转录中的表现,尤其关注从区域级版面分析到行级文本序列的全流程精准度。
衍生相关工作
该数据集衍生的经典工作包括基于其评估报告所开发的Kurrent字体识别优化策略,例如引入数据增强技术(如线条强化与几何变换)提升模型对破损文档的鲁棒性。此外,研究者利用其版面标注信息训练区域检测与文本识别联合模型,推动了PageXML格式在历史文档结构化描述中的标准化应用,为跨语种古文档识别系统提供了可复用的评估基座。
数据集最近研究
最新研究方向
该数据集聚焦于16世纪德国库伦特文(Kurrent)手写体的光学字符识别(HTR)前沿研究,特别是在历史文档数字化与转录任务中,利用TrOCR(Transformer-based Optical Character Recognition)模型进行端到端的图像到文本生成。通过引入基于dh-unibe预训练模型的推理结果与准确的字错误率(CER=0.435)评估,该数据集揭示了当前深度学习方法在复杂手写历史文本识别中的瓶颈与潜力。其与汉萨同盟时期(1505年吕贝克决议案)具体历史文档的关联,彰显了数字人文领域借助AI还原珍贵古籍的巨大价值,推动了历史文献的大规模可检索与语义理解进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务