遇见数据集

rukopys-curated-mvp

收藏
Hugging Face2026-05-28 更新2026-05-29 收录
官方服务:

资源简介:

RUKOPYS Curated MVP 是一个专为乌克兰语手写文档人工智能任务设计的、经过整理的、任务就绪的数据集,源自原始RUKOPYS数据集。它旨在支持端到端的手写文本识别流程,包括数据整理、模型训练、推理和评估。数据集包含2715个页面和39420个标注区域,数据来源多样,涵盖档案(178页)、听写(509页)、学校作业(1782页)和大学材料(246页)。区域类型丰富,主要包括手写文本(31193个区域),以及公式(6174个)、表格(240个)、打印文本(477个)、注释(1145个)、图像(130个)和图表(61个)。数据集为不同标注来源(人工标注者、志愿者、自动标注)分配了质量权重(1.0、0.75、0.35)。提供多种结构化数据格式,如metadata.jsonl(标准化页面记录和区域标注)、regions.jsonl(区域详细信息)、vlm_sft.jsonl(38832个裁剪级手写文本转录示例用于训练)、page_sft.jsonl(2330个全页图像到结构化JSON示例用于全页解析微调)和yolo/目录(YOLO格式用于布局检测实验)。数据集适用于微调视觉语言模型进行手写页面解析、训练布局检测器、OCR/HTR后处理基准测试,以及演示可复现的文档AI流水线。

RUKOPYS Curated MVP is a curated, task-ready dataset designed for Ukrainian language handwritten document AI tasks, derived from the original RUKOPYS dataset. It aims to transform raw data into reproducible training artifacts to support end-to-end handwritten text recognition (HTR) workflows, covering data curation, model training, inference, and evaluation. The dataset consists of 2,715 pages and 39,420 annotated regions, with diverse sources including archives (178 pages), dictations (509 pages), school assignments (1,782 pages), and university materials (246 pages). Region types are varied, primarily comprising handwritten text (31,193 regions), along with formulas (6,174), tables (240), printed text (477), annotations (1,145), images (130), and diagrams (61). Quality weights are assigned to different annotation sources (human annotators, volunteers, automatic annotation) as 1.0, 0.75, and 0.35, respectively. The dataset offers multiple structured data formats: `metadata.jsonl` contains standardized page records and region annotations; `regions.jsonl` provides detailed information per annotated region; `vlm_sft.jsonl` includes 38,832 cropped-level handwritten text transcription examples for training; `page_sft.jsonl` contains 2,330 full-page image to structured JSON examples for full-page parsing fine-tuning; and the `yolo/` directory provides YOLO-formatted data for layout detection experiments. It may also include cropped region images (`crops/`). The dataset is suitable for tasks such as fine-tuning visual language models (VLMs) for Ukrainian handwritten page parsing, training layout detectors for handwritten document regions, benchmarking OCR/HTR post-processing with structured outputs, and demonstrating reproducible document AI pipelines from raw data to model artifacts.

创建时间:
2026-05-25
原始信息汇总

数据集概述:RUKOPYS Curated MVP — 乌克兰手写识别数据集

许可证:CC BY-NC-SA 4.0
任务类别:目标检测、图像到文本
语言:乌克兰语
标签:手写识别(HTR)、光学字符识别(OCR)、文档分析


数据集简介

RUKOPYS Curated MVP 是从原始数据集 UkrainianCatholicUniversity/rukopys 衍生出的精选版本,专为乌克兰手写文档的人工智能处理而设计。它将原始发布数据转化为可复现的训练制品,支持全页视觉语言模型微调、裁剪级手写转录以及版面检测。


支持的应用场景

  • 全页图像到结构化 JSON 的监督微调
  • 裁剪级手写文本转录
  • YOLO 格式的版面检测实验
  • 区域级分析与筛选
  • 可复现的模型训练与数据集打包

数据集内容

文件名/目录 说明
metadata.jsonl 标准化的页面记录,包含图像元数据和区域标注
regions.jsonl 每个标注区域一行记录
vlm_sft.jsonl 裁剪级转录示例
page_sft.jsonl 全页图像到结构化 JSON 的示例
yolo/ YOLO 格式的版面检测数据集
crops/ 裁剪出的区域图像(若已导出)
_pack_manifest.json 压缩分片清单,用于打包上传至 Hub

统计数据

指标 数量
页面总数 2715
区域总数 39420
裁剪 SFT 示例 38832
全页 SFT 示例 2330

数据来源

来源 数量
档案(archive) 178
听写(dictation) 509
学校(school) 1782
大学(university) 246

区域类型与数量

区域类型 数量
批注(annotation) 1145
公式(formula) 6174
图表(graph) 61
手写(handwritten) 31193
图像(image) 130
印刷(printed) 477
表格(table) 240

质量权重

根据标注来源分配质量权重:

  • 标注员(annotator):1.0
  • 志愿者(volunteer):0.75
  • 自动(auto):0.35

推荐用途

  • 微调视觉语言模型以解析乌克兰手写页面
  • 训练手写文档区域的版面检测器
  • 使用结构化输出对 OCR/HTR 后处理进行基准测试
  • 展示从原始数据到模型制品的可复现文档 AI 流程

原始数据集

本数据集衍生自 UkrainianCatholicUniversity/rukopys,引用格式如下:

bibtex @dataset{rukopys_2026, title = {RUKOPYS}: Ukrainian Handwritten Text Recognition Dataset, author = {Dmytro Voitekh and Volodymyr Zmiivskyyi and Oleksii Molchanovskyi}, organization = {Ukrainian Catholic University}, year = {2026}, license = {CC BY-NC-SA 4.0}, url = {https://huggingface.co/datasets/UkrainianCatholicUniversity/rukopys}, note = {First large-scale Ukrainian HTR dataset; from 1920s archival documents to 2025 school homework and exams} }

搜集汇总
数据集介绍
rukopys-curated-mvp 数据集图片
构建方式
RUKOPYS Curated MVP数据集源自乌克兰天主教大学发布的原始RUKOPYS语料库,旨在为乌克兰语手写文档的人工智能研究提供可直接用于训练的标准数据制品。该数据集对原始版本进行了系统化的清洗与重构,生成了多种符合不同任务格式的数据文件,包括用于全页图像到结构化JSON微调的page_sft.jsonl、用于区域级手写文本转录的vlm_sft.jsonl、以及YOLO格式的版面检测数据集。所有区域标注均按来源赋予质量权重,其中人工标注权重为1.0,志愿者标注为0.75,自动标注为0.35。最终数据集包含2715页、39420个区域、38832个裁剪级转录样本和2330个全页结构化样本。
特点
该数据集的核心特点在于其多任务适配性与高度的可复现性。它同时支持全页图像到结构化JSON的视觉语言模型微调、裁剪区域的单个手写文本转录、基于YOLO格式的版面检测,以及区域级分析与筛选。数据集注释覆盖了手写文本、印刷文本、公式、表格、图像和图形等多种区域类型,其中手写区域占比最高,达31193个。来源涵盖档案文献、听写练习、学校作业和大学笔记,确保了文本风格、年代与书写习惯的多样性,适合构建稳健的乌克兰语手写识别与文档理解系统。
使用方法
推荐的使用方式包括:基于page_sft.jsonl进行全页文档解析的视觉语言模型监督微调;利用vlm_sft.jsonl训练区域级手写文本识别模型;借助yolo文件夹下的标注数据训练手写文档区域检测器;使用metadata.jsonl和regions.jsonl进行元数据驱动的分析实验。用户可将crops文件夹中的裁剪图像与对应转录配对,构建OCR/HTR后处理基准。为获得最佳训练效果,建议根据标注来源的质量权重(annotator: 1.0、volunteer: 0.75、auto: 0.35)对样本进行加权采样,以平衡不同标注精度的贡献。
背景与挑战
背景概述
在手写文字识别(HTR)领域,乌克兰语因其独特的西里尔字母书写变体与丰富的历史文档资源,长期缺乏大规模、高质量的结构化数据集。为此,乌克兰天主教大学的研究人员Dmytro Voitekh、Volodymyr Zmiivskyi及Oleksii Molchanovskyi于2026年创建了RUKOPYS数据集,并在此基础上衍生出本数据集。该数据集聚焦于乌克兰语手写文档的端到端智能解析,涵盖从20世纪20年代档案到2025年学校作业的多样化样本,旨在推动视觉-语言模型在全页图像理解、区域转录及版面检测等任务中的微调与评估。其构建不仅填补了乌克兰语HTR领域公开基准的空白,也为多语言文档分析的研究提供了可复现的范式,对东欧文化遗产数字化与教育文档自动化处理具有里程碑意义。
当前挑战
该数据集面临的核心挑战在于多源异构手写文档的联合建模:样本涵盖档案、听写、学校及大学四类来源,书写风格、纸张纹理与墨迹质量差异显著,对模型的泛化能力提出严苛要求。具体而言,全页图像到结构化JSON的转换需同时处理版面布局、公式、表格及手写文本的嵌套关系,而当前视觉-语言模型对此类复杂序列输出的对齐精度不足。构建过程中,数据清洗需要协调39120个区域注释的标注一致性,且不同来源(标注员、志愿者、自动)的质量权重差异(1.0至0.35)引入噪声管理难题,如何在不丢失信息的前提下过滤低置信度样本以保障微调效力,成为工艺设计的关键瓶颈。
常用场景
经典使用场景
在乌克兰语手写文档识别领域,该数据集被广泛用于构建端到端的视觉-语言模型微调任务。其经典使用场景包括全页面图像到结构化JSON的监督微调、手写文本区域的裁剪级转录,以及基于YOLO格式的版面检测实验。研究人员能够利用其精心组织的元数据和区域标注,完成从原始图像到结构化输出的全流程训练,从而高效地实现乌克兰语手写文档的自动化解析。
解决学术问题
该数据集有效解决了乌克兰语手写文本识别中缺乏高质量、可复现训练工件的学术困境。它提供了规格统一的元数据、区域级标注和多种监督学习格式,使研究者能够系统性地攻克全页面版面解析、手写文本转录准确性评估以及多源标注质量融合等挑战。通过引入基于标注来源的质量权重,该数据集推动了可靠的手写文档AI管线构建,显著提升了相关研究的可复现性和可比性。
衍生相关工作
基于该数据集衍生出的经典工作涵盖了多个前沿研究方向。研究者们借助其丰富的标注资源,发展了针对全页面图像的结构化解析模型,以及融合区域级与页面级信息的联合识别框架。在版面检测方面,YOLO格式的标注数据催生了针对乌克兰语手写文档的轻量级目标检测方法。此外,不同来源标注质量权重的引入,启发了关于标注噪声建模与多源数据融合策略的深入探讨,推动手写文本识别领域向着更加鲁棒和实用的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务