遇见数据集

rukopys-workshop-subset

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

RUKOPYS workshop 子集(school + university)是一个小型的微调数据集,专为夏季学校 LLM 微调工作坊设计,旨在训练 Qwen3-VL 模型检测和转录乌克兰语手写文档页面。该子集源自乌克兰天主教大学发布的 RUKOPYS 数据集(CC BY 4.0),仅包含原始训练集中的 school 和 university 来源图像。数据集包含 844 张 JPEG 图像(已缩放至 ≤1.5 Mpx,质量因子 87),以及 760 条训练记录和 84 条验证记录(按来源分层划分,种子 3407)。每条记录包含图像路径、来源、图像尺寸以及目标标注(JSON 格式,包含区域边界框、类型和文本)。区域类型包括:handwritten(手写)、printed(印刷)、formula(公式)、table(表格)、annotation(注释)、image(图像)、graph(图形)。边界框坐标采用 0-1000 的相对尺度,与图像尺寸无关。文本中可包含特殊标记:~~strikethrough~~(删除线)、~~old~~{new}(替换)、[illegible](无法辨认)。数据集还提供了 Unsloth QLoRA 微调脚本、评估工具和 Colab 笔记本,便于在 T4 GPU 上进行单次会话训练。适用于手写文本识别(HTR)、对象检测和 OCR 相关任务。

The RUKOPYS workshop subset (school + university) is a small fine-tuning dataset designed for the summer school LLM fine-tuning workshop, aimed at training the Qwen3-VL model to detect and transcribe Ukrainian handwritten document pages. This subset is derived from the RUKOPYS dataset released by the Ukrainian Catholic University (CC BY 4.0), containing only the school and university source images from the original training set. The dataset includes 844 JPEG images (resized to ≤1.5 Mpx, quality factor 87), with 760 training records and 84 validation records (stratified by source, seed 3407). Each record contains an image path, source, image dimensions, and target annotations (JSON format with region bounding boxes, types, and text). Region types include: handwritten, printed, formula, table, annotation, image, and graph. Bounding box coordinates are in relative scale 0-1000, independent of image dimensions. Text may contain special markers: ~~strikethrough~~, ~~old~~{new} (replacement), [illegible] (illegible). The dataset also provides Unsloth QLoRA fine-tuning scripts, evaluation tools, and a Colab notebook, facilitating single-session training on a T4 GPU. It is suitable for handwritten text recognition (HTR), object detection, and OCR-related tasks.

创建时间:
2026-08-06
原始信息汇总

数据集概述

基本信息

  • 数据集名称:RUKOPYS workshop subset (school + university)
  • 许可证:CC BY 4.0
  • 语言:乌克兰语
  • 任务类别:图像到文本、目标检测
  • 标签:手写识别、HTR、OCR、乌克兰语、工作坊
  • 数据规模:少于 1K 条记录
  • 创建机构:基于乌克兰天主教大学的 RUKOPYS 数据集(v2.2)筛选而得

数据集内容

该子集为暑期学校 LLM 微调工作坊设计,目标是在单次 Google Colab 会话(T4 GPU)中训练 Qwen3-VL 模型完成乌克兰手写文档页面的检测与转录。数据来源于 RUKOPYS 数据集的 train 分割,仅保留 school(学校)和 university(大学)两个来源。

文件结构

文件 说明
images.tar 844 张 JPEG 图像(最大尺寸降至 ≤1.5 Mpx,质量 q87),打包为单压缩包约 190 MB
train.jsonl 760 条训练记录(school 614 条 + university 146 条)
val.jsonl 84 条验证记录(school 68 条 + university 16 条)
code/ft_qwen_unsloth.py Unsloth QLoRA 训练脚本
code/kaggle_metric.py 官方竞赛评分器(类型感知文本归一化)
code/workshop_utils.py 笔记本辅助工具函数
rukopys_ft_workshop.ipynb 工作坊笔记本(下载 → 数据查看 → QLoRA 微调 → CER 对比 → Gemini 比较)

训练/验证分割按来源分层,随机种子为 3407。

记录格式(Schema)

每条记录包含:

  • uuid:唯一标识符
  • image_path:指向 images/<uuid>.jpg 的相对路径
  • source:来源(school 或 university)
  • image_wimage_h:图像宽高
  • target:JSON 字符串,包含区域列表,按自上而下阅读顺序排列,每个区域包含 bbox(0-1000 归一化坐标,与图像缩放无关)、typetext 字段

区域类型包括:handwritten(手写)、printed(印刷)、formula(公式)、table(表格)、annotation(注释)、image(图像)、graph(图形)。其中 imagegraph 类型的 text 字段为空。

文本中的特殊标记包括:~~删除线~~~~旧文本~~{新文本}[illegible](不可辨认)。

使用方式

通过 Hugging Face snapshot_download 下载数据集并解压 images.tar,然后以包根目录为当前工作目录运行训练脚本。image_path 字段相对于包根目录。

引用与版权

图像和标注版权归 RUKOPYS 项目所有(作者:Dmytro Voitekh, Volodymyr Zmiivskyi, Oleksii Molchanovskyi;乌克兰天主教大学,2026;CC BY 4.0)。本子集仅对原数据集进行来源筛选、图像降尺度及标注重序列化,未修改原始内容。

搜集汇总
数据集介绍
rukopys-workshop-subset 数据集图片
构建方式
本数据集源自乌克兰天主教大学发布的RUKOPYS项目,该项目为乌克兰语手写文本识别领域提供了首个大规模基准数据集。为满足夏季学校大语言模型微调工作坊的需求,我们精心筛选了RUKOPYS v2.2版本中训练集内来源为‘school’与‘university’的子集,构建了本数据集。图像经过降采样至不超过150万像素,并以JPEG格式打包成单一压缩文件,便于并行下载。注释数据被重新序列化为紧凑的JSON格式,包含边界框(以0-1000的相对尺度表示)、区域类型及文本内容,并按照从上到下的阅读顺序排列。数据划分采用按来源分层抽样的方式,并以固定随机种子确保可复现性。
使用方法
使用本数据集时,首先通过Hugging Face Hub下载压缩包,并解压得到图像文件。随后,可从包根目录运行提供的训练脚本,该脚本基于Unsloth库实现QLoRA微调,支持自定义参数(如最大像素数、训练步数等)。模型的输入为图像路径和对应的JSON目标,目标格式为包含区域边界框和文本的序列化字典。训练完成后,可借助内置的评估函数计算字符错误率(CER),并与原始模型或Gemini等外部工具进行对比分析。演示笔记本提供了从数据加载到结果可视化的完整流程,便于快速复现和实验扩展。
背景与挑战
背景概述
RUKOPYS workshop subset 数据集由乌克兰天主教大学的研究团队于2026年创建,源自首个大规模乌克兰手写文本识别数据集 RUKOPYS v2.2。该子集专注于学校与大学场景的手写文档,包含844张经过降采样处理的JPEG图像,并划分为训练集与验证集。其核心研究问题在于为夏季学校的大语言模型微调工作坊提供轻量级数据包,使参与者能够在资源受限的Google Colab环境中,利用Qwen3-VL等视觉语言模型完成乌克兰语手写文档的检测与转录。这一数据集的发布为乌克兰语手写识别领域提供了便捷的入门资源,推动了多模态模型在低资源语言上的应用,并促进了相关教学与研究的开展。
当前挑战
该数据集所面临的挑战涵盖多个层面。在领域问题方面,乌克兰语手写文本识别面临复杂版面结构、多样书写风格及手写与印刷内容混合等难点,要求模型具备精细的目标检测与端到端转录能力。在构建过程中,需从大规模原始数据中筛选出学校与大学来源的样本,并将其重新序列化为适合微调的紧凑格式,同时控制图像尺寸以兼容有限算力资源。此外,数据集的规模较小,仅约千条记录,对模型的泛化能力提出了较高要求,而标注中的特殊标记(如删除线、修改及不可辨识文本)也增加了训练的复杂性。
常用场景
经典使用场景
RUKOPYS workshop subset 是专为手写文本识别(HTR)与光学字符识别(OCR)领域设计的高质量数据集,聚焦于乌克兰语手写文档的检测与转录。该子集精选自 RUKOPYS 大规模数据集,涵盖中小学及大学两类来源,包含 844 幅经过下采样处理的 JPEG 图像及对应的区域级标注,标注细分为手写、印刷、公式、表格等七种类型,并支持删除线、替换等特殊标记。其经典使用场景在于微调视觉-语言模型(如 Qwen3-VL),通过 QLoRA 技术实现端到端的页面级检测与转录,同时为评估模型在真实场景下的字符错误率(CER)提供了标准化基准。该数据集以紧凑的 JSON 格式存储标注,边界框采用 0-1000 相对坐标,使得图像尺寸变换后仍可复用,极大便利了研究者快速构建和验证 HTR 模型。
解决学术问题
该数据集直面乌克兰语手写文本识别中训练数据匮乏的难题,为低资源语言的手写识别研究提供了亟需的标准化语料。在学术层面,它解决了跨来源(学校与大学)手写风格差异对模型泛化能力的挑战,通过分层抽样策略保证了训练与验证子集在来源维度上的分布一致性。同时,数据集引入的多类型区域标注(含公式、表格等非手写元素)支持了复杂文档结构解析的研究,推动从纯文本转录向结构化信息抽取的范式演进。通过提供可直接用于 Colab 环境的极简微调包,它显著降低了 HTR 研究的复现门槛,使得注意力机制、视觉编码器等前沿架构的改进得以在统一基准上快速验证,促进了乌克兰语手写识别学术社区的协同发展。
实际应用
在实际应用中,该数据集驱动的模型可部署于乌克兰历史档案的数字化工程,辅助档案馆对手写文献进行高效转录与索引,加速历史资料的在线可检索性。其检测与转录能力同样适用于教育场景,例如自动批改手写作业、解析考试答卷中的混合内容(手写答案与印刷题目),以及构建智能辅导系统中的手写数学公式识别模块。此外,区域级标注支持文档版面分析,可应用于金融机构对老旧手写表单(如贷款申请)的自动化录入,或邮政系统中手写地址的识别。凭借轻量级设计(T4 GPU 即可完成微调),该数据集也适合快速原型开发,为中小型机构提供低成本的 OCR 解决方案,推动乌克兰语信息无障碍化进程。
数据集最近研究
最新研究方向
在当前深度学习与多模态模型交叉融合的浪潮下,乌克兰语手写文本识别(HTR)领域正迎来由大语言模型驱动的范式革新。RUKOPYS workshop subset作为首个大规模乌克兰语HTR数据集RUKOPYS的轻量级微调子集,其设计初衷直指前沿的指令微调与QLoRA效率优化,旨在让学术机构乃至个人研究者能在单块T4 GPU上快速适配Qwen3-VL等视觉-语言模型,实现对历史文档中手写区域的精准检测与转录。该子集聚焦于学校与大学来源的手写样本,通过紧凑的JSON序列化标注(包含区域边界框、手写/印刷/公式等类型划分及特殊标记处理)为多模态模型的区域感知能力提供了高密度训练信号。其契合了当前HTR领域从纯OCR向复杂版面理解、端到端生成式识别转型的趋势,同时作为CC BY 4.0开源生态的一部分,显著降低了乌克兰语数字人文研究的技术门槛,推动了文化遗产的自动化整理与分析,对低资源语言的多模态智能处理具有示范性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务