遇见数据集

DastKhat

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

DastKhat(دستخط,意为手写)是一个专门为波斯语光学字符识别(OCR)和手写文本识别(HTR)研究与开发而创建的数据集。该数据集包含从多位参与者处收集的手写波斯语句子图像,旨在捕捉不同个体的书写风格和特征,以促进识别系统对多样化笔迹的泛化能力。每个数据样本均包含以下字段:唯一样本标识符(sample_id)、书写者标识符(participant_id)、手写图像(image)、句子标识符(sentence_id)、波斯语真实转录文本(text)以及数据集划分标签(split,如训练集、验证集、测试集)。数据集通过提供图像-文本对,支持基于监督学习的端到端识别模型训练。其适用任务广泛,包括但不限于波斯手写文本识别、文档图像分析、书写者识别、手写风格分析以及数据增强研究。数据集目前处于活跃开发阶段,可能会持续扩展参与者数量、句子数量和书写风格多样性。

DastKhat (دستخط, meaning "handwriting") is a dataset specially developed for research and development of Persian optical character recognition (OCR) and handwritten text recognition (HTR). This dataset comprises handwritten Persian sentence images collected from multiple participants, aiming to capture the writing styles and individual characteristics of different writers to enhance the generalization capability of recognition systems for diverse handwriting. Each data sample includes the following fields: unique sample identifier (sample_id), writer identifier (participant_id), handwritten image (image), sentence identifier (sentence_id), Persian ground-truth transcription text (text), and dataset split label (split, such as training set, validation set, test set). The dataset supports the training of end-to-end supervised learning-based recognition models by providing image-text pairs. Its applicable tasks cover a wide range, including but not limited to Persian handwritten text recognition, document image analysis, writer identification, handwriting style analysis, and data augmentation research. The dataset is currently in active development and will continue to expand the number of participants, sentence count, and diversity of writing styles.

创建时间:
2026-07-22
原始信息汇总

数据集概述:DastKhat

DastKhat 是一个波斯语手写文本数据集,专为光学字符识别(OCR)和手写文本识别(HTR)的研究与开发而创建。该数据集包含来自多名参与者的手写波斯语句子图像,每个样本均配有相应的元数据。

数据集内容

每个样本包含以下字段:

字段 描述
sample_id 手写样本的唯一标识符
participant_id 书写该样本的参与者标识符
image 手写图像
sentence_id 句子标识符
text 真实标注的波斯语文本
split 数据集划分(如 train, validation, test

示例样本:

text { "sample_id": "000001", "participant_id": "participant_001", "image": <image>, "sentence_id": "000001", "text": "متن فارسی دست‌نویس", "split": "train" }

数据集结构与划分

数据集围绕手写句子图像组织,每个图像关联唯一样本标识符、参与者标识符、句子标识符、原始波斯语文本及数据集划分。设计上注重保留书写者的多样性。数据集包含以下划分:

  • train
  • validation
  • test

各划分的具体样本数量可能随数据集扩展而变化。

数据收集

数据从多名参与者处收集。参与者被提供预定义的波斯语句子并手写提交,经预处理流程(包括提取手写区域、裁剪单句图像、关联文本、分配参与者标识符、准备元数据及组织最终数据集)后得到样本。

预期用途

DastKhat 可用于以下任务:

  • 波斯语手写文本识别(HTR)
  • 波斯语光学字符识别(OCR)
  • 计算机视觉
  • 深度学习
  • 文档图像分析
  • 书写者识别
  • 笔迹风格分析
  • 数据增强研究
  • 序列识别

加载方式

使用 Hugging Face datasets 库加载:

bash python -m pip install datasets

python from datasets import load_dataset

dataset = load_dataset("MrFarahmand/DastKhat")

访问样本:

python sample = dataset["train"][0] image = sample["image"] text = sample["text"]

局限性

  • 参与者数量可能有限,无法完全代表波斯语手写风格的多样性。
  • 当前仅聚焦于手写波斯语句子。
  • 数据集大小和组成可能随新样本收集而发生变化。

许可协议

请参考数据集仓库中指定的许可协议以了解允许的使用、修改和再分发信息。

引用

若在研究中使用了 DastKhat,请引用该数据集。正式引用将在数据集达到稳定版本时添加。

维护者

  • Amir Reza Farahmand
  • GitHub: https://github.com/AmirRezaFarahmand
  • Hugging Face: https://huggingface.co/MrFarahmand
搜集汇总
数据集介绍
DastKhat 数据集图片
构建方式
DastKhat数据集由多名参与者手写预定义的波斯语句子构成,每位参与者提交的手写样本经过一系列处理流程,包括从提交文档中提取手写区域、裁剪出单个句子图像、将其与对应的波斯语文本关联、分配参与者标识符,并最终整理为带有元数据的结构化数据集。每个样本包含唯一标识符、参与者ID、图像、句子ID、真实文本以及数据集划分信息,便于监督学习任务的实施。
特点
该数据集的核心优势在于其多书写者多样性,涵盖了波斯语手写中常见的字母形状、字符连接、单词间距、书写大小、倾斜度、笔画结构、笔压及整体风格的差异。这种多样性对于训练能够泛化至不同手写风格的识别系统至关重要,尤其在波斯语手写文本识别(HTR)和光学字符识别(OCR)研究领域展现出独特价值。数据集目前处于持续开发阶段,未来可能扩展更多参与者、句子及书写风格。
使用方法
研究者可通过Hugging Face的datasets库便捷加载数据集,使用`load_dataset("MrFarahmand/DastKhat")`命令即可获取。数据集已预分为训练集、验证集和测试集,每个样本可直接访问图像和对应的波斯语文本标签。典型使用流程包括利用图像编码器提取特征,通过序列解码器生成文本,适用于图像到文本的序列识别任务,也可用于书写者识别、手写风格分析及数据增强等方向的研究。
背景与挑战
背景概述
DastKhat(دستخط)是由Amir Reza Farahmand主导创建的一个波斯语手写文本数据集,旨在推动光学字符识别(OCR)与手写文本识别(HTR)领域的研究。该数据集于近期发布,核心研究问题在于解决波斯语手写文本的自动识别难题,特别是应对波斯语字母形状多变、字符连接复杂及书写风格高度个性化等挑战。通过收集多位参与者的手写样本,DastKhat强调了书写者多样性的重要性,为开发能够泛化到不同书写习惯的识别模型提供了宝贵资源。该数据集的发布对波斯语自然语言处理与计算机视觉交叉领域产生了积极影响,尤其为低资源语言的手写识别研究树立了标杆。
当前挑战
DastKhat所解决的领域问题核心在于波斯语手写文本识别的复杂性与多变性。与印刷体不同,手写文本存在极大的个体差异,包括字母形状、倾斜角度、笔画粗细及字间距的不一致性,这要求模型具备强大的特征提取与序列解码能力。在构建过程中,数据集面临了多重挑战:首先,收集足够数量的参与者以保证书写风格多样性是一项艰巨任务,而参与者数量有限可能限制模型的泛化能力;其次,从手写文档中精确分割出单句图像并关联对应的标准波斯语文本需要精细的处理流程,且不同书写质量给图像预处理带来了困难;此外,数据集尚在动态扩展中,其规模与覆盖范围可能不足以完全代表波斯语手写的全貌,亟需持续扩充与质量控制以提升实用价值。
常用场景
经典使用场景
DastKhat数据集最经典的使用场景是波斯语手写文本识别(HTR)任务。研究人员可利用该数据集训练端到端的图像到文本识别模型,将手写句子图像自动转录为对应的波斯语文本。数据集提供了丰富的标注信息,包括每个样本的真实文本转录、参与者标识和数据集划分,使得它非常适合监督学习范式的实验。在深度学习中,它常被用作序列识别问题的基准,例如结合卷积神经网络(CNN)和循环神经网络(RNN)或Transformer的编码器-解码器架构。通过该数据集,研究者可以评估模型在多样性手写风格下的转录准确率,推动波斯语光学字符识别(OCR)技术的发展。
实际应用
在实际应用中,DastKhat数据集为波斯语文档数字化、智能表单处理和文化遗产保护等场景提供了关键支持。金融机构可利用基于该数据集训练的模型自动识别手写支票和银行单据,提升处理效率并减少人工错误。邮政系统可借助手写地址识别技术,实现包裹分拣自动化。在数字人文领域,它有助于历史手稿的转录和索引,保存濒危的文本遗产。此外,该数据集还可服务于教育场景,辅助语言教学中的手写练习评估系统。对于科技公司而言,它支撑了多语种翻译工具中的手写输入功能,增强了人机交互的便捷性与包容性。
衍生相关工作
基于DastKhat数据集,学界衍生出了一系列经典工作。在模型架构方面,研究者借鉴其多写手特征,探索了注意力机制的改进版本与上下文感知的序列解码器。在数据层面,该数据集催生了针对波斯语手写的合成数据生成方法,以及对抗性训练和风格迁移的数据增强技术。在评估基准上,它被纳入多个国际手写竞赛,成为衡量算法对波斯语弱标注和风格变异容忍度的标杆。此外,部分工作将其与阿拉伯语手写数据集联合使用,推动了跨语言迁移学习的研究。这些衍生工作不仅提升了手写识别性能,还深化了对书写过程视觉与语言学特性的理解。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务