遇见数据集

DastKhat

收藏
github2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

DastKhat(دستخط,意为手写)是一个开放的波斯语手写文本数据集,专为光学字符识别(OCR)、手写文本识别(HTR)及相关机器学习任务的研究和开发而创建。该数据集包含从多个参与者收集的波斯语句子手写样本,旨在捕捉手写风格、字母形状、间距和书写模式的多样性。

DastKhat (دستخط, which literally means "handwriting") is an open-access Persian handwritten text dataset created for research and development in optical character recognition (OCR), handwritten text recognition (HTR), and related machine learning tasks. This dataset contains handwritten samples of Persian sentences collected from multiple participants, aiming to capture the diversity of handwriting styles, character shapes, spacing, and writing patterns.

创建时间:
2026-07-19
原始信息汇总

数据集概述:DastKhat

DastKhat 是一个开放的手写波斯文文本数据集,旨在支持光学字符识别、手写文本识别及相关机器学习任务的研究与开发。该数据集由多位参与者手写预定义的波斯语句子构成,覆盖了多样的书写风格、字母形状、间距和书写模式。


数据内容与规模

  • 数据来源:多位参与者手写预定义的波斯语句子。
  • 数据类型:手写波斯语句子的图像样本及对应的元数据。
  • 元数据字段samples.csv):
    • sample_id:样本唯一标识符
    • participant_id:书写者标识符
    • image_path:图像路径或引用
    • sentence_id:句子标识符
    • text:真实波斯语文本转录
    • split:数据集划分(训练、验证或测试)
  • 示例记录000001,participant_001,participant_001/000001.png,000001,متن نمونه فارسی,train
  • 数据集划分:包含训练、验证和测试划分。

数据获取与加载

  • 图像文件存储位置:Hugging Face 数据集 MrFarahmand/DastKhat

  • 加载方式:使用 Hugging Face datasets 库。 python from datasets import load_dataset dataset = load_dataset("MrFarahmand/DastKhat")

  • 访问示例:可通过 dataset["train"][0] 获取样本,图像字段为 image,文本字段为 text


数据集设计特点

  • 书写者多样性:数据集聚焦于不同参与者的书写差异,包括字母形状、书写风格、字符连接、单词间距、书写大小、倾斜角度、笔压模式等。
  • 适用场景:适合研究真实波斯手写识别中的挑战。

潜在应用领域

  • 波斯手写文本识别
  • 波斯光学字符识别
  • 深度学习
  • 计算机视觉
  • 文档图像分析
  • 书写者识别
  • 手写风格分析
  • 数据增强
  • 自监督学习
  • 序列识别

数据收集流程

  1. 收集手写提交物
  2. 提取手写区域
  3. 裁剪单个样本
  4. 关联样本与其真实文本
  5. 整理元数据
  6. 准备用于机器学习应用的数据集

项目状态与未来计划

  • 状态:🚧 积极开发中,数据集仍在扩展与改进。
  • 未来改进方向
    • 增加更多参与者
    • 扩充手写样本
    • 完善元数据
    • 增加额外数据集划分
    • 改进预处理
    • 提供更详细的文档
    • 发布基准模型与基线实验

贡献与许可

  • 贡献方式:提供手写样本、改进处理脚本、修复问题、完善文档、创建基线实验等。
  • 贡献网站:https://www.alacrity.ir/
  • 许可:请参阅仓库中的 LICENSE 文件。

引用与作者

  • 引用:正式引用信息将在数据集稳定版本发布后添加。
  • 作者:AmirReza Farahmand
搜集汇总
数据集介绍
DastKhat 数据集图片
构建方式
DastKhat(波斯语意为“手写”)是一个面向波斯语手写文本识别的开源数据集。该数据集通过征集多名参与者手写预定义的波斯语句子构建而成。每位参与者以自然书写风格完成指定文本,其手写稿件随后经由一套自动化处理流水线进行加工:依次完成书写区域检测、单行样本裁剪、与真实标注文本关联并最终生成结构化元数据,形成可供机器学习任务直接使用的图像与标签对。数据集样本以图像文件形式托管于Hugging Face平台,而GitHub仓库则专注于管理元数据记录与处理脚本。
使用方法
使用者可通过Hugging Face的datasets库便捷加载该数据集。只需安装该库后调用load_dataset("MrFarahmand/DastKhat"),数据便会以标准的Hugging Face数据集格式返回。每个样本中包含可直接访问的PIL图像对象与对应的波斯语真实文本字段。元数据文件samples.csv详细记录了各样本的分配归属与分区状态,便于研究者快速构建训练集与测试集。项目正处于积极扩展阶段,计划纳入更多参与者与样本,并附带预处理工具与基准模型,持续提升数据集的可用性。
背景与挑战
背景概述
DastKhat是由AmirReza Farahmand于近年创建的一个开源波斯语手写文本数据集,致力于推动光学字符识别(OCR)与手写文本识别(HTR)领域的发展。该数据集通过收集多位参与者的手写波斯语句子,系统性地捕捉了书写风格、字母形态、间距及倾斜角度等多样化特征。其核心研究问题在于解决波斯语手写文本的自动识别难题,为深度学习、计算机视觉及文档图像分析等方向提供标准化基准。作为波斯语手写识别领域的稀缺资源,DastKhat的出现填补了该语种在公开数据集上的空白,对促进中东语言信息处理具有显著的学术与应用价值。
当前挑战
DastKhat面临的首要挑战是波斯语手写文本本身的复杂性,包括字母连笔形态多变、单词边界模糊以及不同书写者风格差异悬殊,这些因素导致传统OCR模型难以精准分割与识别。在数据集构建过程中,挑战尤为突出:首先,需要从大量手写稿中高效提取并裁剪单个样本,确保图像质量与标注的一致性;其次,参与者招募与数据采集需兼顾地域多样性,以覆盖更广泛的书写习惯;此外,元数据组织与训练/验证/测试集的合理划分,以及后续预处理管道的优化,均对数据集的扩展性与实用性构成考验。
常用场景
经典使用场景
在波斯语手写文本识别领域,DastKhat数据集被广泛用于训练和评估深度学习模型。其涵盖了多种书写风格、字形变化及间距特征,为构建鲁棒的光学字符识别(OCR)和手写文本识别(HTR)系统提供了丰富的标注样本。研究者通常采用该数据集进行序列到序列建模、注意力机制优化及端到端识别架构的验证,尤其是在处理波斯语独特的连笔和变体字符时,DastKhat成为评估模型泛化能力的重要基准。
解决学术问题
该数据集的核心学术贡献在于填补了波斯语手写识别领域标准化训练资源的缺失。通过系统采集多参与者的手写样本,DastKhat解决了因书写风格多样性导致的模型泛化能力不足问题,为研究字形畸变、笔画粘连和空间布局变异等挑战提供了定量分析基础。其公开的标注信息与数据划分策略,推动了跨机构实验的可重复性,使得手写识别领域从规则驱动向数据驱动范式转型成为可能,显著加速了波斯语自然语言处理技术的学术进展。
实际应用
在实际应用中,DastKhat支撑了波斯语文档数字化、古籍电子化及邮政系统自动化分拣等场景的落地。通过在该数据集上训练的HTR模型,能够从手写信件、历史档案和手写表单中精准提取文本信息,大幅降低人工录入成本。此外,该数据集还被应用于银行支票验证、教育领域手写作业批改以及司法系统中手写签名辨识,展现出在跨场景文本理解任务中的广泛适应性与工程价值。
数据集最近研究
最新研究方向
在波斯语手写文本识别领域,DastKhat数据集的发布为深度学习与计算机视觉的交叉研究注入了新活力。当前前沿研究聚焦于利用该数据集开展序列识别与自监督学习,以应对波斯语独特连笔书写与多变字形带来的挑战。结合多参与者在字体倾斜、间距及笔压模式上的丰富变体,研究者正探索更鲁棒的卷积神经网络与Transformer架构,推动文档图像分析与笔迹鉴别技术迈向更高精度。这一开源资源不仅填补了波斯语OCR基准的空白,还为跨语言手写识别系统的泛化性评估提供了重要基石,对中东数字化档案建设具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务