DastKhat
收藏资源简介:
DastKhat(دستخط,意为手写)是一个开放的波斯语手写文本数据集,专为光学字符识别(OCR)、手写文本识别(HTR)及相关机器学习任务的研究和开发而创建。该数据集包含从多个参与者收集的波斯语句子手写样本,旨在捕捉手写风格、字母形状、间距和书写模式的多样性。
DastKhat (دستخط, which literally means "handwriting") is an open-access Persian handwritten text dataset created for research and development in optical character recognition (OCR), handwritten text recognition (HTR), and related machine learning tasks. This dataset contains handwritten samples of Persian sentences collected from multiple participants, aiming to capture the diversity of handwriting styles, character shapes, spacing, and writing patterns.
数据集概述:DastKhat
DastKhat 是一个开放的手写波斯文文本数据集,旨在支持光学字符识别、手写文本识别及相关机器学习任务的研究与开发。该数据集由多位参与者手写预定义的波斯语句子构成,覆盖了多样的书写风格、字母形状、间距和书写模式。
数据内容与规模
- 数据来源:多位参与者手写预定义的波斯语句子。
- 数据类型:手写波斯语句子的图像样本及对应的元数据。
- 元数据字段(
samples.csv):sample_id:样本唯一标识符participant_id:书写者标识符image_path:图像路径或引用sentence_id:句子标识符text:真实波斯语文本转录split:数据集划分(训练、验证或测试)
- 示例记录:
000001,participant_001,participant_001/000001.png,000001,متن نمونه فارسی,train - 数据集划分:包含训练、验证和测试划分。
数据获取与加载
-
图像文件存储位置:Hugging Face 数据集
MrFarahmand/DastKhat -
加载方式:使用 Hugging Face
datasets库。 python from datasets import load_dataset dataset = load_dataset("MrFarahmand/DastKhat") -
访问示例:可通过
dataset["train"][0]获取样本,图像字段为image,文本字段为text。
数据集设计特点
- 书写者多样性:数据集聚焦于不同参与者的书写差异,包括字母形状、书写风格、字符连接、单词间距、书写大小、倾斜角度、笔压模式等。
- 适用场景:适合研究真实波斯手写识别中的挑战。
潜在应用领域
- 波斯手写文本识别
- 波斯光学字符识别
- 深度学习
- 计算机视觉
- 文档图像分析
- 书写者识别
- 手写风格分析
- 数据增强
- 自监督学习
- 序列识别
数据收集流程
- 收集手写提交物
- 提取手写区域
- 裁剪单个样本
- 关联样本与其真实文本
- 整理元数据
- 准备用于机器学习应用的数据集
项目状态与未来计划
- 状态:🚧 积极开发中,数据集仍在扩展与改进。
- 未来改进方向:
- 增加更多参与者
- 扩充手写样本
- 完善元数据
- 增加额外数据集划分
- 改进预处理
- 提供更详细的文档
- 发布基准模型与基线实验
贡献与许可
- 贡献方式:提供手写样本、改进处理脚本、修复问题、完善文档、创建基线实验等。
- 贡献网站:https://www.alacrity.ir/
- 许可:请参阅仓库中的
LICENSE文件。
引用与作者
- 引用:正式引用信息将在数据集稳定版本发布后添加。
- 作者:AmirReza Farahmand
- GitHub:AmirRezaFarahmand
- Hugging Face:MrFarahmand




