遇见数据集

Hausa

收藏
Hugging Face2026-07-19 更新2026-07-20 收录
官方服务:

资源简介:

Hausa Ajami OCR 数据集是一个用于光学字符识别(OCR)任务的数据集,专注于豪萨语阿贾米文字(一种基于阿拉伯文字改编的豪萨语书写系统)手稿。数据集包含图像与转录文本的配对样本,每个样本对应手稿中一个分割的文本行。数据内容主要包括三个字段:`file_name` 表示对应文本行的图像文件名,`transcript` 为该文本行的拉丁字母转写,`source` 为原始手稿的唯一标识符,可用于追溯数据来源。目前数据集规模较小(样本数少于1000),数据来源于一个已标识的豪萨语伊斯兰宗教诗歌手稿,标题为“Infiraji 1: Le glorieux”,作者为 Alhaji Malam Aliyu Namangi,扫描分辨率为300 ppi。转写遵循特定规范:豪萨语辅音使用标准博科正字法(如 ɗ, ƙ, ɓ),阿拉伯语借词使用科学音标(如带长音符号和变音符号),hamza 用撇号表示,但当前版本未系统标注豪萨语的声调和元音长度。数据分割目前仅提供行级,单词级分割暂不可用。该数据集适用于图像到文本、图像文本到文本等任务,旨在支持豪萨语阿贾米文字的OCR研究和保护工作,由奥尔良大学的 AjamiXTranslit 项目贡献。

创建时间:
2026-07-09
原始信息汇总

数据集概述

数据集名称:Hausa Ajami OCR Dataset
数据集地址:https://huggingface.co/datasets/IntelResearchLab/Hausa

语言与任务

  • 语言:豪萨语(ha)
  • 任务类别:图像到文本(image-to-text)、图像-文本到文本(image-text-to-text)
  • 数据规模:少于1,000条样本(n<1K)

数据内容

  • 数据集包含豪萨语阿贾米文字(用阿拉伯字母书写豪萨语)手稿的图像与转录配对。
  • 每个数据条目存储在 data/train/metadata.jsonl 文件中,每行对应一条已分割的文本行,包含:
    • file_name:该行文本的图像文件名
    • transcript:该行文本的拉丁字母转写
    • source:原始手稿的标识符

手稿来源

来源ID 手稿标题 作者 备注
1 Infiraji 1: Le glorieux (Waƙar Infiraji Ta Farko : Waƙar Majidu) Alhaji Malam Aliyu Namangi, Zaria 伊斯兰宗教诗歌,颂扬先知穆罕默德,扫描分辨率300 ppi

该表格将在添加新手稿时持续更新。

转写规则

  • 豪萨语喉化辅音按标准博科正字法标记:ɗƙɓ
  • 阿拉伯语借词(宗教词汇)转写时使用长音符号和科学变音符号,例如 āīūʿ
  • 哈姆扎用单引号 `` 表示
  • 当前版本未系统标注豪萨语的声调和元音长度

分割方式

  • 当前分割为行级别,未提供词级别分割。

贡献者

  • 该数据集由阿雅米转写项目(AjamiXTranslit,奥尔良大学)制作。
搜集汇总
数据集介绍
Hausa 数据集图片
构建方式
豪萨语阿贾米文字光学字符识别(OCR)数据集基于手稿图像与拉丁转写文本的配对构建而成。数据集中每条记录对应一行经过分割的文本,存储于`data/train/metadata.jsonl`文件中,包含图像文件名(`file_name`)、拉丁转写文本(`transcript`)及来源手稿标识(`source`)。手稿来源以表格形式记录,目前包含一首由Alhaji Malam Aliyu Namangi创作的伊斯兰宗教诗歌手稿(Infiraji 1),图像扫描分辨率为300 ppi。数据集遵循特定的转写惯例:豪萨语声门化辅音采用标准正字法(如ɗ、ƙ、ɓ)表示,阿拉伯语借词则使用带长音符号和科学变音符号(如ā、ṣ)的拉丁字母转写,喉塞音用单引号标记,而声调和元音长度在现行版本中未系统标注。
特点
该数据集以豪萨语阿贾米文字手稿为核心,聚焦于这一使用阿拉伯字母书写豪萨语的独特文字系统,属于低资源语言OCR领域的珍贵资源。其显著特点在于细粒度的行级分割方式,当前版本仅提供文本行的图像与转写配对,尚未实现单词级别分割,为后续研究留下扩展空间。此外,数据集规模较小(少于1000条样本),来源单一,但手稿来源表的设计体现了可持续扩展性,未来可纳入更多手稿以丰富多样性。转写规则兼顾豪萨语本土发音与阿拉伯语宗教词汇的精确性,平衡了语言学规范与OCR任务需求,特别适用于训练和评估针对阿贾米文字的文本识别模型。
使用方法
该数据集适用于图像到文本的OCR任务及多模态理解场景,如文本识别和图像描述生成。用户可通过加载`data/train/metadata.jsonl`元数据文件,获取图像路径与对应转写文本,构建训练或测试数据集。图像文件需按`file_name`字段定位,与手稿来源(`source`)关联以追溯原始上下文。转写文本遵循上述语言学规范,可作为监督信号训练序列到序列模型或注意力机制OCR架构。使用前需注意行级分割的局限性,若需单词级标注需自行扩展。开发者可基于当前版本,结合豪萨语语言学知识或数据增强技术(如纸张噪声模拟),优化模型在历史手稿上的识别精度。
背景与挑战
背景概述
在非洲西部的豪萨语地区,阿贾米文字作为一种基于阿拉伯字母的书写系统,承载了丰富的宗教、文学与历史文献。然而,由于数字化资源匮乏,这些珍贵的手稿长期面临损毁与失传的风险。为此,由奥尔良大学AjamiXTranslit项目团队主导,于近期创建了Hausa Ajami OCR数据集,旨在推动光学字符识别技术对阿贾米手稿的自动化转录研究。该数据集聚焦于豪萨语宗教诗歌手稿,例如Alhaji Malam Aliyu Namangi的《Infiraji 1: Le glorieux》,通过提供图像与拉丁转写的配对数据,为低资源文字的OCR模型训练奠定了基石。这一数据集填补了非洲本土文字数字化研究的空白,对计算语言学和文化遗产保护具有双重推动作用。
当前挑战
该数据集所解决的领域问题在于,豪萨阿贾米文字缺乏标准化的OCR训练资源,传统方法难以处理手写体中的连笔、变体及污损字符,导致识别准确率极低。在构建过程中,团队面临多重挑战:首先,手稿来源单一(仅一部宗教诗歌),样本量不足1K,限制了模型的泛化能力;其次,当前仅完成行级分割,缺乏词级标注,无法支持细粒度的文本分析;此外,转写规范未统一标注声调与元音长度,而阿拉伯借词的复杂变音符号(如ʿ、ṣ、ḥ)增加了标记难度;最后,手稿扫描质量参差,300 ppi的分辨率对字符边缘细节的捕捉构成考验。这些因素共同制约了数据集在真实场景中的应用效果。
常用场景
经典使用场景
在数字人文与低资源语言处理的交汇领域,Hausa Ajami OCR数据集为豪萨语阿贾米文字的手稿识别提供了珍贵资源。该数据集包含从宗教诗歌手稿中提取的行级图像与拉丁转写配对,尤其聚焦于以阿拉伯字母书写的豪萨语。经典使用场景涵盖手稿行级图像的自动转录、光学字符识别模型的训练与评估,以及跨文字系统(阿贾米到拉丁)的映射学习,是探索阿拉伯系文字OCR技术的理想基准。
解决学术问题
该数据集系统性地回应了低资源语言手稿数字化的核心挑战。它解决了豪萨语阿贾米文字因缺乏标准化语料而难以进行自动识别的问题,提供了首个公开的行级图像-转录配对资源。这一贡献加速了非拉丁文字OCR的研究进程,使学术界得以突破小语种手稿识别的瓶颈,并为跨文字转写系统的开发奠定了数据基础。其意义在于捍卫语言多样性的同时,推动了数字人文学科中文化遗产的保护与可访问性。
衍生相关工作
围绕该数据集已衍生出若干开创性工作。核心贡献来源于AjamiXTranslit项目,其中包含了针对阿贾米文字的转写与翻译工具链。该数据集还催生了行级分割算法的优化探索,以及跨字体、跨手稿风格的迁移学习方法。未来,基于此语料的多模态预训练模型、语调标注扩展以及词级分割数据集,均为学术界持续关注的衍生方向,进一步拓展了低资源OCR的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务