遇见数据集

sinhala_synthetic_ocr_news_large

收藏
Hugging Face2026-07-29 更新2026-07-30 收录
官方服务:

资源简介:

Sinhalaa数据集是一个包含僧伽罗语(Sinhala)文本和对应图像的大规模合成数据集,专门为光学字符识别(OCR)任务设计。数据集来源于Kaggle平台上的“sinhala-ocr-image-creation”项目,通过合成方法生成。数据集中包含80,000个训练样本,每个样本由两个字段构成:image字段存储图像数据,text字段存储对应的僧伽罗语文本字符串。数据集总大小约为16.5GB,仅提供训练分割。该数据集适用于僧伽罗语OCR模型的训练、评估与研究,旨在提升对僧伽罗语文本的图像识别能力。

The Sinhalaa Dataset is a large-scale synthetic dataset containing Sinhala text and corresponding images, specifically designed for optical character recognition (OCR) tasks. It is derived from the 'sinhala-ocr-image-creation' project on the Kaggle platform and generated via synthetic methods. The dataset includes 80,000 training samples, each composed of two fields: the 'image' field stores image data, and the 'text' field stores the corresponding Sinhala text string. The total size of the dataset is approximately 16.5 GB, and only the training split is provided. This dataset is suitable for the training, evaluation and research of Sinhala OCR models, aiming to improve the image recognition capability for Sinhala text.

创建时间:
2026-07-26
原始信息汇总

数据集概述

  • 数据集名称:sinhala_synthetic_ocr_news_large
  • 语言:僧伽罗语(si)
  • 数据集大小:约 16.48 GB(下载大小约 16.49 GB)
  • 配置:仅包含 default 配置,训练数据文件位于 data/train-*

数据特征

  • image:图像数据,类型为 image
  • text:文本数据,类型为 string

数据划分

  • 训练集(train):共 80,000 个样本,占用约 16.48 GB 存储空间

来源与引用

搜集汇总
数据集介绍
sinhala_synthetic_ocr_news_large 数据集图片
构建方式
该数据集名为sinhala_synthetic_ocr_news_large,专为僧伽罗语光学字符识别(OCR)任务而构建。其数据生成过程基于Kaggle上公开的僧伽罗语OCR图像创建脚本,通过对新闻文本进行合成渲染,产生大量带有对应文本标注的图像样本。数据集包含80,000个训练样本,每个样本由一张图像和对应的文本字符串组成,图像数据以标准格式存储,文本则采用僧伽罗语字符编码,旨在模拟真实场景下的文本识别挑战。整体构建流程高效且可重复,为低资源语言OCR研究提供了坚实基础。
特点
该数据集的核心特点在于其大规模与针对性。总数据量约16.5 GB,包含80,000张高分辨率僧伽罗语新闻图像,覆盖丰富的词汇与句式结构,增强了模型的泛化能力。图像与文本一一对应,格式简洁统一,便于直接用于端到端OCR模型训练。此外,数据集完全基于合成数据,避免了真实场景中版权与隐私问题,同时保证了标签的精确性,特别适合作为基准数据集评估僧伽罗语文本识别算法的性能。
使用方法
使用该数据集时,用户可通过Hugging Face datasets库直接加载,指定配置名称为'default',并选择训练集分片即可获取图像与文本对。加载后,图像以PIL格式呈现,文本为字符串,适合与常见深度学习框架(如PyTorch或TensorFlow)配合使用。建议在训练前对图像进行归一化与尺寸调整,以适配模型输入需求。引用时应注明DOI编号(10.57967/hf/9748),以确保学术使用的规范性。
背景与挑战
背景概述
僧伽罗语作为斯里兰卡官方语言,其文字识别技术的发展长期受限于高质量标注数据的稀缺。2026年,由研究者Ransaka R.主导构建的sinhala_synthetic_ocr_news_large数据集应运而生,该数据集通过合成方式生成8万张包含僧伽罗语新闻文本的图像,旨在为光学字符识别(OCR)领域提供大规模训练基准。其核心研究问题聚焦于如何利用合成数据克服小语种真实标注成本高昂的瓶颈,填补了南亚低资源语言OCR数据集的重要空白。该数据集的发布(DOI: 10.57967/hf/9748)不仅推动了僧伽罗语文本识别算法的研究,也为其他低资源语言的合成数据构建范式提供了参考,对多语言OCR系统的公平性和泛化能力具有深远影响。
当前挑战
该数据集所解决的领域问题在于僧伽罗语OCR面临两大核心挑战:一是真实场景中手写体与印刷体混排、噪声干扰导致传统模型泛化能力不足;二是小语种缺乏大规模公开标注数据,难以支撑深度神经网络的训练需求。此外,数据集构建过程中亦存在显著困难,包括合成新闻图像时需模拟多样化的字体、排版布局及背景噪声以逼近真实分布,同时确保生成的文本语义与新闻内容高度一致,避免引入误导性标注。原始数据从Kaggle平台获取后,还需经过严格的清洗与格式标准化流程,以消除合成引擎的伪影和字符渲染错误,最终形成高保真度的训练样本。
常用场景
经典使用场景
在低资源语言光学字符识别(OCR)领域,僧伽罗语作为一种拥有丰富文字系统的南亚语言,长久以来因缺乏大规模标注数据集而面临技术瓶颈。sinhala_synthetic_ocr_news_large数据集应运而生,其核心应用场景在于训练和评估深度学习模型对僧伽罗语印刷体文本的识别能力。该数据集整合了来自新闻领域的合成图像与对应文本标注,共计八万条样本,为研究人员提供了稳定可控的基准资源,尤其适用于基于卷积神经网络或Transformer架构的序列识别任务,如CRNN、Attention-OCR等模型的训练与性能验证。
衍生相关工作
围绕该数据集已衍生出多项经典工作,包括基于自注意力机制的僧伽罗语端到端OCR模型优化研究,以及利用生成对抗网络进行合成图像风格迁移以提升真实场景适应性的探索。学术界进一步将其与基于Transformer的语言模型结合,开发出图像到文本的联合学习框架,实现了从印刷体识别到语义理解的进阶。此外,还有工作基于该数据集构建了僧伽罗语拼写校正基准,推动OCR后处理环节的精度提升。这些衍生工作共同丰富了低资源语言的多模态研究体系。
数据集最近研究
最新研究方向
在僧伽罗语自然语言处理与光学字符识别(OCR)交叉领域,该大规模合成新闻数据集弥补了低资源语言标注数据的严重匮乏,为深度学习驱动的端到端文本识别模型提供了80000张高质量训练样本。当前前沿研究聚焦于利用此类合成数据提升实际新闻场景下僧伽罗字符的手写与印刷体识别精度,并结合迁移学习与数据增强技术应对字体变体、噪声干扰及版面复杂性问题。该数据集的发布不仅推动了南亚地区数字文档处理与文化遗产数字化保护的技术进展,也为多语言OCR系统在资源受限环境下的泛化能力评估树立了重要基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务