NayanaOCRBench_Natural_final
收藏资源简介:
该数据集是一个多语言文档图像数据集,包含多种语言的配置,如孟加拉语(bn)、德语(de)、英语(en)、西班牙语(es)、法语(fr)、古吉拉特语(gu)、印地语(hi)、意大利语(it)、日语(ja)、卡纳达语(kn)、马拉雅拉姆语(ml)、马拉地语(mr)、旁遮普语(pa)、俄语(ru)、梵语(sa)、泰米尔语(ta)、泰卢固语(te)和泰语(th)。每个配置包含三个字段:图像数据(image)、唯一标识符(id)和一个名为'omnidocbench'的字段。数据集仅包含训练集,每个语言的训练集样本数量在425至523之间,文件大小从132MB到637MB不等。该数据集适用于多语言文档图像处理、OCR(光学字符识别)及相关自然语言处理任务。
This dataset is a multilingual document image dataset that supports configurations for multiple languages, including Bengali (bn), German (de), English (en), Spanish (es), French (fr), Gujarati (gu), Hindi (hi), Italian (it), Japanese (ja), Kannada (kn), Malayalam (ml), Marathi (mr), Punjabi (pa), Russian (ru), Sanskrit (sa), Tamil (ta), Telugu (te), and Thai (th). Each language configuration includes three fields: image data (image), unique identifier (id), and a field named "omnidocbench". The dataset only contains a training split, with the number of training samples per language ranging from 425 to 523, and the file sizes varying between 132 MB and 637 MB. This dataset is applicable to multilingual document image processing, OCR (Optical Character Recognition) and related natural language processing tasks.
NayanaOCRBench_Natural_final 数据集概述
数据集基本信息
- 数据集名称: NayanaOCRBench_Natural_final
- 数据集地址: https://huggingface.co/datasets/v1v1d1/NayanaOCRBench_Natural_final
- 配置数量: 18个独立语言配置
数据集结构
特征(Features)
所有配置均包含以下三个特征:
image: 图像数据,数据类型为imageid: 标识符,数据类型为stringomnidocbench: 文本数据,数据类型为string
数据划分(Splits)
所有配置仅包含一个划分:
train: 训练集
语言配置详情
| 配置名称 | 语言代码 | 训练集样本数 | 训练集大小(字节) | 下载大小(字节) | 数据集大小(字节) |
|---|---|---|---|---|---|
| bn | 孟加拉语 | 467 | 341,421,892 | 337,782,199 | 341,421,892 |
| de | 德语 | 496 | 240,720,068 | 236,631,965 | 240,720,068 |
| en | 英语 | 502 | 332,624,606 | 328,510,220 | 332,624,606 |
| es | 西班牙语 | 500 | 237,931,802 | 234,007,153 | 237,931,802 |
| fr | 法语 | 504 | 293,555,785 | 289,686,988 | 293,555,785 |
| gu | 古吉拉特语 | 445 | 295,297,538 | 291,993,745 | 295,297,538 |
| hi | 印地语 | 500 | 600,924,377 | 597,356,123 | 600,924,377 |
| it | 意大利语 | 494 | 247,174,321 | 243,132,362 | 247,174,321 |
| ja | 日语 | 502 | 249,186,891 | 245,170,432 | 249,186,891 |
| kn | 卡纳达语 | 500 | 425,009,655 | 421,401,868 | 425,009,655 |
| ml | 马拉雅拉姆语 | 492 | 389,614,880 | 386,073,311 | 389,614,880 |
| mr | 马拉地语 | 515 | 286,958,661 | 282,618,593 | 286,958,661 |
| pa | 旁遮普语 | 463 | 319,502,674 | 316,283,257 | 319,502,674 |
| ru | 俄语 | 523 | 259,241,111 | 254,843,297 | 259,241,111 |
| sa | 梵语 | 425 | 639,258,183 | 637,013,846 | 639,258,183 |
| ta | 泰米尔语 | 504 | 135,080,119 | 132,892,978 | 135,080,119 |
| te | 泰卢固语 | 461 | 258,382,819 | 255,342,301 | 258,382,819 |
| th | 泰语 | 507 | 378,029,896 | 373,459,784 | 378,029,896 |
数据文件路径
每个语言配置的数据文件路径模式如下:
{语言代码}/train-*(例如:bn/train-*,en/train-*)
总体统计
- 总训练集样本数(估算): 约 8,800 个样本
- 涵盖语言: 18种语言,包括孟加拉语、德语、英语、西班牙语、法语、古吉拉特语、印地语、意大利语、日语、卡纳达语、马拉雅拉姆语、马拉地语、旁遮普语、俄语、梵语、泰米尔语、泰卢固语、泰语



