遇见数据集

Cognitive-Lab/NayanaOCR_Corpus_2025

收藏
Hugging Face2026-05-25 更新2026-05-31 收录
官方服务:

资源简介:

NayanaOCR Corpus 2025是一个大规模多语言OCR(光学字符识别)和文档理解数据集,专门设计用于支持视觉语言模型(VLM)和多语言文档分析研究。该数据集涵盖23种语言,包括阿拉伯语、孟加拉语、德语、英语、西班牙语、法语、古吉拉特语、印地语、意大利语、日语、卡纳达语、韩语、马拉雅拉姆语、马拉地语、奥里亚语、旁遮普语、俄语、梵语、泰米尔语、泰卢固语、泰语和中文,特别关注印度语言和低资源语言。数据规模在100万到1000万个样本之间。数据集包含合成生成的文档图像,每张图像都附有详细的标注信息,包括图像ID、使用的字体、文档区域边界框(bbox)、英文原文、布局类型、区域ID以及翻译成目标语言的文本。此外,每个样本还包含视觉问答(VQA)数据,包括问题、答案选项、正确答案和问题类型。数据集适用于多种任务,如图像到文本转换、视觉问答、图像文本到文本生成、文档布局分析、跨语言检索和文档AI应用。

The NayanaOCR Corpus 2025 is a large-scale multilingual Optical Character Recognition (OCR) and document understanding dataset specifically designed to support research on Vision-Language Models (VLMs) and multilingual document analysis. This dataset covers 23 languages, including Arabic, Bengali, German, English, Spanish, French, Gujarati, Hindi, Italian, Japanese, Kannada, Korean, Malayalam, Marathi, Odia, Punjabi, Russian, Sanskrit, Tamil, Telugu, Thai, and Chinese, with a particular focus on Indian languages and low-resource languages. It comprises between 1 million and 10 million samples. The dataset contains synthetically generated document images, each paired with detailed annotation information including image ID, utilized font, document region bounding boxes (bbox), original English text, layout type, region ID, and text translated into the target language. Furthermore, each sample includes Visual Question Answering (VQA) data, consisting of questions, answer options, correct answers, and question types. This dataset is applicable to multiple tasks such as image-to-text generation, Visual Question Answering (VQA), image-text-to-text generation, document layout analysis, cross-lingual retrieval, and document AI applications.

提供机构:
Cognitive-Lab
二维码
社区交流群
二维码
科研交流群
商业服务