hayai-dataset-merged
收藏资源简介:
该数据集是一个大规模多模态数据集,包含图像及其对应的文本转录信息。数据集由1,018,480个训练样本和10,290个测试样本组成,总大小约18.5GB。每个样本包含以下字段:图像数据(image)、转录文本(transcription)、语言标识(language)、置信度分数(confidence)、唯一图像标识符(image_id)、裁剪区域标识符(crop_id)以及数据来源标识(source)。该数据集适用于光学字符识别(OCR)、多语言文本提取、图像描述生成等计算机视觉与自然语言处理交叉任务。数据集的规模和质量使其适合用于训练和评估文本检测、识别以及多语言理解模型。
This is a large-scale multimodal dataset containing images paired with their corresponding text transcriptions. It comprises 1,018,480 training samples and 10,290 test samples, with a total size of approximately 18.5 GB. Each sample includes the following fields: image data (image), transcription text (transcription), language identifier (language), confidence score (confidence), unique image identifier (image_id), cropped region identifier (crop_id), and data source identifier (source). This dataset is suitable for cross-disciplinary tasks at the intersection of computer vision and natural language processing, including optical character recognition (OCR), multilingual text extraction, and image caption generation. Given its scale and quality, the dataset is well-suited for training and evaluating text detection, recognition, and multilingual understanding models.
- 数据集名称:hayai-dataset-merged
- 数据集地址:https://huggingface.co/datasets/JustANormalTinkerer/hayai-dataset-merged
- 数据集描述:该数据集包含图片及其对应的文字转录、语言标签、置信度等信息,主要用于多语言图片文字识别任务。
数据结构:
- 字段:
image(图片)transcription(文字转录)language(语言)confidence(置信度,浮点数)image_id(图片ID)crop_id(裁剪区域ID)source(来源)
数据划分:
- 训练集:1,018,480 个样本,约 18.26 GB
- 测试集:10,290 个样本,约 184.75 MB
- 总大小:约 18.47 GB(下载大小约 18.40 GB)
配置与文件:
- 默认配置:
default - 数据文件路径:
- 训练集:
data/train-* - 测试集:
data/test-*
- 训练集:




