hayai-finetuning-dataset-with-korean
收藏资源简介:
该数据集是一个用于图像文本识别任务的监督学习数据集,包含38,907个训练样本。每个样本由一张图像(image)及其对应的文本转录(transcription)组成,同时提供语言标签(language)、转录置信度(confidence)、图像唯一标识符(image_id)、裁剪区域标识符(crop_id)以及数据来源(source)等元数据。数据集适用于光学字符识别(OCR)、场景文本识别、手写识别等计算机视觉与自然语言处理交叉领域的研究与模型训练。
This dataset is a supervised learning dataset for image text recognition tasks, containing 38,907 training samples. Each sample consists of an image and its corresponding text transcription, along with metadata such as language label, transcription confidence, image unique identifier, crop region identifier, and data source. The dataset is suitable for research and model training in the intersection of computer vision and natural language processing, including optical character recognition (OCR), scene text recognition, and handwriting recognition.
数据集概述:hayai-finetuning-dataset-with-korean
基本信息
- 数据集名称:hayai-finetuning-dataset-with-korean
- 数据集地址:https://huggingface.co/datasets/JustANormalTinkerer/hayai-finetuning-dataset-with-korean
- 用途:该数据集用于微调(fine-tuning)任务,内容包含韩语(Korean)相关数据。
数据特征
该数据集包含以下字段:
| 字段名 | 数据类型 | 说明 |
|---|---|---|
| image | image | 图像数据 |
| transcription | string | 转写文本(可能为语音或图像内容的文本转录) |
| language | string | 语言标识(可能包含韩语等) |
| confidence | float32 | 置信度分数 |
| image_id | string | 图像唯一标识符 |
| crop_id | string | 裁剪区域标识符 |
| source | string | 数据来源 |
数据划分
- 划分名称:train
- 训练集样本数量:38,907 条
- 训练集大小:约 1039.3 MB(1,039,308,005 字节)
- 下载大小:约 1035.1 MB(1,035,065,676 字节)
- 数据集总大小:约 1039.3 MB(1,039,308,005 字节)
配置文件
- 配置名称:default
- 数据文件路径:
data/train-*(采用通配符匹配多个分片文件)
数据集特点
- 多模态内容:包含图像和对应的文本转写信息,适合用于多模态模型(如视觉-语言模型)的微调。
- 韩语相关:数据集中包含韩语(Korean)相关数据,适合进行韩语场景下的模型训练。
- 附带置信度:每个样本带有置信度分数,可用于数据质量筛选或加权训练。
- 来源可追溯:每个样本记录有来源信息(source字段),便于数据溯源。
适用场景
- 多模态模型的微调(结合图像和文本)
- 韩语语音或图像文本转写相关的训练任务
- 模型对特定数据集的适应与优化




