遇见数据集

ademax/ocr_scan_vi_01

收藏
Hugging Face2023-07-15 更新2024-03-04 收录
官方服务:

资源简介:

--- language: vi dataset_info: features: - name: image dtype: image - name: text dtype: string splits: - name: train num_bytes: 410862389.5689411 num_examples: 11003 - name: test num_bytes: 37340942.4310589 num_examples: 1000 download_size: 447854730 dataset_size: 448203332.0 --- # Dataset Card for "quan_ocr_data" [More Information needed](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

语言:越南语(Vietnamese) 数据集信息: 数据特征: - 名称:图像(image),数据类型:图像 - 名称:文本(text),数据类型:字符串 数据集划分: - 划分名称:训练集(train),字节占用量:410862389.5689411,样本数量:11003 - 划分名称:测试集(test),字节占用量:37340942.4310589,样本数量:1000 下载大小:447854730 数据集总大小:448203332.0 # "quan_ocr_data"数据集卡片 [需补充更多信息](https://github.com/huggingface/datasets/blob/main/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards)

提供机构:
ademax
原始信息汇总

数据集概述

数据集名称

quan_ocr_data

数据特征

  • image: 图像数据类型
  • text: 字符串数据类型

数据划分

  • 训练集
    • 示例数量: 11003
    • 数据大小: 410862389.5689411字节
  • 测试集
    • 示例数量: 1000
    • 数据大小: 37340942.4310589字节

数据集大小

  • 下载大小: 447854730字节
  • 数据集总大小: 448203332.0字节
搜集汇总
数据集介绍
ademax/ocr_scan_vi_01 数据集图片
构建方式
在光学字符识别(OCR)技术蓬勃发展的背景下,针对越南语文本识别的专用数据集显得尤为重要。ademax/ocr_scan_vi_01数据集通过收集真实场景中的扫描文档与图像,经过人工标注与质量校验,构建了一个包含11003条训练样本与1000条测试样本的高质量语料库。每条数据均由图像(image)与对应文本(text)组成,确保了视觉与语义信息的精准对齐,为越南语OCR模型的训练提供了可靠的监督信号。
特点
该数据集具有鲜明的专业特性。其图像字段采用高分辨率扫描格式,能够模拟真实应用中的文本变形、光照不均等复杂情况,增强了模型的泛化能力。文本字段则完整保留了越南语特有的字母符号与声调标记,覆盖了日常文档、印刷体及部分手写体场景。数据规模虽适中,但样本多样性高,且训练与测试集分离设计,便于评估模型在未见数据上的表现。
使用方法
使用者可依托HuggingFace Datasets库直接加载该数据集,无需额外预处理。加载后,通过索引访问图像与文本对,即可用于训练端到端的OCR模型,如CRNN或Transformer架构。建议将图像统一缩放至固定尺寸,并应用数据增强技术以提升鲁棒性。该数据集亦可作为微调预训练视觉语言模型的基准,尤其适用于越南语场景下的文字识别任务。
背景与挑战
背景概述
在自然语言处理与计算机视觉交叉领域,光学字符识别(OCR)技术一直是实现文档数字化与信息提取的核心手段。针对越南语这一低资源语言,由于字符集复杂且包含大量音调符号,通用OCR模型往往表现欠佳。ademax/ocr_scan_vi_01数据集应运而生,由研究团队于近年构建,旨在填补越南语场景文本识别领域的空白。该数据集共包含约12,003个图像-文本对,其中训练集11,003例、测试集1,000例,涵盖扫描文档中的多样排版与字体。其发布为越南语OCR模型的训练与评估提供了标准化基准,推动了该语言在智能文档处理、自动化数据录入等应用中的研究进展。
当前挑战
当前数据集面临的核心挑战包括:其一,越南语字符集包含大量带声调字母及特殊符号,导致传统OCR模型在细粒度字符区分上错误率较高,尤其在噪声或低分辨率扫描图像中表现脆弱;其二,数据集规模有限,仅万余样本难以覆盖真实场景中丰富的字体、字号及版面布局变化,模型泛化能力受限。构建过程中亦遭遇挑战,如越南语标注数据稀缺,需耗费大量人力进行精准的文本转录与校对,同时扫描图像的光照不均、倾斜或污渍等质量问题增加了预处理难度,影响了数据一致性与后续模型训练的稳定性。
常用场景
经典使用场景
在光学字符识别(OCR)领域,针对越南语文本的识别任务长期面临标注数据匮乏的困境。ademax/ocr_scan_vi_01数据集应运而生,其包含逾一万一千张训练图像及一千张测试图像,每张图像均配有精准的文本标注。这一资源为研究者提供了构建和评估越南语OCR模型的标准化基准,尤其适用于端到端识别系统的训练与验证,例如基于卷积神经网络(CNN)与循环神经网络(RNN)结合的架构,或预训练视觉语言模型的微调。数据集覆盖多样化的扫描文档场景,助力模型在真实噪声环境下提升鲁棒性。
衍生相关工作
该数据集催生了多项经典学术工作。研究者基于其构建了首个越南语OCR基准测试平台,并衍生出针对噪声扫描图像的增强算法(如生成对抗网络去模糊)。部分工作聚焦于轻量化模型设计,在移动端实现实时OCR推理;另一些则探索多模态预训练范式,将图像编码器与语言模型结合以提升上下文理解能力。此外,该数据集被用于评估OCR系统的对抗鲁棒性,推动了安全文档识别领域的研究。这些成果共同构成了越南语OCR技术演进的重要基石。
数据集最近研究
最新研究方向
在越南语光学字符识别(OCR)领域,ademax/ocr_scan_vi_01数据集的发布为低资源语言的文本数字化研究注入了新活力。该数据集包含超过11000张训练图像与1000张测试样本,专注于扫描文档的图文对应关系,其前沿研究方向聚焦于结合深度学习与注意力机制的端到端识别模型,以应对越南语中特殊字符与复杂排版的挑战。随着东南亚数字化转型加速,该数据集在历史档案数字化、智能政务及多语言文档处理等热点场景中展现出关键作用,推动了小语种OCR技术的实用化进程,为构建更具包容性的多模态语言资源库奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务