遇见数据集

NuosuBburma-OCR-Evaluation-Set

收藏
Hugging Face2026-06-29 更新2026-06-30 收录
官方服务:

资源简介:

NuosuBburma OCR Evaluation Set 是一个专门用于评估规范彝文(Nuosu Yi)光学字符识别(OCR)模型性能的基准数据集,尤其适配PaddleOCR-VL风格的图片OCR评测任务。数据集旨在全面测试模型在多样化、真实世界彝文文本场景下的识别能力。数据内容与构成方面,数据集共包含758个样本,每个样本由一张图片和对应的唯一标准真值(ground truth)文本组成。图片存储于`images/`目录,真值文本及元数据记录在`annotations.jsonl`文件中,每行对应一个样本,采用结构化的JSON格式。该格式不仅包含图片路径和真值文本,还通过`meta`字段提供了丰富的样本属性信息,包括来源名称、样本类型(单行、区域或整页)、采集场景(如新书PDF、旧书PDF、真实屏幕照片、工整手写照片、真实场景照片)、难度等级(简单、中等、困难)以及文字混合类型(纯彝文、彝汉混排、彝汉拉丁注音、纯汉文等)。数据规模为758个图文对,确保了数据集的完整性,标注中不存在空真值文本或缺失图片的情况。数据来源和类型高度多样化,覆盖了旧书扫描、新书扫描、屏幕截图拍照、手写文本拍照、真实环境照片以及标牌照片等多种场景。文本内容不仅包括纯彝文,还涵盖了彝汉混排文本、带有拉丁字母注音的彝文、数字、页码、脚注以及封面和工具书条目,从而全面评估OCR系统处理复杂、混合文本的能力。该数据集适用于OCR模型的性能评估与基准测试任务,特别是针对少数民族语言(彝文)以及多语言混合场景下的文本识别研究。

The NuosuBburma OCR Evaluation Set is a benchmark dataset specifically designed for evaluating the performance of optical character recognition (OCR) models for standardized Yi script (Nuosu Yi), particularly adapted for PaddleOCR-VL style image OCR evaluation tasks. The dataset aims to comprehensively test the models recognition capabilities in diverse, real-world Yi text scenarios. In terms of data content and structure, the dataset contains a total of 758 samples, each consisting of an image and its corresponding unique ground truth text. Images are stored in the `images/` directory, while ground truth text and metadata are recorded in the `annotations.jsonl` file, with each line corresponding to a sample in a structured JSON format. This format includes not only image paths and ground truth text but also provides rich sample attribute information through the `meta` field, such as source name, sample type (single-line, region, or full-page), collection scenario (e.g., new book PDF, old book PDF, real screen photos, neat handwriting photos, real scene photos), difficulty level (easy, medium, hard), and text mixing types (pure Yi, Yi-Chinese mixed, Yi-Chinese with Latin phonetic notation, pure Chinese, etc.). The data scale consists of 758 image-text pairs, ensuring the completeness of the dataset with no empty ground truth texts or missing images in the annotations. Data sources and types are highly diverse, covering various scenarios such as old book scans, new book scans, screen screenshot photos, handwritten text photos, real environment photos, and signboard photos. The text content includes not only pure Yi script but also Yi-Chinese mixed texts, Yi with Latin alphabet phonetic notation, numbers, page numbers, footnotes, as well as covers and reference book entries, thereby comprehensively evaluating the OCR systems ability to handle complex and mixed text. The dataset is suitable for performance evaluation and benchmark testing of OCR models, especially for research on minority languages (Yi script) and multilingual mixed text scenarios.

创建时间:
2026-06-22
原始信息汇总

数据集概述

数据集名称:NuosuBburma OCR Evaluation Set(规范彝文OCR评估集)

语言:彝文(ii)、中文(zh)

任务类型:图像到文本(image-to-text)

数据集规模:样本数小于1000(n<1K)

许可证:其他(other)

标签:OCR、PaddleOCR、Nuosu Yi、Yi、evaluation


核心内容

  • 核心文件

    • annotations.jsonl:唯一的标准真实数据文件,每行包含图片路径和真实文本。
    • images/:评估图片文件夹,路径与annotations.jsonl中的images字段一致。
  • 数据规模

    • 样本数:758
    • 图片数:758
    • 空真实文本:0
    • 缺图:0

覆盖类型

维度 覆盖范围
图片来源 旧书扫描、新书扫描、屏幕拍照、手写拍照、真实场景照片、标牌照片
输入粒度 单行(line)、区域(region)、整页(page)
文字类型 纯彝文、彝汉混排、彝汉拉丁注音、数字、页码、脚注、封面和工具书条目
难度 easy / medium / hard

标注格式

annotations.jsonl 每行包含以下字段:

  • id:样本ID
  • images:图片路径列表
  • messages:对话格式,包含用户输入(如<image>OCR:)和助手输出(真实文本)
  • meta:元数据,包括:
    • source_name:来源名称
    • sample_type:样本类型(line / region / page)
    • scene:场景类型(new_print_pdf / old_print_pdf / real_screen_photo / neat_handwriting / real_photo)
    • difficulty:难度(easy / medium / hard)
    • script_mix:文字混合情况(yi / yi_han / yi_han_latin / han / other)

版本信息

  • 最终版本20260629_final_locked_gt_complete
  • 最终锁定时间2026-06-29T21:22:14
  • annotations.jsonl SHA256db9a2a061054ccfa772566c4482aa0793a8df72b49888d251e0de0e5eb78be93
搜集汇总
数据集介绍
NuosuBburma-OCR-Evaluation-Set 数据集图片
构建方式
NuosuBburma-OCR-Evaluation-Set是一个专为规范彝文(Nuosu Yi)设计的OCR评估数据集,旨在服务于PaddleOCR-VL风格的图片OCR评测。其构建基于多样化的现实场景,涵盖旧书扫描、新书扫描、屏幕拍照、手写拍照、真实场景照片及标牌照片等多源图像,并按照单行、区域、整页三种输入粒度进行组织。此外,数据集综合考虑文字类型的复杂性,包含纯彝文、彝汉混排、彝汉拉丁注音、数字、页码、脚注等多种混合书写形式,同时依据识别难度划分为easy、medium、hard三个等级,确保评估的全面性与挑战性。最终以758个样本组成标准化评测集合,每个样本均配备统一的annotations.jsonl标注文件与对应图像。
特点
该数据集的核心亮点在于其高度结构化的标注体系与丰富的多样性。所有标注信息存储于单一的canonical ground truth文件annotations.jsonl中,每行包含唯一样本ID、图像路径、基于对话格式的user-assistant消息对(明确提示词与GT文本),以及详尽的元数据字段,如来源名称、样本类型、场景类别、难度等级与文字混合类型。这种设计不仅便于直接用于模型推理任务,还支持细粒度性能分析。另外,数据集严格保证数据完整性,无空GT样本或缺失图像,且通过最终锁定版本与SHA256校验确保可复现性与可靠性,为彝文OCR研究提供了标准化基准。
使用方法
使用该数据集时,用户可直接加载annotations.jsonl文件,解析每行JSON对象以获取图像路径与对应的ground truth文本。推荐采用PaddleOCR-VL框架进行评测,将图像输入模型后,利用预设的“<image>OCR:”提示词生成预测结果,并与assistant字段内容比对计算准确率。元数据字段(如difficulty、scene、script_mix)可用于分组评估,以深入分析模型在不同场景或文字复杂度下的表现。数据集规模适中,易于快速部署在实验或基准测试中,无需额外预处理,即开即用。
背景与挑战
背景概述
规范彝文(Nuosu Yi)作为中国彝族使用的官方文字,承载着丰富的民族文化遗产与历史文献。然而,现有光学字符识别(OCR)技术主要聚焦于主流语言,对少数民族文字的数字化处理研究相对薄弱。为填补这一空白,研究者于2026年构建了NuosuBburma-OCR-Evaluation-Set,该数据集由PaddleOCR-VL项目团队主导开发,旨在系统评估和推动规范彝文的OCR性能。其核心研究问题在于构建一个覆盖多场景、多难度的彝文OCR评测基准,以衡量模型在不同来源、字体和排版条件下的识别能力。该数据集的发布为少数民族文字识别领域提供了重要的标准化评估平台,有助于推动相关技术的实际应用与学术交流。
当前挑战
该数据集所解决的领域挑战在于规范彝文OCR任务长期面临标注资源匮乏与场景多样性不足的问题,现有模型难以应对旧书扫描、手写样本及彝汉混排等复杂情况,导致识别精度低下。在构建过程中,研究者遇到多重困难:需从多种异构来源(如扫描件、照片)中采集图片,并统一标注格式;类别覆盖广泛,包括纯彝文、彝汉混排、拉丁注音及数字符号等,增加了均衡采样的难度;同时,需对每张图片标注场景类型(如屏幕拍照、真实照片)与难度等级(easy/medium/hard),这一过程依赖人工审核,耗时且易产生主观偏差。此外,数据集的规模较小(仅758张图片),对模型泛化能力的评测存在局限性。
常用场景
经典使用场景
在低资源文字光学字符识别(OCR)领域,规范彝文(Nuosu Yi)长期缺乏标准化评测基准,严重制约了相关技术的发展。NuosuBburma-OCR-Evaluation-Set作为首个专门面向规范彝文的OCR评估数据集,为模型性能度量提供了统一的尺度。该数据集包含758张精心标注的图片,覆盖旧书扫描、新书扫描、屏幕拍照、手写拍照、真实场景照片及标牌照片等六类来源,输入粒度涵盖单行、区域与整页三种类型,文字组合囊括纯彝文、彝汉混排、彝汉拉丁注音等多种形态。经典使用场景是在PaddleOCR-VL框架下,利用该数据集对模型进行端到端评测,计算字符错误率(CER)和准确率等核心指标。研究者可通过其难度分级(easy/medium/hard)细致分析模型在不同挑战下的表现,从而精准识别模型的薄弱环节。
实际应用
在文化数字化保护与民族文字信息处理的实际应用中,该数据集发挥着不可替代的作用。彝族古籍、现代出版物以及日常场景中的彝文标识的自动化识别,是构建数字图书馆、实现民族语言机器翻译以及开发智慧旅游导览系统的基础。借助NuosuBburma-OCR-Evaluation-Set训练或微调的OCR模型,能够准确识别旧书扫描件中因纸张老化产生的字形粘连,以及屏幕拍照带来的摩尔纹干扰。在公共安全领域,该数据集可支撑彝文交通标识牌的实时识别系统开发。教育科技方面,基于该数据集的OCR工具能够辅助彝文教材的数字化加工,支持双语教学资源的快速生成。文化产业中,博物馆和档案馆利用相关模型高效录入彝文展品说明与历史文献,显著提升了民族文化遗产整理的自动化水平。其覆盖的多种拍摄场景与文字组合类型,确保了从古籍影印本到现代手机拍摄图片等真实场景下的鲁棒识别能力。
衍生相关工作
该数据集的出现催生了一系列有价值的衍生研究工作。在模型层面,研究者基于其多元覆盖类型提出了针对彝文独特字形结构的改进型视觉Transformer,通过引入可形变卷积处理笔画密集区域。针对彝汉混排场景,衍生出结合语言模型先验知识的两阶段解码策略,有效提升了混合文本的切分与识别精度。在评估方法论方面,该数据集的难度分级机制启发了后续工作构建更具挑战性的子集,用于测试模型在极端低质量图片(如严重光照不均的手写片段)上的泛化能力。数据增强策略方面,研究者利用该数据集的场景标注,开发了面向彝文字形变体的合成数据生成管道,有效缓解了原始数据规模有限的瓶颈。此外,该数据集还促进了跨语言OCR迁移学习研究,探索了将预训练模型在彝文数据集上微调后,是否能够提升其他藏缅语族文字的识别性能,为低资源文字共享表征学习提供了新的实验平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务