遇见数据集

consensus-labelling

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

Telugu行图像三引擎OCR共识数据集。该数据集包含约244万张单行裁剪图像,来源于扫描的Telugu(泰卢固语)印刷书籍。每张图像由三个独立的OCR引擎(自定义Telugu CTC识别器、Tesseract、PaddleOCR)进行识别,并记录引擎间的一致性程度。数据字段包括:图像本身、每个引擎的预测文本、引擎间一致性等级(1-4,1表示三个引擎完全一致)、共识文本(当至少两个引擎一致时给出)、是否包含拉丁字母及其比例、以及每对引擎之间的差异度。该数据集旨在通过弱监督方式生成大量训练数据,无需人工标注。但需注意:这些标签未经人工验证,三个引擎的一致并不保证正确,因此不能用作基准评价,而应作为训练数据和筛选工具。用户可根据一致性等级灵活筛选数据(如只使用三个引擎完全一致的样本或至少两个引擎一致的样本)。数据集包含约244万个样本,均为灰度图像,高度64像素,宽度为8的倍数。

Telugu line image three-engine OCR consensus dataset. This dataset contains approximately 2.44 million single-line cropped images from scanned Telugu printed books. Each image is recognized by three independent OCR engines (custom Telugu CTC recognizer, Tesseract, PaddleOCR), and the degree of consistency among the engines is recorded. Data fields include: the image itself, each engines prediction text, inter-engine consistency level (1-4, where 1 indicates all three engines agree), consensus text (given when at least two engines agree), whether Latin characters are present and their proportion, and the divergence between each pair of engines. The dataset is intended to generate large amounts of training data through weak supervision without manual annotation. However, note that these labels are not manually verified; agreement among the three engines does not guarantee correctness, so it should not be used as a benchmark evaluation but as training data and a filtering tool. Users can flexibly filter data based on consistency levels (e.g., use only samples where all three engines agree or at least two engines agree). The dataset contains approximately 2.44 million samples, all grayscale images, with a height of 64 pixels and a width that is a multiple of 8.

创建时间:
2026-07-27
原始信息汇总

数据集概述

数据集名称:Telugu line images with three-engine OCR consensus(泰卢固语行图像与三引擎OCR共识标注)

数据集地址https://huggingface.co/datasets/harsha-desaraju/consensus-labelling

数据集规模:包含约 244万条 单行裁剪图像,来源于扫描的泰卢固语书籍,训练集大小约9.99 GB(下载大小约9.23 GB)。

任务类型:图像到文本(image-to-text)

语言:泰卢固语(te)为主,部分行含有拉丁字母(英语)。

标签:OCR、telugu、pseudo-labelling、weak-supervision

许可协议:other(其他)


核心内容

目的:泰卢固语几乎没有标注的OCR数据,本数据集通过三个OCR引擎(自研Telugu CTC模型、Tesseract、PaddleOCR)对大量扫描书籍行图像进行独立识别,利用引擎间的一致性生成弱监督训练标签,并提供人类审阅的优先级排序。

数据构成:每行图像为灰度图,高度64像素,宽度为8的倍数。每一行包含以下主要字段:

  • line_image:行裁剪图像
  • file_namepage_numberimage_width:来源信息(书籍PDF、页码、像素宽度)
  • pred_model:自研Telugu CTC识别结果
  • pred_tesseract:Tesseract识别结果
  • pred_paddle:PaddleOCR识别结果
  • tier(1–4,0为不可用行)与 tier_reason:三引擎一致程度及一致情况说明
  • consensus_text:三引擎达成一致的文本(全不一致时为空)
  • has_englishenglish_fracpred_model是否含拉丁字母及其比例
  • disagree_model_tesseractdisagree_model_paddledisagree_tesseract_paddle:每对引擎输出间的差异度(0–1)

分层(Tier)定义

含义
1 三引擎识别结果全部一致(最强信号)
2 Tesseract与PaddleOCR一致,自研模型不同
3 自研模型与PaddleOCR一致,Tesseract不同
4 自研模型与Tesseract一致,或三引擎全部不同
0 某引擎出错或所有识别为空(数量极少)

注意:两个引擎对不可读行输出空结果 不计为一致,避免产生大量空字符串标注的tier 1。一致性比较经过了轻度归一化(标点折叠、空白压缩、去除不可见连接字符),因为泰卢固语存在码点不同但显示相同的序列,原始字符串相等会低估实际一致性。

早期抽样统计:在5万行样本中,约3%的行三引擎完全一致,约15%的行至少两个引擎一致。建议在实际使用中对全量数据重新计算。


使用建议

过滤示例(使用HuggingFace datasets库):

python ds = load_dataset("harsha-desaraju/consensus-labelling", split="train")

最严格:三引擎一致

gold = ds.filter(lambda r: r["tier"] == 1)

至少两引擎一致

usable = ds.filter(lambda r: r["consensus_text"] != "")

仅泰卢固语,不含英语

telugu = ds.filter(lambda r: not r["has_english"])

审阅队列:自研模型与PaddleOCR差异最大的前5000行

review = ds.sort("disagree_model_paddle", reverse=True).select(range(5000))

重要提示

  • 本数据集 不是人工验证的标签。三引擎一致仅表示“佐证”,不表示“正确”,识别器可能犯同样的错误,共识会将这些错误提升至tier 1。
  • disagree_*不是错误率,只反映引擎间的差异,并不代表与真实文本的距离。
  • 本数据集适合作为训练数据或分诊工具, 不适合作为基准测试集。评估模型性能请使用人工校验的数据集 telugu-line-ocr-bench

局限性

  • tier 1存在易偏差:三引擎一致的行通常更干净、更短、印刷更规范,仅用tier 1训练会使模型低估真实语料的难度。
  • has_english反映自研模型的判断(因其由pred_model派生)。
  • 领域单一:仅包含来自单一收藏的印刷泰卢固语书籍扫描,无手写、路牌或数字原生文本。
  • consensus_text已归一化,无法还原页面的精确标点。

数据来源

图像来源telugu-book-line-images(从扫描的泰卢固语书籍PDF中分割出的行裁剪图像)。

构建工具:来自TeluguOCR仓库中的 pipelines/label/consensus_labelling.py。PaddleOCR仅运行识别模式,因为输入已是行级图像,若让其重新检测边界框在64px高的条带中会返回乱序的碎片。


引用信息

bibtex @misc{telugu_consensus_labelling, title = {Telugu line images with three-engine OCR consensus}, author = {Desaraju, Harsha}, year = {2026}, url = {https://huggingface.co/datasets/harsha-desaraju/consensus-labelling} }

搜集汇总
数据集介绍
consensus-labelling 数据集图片
构建方式
该数据集源自对扫描版泰卢固语书籍页面进行行级裁剪的图像集合,每幅图像均经过三种OCR引擎(自家CTC模型、Tesseract及PaddleOCR)的独立识别。通过比对三者的输出,在轻度归一化(如标点折叠、空白压缩、不可见连接符去除)后,依据引擎间的一致性程度,将样本划分为不同层级(tier 1至4及无效层级0),并附带共识文本及两两引擎间的差异度量。此构建方式旨在无需人工标注即可大量生成带标签的OCR训练数据,同时利用弱监督与伪标注策略,有效缓解泰卢固语标注数据匮乏的困境。
特点
数据集规模庞大,包含约244万条单行图像,覆盖真实书籍扫描场景,具有高度领域针对性。其特色在于引入了多引擎共识机制,不仅提供了强一致的黄金标签(tier 1),还保留了分歧样本作为人工复核的候补队列。每一行均附带丰富的元数据,如来源出处、图像属性、英文含量及引擎间差异分数,便于用户按需过滤。此外,数据集充分保留了原始预测信息,未做人为过滤,赋予使用者极大的筛选自由度。
使用方法
使用者可通过HuggingFace datasets库便捷加载数据,并依据tier字段或consensus_text非空条件筛选出可靠训练样本,亦可通过has_english等特征构建纯泰卢固语语料。数据集主要适用于OCR模型的训练与弱监督预训练,对于构建噪声鲁棒模型尤具价值。然而,需明确其标签未经人工验证,不适用于官方基准评测,推荐使用配套的人工校验数据集进行性能评估。通过灵活调整过滤策略,可适应从高精度训练到难例挖掘等多种应用场景。
背景与挑战
背景概述
该数据集由Harsha Desaraju于2026年创建,旨在解决泰卢固语光学字符识别(OCR)领域标注数据极度匮乏的问题。泰卢固语作为一种广泛使用的印度语言,其印刷文本的数字化依赖于高效的OCR系统,但缺乏高质量的人工标注数据严重制约了模型训练与性能提升。该数据集创新性地采用三引擎共识策略,通过集成不同OCR引擎的预测结果,自动生成大量弱监督标注,为下游模型训练提供了规模达244万行图像的数据资源。其核心研究问题在于探索无人工干预条件下,利用多引擎一致性构建可靠训练数据的可行性,并对相关领域产生了深远影响,为低资源语言的OCR数据构建提供了新范式。
当前挑战
该数据集面临的挑战首先体现在领域问题层面:泰卢固语OCR因字符组合复杂、相似字形多,且缺乏基准数据集,导致模型评估困难,传统方法依赖昂贵的人工标注。其次,在构建过程中,三引擎共识虽能提高标注可靠性,但面临若干技术难点:一是引擎间的一致性易受编码差异影响,需进行归一化处理;二是共识结果存在易偏置性,高一致性样本多集中于清晰、短小的文本行,导致训练数据分布不均;三是弱监督标签未经人工验证,存在错误传播风险,无法作为严格基准使用。此外,数据来源单一(仅印刷书籍扫描),限制了模型的泛化能力。
常用场景
经典使用场景
该数据集以泰卢固语书籍扫描页面的单行图像为基本单元,融合三种OCR引擎的识别结果,构建了规模达244万条样本的伪标注资源。其经典使用场景聚焦于低资源语种的OCR模型训练,研究者可依据引擎共识等级(tier)灵活划分训练子集,例如选取全部引擎一致同意的tier 1样本作为高置信度训练数据,或利用至少两个引擎达成一致的共识文本进行弱监督学习。这种基于共识机制的数据筛选策略,有效缓解了低资源语言标注数据匮乏的瓶颈,为泰卢固语等小众文字的识别模型提供了可扩展的训练语料。
实际应用
在实际应用中,该数据集主要服务于泰卢固语光学字符识别系统的开发与优化。研究者和工程师可以直接利用其高置信度子集(如tier 1)训练生产级OCR模型,或将其作为预训练语料,通过微调适应特定领域的文档。此外,数据集中标注的分歧分数(如disagree_model_paddle)可构建人工复查队列,帮助标注团队优先审视模型间冲突最强烈的行,提升校对效率。对于数字人文项目,该数据集的来源信息(文件、页码)支持追溯原始书籍,便于构建带版面信息的全文检索库。其灵活的分级策略也使其成为数据增强、域适应等实际任务的可靠数据源。
衍生相关工作
该数据集的出现催生了一系列后续研究。基于其共识标签机制,研究者提出了改进的多引擎融合策略,例如动态加权投票或基于置信度估计的选择性采样方法。数据集的弱监督框架被借鉴到其他低资源语种(如印度各地方言)的OCR标注生成中,形成了跨语种的共识标注基线。此外,围绕tier级别的不平衡性,涌现出针对难例挖掘的训练策略,如对低层级样本进行半监督学习或主动学习。该数据集还常与人工校验基准(如telugu-line-ocr-bench)联合使用,推动OCR模型的鲁棒性评估与错误分析研究,并启发了有关OCR共识误差传播的理论探讨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务