遇见数据集

assistive-ocr-benchmark-results

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

该数据集是辅助OCR可穿戴模块的离线多语言(英语、孟加拉语+英语、印地语+英语)基准测试结果。它包含98张真实图像(涉及药品包装、商品包装和标志牌),以及一个经过人工逐条验证的99行真值清单(每条记录包含ID、图像路径、语言配置文件、领域和手动转录文本)。此外,数据集还提供了Tesseract、EasyOCR和PaddleOCR三个OCR引擎在每张图像上的独立对比结果。基准测试结果表明,EasyOCR在整体通过率(91.9%)和关键词召回率(62.7%)上表现最佳,Tesseract作为置信度门控的备用引擎,而PaddleOCR因不支持孟加拉语+英语且性能未显著优于EasyOCR而未被采纳。该数据集规模小于1000个样本,适用于评估多语言OCR引擎在真实场景中的性能,特别是辅助技术应用中的图像文本识别任务。

This dataset is the offline multilingual (English, Bengali+English, Hindi+English) benchmark results for an assistive OCR wearable module. It contains 98 real images (involving medicine packaging, product packaging, and signage) and a manually verified 99-line ground truth list (each record includes ID, image path, language profile, domain, and manual transcription text). Additionally, the dataset provides independent comparison results of three OCR engines (Tesseract, EasyOCR, and PaddleOCR) on each image. Benchmark results show that EasyOCR performs best with an overall pass rate (91.9%) and keyword recall (62.7%), Tesseract serves as a confidence-gated fallback engine, while PaddleOCR is not adopted due to lack of support for Bengali+English and no significant performance advantage over EasyOCR. The dataset size is less than 1000 samples, suitable for evaluating the performance of multilingual OCR engines in real-world scenarios, especially for image text recognition tasks in assistive technology applications.

创建时间:
2026-08-06
原始信息汇总

Assistive OCR 可穿戴模块引擎基准测试结果

数据集概览

这是一个自包含的 OCR 引擎基准测试结果数据集,用于辅助性 OCR 可穿戴模块的离线多语言识别能力评估,覆盖英语、孟加拉语+英语及印地语+英语。数据集共包含 99 行人工验证的真实标注(少于 1K 样本),采用 CC-BY-SA-4.0 许可证。

数据内容

数据集包含三个核心部分:

文件 说明
manual100_final.csv 99 行真实标注清单,包含 idimage_pathlanguage_profiledomainmanual_transcript 字段,所有转录文本均经人工逐条复核
phase4_engine_comparison.json 逐图像、逐引擎的完整比较结果,涵盖 Tesseract、EasyOCR 和 PaddleOCR 三种引擎,采用无跨引擎回退的独立对比方案
images/ 98 张真实图像(药品包装、商品包装、标牌),其中一条被排除的二维码垃圾样本行无对应图像

主要结论

对 99 张人工验证图像进行独立引擎对比(宽松通过标准:至少正确恢复一个临床/情境相关单词):

引擎 尝试数 通过率 平均关键词召回率 孟加拉语支持
Tesseract 99/99 71.7% 43.2%
EasyOCR 99/99 91.9% 62.7%
PaddleOCR 65/99(34 个跳过) 90.8%(按尝试数计) 72.5%(按尝试数计)

最终结论: EasyOCR 作为主引擎,Tesseract 作为置信度门控的备选引擎。PaddleOCR 完全无法处理孟加拉语+英语(其发布模型矩阵中不含孟加拉语),且在其支持的语言子集内并未显著优于 EasyOCR,因此仅作评估但未采用。

复现指南

数据集可在 Kaggle 上免费复现,步骤包括:新建 notebook、添加本数据集为输入、安装 OCR 引擎(Tesseract 及 EasyOCR)、修正清单中的图像路径、逐引擎运行基准测试并查看结果汇总。完整的设置与故障排除指南位于主代码仓库的 docs/SETUP_GUIDE.md 中。

搜集汇总
数据集介绍
assistive-ocr-benchmark-results 数据集图片
构建方式
该数据集源自辅助型光学字符识别(OCR)可穿戴模块的离线多语言基准测试,涵盖了英语、孟加拉语与英语混合、印地语与英语混合三种语言场景。其构建以99条人工校验的地面真值清单为核心,每条记录包含图像路径、语言配置、领域标签及经人工逐条复核的转录文本,确保标注的准确性与可靠性。数据集中附带98张真实世界图像,涉及药品包装、商品标签及标牌等实际应用场景,并特别剔除了一张二维码垃圾样本,以保证数据纯净度。此外,该数据集自包含完整的基准测试结果文件,记录了三款OCR引擎(Tesseract、EasyOCR、PaddleOCR)在每张图像上的孤立性能表现,无需外部数据即可复现实验。
特点
该数据集的显著特点在于其自洽性与可复现性,所有必要组件——图像、清单、基准结果——均集成于单一仓库,用户可直接运行演示,无需额外数据依赖。同时,数据集设计注重真实性与实用性,图像全部源自现实生活场景,且每份转录文本均经过人工核查,规避了自动生成导致的潜在误差。基准测试覆盖三款主流OCR引擎,提供全面的性能对比,包括通过率、平均关键词召回率及孟加拉语支持情况,揭示了EasyOCR作为主引擎、Tesseract作为置信度门控备选方案的合理配置,并如实记录了PaddleOCR在孟加拉语支持上的缺陷,体现了评估的客观性与严谨性。
使用方法
数据集的使用方法极为简便,尤其支持在Kaggle平台免费复现全部基准测试。用户仅需新建笔记本并开启网络,然后以数据集为输入,安装所需OCR引擎(Tesseract、EasyOCR,可选PaddleOCR),并通过一段Python脚本将清单中的相对图像路径重定向至实际输入位置,即可依次运行各引擎的基准命令。最终结果以JSON格式输出,包含逐图像记录及按语言配置与领域分类的汇总统计,如词错误率、精确匹配率、关键词召回率、延迟及校准误差等。若结果与公开基准存在细微差异,可归因于引擎版本变化,而错误排查指南亦在数据集说明中清晰给出,确保用户能够顺利完成复现与验证。
背景与挑战
背景概述
该数据集由Arko007等研究人员于2026年创建,旨在评估面向可穿戴辅助设备的离线多语种OCR引擎性能。研究聚焦于英语、孟加拉语及印地语混合场景,针对药品包装、商品标签等现实图像,构建了包含99条人工校验标注的基准测试集。其核心研究问题在于探索在资源受限的可穿戴设备上,不同OCR引擎的识别准确率与实用性,为辅助视力障碍人群提供技术支持。该基准通过发布完整的图像、标注与可复现的评估流程,为多语种OCR领域的性能比较提供了标准化参考,对推动辅助技术的实际应用具有重要影响。
当前挑战
该领域面临的核心挑战在于多语种混合文本的准确识别,尤其是在低资源语言(如孟加拉语)支持上的不足,PaddleOCR因缺乏孟加拉语模型而无法处理相关任务。此外,真实场景中的图像质量参差不齐,涵盖药品包装、标牌等复杂背景,增加了识别难度。构建过程中,团队需确保标注的准确性,采用人工逐条校验而非自动生成,以排除噪声样本(如二维码图像)。同时,不同OCR引擎的版本差异可能导致基准结果波动,且需处理如PaddleOCR跳过34个样本等不完整评估问题,确保对比的公平性与结果的可复现性。
常用场景
经典使用场景
该数据集作为辅助性OCR可穿戴模块的引擎基准测试结果集,核心用途在于对离线多语言OCR引擎(Tesseract、EasyOCR、PaddleOCR)进行可复现的性能评估。其自包含特性(涵盖99条人工复核的真实图像及标注清单)使其成为学术与工业界评测OCR引擎在医疗包装、商品标签等真实场景中识别能力的标准测试平台,尤其适用于验证低资源语言(如孟加拉语)的识别鲁棒性。研究者可直接调用该基准以对比不同引擎在词级召回率、字符错误率等指标上的表现,从而为特定应用场景选取最优引擎提供数据驱动依据。
衍生相关工作
基于此基准结果,衍生工作包括针对OCR引擎的置信度门控融合策略研究,以及跨语言子集公平比较的方法论探讨(如文中提及的相同语言子集比较)。此外,该数据集催生了辅助OCR领域的新评测范式——将人工复核的真实图像与可复现脚本结合,推动了Kaggle平台上可交互基准的普及。后续研究亦可能扩展至动态环境下的引擎自适应切换、低资源语言的模型微调预训练,以及将识别结果语义化(如药物剂量提取)的前沿探索,从而将原始基准转化为更具社会价值的辅助智能系统。
数据集最近研究
最新研究方向
该数据集聚焦于可穿戴辅助设备中的多语言离线OCR引擎性能评估,特别针对孟加拉语与英语混合场景。当前研究前沿在于构建可复现的基准测试框架,通过真实图像与人工校验地面真值,系统比较Tesseract、EasyOCR与PaddleOCR的识别准确率、关键词召回率及语言支持度。结果显示EasyOCR在综合表现上领先,而PaddleOCR因缺乏孟加拉语支持而被排除,这为辅助技术领域的引擎选型提供了实证依据。该工作不仅推动了OCR技术在医疗包装、标牌等日常场景的应用,还强调了基准测试的可复现性,为后续研究确立了方法论标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务