assistive-ocr-benchmark-results
收藏资源简介:
该数据集是辅助OCR可穿戴模块的离线多语言(英语、孟加拉语+英语、印地语+英语)基准测试结果。它包含98张真实图像(涉及药品包装、商品包装和标志牌),以及一个经过人工逐条验证的99行真值清单(每条记录包含ID、图像路径、语言配置文件、领域和手动转录文本)。此外,数据集还提供了Tesseract、EasyOCR和PaddleOCR三个OCR引擎在每张图像上的独立对比结果。基准测试结果表明,EasyOCR在整体通过率(91.9%)和关键词召回率(62.7%)上表现最佳,Tesseract作为置信度门控的备用引擎,而PaddleOCR因不支持孟加拉语+英语且性能未显著优于EasyOCR而未被采纳。该数据集规模小于1000个样本,适用于评估多语言OCR引擎在真实场景中的性能,特别是辅助技术应用中的图像文本识别任务。
This dataset is the offline multilingual (English, Bengali+English, Hindi+English) benchmark results for an assistive OCR wearable module. It contains 98 real images (involving medicine packaging, product packaging, and signage) and a manually verified 99-line ground truth list (each record includes ID, image path, language profile, domain, and manual transcription text). Additionally, the dataset provides independent comparison results of three OCR engines (Tesseract, EasyOCR, and PaddleOCR) on each image. Benchmark results show that EasyOCR performs best with an overall pass rate (91.9%) and keyword recall (62.7%), Tesseract serves as a confidence-gated fallback engine, while PaddleOCR is not adopted due to lack of support for Bengali+English and no significant performance advantage over EasyOCR. The dataset size is less than 1000 samples, suitable for evaluating the performance of multilingual OCR engines in real-world scenarios, especially for image text recognition tasks in assistive technology applications.
Assistive OCR 可穿戴模块引擎基准测试结果
数据集概览
这是一个自包含的 OCR 引擎基准测试结果数据集,用于辅助性 OCR 可穿戴模块的离线多语言识别能力评估,覆盖英语、孟加拉语+英语及印地语+英语。数据集共包含 99 行人工验证的真实标注(少于 1K 样本),采用 CC-BY-SA-4.0 许可证。
数据内容
数据集包含三个核心部分:
| 文件 | 说明 |
|---|---|
manual100_final.csv |
99 行真实标注清单,包含 id、image_path、language_profile、domain、manual_transcript 字段,所有转录文本均经人工逐条复核 |
phase4_engine_comparison.json |
逐图像、逐引擎的完整比较结果,涵盖 Tesseract、EasyOCR 和 PaddleOCR 三种引擎,采用无跨引擎回退的独立对比方案 |
images/ |
98 张真实图像(药品包装、商品包装、标牌),其中一条被排除的二维码垃圾样本行无对应图像 |
主要结论
对 99 张人工验证图像进行独立引擎对比(宽松通过标准:至少正确恢复一个临床/情境相关单词):
| 引擎 | 尝试数 | 通过率 | 平均关键词召回率 | 孟加拉语支持 |
|---|---|---|---|---|
| Tesseract | 99/99 | 71.7% | 43.2% | 是 |
| EasyOCR | 99/99 | 91.9% | 62.7% | 是 |
| PaddleOCR | 65/99(34 个跳过) | 90.8%(按尝试数计) | 72.5%(按尝试数计) | 否 |
最终结论: EasyOCR 作为主引擎,Tesseract 作为置信度门控的备选引擎。PaddleOCR 完全无法处理孟加拉语+英语(其发布模型矩阵中不含孟加拉语),且在其支持的语言子集内并未显著优于 EasyOCR,因此仅作评估但未采用。
复现指南
数据集可在 Kaggle 上免费复现,步骤包括:新建 notebook、添加本数据集为输入、安装 OCR 引擎(Tesseract 及 EasyOCR)、修正清单中的图像路径、逐引擎运行基准测试并查看结果汇总。完整的设置与故障排除指南位于主代码仓库的 docs/SETUP_GUIDE.md 中。





