shadid113/ACI-ocr-benchmark-EN
收藏资源简介:
--- license: other license_name: research-only language: - en task_categories: - image-to-text tags: - ocr - handwriting-recognition - document-understanding - vlm - benchmark pretty_name: OCR Evaluation Benchmark size_categories: - 1K<n<10K --- # OCR Evaluation Benchmark Unified evaluation dataset for **continual learning OCR in Vision-Language Models**. ## Splits | Split | Category | Level | Samples | Source | |---|---|---|---|---| | `english_handwritten_line` | English Handwritten | Line | 1,500 | IAM Handwriting Database | | `english_handwritten_page` | English Handwritten | Page | 50 | IAM (pseudo-pages) | | `english_printed_line` | English Printed | Line | ~1,500 | OmniDocBench v1.5 | | `english_printed_page` | English Printed | Page | 50 | OmniDocBench v1.5 | ## Usage ```python from datasets import load_dataset # Load a specific split ds = load_dataset("shadid113/ACI-ocr-benchmark-EN", split="english_handwritten_line") # Each sample has: # image: PIL Image # text: ground truth transcription for sample in ds: img = sample["image"] text = sample["text"] ``` ## Columns - **image**: the document/line image (rendered in the viewer) - **text**: ground truth transcription - **id**: unique sample identifier - **source_dataset**: original dataset (IAM / OmniDocBench) - **source_id**: identifier in the original dataset - **document_type**: document category (for English Printed) ## Sources & Licenses - **IAM Handwriting Database** — free for non-commercial research - **OmniDocBench v1.5** — research purposes only ## EDA See the `benchmark_eda/` folder for exploratory data analysis figures and report.
--- 许可证:其他(Other) 许可证名称:仅用于研究(Research-only) 语言: - 英语(en) 任务类别: - 图像到文本(Image-to-Text) 标签: - 光学字符识别(OCR) - 手写识别(Handwriting Recognition) - 文档理解(Document Understanding) - 视觉语言模型(VLM) - 基准测试集(Benchmark) 展示名称:OCR评测基准集(OCR Evaluation Benchmark) 样本规模类别: - 1000 < 样本量 < 10000(1K<n<10K) --- # 光学字符识别(OCR)评测基准集 面向**视觉语言模型(VLM)中的持续学习光学字符识别(OCR)**的统一评测数据集。 ## 数据集拆分 | 拆分名称 | 类别 | 层级 | 样本量 | 来源 | |---|---|---|---|---| | `english_handwritten_line` | 英文手写 | 行级 | 1,500 | IAM手写数据库 | | `english_handwritten_page` | 英文手写 | 页级 | 50 | IAM(伪页面) | | `english_printed_line` | 英文印刷 | 行级 | ~1,500 | OmniDocBench v1.5 | | `english_printed_page` | 英文印刷 | 页级 | 50 | OmniDocBench v1.5 | ## 使用方式 python from datasets import load_dataset # 加载指定拆分的数据集 ds = load_dataset("shadid113/ACI-ocr-benchmark-EN", split="english_handwritten_line") # 每个样本包含以下字段: # image: PIL图像格式 # text: 真值转录文本 for sample in ds: img = sample["image"] text = sample["text"] ## 数据列 - **image**: 文档或行级图像(可在查看器中渲染预览) - **text**: 真值转录文本 - **id**: 唯一样本标识符 - **source_dataset**: 原始数据集(IAM / OmniDocBench) - **source_id**: 原始数据集中的样本标识符 - **document_type**: 文档类别(仅针对英文印刷样本) ## 数据源与许可协议 - **IAM手写数据库** — 可免费用于非商业研究用途 - **OmniDocBench v1.5** — 仅可用于研究用途 ## 探索性数据分析 请查看`benchmark_eda/`文件夹以获取探索性数据分析图表与分析报告。



