遇见数据集

ClinOCR-Bench

收藏
arXiv2026-07-04 更新2026-07-07 收录
官方服务:

资源简介:

ClinOCR-Bench是由德克萨斯大学休斯顿健康科学中心等机构创建的综合性临床扫描文档数据集,旨在评估光学字符识别模型在医疗领域的性能。该数据集包含384张合成扫描图像,涵盖正常、手写、质量差、旋转、表格和混合伪影六个子集,平均每文档约200个单词,数据来源于16个模板和12种文档类型,通过人工模板设计、大语言模型生成文本内容及物理与程序化退化方法合成。该数据集应用于临床OCR模型开发与评估,旨在解决电子健康记录中扫描文档信息提取的挑战,特别是针对手写、表格、低质量和旋转等常见伪影,以提升医疗数据处理效率与患者安全。

ClinOCR-Bench is a comprehensive clinical scanned document dataset created by institutions including the University of Texas Health Science Center at Houston, aiming to evaluate the performance of optical character recognition (OCR) models in the medical field. This dataset comprises 384 synthetic scanned images, covering six subsets: normal, handwritten, low-quality, rotated, tabular, and mixed artifacts. Each document contains an average of approximately 200 words, with the data sourced from 16 templates and 12 document types, and synthesized via manual template design, text content generation by large language models (LLMs), as well as physical and procedural degradation methods. This dataset is applied to the development and evaluation of clinical OCR models, with the goal of addressing challenges in scanned document information extraction from electronic health records (EHRs), particularly for common artifacts such as handwritten content, tabular structures, low-quality images, and rotated documents, thereby improving medical data processing efficiency and patient safety.

创建时间:
2026-07-04
原始信息汇总

ClinOCR-Bench 数据集概述

ClinOCR-Bench 是一个专门用于评估光学字符识别(OCR)系统在临床文档上表现的基准数据集。它旨在模拟真实世界中扫描文档的复杂性和多样性,包括传真、皱褶打印件、照片、手写笔记和密集的表格报告等多种场景。

核心特性

  • 评估场景:支持零样本和单样本评估。
  • 单样本设置:每个评估文档提供两种预定义的单样本示例:
    • 同质单样本:使用与查询文档相同模板的示例。
    • 异质单样本:使用与查询文档不同模板(但属于同一子集)的示例。
  • 基准性能:提供了基线OCR性能的参考(ClinOCR-Bench-Baseline)。

数据集结构与规模

数据集包含 6个子集16个模板,共计 384个文档(每个子集64个文档)。子集划分如下:

子集 扫描图像路径 真实文本路径 描述
Normal-quality scans/normal/ ground_truth/normal/ 清晰、高质量的扫描文档
Handwriting scans/handwriting/ ground_truth/handwriting/ 手写字体的文档
Poor-quality scans/poor/ ground_truth/poor/ 低分辨率、照片、皱褶或退化扫描件
Rotation scans/rotated/ ground_truth/rotated/ 旋转/倾斜的文档
Tables scans/tables/ ground_truth/tables/ 包含复杂表格布局的文档
Mixed artifacts scans/mixed/ ground_truth/mixed/ 结合多种缺陷(如旋转、高亮、低分辨率)的文档
  • 模板分配:模板1-8用于 Normal-qualityHandwritingPoor-qualityRotation 子集;模板9-16用于 Tables 子集;Mixed artifacts 子集包含模板1-16各4个样本。

数据划分

文档被分为训练集(示例集)和测试集(评估集):

  • 训练集(示例集):每个模板中编号最小的一个样本被保留作为该模板的示例,共 56个示例
  • 测试集(评估集):其余所有文档参与评分,共 328个文档

构建方法

数据集通过多阶段流程构建,生成逼真的临床文档:

  1. 模板设计:基于真实扫描文档手动创建布局。
  2. 嵌入图像生成:利用图像生成模型创建标识、条形码和医学图像。
  3. 内容生成:利用大语言模型为各文本区(如患者信息、印象、笔记)生成真实内容。
  4. 样式调整:采用手写字体并调整表格布局。
  5. 物理伪影模拟:通过打印、皱褶、塑料文件夹、多代复印、降低分辨率和旋转等方式模拟真实扫描伪影。
  6. 质量控制:通过小组讨论进行审核和修订。

真实文本通过从源Word文档中程序提取后,再人工审核获得。


数据获取方式

数据可通过两种方式获取:

  • 直接下载(原始文件):从GitHub Release中下载包含 scans/ground_truth/ 和单样本查找文件的压缩包。

  • Hugging Face Hub:使用 datasets 库加载,每个子集作为一个配置,包含 train(示例集)和 test(评估集)划分。示例代码: python from datasets import load_dataset ds = load_dataset("ClinOCR-Bench/ClinOCR-Bench", "handwriting") test, exemplars = ds["test"], ds["train"]

  • 单样本映射oneshot_lookup.csvoneshot_lookup.json 文件记录了每个文档的同质和异质单样本示例的映射信息。


许可与引用

  • 许可协议:MIT License。
  • 引用信息:待补充。
搜集汇总
数据集介绍
ClinOCR-Bench 数据集图片
构建方式
ClinOCR-Bench的构建流程严谨而细致,首先基于真实电子健康档案中的扫描文档手动创建了16种涵盖12种文档类型的空白模板,包括影像报告、病理报告、临床访视记录、用药清单等,每份模板包含4至12个文本区域、页眉页脚以及图标与图像占位符。随后,利用ChatGPT等生成式AI工具生成医院徽标、结肠镜图像和实验室条码等嵌入式图像,并经过尺寸调整和背景去除等后处理。文本与表格内容则通过提示多个大语言模型(如ChatGPT、Gemini、Claude)进行生成,并手动调整布局与字体,其中手写子集采用了61种独特的手写字体。扫描伪影的引入结合了物理降解(如纸张折叠、多代复印)和程序化方法(如分辨率降低、滤镜应用),最终经过四轮人工审计与修订,确保数据集质量。
使用方法
ClinOCR-Bench的使用方式灵活且适配多种评估范式。研究者可从GitHub或Hugging Face Hub下载原始图像文件、真实标注文本及单样本示例映射表,推荐通过Hugging Face datasets Python包进行程序化访问。数据集支持零样本与单样本两种OCR评估设置:零样本模式下,仅需提供系统提示词、用户提示词和目标扫描文档图像;单样本模式下,则额外提供一张示例图像及其真实标注作为上下文。单样本配置进一步分为同质设置(示例与测试图像共享同一模板)和异质设置(示例与测试图像来自不同模板),分别对应固定模板重复使用和异构来源文档的实际场景。基线实验代码、结果及文档已在GitHub上开源,研究者可复现评估流程,并使用词错误率作为主要评估指标。
背景与挑战
背景概述
ClinOCR-Bench是由德克萨斯大学休斯顿健康科学中心生物医学信息学学院的Enshuo Hsu、Jin Zhou和Kirk Roberts于近年构建并公开的临床扫描文档光学字符识别(OCR)基准数据集。在电子健康记录(EHR)系统中,扫描文档长期以来构成了信息提取的重大障碍——仅2018年,某城市医疗系统即接收超过350万份扫描文档,涵盖129种类型。尽管视觉语言模型(VLM)在通用OCR任务上展现出超越传统引擎的潜力,但临床领域的OCR研究多依赖于私有机构数据,缺乏系统性的公开评估资源。ClinOCR-Bench的诞生正是为了填补这一空白,其核心研究问题在于:如何在真实扫描伪影(如手写、表格、低质量扫描、旋转)全覆盖的条件下,构建一个可公开访问、模板多样且具备精确标注的临床OCR评测框架。数据集一经发布即被托管于GitHub与Hugging Face Hub,为定量比较不同OCR方法在临床场景中的鲁棒性与准确性提供了标准化的试验场。
当前挑战
临床OCR面临的挑战首先源于扫描文档本身的复杂性:手写文字常导致OCR引擎产生无意义字符;表格数据在行列对齐上极易发生断裂,嵌套表格问题尤为突出;低质量扫描(如模糊、褪色、背景噪声)及旋转歪斜(超过30度)则造成大面积误识别。现有公开医疗OCR数据集普遍存在布局单一(多基于同一模板生成)、文档类型匮乏(以实验室报告为主)、且完全忽略上述常见伪影的问题,无法支撑系统化的模型评估。在构建ClinOCR-Bench的过程中,研究者亦遭遇多重困难:利用大语言模型生成文本内容时,常出现区域缺失或内容不当,需反复对话修正;手工创建16个源自真实医疗文档的模板并嵌入图标、条形码与医学图像,同时适配61种手写字体以模拟手写场景;物理及程序化降质方法(如折叠、多次复印、分辨率缩减)的复现与参数调优,以及四轮人工审计以纠正字体误用、内容截断、旋转角度不足等错误,均耗费大量精力。最终,数据集包含384张扫描图像,覆盖6个子集,并提供了同模板与异模板两种少样本学习配置,为临床OCR模型的公平基准测试奠定了坚实基础。
常用场景
经典使用场景
在临床文档的智能处理领域,光学字符识别(OCR)技术是连接纸质医学记录与电子健康记录(EHR)系统的关键桥梁。ClinOCR-Bench数据集专为评估临床扫描文档的OCR模型性能而设计,涵盖了正常质量、手写、表格、低质量扫描、旋转扫描及混合伪影六类子集。其经典使用场景在于提供一个真实感强、布局多样且包含常见扫描伪影的公开基准,使研究者能够在统一框架下系统对比传统OCR引擎与视觉语言模型(VLM)在医疗文档转录任务上的表现。该数据集的同质与异质单样本提示设置,进一步模拟了临床工作流中模板重复使用与异构来源文档的两种典型评估需求。
解决学术问题
过去,临床OCR研究大多依赖机构内部数据,缺乏公开、标准化的评估数据集,导致模型性能难以横向比较,且现有公共数据集往往忽略手写、模糊、旋转等真实EHR扫描场景中普遍存在的伪影。ClinOCR-Bench的出现填补了这一空白,解决了医疗OCR领域长期面临的系统性评估难题。该数据集通过精心构造的16种模板和12类文档类型,提供了对文档布局多样性与扫描伪影的全覆盖,使得研究者能够精确测量不同模型在复杂条件下的词错误率(WER),从而推动OCR技术在医疗信息学中的鲁棒性研究。其公开的PHI-free合成数据特性,更消除了隐私壁垒,让学术界能够自由复现实验与迭代模型。
实际应用
在临床信息学的实际应用中,ClinOCR-Bench所模拟的场景直指医院EHR系统日常面临的棘手问题:大量外院报告、手写表格、传真和多方转诊文档需要精准转录以纳入结构化数据。该数据集为研发高效、可靠的临床OCR工具提供了落地前的关键验证平台,帮助开发者在部署前识别模型在手写处方、复杂化验单以及因老旧扫描仪导致的模糊旋转图像上的弱点。通过在此基准上的测试,医疗IT团队可以筛选出最适合本机构扫描文档特征的OCR方案,从而提升患者数据整合效率,减少因转录错误引发的医疗差错,并加速病历数字化改造进程。
数据集最近研究
最新研究方向
在电子健康记录系统面临海量扫描文档处理压力的背景下,ClinOCR-Bench应运而生。该数据集精准聚焦临床光学字符识别领域的前沿挑战,系统性地覆盖了手写文字、表格错乱、低质量扫描及旋转倾斜等真实医疗文档中普遍存在的伪影干扰。当前视觉语言模型在通用OCR基准上虽已展现显著优势,但临床场景下模型评估仍多依赖不可公开的机构数据。ClinOCR-Bench以合成数据策略构建了包含384幅扫描图像、横跨12种文档类型的多样化基准,其模板感知的少样本学习设计和完全脱敏特性,为系统性评估和推动临床OCR模型的鲁棒性发展提供了关键公共资源,对提升医疗信息自动化处理效能具有深远意义。
相关研究论文
  • 1
    ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation德克萨斯大学休斯顿健康科学中心·麦威廉姆斯生物医学信息学院; 德克萨斯大学MD安德森癌症中心·企业开发与集成部 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务