muneeb-py/autotrain-data-medocr-berta
收藏官方服务:
资源简介:
该数据集是通过AutoTrain为项目medocr-berta自动处理的。数据集的BCP-47语言代码为unk,表示语言未知。数据集包含上下文、问题、答案文本、答案起始位置、未命名特征、图像路径和上下文特征等字段。数据集被分为训练集和验证集,训练集包含773个样本,验证集包含194个样本。
该数据集是通过AutoTrain为项目medocr-berta自动处理的。数据集的BCP-47语言代码为unk,表示语言未知。数据集包含上下文、问题、答案文本、答案起始位置、未命名特征、图像路径和上下文特征等字段。数据集被分为训练集和验证集,训练集包含773个样本,验证集包含194个样本。
提供机构:
muneeb-py原始信息汇总
数据集概述
数据集名称
- AutoTrain Dataset for project: medocr-berta
语言
- BCP-47代码: unk
数据集结构
- 数据实例示例: json [ { "context": "[597, 612]", "question": "What are the contents?", "answers.text": ["INCL.ALL TAXES"], "answers.answer_start": [597], "feat_Unnamed: 0": [831], "feat_image_path": "/content/train/images/20221121_165501_71f9_jpg.rf.446486cc21bc5e8b824c6554a12e5dfd.jpg", "feat_context": "..." }, { "context": "[100, 111]", "question": "What is Expiry Date?", "answers.text": ["EXP.APR.25"], "answers.answer_start": [100], "feat_Unnamed: 0": [25], "feat_image_path": "/content/train/images/20221121_161649_7e1f_jpg.rf.f9286b7e77dc417400d771a1274f3ab8.jpg", "feat_context": "..." } ]
数据集字段
- 字段列表: json { "context": "Value(dtype=string, id=None)", "question": "Value(dtype=string, id=None)", "answers.text": "Sequence(feature=Value(dtype=string, id=None), length=-1, id=None)", "answers.answer_start": "Sequence(feature=Value(dtype=int32, id=None), length=-1, id=None)", "feat_Unnamed: 0": "Sequence(feature=Value(dtype=int64, id=None), length=-1, id=None)", "feat_image_path": "Sequence(feature=Value(dtype=string, id=None), length=-1, id=None)", "feat_context": "Sequence(feature=Value(dtype=string, id=None), length=-1, id=None)" }
数据集分割
-
分割详情:
Split name Num samples train 773 valid 194
搜集汇总
数据集介绍

构建方式
该数据集由AutoTrain自动处理生成,专为medocr-berta项目设计。数据来源于光学字符识别(OCR)场景下的医学文档图像,通过提取图像中的文本片段作为上下文,并围绕这些文本构建问答对。每条样本包含问题、答案文本及其起始位置,同时保留了原始图像路径和完整上下文信息。数据集共包含967个样本,其中训练集773个,验证集194个,旨在支持医学文档中的信息抽取任务。
特点
数据集以医学处方和药品标签为核心领域,覆盖了药品名称、剂量、有效期、价格等多类关键信息。样本中的上下文直接源自OCR识别的原始文本,保留了真实场景中的噪声和格式多样性,如换行符、特殊符号和排版错位。答案以序列形式存储,支持多答案标注,并额外提供了图像路径和未命名特征,便于多模态扩展。语言标签为未知,但内容以英文为主,兼具领域术语和缩写。
使用方法
该数据集适用于抽取式问答任务,可直接加载至Hugging Face的AutoTrain框架进行微调。使用时需将'context'和'question'作为输入,'answers.text'和'answers.answer_start'作为监督信号。建议配合OCR预处理流水线,利用'feat_image_path'字段关联原始图像以增强上下文理解。验证集可用于评估模型在医学文档上的泛化能力,训练时需注意处理文本中的噪声和格式不一致问题。
背景与挑战
背景概述
在医疗文本与图像理解领域,光学字符识别(OCR)技术对药物包装信息的精准抽取至关重要,然而现有模型常因药品标签的复杂排版、多语言混合及印刷噪声而性能受限。muneeb-py/autotrain-data-medocr-berta数据集由AutoTrain工具自动生成,旨在服务于medocr-berta项目,其核心研究问题聚焦于从药品包装图像中提取关键字段(如成分、有效期、批号等)的问答式阅读理解。该数据集创建于近期,依托HuggingFace平台,虽未明确标注主导机构,但其设计反映了对医疗领域细粒度信息检索的迫切需求。通过整合图像路径、上下文文本及问答对,数据集为训练具备领域适应性的BERT类模型提供了基础,有望推动药品信息自动化验证与用药安全监控的发展。
当前挑战
该数据集面临的核心挑战在于医疗OCR场景的独特性:首先,药品包装常包含倾斜、模糊或反光的文字区域,且背景干扰(如品牌标识、剂量图表)显著增加OCR提取难度;其次,答案文本的起始位置(answer_start)依赖于精确的字符级标注,但实际图像中文字位置可能因排版差异(如换行、缩进)导致定位偏差,影响模型对上下文-答案对齐的学习。构建过程中,数据源的自动处理(如AutoTrain管道)虽提升了效率,却可能引入标注噪声——例如,样本中“context”字段包含非结构化OCR输出(如残缺文本“chim cuated tablet conte”),而“feat_context”字段的冗余信息进一步加剧了模型对无关特征的过拟合风险。此外,数据规模有限(训练集仅773样本),难以覆盖药品标签的多样性,可能削弱跨厂商、跨语言的泛化能力。
常用场景
经典使用场景
在光学字符识别与自然语言处理的交叉领域中,muneeb-py/autotrain-data-medocr-berta数据集为医学文档的智能理解提供了关键支撑。该数据集最经典的使用场景是训练基于Transformer架构的抽取式问答模型,用于从药品包装、处方标签等医学图像中精准提取结构化信息。具体而言,模型通过给定上下文文本(如OCR识别的药品说明)和问题(如“有效期是什么?”),定位并返回答案片段。这一范式有效弥合了非结构化图像文本与结构化数据之间的鸿沟。
实际应用
在实际应用中,基于该数据集训练的模型可嵌入到药品供应链管理系统、智慧药房或移动健康应用中。例如,当药师或患者拍摄药品包装图像后,系统自动进行OCR并将识别文本输入问答模型,实时返回药品成分、用法用量及有效期等关键信息。这极大简化了药品信息录入与核对流程,降低了因人工误读导致的用药风险,尤其在医疗资源匮乏地区具有重要价值。此外,该技术还可推广至食品标签、化妆品成分表等消费品信息验证场景。
衍生相关工作
围绕该数据集衍生了一系列经典工作,包括但不限于:基于多模态融合的医学文档理解模型,将图像视觉特征与OCR文本特征进行联合编码;面向低资源领域的跨语言迁移学习方法,利用英语预训练模型适配非英语医学文本;以及针对长文本上下文的稀疏注意力机制优化,以应对药品说明中密集排列的信息。这些工作进一步拓展了数据集的价值,并催生了诸如MedBERT、BioClinicalBERT等医学领域专用语言模型的微调基准,为医学自然语言处理社区提供了标准化评估平台。
以上内容由遇见数据集搜集并总结生成



