遇见数据集

cbasu/Med-EASi

收藏
Hugging Face2023-03-08 更新2024-03-04 收录
官方服务:

资源简介:

Med-EASi(医学文本精细和抽象简化数据集)是一个独特的众包和精细标注的数据集,用于监督简化短篇医学文本。它包含1979对专家-简化文本对,涵盖了4478个UMLS概念,并标注了四种文本转换:替换、扩展、插入和删除。数据集可用于直接生成简化医学文本或生成具有可控性的简化文本。数据集结构包括训练集、验证集和测试集,并提供了多种度量指标。数据集创建过程中使用了专家-外行-AI协作的方式进行标注。

Med-EASi(医学文本精细和抽象简化数据集)是一个独特的众包和精细标注的数据集,用于监督简化短篇医学文本。它包含1979对专家-简化文本对,涵盖了4478个UMLS概念,并标注了四种文本转换:替换、扩展、插入和删除。数据集可用于直接生成简化医学文本或生成具有可控性的简化文本。数据集结构包括训练集、验证集和测试集,并提供了多种度量指标。数据集创建过程中使用了专家-外行-AI协作的方式进行标注。

提供机构:
cbasu
原始信息汇总

Dataset Card for Med-EASi

Dataset Description

  • Repository: https://github.com/Chandrayee/CTRL-SIMP
  • Paper: https://arxiv.org/pdf/2302.09155.pdf
  • Point of Contact: Chandrayee Basu

Dataset Summary

Med-EASi (Medical dataset for Elaborative and Abstractive Simplification) is a crowdsourced dataset containing 1979 expert-simple text pairs in the medical domain, with 4478 UMLS concepts. It is annotated with four textual transformations: replacement, elaboration, insertion, and deletion.

Supported Tasks

The dataset supports the generation of simplified medical text and controllability over individual transformations.

Languages

English

Dataset Structure

  • train.csv: 1397 text pairs (5.19 MB)
  • validation.csv: 197 text pairs (1.5 MB)
  • test.csv: 300 text pairs (1.19 MB)

Metrics provided include Levenstein similarity, SentenceBERT embedding cosine similarity, compression ratio, Flesch Kincaid readability grade, and automated readability index for each text pair.

Data Instances

Example of an annotated text pair showing transformations.

Data Fields

  • Expert
  • Simple
  • Annotation
  • sim (Levenstein Similarity)
  • sentence_sim (SentenceBERT embedding cosine similarity)
  • compression
  • expert_fk_grade
  • expert_ari
  • layman_fk_grade
  • layman_ari
  • umls_expert
  • umls_layman
  • expert_terms
  • layman_terms
  • idx (original data index before shuffling, redundant)

Data Splits

75% train, 10% validation, and 15% test.

Dataset Creation

Created by annotating 1500 SIMPWIKI data points and all MSD data points using expert-layman-AI collaboration.

Personal and Sensitive Information

No personal or sensitive information is included.

Considerations for Using the Data

Discussion of Biases

Contains biomedical and clinical short texts.

Other Known Limitations

Expert and simple texts were extracted and aligned using automated methods with inherent limitations.

搜集汇总
数据集介绍
cbasu/Med-EASi 数据集图片
构建方式
在医疗文本简化领域,Med-EASi(Medical dataset for Elaborative and Abstractive Simplification)数据集应运而生,其构建过程融合了专家、非专业人士与人工智能的协同标注。该数据集精选了1500条来自SIMPWIKI的数据点以及所有MSD数据点,通过精细的众包方式,由专家对原始文本进行替换、阐述、插入和删除四种变换的标注,最终形成了1979对专家-简化文本对,覆盖4478个UMLS概念,为监督式医疗文本简化提供了高质量的基础。
特点
Med-EASi数据集的核心特点在于其细粒度的标注和丰富的元数据。每个文本对不仅包含原始专家文本和简化文本,还记录了详细的变换注释,揭示了简化的具体操作。此外,数据集提供了多个辅助指标,包括莱文斯坦相似度、句子BERT嵌入余弦相似度、压缩比、弗莱施-金凯德可读性等级和自动可读性指数,以及每条文本中的UMLS概念列表,这些特性使得数据集不仅可用于直接生成简化文本,还支持对单个变换进行可控性研究。
使用方法
使用Med-EASi数据集时,研究者可直接利用其提供的训练集(1397对)、验证集(197对)和测试集(300对)进行监督学习,训练医疗文本简化模型。数据以CSV格式存储,包含专家文本、简化文本、注释和多种相似度与可读性指标,便于进行多维度评估。此外,由于注释字段标注了具体的变换类型,该数据集特别适用于开发可控的文本简化系统,允许模型在生成简化文本时针对性地应用替换、阐述、插入或删除操作,从而提升简化结果的可解释性和灵活性。
背景与挑战
背景概述
在医学文本处理领域,专业术语的密集使用常导致患者难以理解诊疗信息,从而影响医患沟通与健康决策。为弥合这一鸿沟,文本简化技术应运而生,旨在将复杂的医学表述转化为平易近人的语言。2023年,由Chandrayee Basu及其合作者创建的Med-EASi(Medical dataset for Elaborative and Abstractive Simplification)数据集应运而生,该数据集通过众包与专家-非专家-AI协作的精细标注方式,构建了包含1979对专家-简化文本的语料库,覆盖4478个UMLS概念。其核心研究问题聚焦于可控的医学文本简化,不仅支持直接生成简化文本,还允许对替换、阐述、插入和删除四种变换进行细粒度调控。该数据集整合了SIMPWIKI与MSD两大来源,为医学自然语言处理领域提供了稀缺的高质量监督数据,显著推动了可解释、可控制的文本简化模型发展,对提升医疗信息可及性具有深远影响。
当前挑战
Med-EASi数据集所面临的挑战首先源于医学文本简化的领域难题:如何在保留关键临床信息的同时,将高度专业化的术语转化为患者可理解的表述,避免因过度简化导致信息失真或歧义。例如,贫血、舌炎等术语的简化需平衡医学准确性与通俗性。其次,数据构建过程中存在显著困难:原始数据集中的专家-简化文本对通过自动方法提取与对齐,这些方法自身的局限性(如对齐错误或语义偏差)可能引入噪声,影响标注质量。此外,众包标注环节需协调专家与非专家之间的认知差异,确保标注一致性,而1979对样本的规模虽具代表性,但面对医学领域的庞杂概念,仍显稀疏,难以覆盖所有罕见病或复杂场景。这些挑战共同制约着模型在真实临床环境中的泛化能力与可靠性。
常用场景
经典使用场景
Med-EASi数据集的核心应用在于面向医学文本的抽象化与精细化简化任务。该数据集收录了1979对由专家与通俗作者共同撰写的短篇医学文本,覆盖4478个UMLS医学概念,并标注了替换、阐释、插入与删除四种文本变换操作。研究人员可基于此进行端到端的简化文本生成,或针对特定变换类型实现可控简化,从而在保留医学信息准确性的前提下,降低文本的阅读难度。
实际应用
在实际应用中,Med-EASi可赋能智能医疗辅助系统,自动将复杂的诊断说明、药物指南或健康科普内容转化为患者易于理解的语言。例如,面向慢性病患者的自我管理平台可借助基于该数据集训练的模型,将专业医嘱改写为日常用语,提升患者依从性。此外,该数据集还可用于构建医学文档摘要工具,帮助非专业读者快速把握关键信息。
衍生相关工作
Med-EASi的发布催生了多项后续研究,尤其是在可控文本简化与医学知识蒸馏方向。其标注框架被借鉴用于构建多语言医学简化基准,并启发了基于提示学习的可控生成模型设计。此外,该数据集与CTRL-SIMP模型的结合验证了变换级别控制的有效性,为后续探索分层简化、融入外部知识图谱的文本生成等工作奠定了数据基础,推动了医学自然语言处理领域的范式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务