遇见数据集

CLARA-MeD/claramed3800

收藏
Hugging Face2024-04-02 更新2024-04-21 收录
官方服务:

资源简介:

--- license: cc-by-nc-4.0 --- # Dataset Card for CLARA-MeD-3800 ## Table of Contents - [Table of Contents](#table-of-contents) - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Supported Tasks and Leaderboards](#supported-tasks-and-leaderboards) - [Languages](#languages) - [Dataset Structure](#dataset-structure) - [Data Instances](#data-instances) - [Data Fields](#data-fields) - [Dataset Creation](#dataset-creation) - [Source Data](#source-data) - [Annotations](#annotations) - [Personal and Sensitive Information](#personal-and-sensitive-information) - [Additional Information](#additional-information) - [Dataset Curators](#dataset-curators) - [Licensing Information](#licensing-information) - [Citation Information](#citation-information) - [Contributions](#contributions) ## Dataset Description - **Homepage:** [https://clara-nlp.uned.es/home/med/](https://clara-nlp.uned.es/home/med/) - **Repositories:** [https://github.com/lcampillos/CLARA-MeD](https://github.com/lcampillos/CLARA-MeD), [https://digital.csic.es/handle/10261/269887](https://digital.csic.es/handle/10261/269887) - **Paper:** [http://journal.sepln.org/sepln/ojs/ojs/index.php/pln/article/view/6439](http://journal.sepln.org/sepln/ojs/ojs/index.php/pln/article/view/6439) - **DOI:** [https://doi.org/10.20350/digitalCSIC/14644](https://doi.org/10.20350/digitalCSIC/14644) - **Point of Contact:** [Leonardo Campillos-Llanos](leonardo.campillos@csic.es) ### Dataset Summary A parallel corpus with a subset of 3800 sentence pairs of professional and laymen variants (149 862 tokens) as a benchmark for medical text simplification. This dataset was collected in the CLARA-MeD project, with the goal of simplifying medical texts in the Spanish language and reducing the language barrier to patient's informed decision making. ### Supported Tasks and Leaderboards Medical text simplification ### Languages Spanish ## Dataset Structure ### Data Instances For each instance, there is a string for the source text (professional version), and a string for the target text (simplified version). ``` {'SOURCE': 'adenocarcinoma ductal de páncreas' 'TARGET': 'Cáncer de páncreas'} ``` ### Data Fields - `SOURCE`: a string containing the professional version. - `TARGET`: a string containing the simplified version. ## Dataset Creation ### Source Data #### Who are the source language producers? 1. Drug leaflets and summaries of product characteristics from [CIMA](https://cima.aemps.es) 2. Cancer-related information summaries from the [National Cancer Institute](https://www.cancer.gov/) 3. Clinical trials announcements from [EudraCT](https://www.clinicaltrialsregister.eu/) ### Annotations #### Annotation process Semi-automatic alignment of technical and patient versions of medical sentences. Inter-annotator agreement measured with Cohen's Kappa (average Kappa = 0.839 +- 0.076; very high agreement). #### Who are the annotators? Leonardo Campillos-Llanos Adrián Capllonch-Carriónb Ana Rosa Terroba-Reinares Ana Valverde-Mateos Sofía Zakhir-Puig ### Personal and Sensitive Information No personal and sensitive information was used. ### Licensing Information These data are aimed at research and educational purposes, and released under a Creative Commons Non-Commercial Attribution (CC-BY-NC-A) 4.0 International License. ### Citation Information Campillos Llanos, L., Terroba Reinares, A. R., Zakhir Puig, S., Valverde, A., & Capllonch-Carrión, A. (2022). Building a comparable corpus and a benchmark for Spanish medical text simplification. *Procesamiento del lenguaje natural*, 69, pp. 189--196. ``` @article{2022claramedcorpus, title={Building a comparable corpus and a benchmark for Spanish medical text simplification}, author={Campillos-Llanos, Leonardo and Terroba Reinares, Ana R., and Zakhir Puig, Sofía, and Valverde-Mateos, Ana and Capllonch-Carri{\'o}n}, title={Procesamiento del Lenguaje Natural}, volume={69}, year={2022}, pages={189--196}, publisher={Sociedad Espa{\~n}ola para el Procesamiento del Lenguaje Natural} } ``` ### Contributions Thanks to [Jónathan Heras from Universidad de La Rioja](http://www.unirioja.es/cu/joheras) ([@joheras](https://github.com/joheras)) for formatting this dataset for Hugging Face.

--- 许可证:CC-BY-NC-4.0 --- # CLARA-MeD-3800 数据集卡片 ## 目录 - [目录](#table-of-contents) - [数据集描述](#dataset-description) - [数据集概述](#dataset-summary) - [支持任务与排行榜](#supported-tasks-and-leaderboards) - [语言](#languages) - [数据集结构](#dataset-structure) - [数据实例](#data-instances) - [数据字段](#data-fields) - [数据集构建](#dataset-creation) - [源数据](#source-data) - [标注流程](#annotations) - [个人与敏感信息](#personal-and-sensitive-information) - [附加信息](#additional-information) - [数据集策展人](#dataset-curators) - [许可信息](#licensing-information) - [引用信息](#citation-information) - [贡献致谢](#contributions) ## 数据集描述 - **主页:** [https://clara-nlp.uned.es/home/med/](https://clara-nlp.uned.es/home/med/) - **仓库地址:** [https://github.com/lcampillos/CLARA-MeD](https://github.com/lcampillos/CLARA-MeD), [https://digital.csic.es/handle/10261/269887](https://digital.csic.es/handle/10261/269887) - **相关论文:** [http://journal.sepln.org/sepln/ojs/ojs/index.php/pln/article/view/6439](http://journal.sepln.org/sepln/ojs/ojs/index.php/pln/article/view/6439) - **DOI:** [https://doi.org/10.20350/digitalCSIC/14644](https://doi.org/10.20350/digitalCSIC/14644) - **联系方式:** [Leonardo Campillos-Llanos](leonardo.campillos@csic.es) ### 数据集概述 本数据集为平行语料库,包含3800组专业医学文本与通俗文本的句子对(共计149862个Token(Token)),可作为医学文本简化任务的基准数据集。本数据集源自CLARA-MeD项目,旨在实现西班牙语医学文本的简化,破除语言壁垒,助力患者做出知情决策。 ### 支持任务与排行榜 医学文本简化 ### 语言 西班牙语 ## 数据集结构 ### 数据实例 每个数据实例包含源文本(专业版本)字符串与目标文本(简化版本)字符串。 {'SOURCE': '胰腺导管腺癌', 'TARGET': '胰腺癌'} ### 数据字段 - `SOURCE`:字符串类型,存储专业版本的医学文本。 - `TARGET`:字符串类型,存储简化后的通俗医学文本。 ## 数据集构建 ### 源数据 #### 源语言文本的创作者 1. 来自[CIMA](https://cima.aemps.es)的药品说明书与产品特性摘要 2. 来自[美国国家癌症研究所(National Cancer Institute)](https://www.cancer.gov/)的癌症相关信息摘要 3. 来自[EudraCT](https://www.clinicaltrialsregister.eu/)的临床试验公告 ### 标注流程 #### 标注过程 对医学文本的专业版本与患者友好版本进行半自动化对齐。采用科恩卡帕系数(Cohen's Kappa)评估标注者间一致性,平均卡帕值为0.839 ± 0.076,一致性极高。 #### 标注者名单 Leonardo Campillos-Llanos、Adrián Capllonch-Carrión、Ana Rosa Terroba-Reinares、Ana Valverde-Mateos、Sofía Zakhir-Puig ### 个人与敏感信息 本数据集未使用任何个人与敏感信息。 ## 附加信息 ### 数据集策展人 无公开信息 ### 许可信息 本数据集仅用于研究与教育目的,采用知识共享署名-非商业性使用4.0国际许可协议(CC-BY-NC-4.0)发布。 ### 引用信息 Campillos-Llanos, L., Terroba Reinares, A. R., Zakhir Puig, S., Valverde-Mateos, A., & Capllonch-Carrión, A. (2022). 构建西班牙语医学文本简化的可比语料库与基准数据集. *Procesamiento del lenguaje natural(自然语言处理)*, 69, 第189-196页. @article{2022claramedcorpus, title={构建西班牙语医学文本简化的可比语料库与基准数据集}, author={Campillos-Llanos, Leonardo and Terroba Reinares, Ana R., and Zakhir Puig, Sofía, and Valverde-Mateos, Ana and Capllonch-Carrión, Adrián}, journal={Procesamiento del lenguaje natural(自然语言处理)}, volume={69}, year={2022}, pages={189--196}, publisher={Sociedad Española para el Procesamiento del Lenguaje Natural(西班牙自然语言处理学会)} } ### 贡献致谢 感谢来自拉里奥哈大学的Jónathan Heras([http://www.unirioja.es/cu/joheras](http://www.unirioja.es/cu/joheras),GitHub账号[@joheras](https://github.com/joheras))为本数据集适配Hugging Face格式。

提供机构:
CLARA-MeD
原始信息汇总

数据集概述

数据集名称

CLARA-MeD-3800

数据集摘要

CLARA-MeD-3800是一个包含3800对专业和非专业(简化)版本的西班牙语医学文本的平行语料库。该数据集旨在简化医学文本,减少患者理解医学信息的语言障碍。

支持的任务

医学文本简化

语言

西班牙语

数据集结构

数据实例

每个实例包含两个字段:

  • SOURCE: 包含专业版本的字符串。
  • TARGET: 包含简化版本的字符串。

数据字段

  • SOURCE: 专业版本的医学文本。
  • TARGET: 简化版本的医学文本。

数据集创建

源数据

  • 来源包括药品传单、产品特性概要、癌症相关信息摘要和临床试验公告。

标注过程

  • 采用半自动方式对技术版本和患者版本的医学句子进行对齐。
  • 标注者间一致性通过Cohens Kappa测量,平均Kappa值为0.839。

标注者

  • Leonardo Campillos-Llanos
  • Adrián Capllonch-Carrión
  • Ana Rosa Terroba-Reinares
  • Ana Valverde-Mateos
  • Sofía Zakhir-Puig

个人和敏感信息

  • 数据集中不包含个人和敏感信息。

许可证信息

  • 数据集遵循Creative Commons Non-Commercial Attribution (CC-BY-NC-A) 4.0国际许可证。

引用信息

@article{2022claramedcorpus, title={Building a comparable corpus and a benchmark for Spanish medical text simplification}, author={Campillos-Llanos, Leonardo and Terroba Reinares, Ana R., and Zakhir Puig, Sofía, and Valverde-Mateos, Ana and Capllonch-Carri{o}n}, title={Procesamiento del Lenguaje Natural}, volume={69}, year={2022}, pages={189--196}, publisher={Sociedad Espa{~n}ola para el Procesamiento del Lenguaje Natural} }

搜集汇总
数据集介绍
CLARA-MeD/claramed3800 数据集图片
构建方式
在医疗文本简化这一自然语言处理的关键任务中,数据集CLARA-MeD-3800应运而生。该数据集基于CLARA-MeD项目,旨在降低医患沟通中的语言壁垒,提升患者对医疗信息的理解。其构建过程严谨而系统,首先从CIMA药品说明书、美国国家癌症研究所的癌症信息摘要以及EudraCT临床试验公告中,分别提取专业版本和面向患者的简化版本句子。随后,通过半自动对齐技术,将专业医学术语与通俗表达进行配对,形成3800个高质量的句子对,总词数达149862。为确保对齐的准确性,研究团队采用了Cohen's Kappa系数进行一致性评估,平均Kappa值高达0.839,显示出极高的人工标注一致性。
特点
该数据集的核心特点在于其独特的可比语料库设计,聚焦于西班牙语医疗文本的简化任务。每个数据实例包含专业版文本(SOURCE)和简化版文本(TARGET),直观呈现了从复杂医学术语到通俗语言的转化过程。数据集覆盖药物说明书、癌症信息及临床试验公告等多源医疗场景,确保了内容的多样性与代表性。此外,其规模适中,3800个句子对既可作为基准测试集,又避免了冗余,为模型训练与评估提供了高效平台。标注过程中极强的一致性进一步保障了数据质量,使其成为医疗文本简化研究中的可靠资源。
使用方法
使用该数据集时,研究者可将其直接作为序列到序列模型的训练与评估语料。数据以JSON格式存储,每个实例包含SOURCE和TARGET两个字段,便于加载与处理。典型应用包括训练基于Transformer的文本简化模型,或作为微调预训练语言模型的基准。用户可通过HuggingFace的datasets库轻松调用,例如使用load_dataset('CLARA-MeD/claramed3800')一键获取数据。此外,数据集采用CC-BY-NC-4.0许可,仅限研究与教育用途,使用时需引用相关论文以尊重原创工作。
背景与挑战
背景概述
CLARA-MeD-3800数据集由西班牙国家研究委员会(CSIC)的Leonardo Campillos-Llanos团队于2022年创建,旨在推动西班牙语医学文本简化领域的发展。该数据集源自CLARA-MeD项目,核心研究问题在于如何将专业医学文本转化为患者易于理解的通俗版本,以降低医疗信息获取的语言障碍。数据集包含3800个句对,总计约15万词,源文本来自药品说明书、癌症信息摘要和临床试验公告等权威医学资源。作为西班牙语医学文本简化的首个基准数据集,它填补了该语言在医疗自然语言处理中的空白,为后续研究提供了标准化评估平台,对促进医患沟通和患者知情决策具有重要学术与应用价值。
当前挑战
该数据集面临的核心挑战在于医学文本简化的领域特殊性:一方面,专业术语(如“adenocarcinoma ductal de páncreas”)需转化为患者能理解的通俗表达(如“Cáncer de páncreas”),但如何在不丢失关键医学信息的前提下实现语义等价简化,仍是自然语言处理的难题。另一方面,数据集构建过程中,团队需从异构源(药品说明书、癌症摘要、临床试验公告)中半自动对齐专业版与患者版句子,尽管通过Cohen's Kappa(平均0.839)验证了标注一致性,但跨领域文本的语义对齐和简化规则泛化仍存在困难。此外,当前数据集规模有限(3800句对),难以覆盖西班牙语医学文本的全部复杂场景,未来需扩展至更多疾病领域和文本类型以提升模型鲁棒性。
常用场景
经典使用场景
CLARA-MeD-3800数据集的核心应用场景在于医学文本简化任务的基准测试与模型训练。该数据集收录了3800对西班牙语医学语句,每对包含专业版本与面向患者的简化版本,覆盖药品说明书、癌症信息摘要及临床试验公告等多源文本。研究者可借助此平行语料库,训练序列到序列的文本生成模型,实现从晦涩医学术语到通俗表达的自动转换。例如,将“腺导管胰腺癌”简化为“胰腺癌”,从而降低患者理解医学信息的认知门槛。该数据集为西班牙语医学文本简化提供了标准化的评估基准,推动了低资源语言在医疗自然语言处理领域的发展。
衍生相关工作
围绕CLARA-MeD-3800数据集,衍生了一系列西班牙语医学文本简化的前沿研究。原始论文由Campillos-Llanos等人发表于《Procesamiento del Lenguaje Natural》,详细阐述了语料构建与基准定义。后续工作包括基于Transformer架构的简化模型优化,如利用BART或T5在西班牙语上的微调探索,以及跨领域迁移学习研究,将简化能力拓展至其他医学子领域。此外,该数据集还催生了针对低资源语言的文本简化评估指标开发,例如语义相似度与可读性指标的适配改进。这些工作共同构建了西班牙语医学自然语言处理的研究生态,推动了多语言健康信息公平获取的学术进步。
数据集最近研究
最新研究方向
在健康素养日益受到关注的当下,CLARA-MeD-3800作为西班牙语医学文本简化领域的标杆数据集,正推动自然语言处理技术向更贴近患者实际需求的方向演进。该数据集聚焦于将专业医疗术语转化为患者易于理解的语言,其构建过程融合了药品说明书、癌症信息摘要及临床试验公告等多源数据,并通过半自动对齐与高一致性人工标注确保了质量。当前前沿研究多围绕如何利用该基准优化生成式模型在低资源语言上的简化能力,或探索跨领域迁移学习以应对罕见病术语的简化挑战。这一方向不仅呼应了全球医疗信息公平化的热点,也为西班牙语国家提升患者知情决策能力提供了关键数据支撑,其意义在于弥合医患沟通中的语言鸿沟,推动精准健康传播的落地。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务