遇见数据集

LIB-InCor/pt-en-cardiology-icd10

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

PT-EN Cardiology ICD-10 Dataset是一个双语葡萄牙语-英语心脏病学诊断数据集,与ICD-10代码对齐。该数据集包含14,685个独特的心脏病学诊断表达,每个表达都配有对应的ICD-10代码。它由圣保罗大学医学院医院(HCFMUSP)心脏研究所(InCor)的生物医学信息学实验室(LIB)开发,最初旨在支持内部研究,利用大型语言模型从简短的葡萄牙语临床诊断中自动分配ICD-10代码。数据集结构包括三列:diagnosis_pt(原始葡萄牙语临床诊断)、diagnosis_en(自动翻译的英语版本)和icd10(关联的ICD-10代码)。葡萄牙语诊断是原始临床表达,应视为数据集的主要参考语言;英语诊断则通过基于GPT-OSS-120B的LLM医疗翻译流程自动生成。数据集适用于研究目的,如ICD-10自动编码、临床自然语言处理、生物医学嵌入、多语言术语对齐、检索系统以及紧凑语言模型的微调。局限性包括:仅限于心脏病学相关诊断、英语翻译为自动生成、ICD-10标签可能反映机构编码实践。

The PT-EN Cardiology ICD-10 Dataset is a bilingual Portuguese-English cardiology diagnosis dataset aligned with ICD-10 codes. It contains 14,685 unique cardiology diagnosis expressions paired with ICD-10 codes. The resource was developed at the Biomedical Informatics Laboratory (LIB), Heart Institute (InCor), Hospital das Clínicas, University of São Paulo Medical School (HCFMUSP), originally to support internal research on Large Language Models (LLMs) for automatic ICD-10 assignment from short Portuguese clinical diagnoses. The dataset structure includes three columns: diagnosis_pt (original Portuguese clinical diagnosis), diagnosis_en (automatically translated English version), and icd10 (associated ICD-10 code). The Portuguese diagnoses represent the original clinical expressions and should be considered the primary reference language of the dataset, while the English diagnoses were automatically generated using an LLM-based medical translation pipeline powered by GPT-OSS-120B. The dataset is intended for research purposes, such as ICD-10 automatic coding, clinical NLP, biomedical embeddings, multilingual terminology alignment, retrieval systems, and fine-tuning of compact language models. Limitations include: the dataset is restricted to cardiology-related diagnoses, English translations are automatically generated, and ICD-10 labels may reflect institutional coding practices.

提供机构:
LIB-InCor
搜集汇总
数据集介绍
LIB-InCor/pt-en-cardiology-icd10 数据集图片
构建方式
在心脏病学临床研究与医疗信息化进程中,ICD-10编码的自动化分配是一项关键挑战。本数据集由巴西圣保罗大学医学院心脏研究所生物医学信息学实验室构建,收录了14,685条独特的心脏病诊断表达式及其对应的ICD-10编码。数据集以葡萄牙语原始临床诊断为基准,借助基于GPT-OSS-120B的大语言模型医学翻译流水线自动生成对应的英文版本,从而构建出双语对齐的诊断资源。每条样本包含葡萄牙语诊断、英语翻译及ICD-10编码三个字段,严格遵循结构化存储格式。
特点
该数据集的核心特点在于其领域专精性与双语对齐特性。所有诊断条目均聚焦于心脏病学范畴,涵盖从急性心肌梗死到心功能不全等典型病种,临床表达真实反映了医院实际编码实践。葡萄牙语作为原始语言保证了诊断术语的临床真实性,而自动生成的英文翻译则拓展了跨语言应用的潜力。数据集规模适中,便于进行高效训练与评估,特别适用于层次化ICD-10编码任务中的细粒度语义建模。
使用方法
研究人员可将本数据集应用于多种自然语言处理与生物医学信息学场景。在ICD-10自动编码任务中,可利用葡萄牙语诊断作为输入,训练模型预测对应编码;通过英文翻译字段,可开展跨语言临床术语对齐与检索研究。数据集亦适用于微调轻量级语言模型、构建生物医学词嵌入,以及评估多语言临床NLP系统的性能。建议使用标准训练-验证-测试划分方案,并以ICD-10编码的层次结构作为评价指标设计的参考依据。
背景与挑战
背景概述
该数据集由巴西圣保罗大学医学院心脏研究所(InCor)生物医学信息学实验室(LIB)于近年来创建,专注于心脏病学领域,包含14,685条独特的葡萄牙语诊断表述及其对应的ICD-10代码,并附有通过大语言模型自动翻译的英文版本。其核心研究问题在于利用大型语言模型实现从简短的葡萄牙语临床诊断到ICD-10编码的自动分配,旨在推进临床自然语言处理、多医学本体术语对齐及双语生物医学嵌入等研究。鉴于ICD-10编码在医疗计费、流行病学统计及临床决策支持中的基础性作用,该数据集为评估和微调层级感知的编码模型提供了关键资源,对提升葡萄牙语医疗信息系统的智能化水平具有重要价值。
当前挑战
数据集面临的核心领域挑战是ICD-10编码的复杂性,包括诊断表述的多样性与代码层级结构的精确匹配,尤其在高特异性亚型区分和上下文歧义消解方面。构建过程中,挑战在于确保自动生成的英文翻译在医学术语上的准确性,避免因语言转换导致的临床信息失真;同时,数据集仅涵盖心脏病学诊断,限制了模型的泛化能力。此外,ICD-10标签可能反映特定机构的编码惯例,若直接用于外部系统,可能引入系统性偏差,影响跨机构部署时的可靠性。数据规模虽达万级,但在低频诊断和罕见病代码上仍存在样本不平衡问题,需通过数据增强或主动学习策略缓解。
常用场景
经典使用场景
该数据集为葡萄牙语-英语双语心脏病学诊断文本与ICD-10编码的对照资源,经典使用场景聚焦于临床自然语言处理中的自动ICD-10编码任务。研究人员可利用双语诊断描述训练模型,实现从非结构化临床文本到标准化疾病编码的精准映射,尤其适用于葡萄牙语医疗环境下的编码自动化需求。
解决学术问题
数据集旨在解决临床文本中ICD-10编码的自动分配这一核心学术难题,特别是针对葡萄牙语心脏病学诊断的层级感知编码。它填补了低资源语言领域标注数据的空白,推动了多语言临床NLP模型的研发,为提升编码一致性、降低人工编码错误率提供了基础支撑。
衍生相关工作
基于此数据集,衍生工作包括专用大语言模型在层级感知编码任务上的微调与评估,以及双语生物医学嵌入向量的训练。此外,它还促进了葡萄牙语临床术语与英语标准术语的对齐研究,为多语言医学信息抽取、诊断文本摘要生成等任务提供了基准测试集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务