IVN-RIN/PsyNIT
收藏官方服务:
资源简介:
PsyNIT是一个意大利语的命名实体识别(NER)数据集,由意大利研究医院Centro San Giovanni Di Dio Fatebenefratelli创建。该数据集基于100份电子医疗报告,经过手动匿名化处理并由有10年经验的心理学家进行标注。数据集包含四个部分:药物治疗史、远程病理史和活动性疾病、认知近端病理史和心理评估。实体类别包括诊断和合并症、认知症状、神经精神症状、药物治疗和医学评估。
PsyNIT是一个意大利语的命名实体识别(NER)数据集,由意大利研究医院Centro San Giovanni Di Dio Fatebenefratelli创建。该数据集基于100份电子医疗报告,经过手动匿名化处理并由有10年经验的心理学家进行标注。数据集包含四个部分:药物治疗史、远程病理史和活动性疾病、认知近端病理史和心理评估。实体类别包括诊断和合并症、认知症状、神经精神症状、药物治疗和医学评估。
提供机构:
IVN-RIN原始信息汇总
数据集概述
数据集名称
PsyNIT (Psychiatric Ner for ITalian)
数据集类型
- 任务类别:Token-Classification (命名实体识别)
- 语言:意大利语 (it)
数据集描述
PsyNIT 是一个意大利语的命名实体识别数据集,由意大利研究医院 Centro San Giovanni Di Dio Fatebenefratelli 创建。数据集基于100份电子医疗报告,这些报告经过手动匿名化处理,去除了个人患者数据、医生参考、日期和地点。数据集由一位有10年经验的临床心理学家进行标注。
数据集内容
数据集包含四个主要部分:
- 药物治疗历史:患者正在使用的药物及其剂量的结构化列表。
- 远程病理历史和活动疾病:过去和当前相关疾病的列表。
- 认知近端病理历史:包括患者进行的医疗检查,以及患者的个人生活信息,如婚姻状况、日常习惯、睡眠障碍等。
- 心理评估:包括神经心理测试的结果和主治医生的评论。
实体类别
- 诊断和共病:779个例子,占数据集的13.23%。
- 认知症状:2386个例子,占数据集的40.52%。
- 神经精神症状:707个例子,占数据集的12.01%。
- 药物治疗:162个例子,占数据集的2.75%。
- 医疗评估:1854个例子,占数据集的31.49%。
数据集规模
- 大小类别:1K<n<10K
许可证
- 许可证:cc-by-sa-4.0
搜集汇总
数据集介绍

构建方式
PsyNIT数据集是面向意大利语的精神科命名实体识别(NER)资源,由意大利研究型医院Centro San Giovanni Di Dio Fatebenefratelli构建。其原始数据源自100份电子医疗报告,经手动匿名化处理以移除患者身份、医师信息、日期及地点等敏感内容。匿名化后的文档由一位具有十年经验的心理学家进行标注,从中提取了四个关键部分:药物治疗史、远病史与现患疾病、认知近病史以及心理评估。这些部分分别对应结构化药物列表、疾病记录、非结构化检查与生活信息、神经心理学检查结果。数据集共涵盖5888个标注实体,分布于五个类别:诊断与共病、认知症状、神经精神症状、药物治疗及医学评估,类别分布体现了临床文本中认知症状和评估信息的突出地位。
特点
该数据集具有鲜明的临床领域特性与语言特异性。作为首个原生意大利语精神科NER数据集,其标注体系紧密贴合神经精神疾病的诊疗逻辑,例如将认知症状独立成类(占40.52%),突显认知评估在精神科中的核心作用。实体类别设计兼顾结构化与非结构化文本,药物治疗类仅含药物名称而不含剂量,确保标注的简洁性。数据来源于真实电子病历,涵盖从人口学变量到行为症状的丰富信息,具有高度的生态效度。此外,标注者具备十年临床心理学经验,保障了标签的医学准确性与一致性。数据集规模适中(5888个实体),为意大利语医学自然语言处理研究提供了稀缺的标注资源。
使用方法
PsyNIT数据集适用于基于Transformer的序列标注模型,如BERT、ELECTRA或XLM-RoBERTa的意大利语版本。用户可通过HuggingFace的datasets库直接加载,指定token-classification任务进行训练与评估。使用时需注意文本为意大利语,且实体标签采用BIO或BIOES编码格式。建议将数据划分为训练集、验证集和测试集,以评估模型在五个实体类别上的表现。该数据集特别适合用于构建从电子病历中自动提取诊断、症状及用药信息的系统,也可作为医学命名实体识别基准测试的一部分。研究者可参考原始论文中的预处理流程与基线模型结果,以复现或改进实验。
背景与挑战
背景概述
在自然语言处理与临床医学的交叉领域,命名实体识别(NER)技术对非结构化电子医疗记录的信息抽取至关重要。然而,多数临床NER数据集集中于英语,针对意大利语的精神神经病学文本资源极为匮乏。IVN-RIN/PsyNIT数据集由意大利研究型医院Centro San Giovanni Di Dio Fatebenefratelli于2023年发布,旨在填补这一空白。该数据集源自100份手动匿名化的电子医疗报告,由拥有十年经验的心理学家进行标注,涵盖药理史、病理史、认知近端病理史及心理评估四类文本区域。PsyNIT定义了诊断与共病、认知症状、神经精神症状、药物治疗及医学评估五类实体,其中认知症状占比最高(40.52%)。该数据集为意大利语临床NER研究提供了首个标准化基准,推动了低资源语言在精神神经病学领域的信息提取进展。
当前挑战
PsyNIT数据集面临多重挑战。领域层面,精神神经病学文本具有高度专业性和语义复杂性,如认知症状与神经精神症状的边界模糊(例如“抑郁症状”可能跨类别),需精细的标注规范。此外,实体类别分布极不均衡,药物治疗类仅占2.75%,导致模型易偏向高频类别。构建过程中,医疗报告的手动匿名化需严格保护隐私,同时保留临床语义,这对去标识化技术提出高要求。标注依赖单一心理学专家,虽保证一致性,但可能引入主观偏差,且缺乏跨标注者信度验证。数据规模较小(1K-10K样本),限制了深度学习模型的泛化能力。最后,意大利语形态丰富性(如词形变化)增加了NER系统对词边界和上下文依赖的建模难度。
常用场景
经典使用场景
PsyNIT数据集专为意大利语精神健康领域的命名实体识别任务而设计,其经典使用场景聚焦于从非结构化电子医疗报告中自动抽取关键临床信息。该数据集涵盖药物史、远程病理史、认知近端病理史及心理评估四个核心文档区域,标注了诊断与共病、认知症状、神经精神症状、药物治疗和医学评估五类实体。研究者可借助PsyNIT构建和评估NER模型,以精准识别精神疾病患者的症状描述、诊断名称及用药记录,从而推动意大利语临床文本的语义理解与分析。
实际应用
在实际应用中,PsyNIT可直接赋能意大利精神卫生机构的临床决策支持系统。通过集成基于该数据集训练的NER模型,医院能够自动化提取电子病历中的关键信息,如患者的主要诊断、认知功能损伤的具体表现及当前用药方案,从而辅助医生快速生成结构化摘要、优化治疗路径并监测疾病进展。此外,该数据集还可用于构建精神疾病流行病学监测工具,通过大规模文本分析识别症状分布模式,助力公共卫生资源的精准调配。
衍生相关工作
PsyNIT的发布催生了多项衍生研究,包括将其标注体系迁移至其他罗曼语族语言的跨领域NER模型,以及结合意大利语词嵌入与Transformer架构的临床文本预训练方法。部分工作进一步扩展了实体类型,如加入社交行为与生活质量的标注,或利用该数据集训练多任务学习模型以同时完成实体识别与关系抽取。此外,PsyNIT还被用作评估大语言模型在意大利语临床场景下零样本学习能力的基准,推动了可解释人工智能在精神健康领域的应用探索。
以上内容由遇见数据集搜集并总结生成



