遇见数据集

synthetic-pii-phi-v2

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集是一个合成多语言PII/PHI去标识化语料库(v3版本),专为训练多语言去标识化(Token分类)模型而设计。数据集包含来自三个地区(en-GB、nl-BE、fr-FR)的合成临床/行政文档,每篇文档均带有字符级PII/PHI实体标注(如姓名、ID、日期、地址、实验室结果等)。所有实体值均为合成生成,绝不包含真实患者、提供者或组织数据;城市名称和邮政编码词干是真实的(因为城市名不属于个人数据,且文档需要合理的地点),其余所有内容均为构造。数据规模:总计48,783行,其中训练集41,854行,开发集2,964行,测试集3,965行。每个地区大致均衡分布。字段说明:每行包含`source_text`(完整文档文本)、`privacy_mask`(字符偏移的实体列表,含开始/结束位置、标签和值)、`language`(地区代码)、`source_dataset`(溯源标签)、`dataset_split`(训练/开发/测试)。实体标签共32个,包括核心标签(如AGE, BLOOD_TYPE, BMI, BUILDINGNUM, CITY, DATE, DIAGNOSIS, DOSAGE, EMAIL, GENDER, HEALTH_INSURANCE_ID, HEIGHT, LAB_RESULT, MEDICATION, MRN, NAME, ORGANIZATION_ID, ORGANIZATION_NAME, PHONE_NUMBER, PROCEDURE, SEX, STREET, SYMPTOM, URL, WEIGHT, ZIPCODE)以及地区特定标识符(en-GB的NHS_NUMBER/GMC,nl-BE的INSZ/RIZIV,fr-FR的NIR/RPPS)。构建方法:基于Synthea派生管道,通过LLM生成文本模板(蓝图),填充合成身份值和实体值,经过组成、渲染、确定性缩写、无实体文档生成、防泄漏分割等步骤。v3版本相较于v2进行了术语池分离、单次复用率降低、后渲染补丁(标识符表面形式多样化、硬负例添加、邮政编码和电话号码格式修正、日期格式扩展)等改进。已知局限:文档内可能存在叙事矛盾(因不同蓝图组合共享同一诊断值,导致同一文档不同部分断言和否定同一发现);无实体文档仅出现在训练集中。适用任务:多语言去标识化(Token分类),特别是训练能够识别并遮盖PII/PHI实体的模型。

This dataset is a synthetic multilingual PII/PHI de-identification corpus (v3) designed for training multilingual de-identification (token classification) models. It contains synthetic clinical/administrative documents from three regions (en-GB, nl-BE, fr-FR) with character-level annotations of PII/PHI entities (e.g., names, IDs, dates, addresses, lab results). All entity values are synthetically generated and contain no real patient, provider, or organization data; city names and ZIP code stems are real (as city names are not personal data and documents require plausible locations), while everything else is constructed. Data size: 48,783 rows total, with 41,854 training, 2,964 development, and 3,965 test rows, roughly balanced per region. Fields: each row includes `source_text` (full document text), `privacy_mask` (list of character-offset entities with start/end positions, labels, and values), `language` (region code), `source_dataset` (provenance tag), and `dataset_split` (train/dev/test). There are 32 entity labels, including core tags (AGE, BLOOD_TYPE, BMI, BUILDINGNUM, CITY, DATE, DIAGNOSIS, DOSAGE, EMAIL, GENDER, HEALTH_INSURANCE_ID, HEIGHT, LAB_RESULT, MEDICATION, MRN, NAME, ORGANIZATION_ID, ORGANIZATION_NAME, PHONE_NUMBER, PROCEDURE, SEX, STREET, SYMPTOM, URL, WEIGHT, ZIPCODE) and region-specific identifiers (NHS_NUMBER/GMC for en-GB, INSZ/RIZIV for nl-BE, NIR/RPPS for fr-FR). Construction: based on the Synthea-derived pipeline, using LLM-generated text templates (blueprints) filled with synthetic identity and entity values, followed by composition, rendering, deterministic abbreviation, entity-free document generation, and leakage-proof splitting. v3 improvements over v2 include term pool separation, reduced single-use reuse rate, and post-rendering patches (identifier surface form diversification, hard negative addition, ZIP code and phone number format correction, date format expansion). Known limitations: possible narrative contradictions within documents (due to different blueprints sharing the same diagnosis value, leading to assertion and negation of the same finding in different parts of the same document); entity-free documents only appear in the training set. Applicable task: multilingual de-identification (token classification), especially for training models to recognize and mask PII/PHI entities.

创建时间:
2026-08-18
原始信息汇总

数据集概述:Synthetic Multilingual PII/PHI De-identification Corpus (v3)

基本信息

  • 数据集名称:Synthetic PII/PHI v3
  • 许可证:other(自定义许可证)
  • 语言:英语(en-GB)、荷兰语(nl-BE)、法语(fr-FR)
  • 标签:PII(个人身份信息)、PHI(个人健康信息)、去标识化、合成数据、多语言
  • 数据集地址:https://huggingface.co/datasets/Marawanelbalal/synthetic-pii-phi-v2

数据集内容

该数据集包含三个语言区域的合成临床/行政文档,带有跨度级别的PII/PHI标注,专为训练多语言去标识化(token分类)模型而构建。所有实体值——姓名、ID、日期、地址、实验室结果——均为合成生成,不包含任何真实患者、提供者或组织数据。

数据划分

划分 行数 en-GB nl-BE fr-FR
train 41,854 13,653 14,480 13,721
development 2,964 988 988 988
test 3,965 1,352 1,352 1,261

总计48,783行。

实体标签(共32个标签)

  • 核心标签(所有3个语言区域):AGE, BLOOD_TYPE, BMI, BUILDINGNUM, CITY, DATE, DIAGNOSIS, DOSAGE, EMAIL, GENDER, HEALTH_INSURANCE_ID, HEIGHT, LAB_RESULT, MEDICATION, MRN, NAME, ORGANIZATION_ID, ORGANIZATION_NAME, PHONE_NUMBER, PROCEDURE, SEX, STREET, SYMPTOM, URL, WEIGHT, ZIPCODE
  • 地区特定标识符方案:NHS_NUMBER、GMC(en-GB);INSZ、RIZIV(nl-BE);NIR、RPPS(fr-FR)

数据模式(Schema)

每行包含:

  • source_text(字符串):完整文档文本
  • privacy_mask(列表[{start, end, label, value}]):字符偏移跨度及其实体标签和子字符串值
  • language(字符串):语言代码(en-GB、nl-BE、fr-FR)
  • source_dataset(字符串):来源标签
  • dataset_split(字符串):train / development / test

主要特点

  1. 合成数据:所有实体值均为合成生成,无真实个人数据泄露
  2. 术语池分离:DIAGNOSIS、SYMPTOM和LAB_RESULT使用独立、不重叠的术语池
  3. 跨文档一致性:同一文档内实体的身份和值保持一致
  4. 无实体文档:包含不含任何PII/PHI实体的文档作为训练负例
  5. 防泄漏划分:基于blueprint_id进行聚类,确保同一模板的文本不会出现在多个划分中
  6. 低文本重复率:最常用的精确文档文本最多出现在0.0205%的文档中

v3版本改进

  • 术语池分离修复(DIAGNOSIS/SYMPTOM重叠从92%降至6/1687个术语)
  • 降低单句重复使用率
  • 增强标识符表面形式多样性(如NHS号码添加分隔符)
  • 添加BMI形态的硬负例句子
  • 完善en-GB ZIPCODE为完整邮编格式(如M9→M9 4TF)
  • 约40%电话号码改写为国际形式
  • 添加5种新的硬负例句子族(共27,140条)
  • 增加日期序数后缀和月份优先格式(10,022个日期实体被重新格式化)

构建方法

  1. 蓝图生成:LLM生成带{{PLACEHOLDER}}槽位的短文本模板
  2. 值/身份填充:每个文档采样一次合成身份和实体值集
  3. 组合:基于文档族矩阵构建不同的槽位排列
  4. 渲染:每种组合渲染多次,每次使用新的合成身份和措辞
  5. 确定性缩写处理:约15%的候选措辞池应用临床简写
  6. 无实体文档:单独生成不含PII/PHI的文档
  7. 防泄漏划分:按蓝图ID聚类分配至单一划分
  8. 验证:包括术语池独立性检查、跨度/偏移缺陷检查、文本重复率验证

已知限制

  • 文档内叙述矛盾:不同部分可能对同一诊断既肯定又否定,但不影响实体标注正确性
  • 无实体文档仅存在于训练集:development/test划分中不含此类文档

来源

由Synthea衍生的合成临床文档生成流水线构建,文档由LLM生成的文本模板(“蓝图”)填充合成身份/实体值而成。

搜集汇总
数据集介绍
synthetic-pii-phi-v2 数据集图片
构建方式
本数据集基于Synthea衍生的合成临床文档生成流程精心构建,涵盖英语(英国)、荷兰语(比利时)及法语(法国)三种语言环境。其构建历程涉及蓝图生成、实体值填充、文档组合、渲染及验证等多个阶段。蓝图由大型语言模型撰写,经严格审查以确保结构合规;实体值如姓名、识别号、日期等均为合成生成,不涉及真实患者数据。在v3版本中,尤为注重术语池的隔离,将诊断、症状及实验室结果分别赋予独立且无重叠的术语集合,并辅以确定性缩写处理及无实体文档的编制,以增强模型的泛化能力与负样本学习。
使用方法
此数据集专为训练多语言去标识化(令牌分类)模型而设计。使用方法直接明确:将source_text作为输入,利用隐私掩码(privacy_mask)中的字符偏移标签进行监督学习。数据已划分为训练集、开发集与测试集,其中测试集独立于训练模板簇,有利于评估泛化性能。用户可在HuggingFace平台上直接加载,结合标准序列标注框架如HuggingFace的Transformers库,对模型进行微调以识别并掩码各类实体。该数据集的构建细节,如术语池分离及后处理修补,为模型训练提供了高仿真度与鲁棒性的基础,适用于临床文档的自动化去标识化任务。
背景与挑战
背景概述
synthetic-pii-phi-v2数据集(当前版本标记为v3)由Synthea衍生的合成临床文档生成流水线构建,覆盖英语(英国)、荷兰语(比利时)和法语(法国)三个区域,专为训练多语言去标识化(令牌分类)模型而设计。该数据集由研究团队于2023年创建(具体时间未明确),其核心研究问题在于提供大规模、高质量、具有细粒度跨度级PII/PHI标注的合成临床文档,以应对真实医疗数据隐私保护与共享的困境。数据集中所有实体值(如姓名、身份证号、日期、地址、实验室结果)均为合成生成,不含任何真实患者或机构数据,但城市名和邮政编码前缀为真实值,以增强文档的合理性。该数据集通过精心设计的架构(包括39种实体标签、蓝本生成、值填充、组合、渲染等步骤)确保数据的多样性和低重复率,并通过泄漏安全的划分方式防止模板跨数据分割,从而为多语言去标识化模型提供可靠的训练基准。其影响力在于推动医疗文本去标识化技术的发展,为跨语言环境下的隐私保护提供了关键资源。
当前挑战
该数据集面临的核心挑战涵盖领域问题和构建过程两方面。在领域问题层面,去标识化需同时兼顾高精度与高召回率,尤其对英语、荷兰语、法语混合的临床文本,需处理多样化的实体表面形式(如日期序数后缀、国际电话号码、完整邮政编码等),并避免对非实体数字(如BMI值)产生误报。在构建过程中,挑战包括:确保合成数据与真实临床文档的分布一致性,避免术语池重叠(如诊断与症状概念混淆)、降低重复文本模式导致的记忆风险(通过多次补丁将单个措辞复用率降至≤0.0205%)、修正实体跨度的不重叠性(经BIO兼容性扫描修复),以及设计有效的硬负样本(如BMI形状的诱饵句子)以抑制模型在未见形状上的错误激活。此外,还需严格控制实体偏移的准确性(所有补丁均通过偏移保留技术实现零缺陷),并处理多语言中的格式规则差异(如英国邮政编码的内外码、法国日期格式的序数限制)。这些工作共同保障了数据集的质量与实用性,为此类语料的构建树立了标杆。
常用场景
经典使用场景
该数据集作为多语言临床与行政文档去标识化的基准语料,核心应用场景为训练与评估基于token分类的命名实体识别(NER)模型,以精准识别并掩蔽文本中嵌入的个人身份信息(PII)与受保护健康信息(PHI)。其覆盖英、荷、法三种语言,囊括39种实体标签,横跨姓名、证件号码、日期、地址、检查结果等丰富类别,为跨区域、多语种的隐私保护模型研发提供了高保真、注释精细的训练与测试样本。
解决学术问题
该数据集直面医疗文本共享中的数据泄露风险与去标识化模型泛化能力不足的学术难题。传统真实临床语料受隐私法规约束难以公开,且标注一致性差;此数据集通过全合成生成策略,彻底规避真实患者数据泄露之虞,同时凭借其严格的防泄漏划分(按蓝图簇划分训练/验证/测试集)与对表面形式多样性、硬负样本(如BMI形数字)的精细设计,有效缓解了模型过拟合、对未见格式识别不佳及误报频发等问题,为构建鲁棒、可靠的自动去标识化系统奠定了实验基准。
实际应用
在实际应用中,该数据集支撑了医疗健康领域内文本处理管线的隐私保护环节。基于此训练的模型可部署于电子健康记录(EHR)系统的导出与共享流程,自动筛查并遮蔽病历、转诊信、检验报告中的敏感信息,从而满足GDPR、HIPAA等合规要求。同时,其多语言特性适配跨国医疗机构或区域性医疗协作网络的需求,能够实现跨语种文本的统一匿名化处理,促进医学研究数据的合法二次利用,加速真实世界证据的生成。
数据集最近研究
最新研究方向
该数据集聚焦于多语种临床文本的自动化去标识化技术,最新研究动向集中于提升模型对复杂实体形态的泛化能力与鲁棒性。研究热点包括:通过后渲染补丁策略,针对标识符表面形式多样性、日期序数后缀及月份前置格式等细节缺陷进行定向修复,以弥合训练数据与真实世界文本之间的分布鸿沟;引入新型硬负样本(如BMI形状的十进制数、特定格式的电话号码和邮政编码),增强模型对非实体相似模式的判别力;同时,术语池的严格隔离与实体自由文档的引入,旨在减少标签间的语义混淆并提升模型在纯文本上的精确率。这些进展对于保障临床数据共享中的隐私安全、推动跨语言医疗信息处理系统的可靠部署具有关键意义,也为合成数据在敏感领域的高保真应用树立了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务