遇见数据集

ai4privacy/pii-masking-micro-100k

收藏
Hugging Face2026-06-03 更新2026-06-14 收录
官方服务:

资源简介:

PII掩码微样本:多语言样本是PII-Masking-3M系列的一个微型分层样本,源自更大的数据集pii-masking-openpii-1.5m。该样本按(source_dataset, language)比例抽样,确保每种语言区域和标签都有代表性,且亚太地区的行优先出现。数据集包含99,990个示例,其中训练集90,000个,验证集9,990个,涵盖30种语言、37个区域和19种个人可识别信息(PII)标签,总标注数为725,798个。数据格式为JSONL,许可证为CC-BY-4.0。该数据集专门用于隐私保护任务,如令牌分类和文本生成,包含合成PII数据,无真实个人数据,适用于多语言NLP应用。

PII Masking Micro: Multilingual Sample is a micro-sized stratified sample of the PII-Masking-3M family, derived from the larger dataset pii-masking-openpii-1.5m. It is sampled proportionally by (source_dataset, language) to ensure representation for every locale and label, with Asia Pacific rows appearing first. The dataset contains 99,990 examples, with 90,000 for training and 9,990 for validation, covering 30 languages, 37 regions, and 19 personally identifiable information (PII) labels, totaling 725,798 annotations. The data is in JSONL format and licensed under CC-BY-4.0. It is designed for privacy-preserving tasks such as token classification and text generation, containing synthetic PII data only, with no real personal data, and is suitable for multilingual NLP applications.

提供机构:
ai4privacy
搜集汇总
数据集介绍
ai4privacy/pii-masking-micro-100k 数据集图片
构建方式
该数据集是PII-Masking-3M系列中微规模样本的代表,基于旗舰数据集pii-masking-openpii-1.5m进行比例分层抽样,依据source_dataset与language维度确保每个语种与标签类别均获得充分表征。亚太地区的数据行被优先排列,最终形成包含99,990条示例的平衡子集,其中训练集与验证集分别涵盖90,000和9,990条样本,并附有725,798条精细标注。
特点
数据集横跨30种语言与37个地理区域,覆盖19种个人可识别信息标签,包括姓名、证件号、财务信息等关键类型。其标签分布经过精心校准,既保证各类别数据的充分性,又通过合成数据生成方式避免引入真实个人隐私。CC-BY-4.0许可协议进一步开放了学术与商业应用场景。
使用方法
借助HuggingFace Datasets库,开发者可通过load_dataset('ai4privacy/pii-masking-micro-100k')一键加载数据,直接用于序列标注模型的训练与评估。数据集支持token-classification及text-generation任务,适合开发多语言PII脱敏系统。配对的Nano与Mini样本为快速原型验证提供便捷入口。
背景与挑战
背景概述
随着人工智能技术的迅猛发展,个人身份信息(PII)的识别与保护成为隐私计算领域的关键挑战。pii-masking-micro-100k数据集由AI4Privacy团队于2026年创建,源自旗舰级PII-Masking-3M系列,是其中规模为10万条的微缩分层样本。该数据集旨在为多语言环境下的PII脱敏任务提供高质量标注资源,覆盖30种语言和19种PII标签类型,涵盖亚洲、欧洲等多个地区。其核心研究问题在于推动命名实体识别(NER)与文本生成任务中的隐私保护能力,尤其关注跨语种数据分布的均衡性。通过释放这一标准化基准,数据集为全球隐私合规技术(如GDPR、CCPA)的评估与优化提供了重要基础,显著促进了开放PII屏蔽领域的发展。
当前挑战
该数据集面临的核心挑战包括:在领域应用上,多语言NER任务中PII标签的语义泛化能力不足,尤其是亚洲语言(如中文、日语)与欧洲语言在字符表示、语法结构上的差异加剧了模型对‘GIVENNAME’、‘STREET’等标签的识别难度;同时,不同地区身份证号、护照号等标识符的格式规范各异,导致跨地域PII检测的迁移性较差。在构建过程中,由于数据集完全由合成数据构成以避免真实隐私泄露,如何确保合成样本的逼真度与多样性成为难点,需在无真实PII的前提下模拟自然出现频率和上下文关联,防止模型产生偏见或过拟合;此外,对37个地区、30种语言进行等比例分层采样以覆盖低资源语种,也增加了数据收集与标注的平衡性挑战。
常用场景
经典使用场景
在隐私保护与自然语言处理的交叉领域中,PII Masking Micro Multilingual Sample数据集凭借其多语种、多标签的合成个人身份信息(PII)标注数据,成为训练和评估序列标注模型的经典资源。该数据集涵盖30种语言、19类PII标签(如姓名、地址、证件号码等),并采用分层抽样策略确保各语种和标签的均衡分布,特别适合用于构建跨语言命名实体识别(NER)系统。研究者和开发者常以此数据集为基准,微调预训练语言模型(如BERT、XLM-R),使其具备从多语种文本中精准定位并遮蔽敏感信息的能力,从而推动隐私合规技术的发展。
解决学术问题
该数据集有效回应了隐私保护领域的两大核心学术挑战:一是多语种环境下PII标注数据的匮乏,二是合成数据在真实场景中的泛化能力验证。通过提供大规模、高质量且覆盖30种语言的合成PII语料,它使研究者能够系统性地探索跨语言PII检测的模型架构、迁移学习策略以及低资源语言的性能瓶颈。此外,数据集严格采用合成数据(无真实个人信息),规避了隐私法规对数据发布的限制,为学术界提供了可自由使用的基准,促进了隐私保护算法的可重复性研究,并推动了差异化隐私与文本匿名化技术的理论深化。
衍生相关工作
基于PII Masking Micro Multilingual Sample及其所属的3M系列,衍生出多项具有影响力的研究工作。例如,研究者借鉴其分层抽样思想,提出了更细粒度的地区特定PII检测模型,并探索基于对比学习的少样本PII识别范式。该数据集还被视为评估大型语言模型(LLM)隐私泄露风险的测试床,催生了探究模型在指令微调后是否会记忆并输出合成PII的实证研究。此外,社区基于此数据构建了自动化的PII遮蔽流水线(如OpenPII框架),并进一步扩展至非结构化文本的隐私保护,推动了从数据集构建到模型部署的全链路创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务