遇见数据集

ai4privacy/pii-masking-nano-1k

收藏
Hugging Face2026-06-03 更新2026-06-14 收录
官方服务:

资源简介:

PII掩码纳米版:多语言样本是一个纳米级分层样本,源自PII-Masking-3M家族的主要版本pii-masking-openpii-1.5m数据集。该样本通过(source_dataset, language)进行比例抽样,确保每个语言和标签都有代表性,亚洲太平洋地区的行优先显示。数据集包含990个示例,其中训练集900个,验证集90个,涵盖19种个人身份信息(PII)标签类型(如姓名、电子邮件、日期、地址等)和30种语言,涉及37个地区,总共有7,611个标注。数据集格式为JSONL,许可证为CC-BY-4.0,专门用于隐私保护任务,如PII掩码,属于token-classification和text-generation类别。数据仅包含合成PII,无真实个人数据。

PII Masking Nano Edition: Multilingual Sample is a nano-scale stratified sample derived from the pii-masking-openpii-1.5m dataset, the primary release of the PII-Masking-3M family. This sample adopts proportional sampling based on (source_dataset, language) to ensure representative coverage for each language and label, with entries from the Asia-Pacific region displayed first. The dataset contains 990 total examples, including 900 for training and 90 for validation. It covers 19 types of Personally Identifiable Information (PII) labels (e.g., name, email, date, address, etc.), 30 languages, and 37 regions, with a total of 7,611 annotations. The dataset is formatted in JSONL, licensed under CC-BY-4.0, and is specifically designed for privacy protection tasks such as PII masking, falling under the token-classification and text-generation task categories. All data in this dataset consists of synthetic PII, with no real personal data included.

提供机构:
ai4privacy
搜集汇总
数据集介绍
ai4privacy/pii-masking-nano-1k 数据集图片
构建方式
在隐私保护与自然语言处理交叉领域,PII(个人身份信息)掩码任务亟需多语言、多标签的基准数据集。该数据集以PII-Masking-3M系列旗舰版本pii-masking-openpii-1.5m为母体,采用按(source_dataset, language)对进行比例分层抽样的策略,精心遴选出990条样本。构建过程中严格遵循语种与标签的均衡表征,优先纳入亚太地区语料,形成涵盖900条训练样本与90条验证样本的纳米级子集,所有数据以JSONL格式存储,总计包含7611条人工标注,确保抽样科学性与代表性。
特点
该数据集以精巧体量承载显著多样性,覆盖30种语言、37个地域及19种PII标签类别,其中GIVENNAME、DATE、SURNAME等标签出现频次居前,而SOCIALNUM、PASSPORTNUM等敏感标签亦获充分收录。其核心优势在于通过多源语料的严格分层抽样,使得每一语种与标签类型均获得均衡呈现,为多语言环境下的PII识别模型提供可控的测试基准。作为开源资源,采用CC-BY-4.0许可协议,且仅包含合成PII数据,完全规避真实个人隐私泄露风险。
使用方法
开发者可通过HuggingFace Datasets库以一行代码轻松调用:from datasets import load_dataset; ds = load_dataset('ai4privacy/pii-masking-nano-1k'),即可获得预划分的训练集与验证集。该数据集适用于token-classification与text-generation两类任务,特别适合快速验证多语言PII掩码模型的性能基线,或进行小样本学习实验。建议作为PII-Masking-3M系列更大规模数据集的轻量级先行测试工具,参数微调时可结合19类标签分布特点设计损失函数,以优化边境场景下的泛化能力。
背景与挑战
背景概述
pii-masking-nano-1k数据集由Ai Suisse SA于2026年发布,作为PII-Masking-3M系列中的微型样本,旨在为多语言个人可识别信息(PII)掩码任务提供标准化基准。该数据集从旗舰级pii-masking-openpii-1.5m中按源数据集与语言比例分层采样,涵盖30种语言、37个地区,标注了19类PII标签(如姓名、邮箱、证件号等),共计990条样本。其核心研究问题在于解决跨语言、跨地域的PII识别与脱敏难题,推动隐私保护技术在自然语言处理中的落地。作为AI4Privacy倡议的重要组件,该数据集为开发者提供了轻量级测试资源,尤其助力亚太地区隐私合规模型研发,对多语言NER及文本生成领域的数据隐私保护产生了标杆性影响。
当前挑战
当前数据集面临的核心挑战涉及多维度隐私技术难题。在领域问题层面,跨语言PII识别需应对不同语系(如西日耳曼语、南岛语、汉藏语)的命名实体变体、格式差异及上下文歧义,例如欧洲身份证号与亚洲社保号的编码规则迥异。构建过程中,合成数据虽规避了真实隐私风险,但其标注分布需精准模拟现实场景中PII的出现频率与语言比例,以避免模型产生地域性偏差。此外,仅990条的小规模样本难以为罕见PII标签(如SOCIALNUM仅170例)提供充足训练信号,可能导致模型在长尾分布下的泛化能力不足。同时,法律合规要求(如GDPR、CCPA)的国别差异迫使数据集在标签设计上需兼顾通用性与本地化,这对标注体系的灵活拓展构成显著制约。
常用场景
经典使用场景
在隐私保护与自然语言处理的交叉领域,pii-masking-nano-1k数据集为多语言、多标签的个人身份信息识别与脱敏任务提供了理想的训练与评估基准。该数据集精选990条涵盖30种语言及37个地域的合成文本,标注了包括姓名、地址、电话、信用卡号、身份证号在内的19类敏感实体。研究者可借助此资源,开展基于序列标注(token-classification)或文本生成(text-generation)范式的PII检测与掩码模型训练,从而在确保隐私合规的前提下,提升模型对跨语种、跨文化背景下个人信息识别的鲁棒性与泛化能力。
衍生相关工作
该数据集是PII-Masking-3M系列家族的小型分层样本,其母数据集pii-masking-openpii-1.5m则是该系列的旗舰版本。基于此框架,衍生出一套规模递进的资源生态:从千条量级的Nano版到万条级别的Mini版,再到十万条的Micro版,直至完整的一百五十万条全量数据集。这些分级版本使得研究者能够根据计算资源与任务复杂度灵活选择训练规模,同时保持跨版本间标签体系与语言分布的兼容性。后续工作还可能拓展至更细粒度的PII类型(如生物识别信息)或引入噪声文本的鲁棒性评估,进一步丰富该数据集的学术与工业价值。
数据集最近研究
最新研究方向
在隐私保护与自然语言处理交叉的前沿领域,pii-masking-nano-1k作为PII-Masking-3M系列的精炼样本,正推动着多语言环境下个人身份信息的脱敏技术迈向新高度。该数据集通过分层采样策略,覆盖30种语言及19类敏感标签,为跨地域的命名实体识别与文本生成任务提供了标准化评估基准。随着全球数据隐私法规如GDPR与CCPA的深化实施,合成数据驱动的隐私保护研究成为热点,该数据集以完全合成的非真实个人数据,规避了法律风险,同时为大型语言模型的合规训练与敏感信息匿名化提供了关键资源,深刻影响了AI系统在金融、医疗等强隐私领域部署的可信度与安全性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务