ai4privacy/pii-masking-mini-10k
收藏资源简介:
PII Masking Mini: Multilingual Sample 是一个多语言小规模样本数据集,属于PII-Masking-3M系列。它是pii-masking-openpii-1.5m数据集的stratified样本,通过按(source_dataset, language)比例采样确保每个语言和标签都有代表性,并优先包含亚洲太平洋地区的数据。数据集总共有9,990个示例,其中训练集9,000个,验证集990个,涵盖19个标签(如GIVENNAME、SURNAME、EMAIL、DATE、CITY、TELEPHONENUM、AGE、STREET、BUILDINGNUM、ZIPCODE、IDCARDNUM、CREDITCARDNUMBER、DRIVERLICENSENUM、TAXNUM、GENDER、SEX、SOCIALNUM、PASSPORTNUM、TITLE)、30种语言(包括英语、法语、德语、西班牙语、意大利语、荷兰语、葡萄牙语、保加利亚语、捷克语、丹麦语、希腊语、爱沙尼亚语、芬兰语、克罗地亚语、匈牙利语、立陶宛语、拉脱维亚语、波兰语、罗马尼亚语、斯洛伐克语、斯洛文尼亚语、塞尔维亚语、瑞典语、印度尼西亚语、日语、韩语、马来语、他加禄语、越南语和中文)和37个地区,共有72,988个标注,数据格式为JSONL,许可证为CC-BY-4.0。该数据集主要用于隐私保护、个人身份信息(PII)掩码、命名实体识别(NER)和文本生成任务,所有数据均为合成PII,不包含真实个人数据。
PII Masking Mini: Multilingual Sample is a mini-sized stratified sample of the pii-masking-openpii-1.5m dataset, part of the PII-Masking-3M family. It is sampled proportionally by (source_dataset, language) to ensure representation for every locale and label, with Asia Pacific rows appearing first. The dataset contains 9,990 examples in total, with 9,000 for training and 990 for validation, covering 19 labels (such as GIVENNAME, SURNAME, EMAIL, DATE, CITY, TELEPHONENUM, AGE, STREET, BUILDINGNUM, ZIPCODE, IDCARDNUM, CREDITCARDNUMBER, DRIVERLICENSENUM, TAXNUM, GENDER, SEX, SOCIALNUM, PASSPORTNUM, TITLE), 30 languages (including English, French, German, Spanish, Italian, Dutch, Portuguese, Bulgarian, Czech, Danish, Greek, Estonian, Finnish, Croatian, Hungarian, Lithuanian, Latvian, Polish, Romanian, Slovak, Slovenian, Serbian, Swedish, Indonesian, Japanese, Korean, Malay, Tagalog, Vietnamese, and Chinese), and 37 regions, with 72,988 annotations in JSONL format, licensed under CC-BY-4.0. It is designed for privacy protection, personally identifiable information (PII) masking, named entity recognition (NER), and text generation tasks, containing synthetic PII only and no real personal data.




