遇见数据集

AIM-Intelligence/guardian-pii-train-data

收藏
Hugging Face2026-06-15 更新2026-06-14 收录
官方服务:

资源简介:

Guardian-PII训练数据版本是一个用于训练Starfort专用PII(个人可识别信息)模型的版本化数据集集合。该数据集从上游源数据(AIM-Intelligence/guardian-pii-data)中派生,经过混合管道采样和比例平衡,生成训练就绪的数据分片,并按版本冻结以确保可重现性。当前版本v001包含999,338行数据,涵盖两种记录类型:ner-extract(56.85%)和ner-batch-classify(43.15%),涉及两种语言:英语(62.59%)和韩语(37.41%)。数据来源于9个不同的家族(如ai4privacy_1_5m_ko、syvai_en等),包含168种PII实体标签(如GIVENNAME、DATE、SURNAME等),并包含基础示例和注入示例。数据集专门用于训练模型识别和分类PII实体,同时包含负样本(PII不存在)以降低误检率。

Guardian-PII — Training Data Versions is a collection of versioned training datasets used to train Starforts dedicated PII (Personally Identifiable Information) model. Derived from an upstream source dataset (AIM-Intelligence/guardian-pii-data), it undergoes sampling and ratio-balancing via a mixing pipeline to produce train-ready data shards, frozen per version for reproducibility. The current version v001 consists of 999,338 rows, covering two record types: ner-extract (56.85%) and ner-batch-classify (43.15%), and two languages: English (62.59%) and Korean (37.41%). Data is sourced from 9 families (e.g., ai4privacy_1_5m_ko, syvai_en, etc.) and includes 168 PII entity tags (e.g., GIVENNAME, DATE, SURNAME). It contains both base and injected examples, and is designed for training models to detect and classify PII entities, with negative examples (no PII present) to reduce over-detection.

提供机构:
AIM-Intelligence
搜集汇总
数据集介绍
AIM-Intelligence/guardian-pii-train-data 数据集图片
构建方式
Guardian-PII训练数据集是为Starfort专用PII模型训练而构建的版本化数据集。其构建流程从上游种子池AIM-Intelligence/guardian-pii-data出发,该池汇集了跨家族、语言和分类标签的原始PII样本。通过混合流水线进行采样和比例平衡,生成混合后可直接投入训练的数据集。每个版本均以冻结快照形式存储于独立的vNNN/文件夹中,包含精确的训练数据分片及对应的DATA_DISTRIBUTION.md文档,以描述该版本的组成。新版本随时间递增,旧版本则保留以确保可复现性。
使用方法
用户可通过HuggingFace的datasets库加载该数据集。加载时需指定配置名称和分割名称,例如使用load_dataset('AIM-Intelligence/guardian-pii-train-data', 'v001', split='ner_batch_classify')即可加载v001版本的ner_batch_classify分割。数据集提供ner_batch_classify与ner_extract两种分割,分别对应不同的训练阶段。用户可根据训练需求选择相应的分割进行模型微调或评估。此外,数据集各版本文件夹中附带的DATA_DISTRIBUTION.md文档可帮助用户深入了解该版本的数据分布特征,以优化训练策略。
背景与挑战
背景概述
随着人工智能技术在个人身份信息(PII)检测领域的广泛应用,构建高质量、多语言、多类型的训练数据集成为提升模型性能的关键。Guardian-PII训练数据集(guardian-pii-train-data)由Starfort团队于2026年创建,旨在为其专用PII检测模型提供版本化、经过平衡混合的训练数据。该数据集源自上游种子数据集AIM-Intelligence/guardian-pii-data,通过采样和比例平衡流水线生成,包含v001版本,总计约999,338条样本,覆盖9个源家族、2种语言(英语和韩语)及168种PII标签。其核心研究问题是如何在保证数据多样性和代表性的前提下,高效训练出能够准确识别多种PII实体的模型。该数据集在隐私保护领域具有重要影响力,为下游模型训练提供了可靠、可复现的数据基础。
当前挑战
该数据集面临的主要领域挑战在于:PII检测任务需应对多语言、多标签、实体类型细粒度高的复杂场景,要求模型能准确区分168种PII标签,同时避免误检,如通过12.68%的负样本(无PII)来抑制过检测。构建过程中遇到的挑战包括:从9个源家族中整合许可和来源不明的数据,处理不同标注方式的异构性;通过水填充算法在1M目标量下平衡各家族、语言和记录类型的比例,避免类别不平衡;确保数据完整性,严格控制输出重复和跨源重复,最终实现零重复违规;以及引入注入机制(48.34%样本为答案注入),需确保注入的PII内容真实合理,不引入噪声。
常用场景
经典使用场景
在隐私保护与数据安全的研究版图中,Guardian-PII训练数据集以其精细的版本管理与多阶段任务设计,成为命名实体识别(NER)领域的标杆性资源。该数据集通过精心拆分的ner_extract与ner_batch_classify两个子集,分别服务于实体提取型任务与批量分类型任务。其内含超过160种细粒度PII标签,覆盖姓名、证件号码、金融信息等敏感数据类别,并巧妙融入了12.68%的负样本,以引导模型避免过度检测。这一设计使得研究者能够在统一的框架下训练高鲁棒性、高召回率的隐私实体识别模型,是构建智能数据脱敏系统的理想选择。
解决学术问题
该数据集直面学术界长期存在的隐私实体识别挑战,即跨语言、跨类别的细粒度PII标注数据匮乏问题。通过汇聚九个来源家族、两种语言(英语与韩语)的百万级样本,它有效缓解了小众PII标签(如生物识别标识符、医疗记录号)的样本稀疏困境。特别是其创新的answer-injected机制,通过对比基础样本与注入答案的样本,为研究“提示学习如何影响NER性能”提供了绝佳的实验对照组。此数据集的出现,不仅推动了多语言PII识别的基准测试发展,更为探究数据混合策略(如水罐算法)对模型泛化能力的影响开辟了新的实验路径。
实际应用
在实际产业应用中,Guardian-PII训练数据集扮演着核心基石的角色,为金融机构、医疗平台及科技企业的数据合规系统提供动力。基于该数据集训练的模型能够精准识别并脱敏用户文本中的身份证号、信用卡号、护照信息等敏感内容,从而满足GDPR、CCPA等隐私法规的严苛要求。在智能客服场景中,模型可动态屏蔽对话记录中的PII,保障客户信息安全;在日志审计环节中,则能批量检出系统日志中的隐藏隐私字段,大幅降低数据泄露风险。此外,其versioned训练数据的可追溯特性,为模型迭代中的回归测试提供了牢靠的基准。
数据集最近研究
最新研究方向
在隐私保护领域,个人可识别信息(PII)的精准检测与脱敏已成为数据安全治理的核心议题。guardian-pii-train-data数据集通过多源异构数据的版本化融合策略,为训练高鲁棒性的专用PII识别模型提供了关键支撑。其v001版本整合了来自9个数据家族的近百万条训练样本,覆盖168种PII实体标签,并创新性地引入比例平衡与答案注入机制,有效降低了模型对常见PII类别的过度拟合风险。该数据集的设计理念与当前业界对合成数据增强、跨语言泛化能力及细粒度实体分类的前沿需求高度契合,尤其通过水填充算法对韩语数据的优化处理,展现了在多语言场景下对抗样本稀缺性的方法论突破。这一系统的训练数据管线不仅推动了命名实体识别任务在敏感信息场景中的实用化进程,也为构建合规、可复现的隐私计算模型树立了重要基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务