遇见数据集

korean-pii-dataset

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

Korean Synthetic PII Dataset 是一个专为韩语文本中的个人身份信息(PII)检测与令牌分类任务设计的合成数据集。该数据集包含 11,732 个文档,划分为训练集(9,227)、验证集(1,510)和测试集(995),共计 55,627 个 PII 片段,覆盖 33 种 PII 标签(如姓名、电话号码、电子邮件、地址、身份证号等)。数据集提供两种配置:raw 配置保留原始文本和字符级别的 span 标注(起始与结束位置),适合直接查看或自定义处理;bio 配置使用 KPF-BERT 分词器转换为 BIO 序列(包含 input_ids、token_type_ids、attention_mask 和 labels),可直接用于模型训练。所有姓名、号码、地址和句子均为合成生成,不包含真实个人隐私信息。数据质量经过多项增强,包括校验规则(如 Luhn 算法、RRN 校验)、长文档支持(最大 512 令牌)、counterfactual 样本和 hard negative 样本。注意:数据集的 train/validation/test 拆分并非均衡分布,某些稀有标签在测试集中缺失,最终评测使用独立的 holdout 集。该数据集适用于韩语命名实体识别、隐私保护、令牌分类等任务。

Korean Synthetic PII Dataset is a synthetic dataset designed for personal identifiable information (PII) detection and token classification tasks in Korean text. It contains 11,732 documents split into training (9,227), validation (1,510), and test (995) sets, with a total of 55,627 PII spans covering 33 PII labels (e.g., name, phone number, email, address, resident registration number). The dataset offers two configurations: raw (preserving original text and character-level span annotations with start and end positions) and bio (tokenized using KPF-BERT tokenizer into BIO sequences with input_ids, token_type_ids, attention_mask, and labels). All names, numbers, addresses, and sentences are synthetically generated and contain no real personal privacy information. Data quality is enhanced through various checks (Luhn algorithm, RRN validation), long-document support (max 512 tokens), counterfactual samples, and hard negative samples. Note that the train/validation/test split is not balanced, and some rare labels are missing from the test set; final evaluation uses a separate holdout set. The dataset is suitable for Korean named entity recognition, privacy protection, token classification, and other tasks.

创建时间:
2026-08-03
原始信息汇总

数据集概述

Korean Synthetic PII Dataset 是一个用于韩语个人隐私信息(PII)检测与命名实体识别(NER)的合成数据集,专为 token 分类模型训练而设计。数据集中的所有名称、号码、地址及句子均为合成值,不含真实个人信息。

基本构成

项目 数量
总文档数 11,732
训练集(Train) 9,227
验证集(Validation) 1,510
测试集(Test) 995
PII 片段总数 55,627
PII 类型 33
BIO 标签数 67(含 O
最大 token 长度 511

数据集配置

提供了两种可加载的配置(config):

  • raw:默认配置。包含人读的原文及字符位置 span。
  • bio:包含经 KPF-BERT 分词器转换的 BIO 训练输入。

文件结构

  • corpus_all.jsonl:三个 split 合并后的原文及 span 数据
  • corpus_all_bio.jsonl:三个 split 合并后的 KPF-BERT BIO 数据
  • data/{train,validation,test}.jsonl:raw 配置的 split 文件
  • bio/{train,validation,test}.jsonl:BIO 配置的 split 文件
  • label_map.json:BIO 标签与整数 ID 的双向映射
  • dataset_stats.json:按 split 及标签的详细统计

注意:合并文件与 split 文件是同一份数据的不同划分方式,而非独立数据。

数据 Schema

Raw 格式 示例字段包括:idsource_text(原句)、privacy_mask(PII 片段列表,含标签、值、起始/结束位置)、languageregionsplit。位置信息为 0-based 的 Python 字符串索引,满足 source_text[start:end] == value

BIO 格式 每个样本包含:idsplitinput_idstoken_type_idsattention_masklabels。其中 labels 为整数化的 B-LABEL/I-LABEL/O 序列,-100 表示损失计算中需排除的位置(如特殊 token)。所有数组长度相等且不超过 512。

PII 标签(共 33 类)

ACCOUNT_NUMBERADDRESSAGEALIEN_NUMBERBIRTHDATEBLOOD_TYPECARD_NUMBERCITYDEPARTMENTDRIVER_LICENSEEMAILEMPLOYEE_IDGENDERHEIGHTIP_ADDRESSMAJORMEMBER_IDNAMENATIONALITYNICKNAMEPARTICIPANT_IDPASSPORTNUMPHONEPOSITIONRELIGIONRRNSCHOOLURLUSER_IDVEHICLE_NUMBERWEIGHTWORKPLACEZIPCODE

数据质量设计

  • 居民身份证号(RRN)生成时保证出生年份与性别代码(1~4)语义一致。
  • 外国人登记号应用性别代码(5~8)及旧版外国人登记号校验和规则。
  • 卡号中包含通过 Luhn 校验的示例。
  • 包含表格、列表、CSV、JSON 等无引导语格式,以及多 PII 共现的文档。
  • 训练集包含 480 行 RRN/外国人登记号上下文词与真实第 7 位冲突的反事实样本。
  • 训练集包含 500 行 RRN 与外国人登记号同现的未标注结构化样本。
  • BIO 输入长度扩展至最多 512 token,以支持长文档。
  • 训练用 hard negative 包含外表类似 PII 但非目标标签的普通代码上下文。

使用注意

  • train/validation/test 为复现实际模型训练时使用的固定划分,标签分布并非均衡,部分稀疏标签在公开测试集中极少甚至缺失,不宜仅依据测试集评判各类别性能。
  • 最终模型评估使用了与公开 corpus 在模板和值上均不重叠的独立合成 holdout(每类标签各 100 个正例),该 holdout 未并入公开训练集,以防止调参污染。

已知局限

  • 合成句子与实际 RAG 响应、业务文档的表达与分布存在差异。
  • 可能存在有限的生成规则或重复表达残留。
  • 依赖上下文程度较高的标签(如姓名、昵称、职位、用户 ID)在领域变化时性能可能明显下降。
  • 仅凭本数据集或其训练的模型不能保证个人隐私保护效果。
搜集汇总
数据集介绍
korean-pii-dataset 数据集图片
构建方式
该数据集为韩语个人隐私信息(PII)识别任务而构建,采用合成数据生成技术,所有姓名、号码、地址及句子均为人工合成值,刻意排除真实个体信息。数据包含11,732篇文档,划分为训练集(9,227篇)、验证集(1,510篇)与测试集(995篇),共标注55,627个PII跨度,涵盖33种PII类型。构建过程注重真实性,例如身份证号与出生年份和性别代码逻辑一致,外国人登记号应用校验规则,卡号通过Luhn验证。此外,数据集加入对抗性样本,包括无标签的结构化数据、上下文冲突的反事实样本及硬负样本,以增强模型鲁棒性。
特点
数据集提供两种配置:raw格式保留人类可读文本与字符位置跨度,bio格式则利用KPF-BERT分词器转换为BIO标注序列,便于直接训练。质量提升举措包括在非结构化表格、列表、JSON等场景中嵌入PII,扩展最大序列长度至512 tokens。同时,数据明确区分训练、验证与测试,但测试集标签分布不均衡,部分稀有类别缺失,故不推荐仅依赖测试集评估模型性能。最终模型评估使用独立合成的holdout集,确保无数据泄露。
使用方法
用户通过HuggingFace加载数据,可选用raw配置获取原始文本和span信息,或选用bio配置获取处理好的input_ids和labels。数据手册提供详细字段说明,如raw格式的start/end为Python字符串索引,bio格式中labels以整数表示BIO标签,-100表示loss计算忽略位置。建议使用者注意split的使用限制,并参考label_map.json进行标签映射。数据集附带统计文件dataset_stats.json,便于进一步分析。
背景与挑战
背景概述
随着深度学习在自然语言处理领域的迅猛发展,命名实体识别(NER)已成为信息抽取的核心技术之一。然而,针对韩语个人隐私信息(PII)的识别研究仍面临数据稀缺的瓶颈。为此,korean-pii-dataset于近年应运而生,由韩国研究团队创建,旨在为韩语PII检测与令牌分类提供高质量的合成数据集。该数据集包含11,732篇文档、55,627个PII片段,覆盖33种实体类型,并提供了原始文本与BIO标签两种格式,适配KPF-BERT等韩语预训练模型。其设计严谨,如对居民身份证号、外国人登记号等采用虚拟但符合校验规则的生成方法,确保了数据的真实性与实用性。该数据集填补了韩语PII NER研究的空白,为隐私保护、文本匿名化及合规分析等应用提供了关键资源,对韩语信息抽取领域具有重要推动作用。
当前挑战
韩语PII识别面临多重挑战。从领域问题看,PII类型多样且高度依赖上下文,如姓名、昵称、职位等在不同领域语义变化大,导致模型泛化能力受限;且真实场景中PII常以非结构化形式(如表格、列表、JSON)出现,增加了识别难度。从数据集构建看,合成数据的生成需兼顾真实性与隐私安全,避免引入真实个人信息;同时,需确保PII值的合法性(如校验码)和标签的一致性。此外,数据集中稀有标签分布不均,且公开测试集未能充分覆盖所有类别,这导致模型性能评估存在偏差。为规避数据污染,研究者额外构建了独立holdout集,但这也增加了评估的复杂性。未来,仍需探索更高效的合成策略与评价方法,以推动韩语PII识别的进一步发展。
常用场景
经典使用场景
该数据集专为韩语文本中的个人身份信息(PII)识别与抽取任务而设计,其经典应用场景聚焦于命名实体识别(NER)与序列标注任务。研究人员利用其提供的raw格式原始文本及字符级位置标注,可训练并评估基于Transformer架构(如KPF-BERT)的细粒度PII分类模型。数据集的bio配置进一步提供了与KPF-BERT分词器对齐的BIO序列标注输入,极大便利了令牌级标注模型的直接使用。凭借33种细粒度PII标签,涵盖姓名、地址、电话号码等,该数据集成为韩语PII检测领域标准化的基准资源。
解决学术问题
该数据集回应了韩语信息提取领域内高质量、合规PII标注数据稀缺的难题。鉴于真实个人数据的隐私法规限制,其全合成属性保证了研究无伦理与合规障碍,推动了针对长尾及嵌套实体(如身份证号、外国人登记号)识别的基础研究。数据集精心引入了对抗性与反事实样本,旨在增强模型对虚假PII模式的鲁棒性,从而解决分布偏移与标签噪声问题,为评估PII标注系统的泛化能力与公平性提供了严谨的学术实验平台。
衍生相关工作
基于该数据集,后续研究可衍生出多方向工作:包括探索跨语言PII识别模型的迁移学习,利用其韩语标注去对齐英语或其他语种的表示;开发高效的主动学习框架,以缓解稀疏标签样本不足的问题;或构建对抗性攻击与防御的基准,专门评测模型对反事实样本的鲁棒性。另有工作可能扩展其任务范围,如结合PII识别与关系抽取,以识别实体间关联。这些衍生工作共同促进了合成数据在隐私保护NLP领域的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务