遇见数据集

SCPI Dataset

收藏
arXiv2026-06-10 更新2026-06-12 收录
官方服务:

资源简介:

SCPI数据集是由早稻田大学与国立信息学研究所联合构建的、专门针对日本《个人信息保护法》所定义的特殊需谨慎个人信息进行标注的文本数据集。该数据集源自日本Common Crawl网络语料库的采样,包含约261万条文本,平均每条长度为2474字符,最终通过两阶段大语言模型标注流程筛选出涵盖医疗史、犯罪记录、残疾状况等核心敏感类别的954条正例样本,并配以8586条负例构成平衡训练集。数据集的创建过程首先基于命名实体识别模型筛选含人名文本,随后采用低参数模型与高性能模型协同的标注策略,并辅以人工校正确保标注质量。该数据集主要应用于大型语言模型预训练语料库的隐私合规过滤,旨在开发高效SCPI分类器以自动检测并移除日语文本中的敏感个人信息,从而防范模型记忆泄露风险并满足日本法律监管要求。

The SCPI dataset is a text annotation dataset jointly constructed by Waseda University and the National Institute of Informatics, specifically targeting special care-required personal information as defined by Japan’s Act on the Protection of Personal Information. This dataset is sampled from the Japanese Common Crawl web corpus, containing approximately 2.61 million text entries with an average length of 2474 characters per entry. Finally, 954 positive samples covering core sensitive categories including medical history, criminal records, and disability status were screened out through a two-stage large language model annotation pipeline, paired with 8586 negative samples to form a balanced training dataset. The dataset construction process first filters text containing personal names using a Named Entity Recognition (NER) model, then adopts a collaborative annotation strategy combining low-parameter and high-performance models, supplemented by manual verification to ensure annotation quality. This dataset is mainly applied to privacy compliance filtering for large language model pre-training corpora, aiming to develop an efficient SCPI classifier to automatically detect and remove sensitive personal information in Japanese texts, thereby preventing the risk of model memorization leakage and complying with Japanese legal and regulatory requirements.

创建时间:
2026-06-10
搜集汇总
数据集介绍
SCPI Dataset 数据集图片
构建方式
在大型语言模型预训练语料库的隐私合规治理背景下,SCPI Dataset的构建遵循了一个严谨的两阶段流水线。首先,基于命名实体识别模型从日本网络语料库中筛选出包含人名的文本,以此作为候选条目;随后,采用轻量级大语言模型(如Llama 3.1 Swallow 8B与Gemma 2 9B)对候选文本进行高效初步标注,并仅将两者均判定为阳性的高置信度样本(共2,373条)提交至高性能模型gpt-oss-120b进行最终验证。经人工校正后,共获得1,216条含有特殊要配虑个人信息(SCPI)的文本,并从中提取出病史、犯罪、残障三大主要类别共954条正面样本,与8,586条负面样本按1:9比例混合,形成了平衡的分类训练数据集。
特点
该数据集紧密围绕日本《个人信息保护法》中定义的11类特殊要配虑个人信息(SCPI)进行构建,尤其聚焦于病史、犯罪和残障三个在网络上可获取且数量充足的类别。其独特之处在于,标注过程采用LLM协同过滤策略,通过低参数模型实现大规模初筛、高性能模型完成精细确认,兼顾了标注质量与处理效率。数据集的标注质量经过双人独立评估,总体精确率高达0.900,一致性率达0.929,Cohen's Kappa系数为0.614,表明标注具有较高可靠性。此外,数据集还包含了非SCPI的负面样本,并针对类别不平衡问题进行了重新平衡,为后续分类器的鲁棒训练奠定了基础。
使用方法
该数据集专为训练快速SCPI分类器而设计,可直接用于监督学习场景。使用方法上,数据集被划分为病史、犯罪、残障与非SCPI四个类别,用户可基于此训练轻量级机器学习模型(如SVC、LGBM)以对大规模日语文本进行高效筛查。实验中展示了两种应用模式:一是作为独立分类器,通过交叉验证评估其F1分数与召回率;二是作为级联过滤的第一阶段,先利用该数据集训练的模型快速识别与SCPI相关的主题类别,再结合更精确的模型或人工标注进行二次甄别。处理速度测试表明,使用TF-IDF特征的LGBM模型在8核CPU上可在一天内处理含1.84亿文本的完整语料库,适用于超大规模预训练语料的前置过滤任务。
背景与挑战
背景概述
SCPI Dataset由早稻田大学与日本国立信息学研究所LLM研发中心的Rei Minamoto、Yusuke Oda及Daisuke Kawahara于2026年构建,旨在解决日语大语言模型预训练语料中敏感个人信息检测这一关键问题。该数据集聚焦于日本《个人信息保护法》定义的“要配慮個人情報”,涵盖种族、信仰、医疗史等11个法定类别。作为首个系统探索日语文本中SCPI检测的研究,其通过LLM标注构建了包含954条正例与8586条负例的标注数据集,为隐私合规与信息泄露防范提供了重要基准,对推动日语NLP领域的隐私保护研究具有开创性意义。
当前挑战
SCPI Dataset面临双重挑战:其一,在领域问题层面,SCPI检测需同时识别个人身份信息与敏感类别信息,且两者在文本中常相隔甚远,传统方法难以准确建立语义关联,而现有PII检测研究多忽略敏感属性,日语环境下更缺乏系统化探索;其二,在数据集构建中,SCPI受法律限制无法直接公开获取,需通过LLM两阶段标注(低参数模型筛选后由高性能模型验证)构建,但存在类别不平衡(如‘社会地位’‘青少年保护’样本极少)、模型标注偏差(LLM无法识别的SCPI便无法被纳入)、以及敏感信息与相关领域信息(如‘医疗史’与‘护理’)难以精确区分等难题。
常用场景
经典使用场景
SCPI Dataset最经典的使用场景是训练和评估用于检测日文文本中特别护理个人信息(SCPI)的分类器。该数据集聚焦于日本《个人信息保护法》定义的11类敏感信息,涵盖医疗史、犯罪记录、残疾等类别。研究者常利用该数据集训练轻量级机器学习模型(如支持向量机、轻量梯度提升机)或Transformer模型(如ModernBERT),以在大规模网络语料中高效识别SCPI,从而为大型语言模型的预训练语料提供隐私过滤基础。
解决学术问题
该数据集解决了日文语料中SCPI系统检测的学术空白。此前,针对日文大规模预训练语料的敏感信息检测研究极为有限,且缺乏基于法律定义的公开数据集。SCPI Dataset首次构建了符合日本法律框架的标注数据集,并验证了不同模型的分类性能,揭示了医疗史与残疾类别的混淆问题以及特征重要性中语义无关词的干扰。其意义在于为多语言隐私保护研究提供了日文基准,推动了法律定义与自然语言处理技术的交叉融合。
衍生相关工作
该数据集衍生了一系列关于敏感信息检测与分类器优化的经典工作。例如,研究者基于其标注方法扩展了LLM与人工协同标注的管道,用于捕获模型遗漏的SCPI实例;还发展了针对种族、信仰、LGBT等标签的补充数据集。此外,堆叠模型策略(如SVC+LGBM)通过集成学习提升了召回率,而SHAP分析则揭示了特征工程在噪声数据中的优化方向,催生了多阶段过滤与重排序方法的后续研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务