ai4privacy/pii-masking-65k
收藏资源简介:
该数据集的主要目的是从文本中移除个人身份信息(PII),特别是在AI助手和大型语言模型(LLMs)的上下文中。数据集包含约43,000条观察数据,每条数据以包含PII占位符的自然语言句子开始,并用模拟的个人信息填充这些占位符。数据集涵盖了多种PII出现的上下文,包括商业、心理学和法律领域,以及五种交互风格。数据集还支持多种语言,并经过人工验证以确保高质量。
The primary objective of this dataset is to eliminate personally identifiable information (PII) from textual content, specifically within the context of AI assistants and large language models (LLMs). This dataset comprises approximately 43,000 observations, where each entry begins with a natural language sentence that includes PII placeholders, and these placeholders are populated with simulated personal information. The dataset covers diverse contexts where PII may appear, including business, psychology, and legal domains, alongside five interaction styles. Additionally, it supports multiple languages and has undergone manual validation to ensure high data quality.
数据集概述
数据集目的与特征
- 目的:用于从文本中移除个人身份信息(PII),特别是在AI助手和大型语言模型(LLMs)的背景下。
- 模型:基于“Distilled BERT”进行微调,用于令牌分类任务,模型大小为6200万参数,原始大小268MB,压缩后为43MB。
- 数据集组成:约43,000个观察,每个观察包含一个包含PII占位符的自然语言句子,随后填充模拟的个人信息并使用BERT令牌器进行令牌化。
- 覆盖范围:涉及125个讨论主题/用例,跨越商业、心理学和法律领域,以及5种交互风格。
数据集详细信息
- 数据量:当前包含560万令牌,其中65,000个PII示例。
- 语言支持:多语言,包括英语、法语、德语和意大利语。
- 数据质量:通过人机交互验证的高质量数据集,使用专有算法生成的合成数据。
- 技术框架:基于PyTorch,采用8位量化。
数据集版本
- 原始发布:
PII43k_original.jsonl - 新发布:
- 英语平衡版:
english_balanced_10k.jsonl - 法语平衡版:
french_balanced_5k.jsonl - 德语平衡版:
german_balanced_3k.jsonl - 意大利语平衡版:
italian_balanced_3k.jsonl
- 英语平衡版:
数据集应用场景
- 聊天机器人
- 客户支持系统
- 电子邮件过滤
- 数据匿名化
- 社交媒体平台
- 内容审核
- 在线表单
- 协作文档编辑
- 研究和数据共享
- 内容生成
数据集维护与支持
- 项目隶属:AI4Privacy项目隶属于AISuisse SA。




