遇见数据集

UlrikKoren/GreatShoes_PII_Dataset

收藏
Hugging Face2024-06-26 更新2024-06-29 收录
官方服务:

资源简介:

GreatShoes PII数据集是一个为研究目的创建的合成数据集,用于评估个人可识别信息(PII)的编辑模型。该数据集模拟了一个虚构鞋店“Great Shoes”的客户支持互动,包含多种类型的PII,如姓名、订单号、电话号码、地址和电子邮件。数据集分为两个主要文件:一个包含客户与支持代理的互动,另一个列出了每个条目中使用的PII元素。

GreatShoes PII数据集是一个为研究目的创建的合成数据集,用于评估个人可识别信息(PII)的编辑模型。该数据集模拟了一个虚构鞋店“Great Shoes”的客户支持互动,包含多种类型的PII,如姓名、订单号、电话号码、地址和电子邮件。数据集分为两个主要文件:一个包含客户与支持代理的互动,另一个列出了每个条目中使用的PII元素。

提供机构:
UlrikKoren
原始信息汇总

GreatShoes PII Dataset

概述

GreatShoes PII Dataset 是一个用于研究目的的合成数据集,旨在评估个人身份信息(PII)修订模型的性能。该数据集模拟了虚构鞋店“Great Shoes”的客户支持交互,包含多种类型的PII,如姓名、订单号、电话号码、地址和电子邮件。

数据集描述

数据集包含客户与支持代理的交互,嵌入了PII。每个条目包括一系列客户消息和相应的支持代理响应。数据集分为两个主要文件:

  • GreatShoes_PII_Dataset.csv: 包含嵌入PII的客户-支持交互。
  • pii_used_in_finetune.csv: 列出每个条目中存在的PII元素,基于索引。

示例行

以下是 GreatShoes_PII_Dataset.csv 的前几行示例:

plaintext customer_message_1;response_1;customer_message_2;response_2;customer_message_3;response_3;name "Can I return a pair of shoes I bought over a month ago? They are still unworn and with tags."; "Im sorry, Ram Watanabe, but our return policy allows for returns within 30 days of purchase if the product is unworn, unwashed, and still has its tags attached. Unfortunately, if its been over a month, we wont be able to accept a return."; "What if the shoes were a gift and I just received them?"; "If the shoes were a gift, please provide the order number or the purchasers information. We understand these situations and will do our best to assist you, Ram Watanabe.

Best regards, Great Shoes.";;;Ram Watanabe "How do I get a return label for my order: ON-805533?"; "To obtain a return label for your order, Justin Weber, please visit our website at www.greatshoes.com/return-label. Enter your order number and follow the instructions to print your free return label."; "I printed the label. Do I need to pay for shipping?"; "No, Justin Weber, you dont need to pay for shipping. Just attach the return label to your package and drop it off at the nearest post office. Shipping is on us!

Best wishes, Great Shoes.";;;Justin Weber "I received the wrong size for order: ON-712976. How can I exchange them?"; "I apologize for the inconvenience, Arthur Luo. To exchange the shoes for the correct size, please initiate a return on our website and specify the size you need. We offer free returns and shipping for situations like this."; "Thanks! And how long will the exchange process take?"; "Once we receive your returned item, Arthur Luo, the exchange process typically takes 5-7 business days. Well expedite your exchange to ensure you get the correct size as soon as possible.

Thank you for your understanding, Great Shoes.";;;Arthur Luo

PII元素

pii_used_in_finetune.csv 文件包含与每个条目关联的PII元素。以下是其内容的示例:

plaintext name,order number,phone,address,email Ram Watanabe,,,, Justin Weber,ON-805533,,, Arthur Luo,ON-712976,,, Sushila Martinez,ON-689959,,,

使用场景

该数据集可用于评估和微调设计用于客户服务上下文中PII修订的模型。它提供了一个现实场景,其中客户支持交互包含需要识别和修订的敏感信息。

许可证

GreatShoes PII Dataset 根据 Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0) 许可证分发。这意味着您可以自由使用、分发和修改数据集,用于非商业目的,前提是您给予适当的信用并指示是否进行了更改。

搜集汇总
数据集介绍
UlrikKoren/GreatShoes_PII_Dataset 数据集图片
构建方式
在自然语言处理与隐私保护交叉领域,个人可识别信息(PII)的自动脱敏技术日益受到关注。为此,研究者构建了GreatShoes PII Dataset,一个面向客户服务场景的合成数据集。该数据集以虚构鞋业品牌“Great Shoes”为背景,模拟了顾客与客服之间的多轮对话交互。每条对话记录中嵌入了姓名、订单号、电话号码、地址和电子邮件等多种类型的PII元素。数据集以CSV格式存储,主要文件GreatShoes_PII_Dataset.csv包含客户消息与客服回复的序列,而pii_used_in_finetune.csv则按索引列出每条记录中出现的具体PII内容,为模型训练与评估提供了结构化的标注基础。
特点
该数据集的核心特色在于其高度拟真的合成属性与精细的隐私标注体系。对话内容涵盖了退货咨询、订单查询、尺码更换等典型客户服务场景,使得PII的嵌入方式贴近真实商业交互语境。相较于真实数据,合成数据避免了隐私泄露风险,同时保留了敏感信息的多样性分布。每个条目均通过独立文件精确标注了所包含的PII类型与具体值,支持细粒度的脱敏模型训练与评测。数据集采用CC BY-NC 4.0许可证发布,专为非商业研究与教育目的设计,在推动隐私保护技术发展的同时确保了合规性。
使用方法
该数据集主要服务于PII脱敏模型的微调与性能评估。使用者可加载GreatShoes_PII_Dataset.csv中的对话文本作为模型输入,结合pii_used_in_finetune.csv提供的标签信息,训练序列标注或生成式模型以识别并遮蔽敏感信息。典型应用流程包括将对话拆分为消息对、构建PII实体标签序列,并采用交叉验证方式衡量模型的召回率与精确率。由于数据集规模适中且结构清晰,它适合作为基准测试集,用于对比不同脱敏算法在客服领域的实际效果。研究者亦可将其与真实脱敏数据结合,开展领域迁移与泛化能力分析。
背景与挑战
背景概述
在人工智能驱动的客户服务系统中,个人身份信息(PII)的泄露已成为隐私保护领域的核心挑战。UlrikKoren等人于近年创建的GreatShoes PII Dataset,正是为应对这一需求而设计的合成数据集。该数据集模拟了一家虚构鞋店“Great Shoes”的客服交互场景,嵌入了姓名、订单号、电话号码、地址和电子邮件等多类敏感信息。研究团队通过构建真实感十足的对话文本,旨在为PII脱敏模型的评估与微调提供标准化基准。该数据集的出现,不仅填补了客服场景下PII标注数据的空白,还为隐私保护技术的可复现研究奠定了重要基础,在自然语言处理与数据安全交叉领域产生了显著影响力。
当前挑战
该数据集所面临的挑战主要体现在两个层面。首先,在领域问题层面,PII脱敏任务的核心难点在于如何精准识别并遮蔽对话中形态多样的敏感信息,例如不同语言习惯下的姓名表达、非标准格式的订单号或嵌入自然语句中的电话号码,这对模型的上下文理解能力提出了极高要求。其次,在构建过程中,研究团队需平衡合成数据的真实性与多样性,避免因过度简化而导致模型泛化能力不足;同时,确保多轮对话中PII元素的一致标注与索引关联,也构成了数据质量控制上的技术挑战。
常用场景
经典使用场景
GreatShoes PII Dataset的核心应用场景在于评估与微调面向客服对话系统的个人身份信息(PII)脱敏模型。该数据集模拟了虚构鞋店“Great Shoes”中客户与客服代理的交互,嵌入了姓名、订单号、电话号码、地址和电子邮件等多种敏感信息。研究者可借助此数据集,训练模型精准识别并擦除对话中的PII,从而在保护用户隐私的同时,维持客服对话的自然流畅性。其设计贴近真实商业场景,为隐私保护技术的验证提供了标准化基准。
衍生相关工作
基于GreatShoes PII Dataset,研究者已衍生出多项经典工作。一方面,该数据集被用于对比不同PII识别架构的性能,如基于BERT的序列标注模型与基于GPT的生成式脱敏方法的优劣;另一方面,它催生了针对多语言PII检测的扩展研究,例如将英文对话数据通过机器翻译扩充为多语种版本,以评估模型的跨语言泛化能力。此外,该数据集还启发了对抗性PII攻击与防御的探索,即通过故意构造含模糊PII的样本,检验模型在极端场景下的鲁棒性。
数据集最近研究
最新研究方向
当前,随着隐私保护法规的日益严格和人工智能在客服系统中的广泛应用,个人可识别信息(PII)的自动脱敏成为自然语言处理领域的前沿热点。GreatShoes PII Dataset 作为一项精心构建的合成数据集,聚焦于模拟真实电商客服对话中的敏感信息识别与移除任务,为研究基于大语言模型的隐私保护技术提供了标准化评估基准。该数据集涵盖姓名、订单号、电话、地址及邮箱等多类PII,其多轮对话结构更贴合实际应用场景,推动模型在上下文感知的PII检测与精准脱敏方面取得突破。这一资源不仅有助于提升AI系统的合规性与用户信任,还促进了跨学科合作,在数据安全与对话智能的交叉领域开辟了新的探索路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务