遇见数据集

t22000t/anonymization-before-after

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个小型配对表格数据集,展示了相同记录在10步匿名化流程前后的对比。数据集包含两个配置:raw(原始数据)和anonymized(匿名化后数据)。原始数据包含500行、16列,其中包含合成个人身份信息(PII),如姓名、电子邮件、电话号码和国家ID,但这些信息完全是模板化生成的,不代表任何真实个体。匿名化后数据包含339行、10列,通过删除直接标识符和指纹列、对年龄进行分箱、对区域进行类别合并(保留前6个,其余归为其他)、对数值字段注入乘性噪声、对日期进行HMAC确定性偏移等操作,实现了k-匿名性(k≥5)。该数据集可用于隐私概念教学、匿名化工具包基准测试、红队/成员推理实验的验证输入,以及合成数据生成器的完整性检查。数据集基于MIT许可证发布。

A small paired tabular dataset showing the same records before and after a 10-step anonymization pipeline. It includes two configurations: raw (original data) and anonymized (anonymized data). The raw data contains 500 rows and 16 columns with synthetic personally identifiable information (PII), such as names, emails, phone numbers, and national IDs, all generated from templates and not representing any real individuals. The anonymized data contains 339 rows and 10 columns, achieved by removing direct identifiers and fingerprint columns, banding age into ranges, collapsing rare region categories to Other (top-6 kept), injecting multiplicative noise into numeric fields, applying HMAC-deterministic offsets to dates, and enforcing k-anonymity (k≥5). The dataset is useful for teaching privacy concepts, benchmarking anonymization toolkits, sanity-checking inputs for red-team/membership-inference experiments, and validating synthetic data generators. It is released under the MIT license.

提供机构:
t22000t
搜集汇总
数据集介绍
t22000t/anonymization-before-after 数据集图片
构建方式
该数据集为一组精心配对的表格型数据,展示了同一批记录在经历十步匿名化流水线处理前后的状态。原始数据由脚本通过确定性种子生成,包含500条完全合成的记录,其中嵌入了四类直接标识符(如姓名、邮箱)、两类指纹列及若干准标识符与数值字段。匿名化版本则基于配置驱动的工具包,对年龄进行十岁区间分箱处理,将地区字段中频次较低的类别合并为“其他”,对收入和余额分别施加±5%与±3%的乘法噪声,并利用HMAC算法对日期字段施加±7天的确定性偏移。最终通过k-匿名性约束(k≥5)压制了161条无法满足条件的记录,剩余339条记录经确定性随机打乱后输出。
特点
该数据集最显著的特征在于其成对对照的设计,使研究者能够直观审视每条记录在匿名化前后的具体变化。数据规模虽小但结构紧凑,涵盖直接标识符剔除、准标识符泛化、数值加噪、日期扰动以及k-匿名性强制压制等多种主流匿名化操作。特别地,年龄字段由精确数值转化为区间标签,地区字段保留了前六大高频类别并将剩余归入“其他”,这些处理方式真实反映了实际生产环境中泛化与抑制策略的权衡。数据集还保留了信用评分、交易金额等未经变换的字段,为评估不同属性对隐私保护效果的影响提供了对照基础。
使用方法
使用者可通过HuggingFace Datasets库以两行代码分别加载原始与匿名化版本,利用split参数指定所需配置。亦可通过Pandas直接读取CSV文件以便进行更灵活的数据操作。该数据集设计的典型应用场景包括:在隐私课程中用于展示k-匿名性与准标识符泛化的具体实现;作为基准测试集,对比不同匿名化工具包的输出效果;用作成员推断攻击实验的对照素材,通过训练分类器区分原始与匿名化记录来量化残留的标识信号;以及作为合成数据生成器的验证基准,检验生成数据在相同模式下的分布一致性。
背景与挑战
背景概述
Anonymization Before/After数据集由Timothy Mun于2026年创建,源自其开发的data-anonymization-toolkit项目,旨在为隐私保护研究提供教学与基准测试资源。该数据集包含500条合成记录及其经10步匿名化流水线处理后的339条对应结果,核心解决k-匿名化、准标识符泛化与直接标识符抑制等隐私保护技术的可复现验证问题。通过呈现原始数据与匿名化数据的成对对比,该数据集成为隐私课程的教学范例、匿名化工具包的基准测试输入以及针对成员推理攻击的红队测试平台,在数据隐私领域具有重要参考价值。
当前挑战
该数据集面临的挑战包括:1) 领域问题层面,需要应对数据发布中个人身份信息泄露的风险,在保留数据可用性的同时确保满足k-匿名化(k≥5)的隐私保护标准;2) 构建过程中,需处理直接标识符的识别与删除、准标识符的泛化策略(如年龄分箱、地区稀有类别合并为“Other”)、数值字段的噪声注入(收入±5%、余额±3%)、日期的HMAC扰动(±7天)以及k-匿名化实施中161条记录的抑制问题,最终还需平衡隐私保护强度与数据实用性间的权衡。
常用场景
经典使用场景
在隐私保护与数据匿名化的教学与研究中,Anonymization Before/After数据集提供了一种直观的配对结构,通过展示同一批数据在匿名化处理前后的完整变化,成为理解k-匿名性、准标识符泛化、直接标识符抑制等核心概念的绝佳教学样例。数据集包含500条合成个人身份信息(PII)的原始记录与339条匿名化后的记录,对比鲜明地呈现了年龄分箱、地区稀有类别合并、数值字段注入乘性噪声、日期HMAC扰动等10步匿名化管线的具体效果。这种设计使得研究者或学生能够通过单次侧对比,清晰观察到敏感信息如何被系统地削弱。
实际应用
在实际应用层面,该数据集主要服务于三个场景:首先,企业与政府机构的数据治理团队可以利用它作为内部培训素材,让员工直观认识到直接标识符(姓名、邮箱、身份证号)与非直接标识符(年龄、地区、性别)组合推理带来的重识别风险;其次,数据匿名化工具的开发团队能够将其作为回归测试用例,通过将新版本管线的输出与数据集提供的标准匿名化版本进行对比,验证管线修改是否引入缺陷;最后,合成数据生成器的评估流程中,它充当了真实数据分布的参考锚点,辅助生成器在保真度与隐私性之间取得平衡。
衍生相关工作
围绕该数据集衍生的经典工作主要集中于隐私攻击与防御的交叉验证领域。研究者利用其原始与匿名化的配对结构,设计出针对k-匿名性数据的自适应成员推断攻击方法,揭示了即使满足k≥5的匿名化条件,仍可能通过准标识符组合的频次差异泄露成员信息。此外,该数据集催生了一系列针对小样本场景下的隐私效用权衡研究,例如在学术论文中通过其合成PII字段(如模板化姓名与邮箱)的脆弱性,论证了真实PII分布与非真实分布对攻击成功率的影响差异。数据集中“地区”字段因稀有类别合并导致的泛化偏差,也启发了对非均衡准标识符的更精细泛化算法的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务