遇见数据集

synthworld-benchmarks

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

SynthWorld Frozen Benchmarks 是一个确定性的、连接的合成身份图谱数据集,专门设计用于测试和评估隐私保护、个人身份信息(PII)提取、实体解析以及暴露分析系统,其核心优势在于完全无需使用任何真实人物的数据。该数据集构建了一个由10个合成角色(personas)组成的微型社会网络,这些角色通过9条有明确证据支持的关系边(如家庭、同事、同学、邻居、社交关系)相互连接,形成一个完整的身份图谱。与常见的句子级PII语料库不同,本数据集强调记录间的关联性,为评估系统在复杂、关联场景下的性能提供了基础。数据集严格遵循产品安全设计原则,将公开的、可供系统处理的输入数据(如62个产品安全的PII提取页面、18个原始身份记录)与包含真实标签和答案的评估密钥物理分离,确保了评估的公正性。所有数据均为机械生成的、明确标记为虚假的合成数据,例如使用保留域名‘example.test’的邮箱、虚构的‘555-01xx’区号电话号码、位于‘Testville’的示例地址以及带有无效校验和的国家标识符,从根本上杜绝了隐私泄露风险。数据集适用于多种自然语言处理和隐私计算任务,主要包括:精确跨度的PII提取、对抗性实体解析、关系识别与证据覆盖评估以及风险校准。数据集规模较小(样本数少于1K),以JSON和JSONL格式提供,并可通过Hugging Face Datasets库便捷加载其不同配置,如‘personas’(角色信息)、‘relationships’(关系图谱)、‘public_extraction_pages’(PII提取公开页面)等。

SynthWorld Frozen Benchmarks is a deterministic, connected synthetic identity graph dataset specifically designed for testing and evaluating privacy protection, Personally Identifiable Information (PII) extraction, entity resolution, and exposure analysis systems, with the core advantage of not using any real person data. The dataset constructs a micro social network consisting of 10 synthetic personas, connected by 9 relationship edges with clear evidence (such as family, colleague, classmate, neighbor, and social relationships), forming a complete identity graph. Unlike common sentence-level PII corpora, this dataset emphasizes the correlation between records, providing a foundation for evaluating system performance in complex, interconnected scenarios. It strictly adheres to product safety design principles, physically separating publicly available input data (e.g., 62 product-safe PII extraction pages, 18 raw identity records) from evaluation keys containing ground truth labels and answers, ensuring fair evaluation. All data is mechanically generated, explicitly labeled as fake synthetic data, such as emails using the reserved domain example.test, fictional phone numbers with area code 555-01xx, example addresses in Testville, and national identifiers with invalid checksums, fundamentally eliminating privacy leakage risks. The dataset is suitable for various natural language processing and privacy computing tasks, including precise-span PII extraction, adversarial entity resolution, relationship identification and evidence coverage evaluation, and risk calibration. It has a small scale (fewer than 1K samples), is provided in JSON and JSONL formats, and can be easily loaded via the Hugging Face Datasets library with different configurations, such as personas (persona information), relationships (relationship graph), and public_extraction_pages (PII extraction public pages).

创建时间:
2026-07-20
原始信息汇总

数据集概述:SynthWorld Frozen Benchmarks

SynthWorld Frozen Benchmarks 是一个用于测试隐私保护、PII 提取、实体解析和暴露分析系统的确定性、连通的合成身份图基准数据集。该数据集完全由合成数据构成,不包含任何真实个人信息。

核心特征

  • 数据真实性:所有记录均明确标记为合成数据,确保无真实人物信息。
  • 数据连通性:数据集中的人设构成一个连通的社会网络,包含显式的关系图(如家庭、同事、同学、邻居、社交关系),每条关系边都附带支持证据。
  • 公共输入与答案分离:每个基准测试家族都将产品安全的公共输入与评估者专用的答案密钥物理隔离,确保评估的公正性。

数据规模与配置

  • 数据规模n<1K (少于1000条记录)
  • 语言:英语 (en)
  • 许可证:Apache-2.0
  • 任务类别:Token 分类 (token-classification)
  • 数据集配置 (configs):
    • personas:人设信息
    • relationships:关系信息
    • public_extraction_pages:公共 PII 提取页面
    • extraction_answers:PII 提取答案密钥
    • public_identity_records:公共身份记录

数据集结构

数据集包含两个主要目录:

  1. frozen/ 目录:权威的、经过 SHA-256 校验的基准文件,与 Python 包内部文件字节一致。包含以下核心文件:
    • golden-v1.json:暴露语料库,包含 10 个人设、9 条关系边及每个人的脚本化暴露历史。
    • extraction-public-golden-v1.json & extraction-answer-golden-v1.json:精确跨度 PII 提取基准,包含 62 个产品安全页面和对应的答案密钥。
    • connection-golden-v1.json & connection-public-golden-v1.json:对抗性实体解析基准,包含 18 条原始身份记录。
    • risk-public-golden-v1.json & risk-answer-golden-v1.json:风险校准案例。
  2. viewer/ 目录:JSONL 格式的投影文件,用于数据集查看器渲染表格,并非权威文件。

使用方式

  • 浏览数据:可使用 🤗 Datasets 库加载,例如: python from datasets import load_dataset pages = load_dataset("Bluntmachetti7/synthworld-benchmarks", "public_extraction_pages")

  • 评估系统:从 v0.8.0 版本开始,可使用 Python 包 idcognito-synthworld 中的统一评估 SDK 进行评分,支持 extractionentity-resolutionrelationshiprisk 等任务。

  • 重新生成:可使用生成器从源头重新生成,支持自定义规模: bash synthworld generate --seed 20260719 --persona-count 100 --output world.json

生成与校验

  • 数据集由 SynthWorld 生成器 生成,使用种子 20260719,包含 10 个人设,并经过 SHA-256 认证。
  • 生成器的 CI 系统会在每次提交时重新生成数据集,确保字节完全一致,从而实现跨时间、跨系统的分数可比性。

数据安全性

  • 所有合成数据均设计有明显的虚假特征:
    • 每个对象带有 synthetic: true 标记。
    • 电子邮箱使用保留域名 example.test
    • 电话号码位于虚构的北美 555-01xx 号码段。
    • 地址位于示例街道、Testville 城市,邮政编码 00000,国家 ZZ
    • 国家身份证件以 SYN- 为前缀,并带有无效校验和。

链接

搜集汇总
数据集介绍
synthworld-benchmarks 数据集图片
构建方式
SynthWorld Frozen Benchmarks 通过确定性的合成身份图生成器构建,采用种子 `20260719` 以十个人物为基准,生成具有真实答案密钥的关联记录。每个身份形成一个连通的社交网络,包含明确的关系边(如家庭、同事、同学、邻居和社交关系),每条边都携带支持其存在的具体证据。为确保可复现性,生成器在每次提交时通过 SHA-256 摘要验证数据完整性,确保字节级一致性。数据集被划分为多个配置,包括人物画像、关系、公共提取页面、提取答案和公共身份记录,分别存储为 JSONL 文件。
特点
该数据集的核心特点在于其所有记录均带有显式的 `synthetic: true` 标记,并使用保留域名和无效校验码确保数据不可用于真实身份识别。每条记录在构建时被设计为无可争议的虚假数据,包含虚构的地址、电话号码和国家标识符。此外,数据集将公共输入与评估密钥物理分离,例如提取答案和风险答案均单独存储,保证了基准测试的客观性和安全性。这种设计使得系统在评估时仅能访问公共部分,而评分阶段则通过密钥进行对比,有效避免了数据泄露风险。
使用方法
用户可通过 Hugging Face `datasets` 库直接加载观览格式的 JSONL 分片,例如使用 `load_dataset('public_extraction_pages')` 获取公共页面及其对应的提取答案。对于权威评估,建议下载 `frozen/` 目录下的字节精确文件,并通过 SHA-256 校验确保完整性。生成器包 `idcognito-synthworld` 提供了统一的评估 SDK,支持提取、实体解析、关系和风险等任务,通过 `synthworld evaluate` 命令向系统输入预测结果并获取精确的 F1 分数、B-cubed 指标和边缘覆盖率等评估报告。
背景与挑战
背景概述
SynthWorld Frozen Benchmarks是由Idcognito贡献者于2026年创建的一套确定性合成身份图谱基准测试集,旨在为隐私保护、个人可识别信息(PII)提取、实体解析及暴露分析系统的评估提供可靠且可复现的黄金标准。该数据集通过生成器从种子`20260719`以十个人物为规模生成,并经过SHA-256哈希验证以确保字节级一致性。每个合成记录均携带显式标记(如`example.test`域名的邮箱、`555-01xx`的电话号码及无效校验和的标识符),从根本上杜绝了与真实个人的关联。该基准将产品安全的公共输入与评估员专用的答案密钥物理分离,支持精确跨度F1、成对B-cubed及边缘F1等多维度指标,为合成数据在隐私评估领域的应用提供了严谨的测试框架。
当前挑战
该数据集面临的挑战涵盖多层面。在领域问题层面,现有PII数据集多局限于句子级标注,缺乏对身份图谱中复杂关联(如家庭、同事、邻居等多类关系)的建模,且真实数据存在隐私泄露与去匿名化风险。SynthWorld通过构建连接的社会关系图谱并附上明确证据边,解决了实体解析与暴露分析中缺乏结构化黄金答案的难题。在构建过程中,挑战包括设计机械性安全机制(如类型系统强制执行无效校验和与保留域名),确保数据100%可鉴别为伪造;维护公共输入与答案密钥的物理分离以保障评估公平性;以及通过CI流水线实现字节级确定性再生,防止基准漂移,确保跨时间与系统的可比较性。
常用场景
经典使用场景
SynthWorld Frozen Benchmarks专为隐私保护研究中关键任务的标准化评估而设计。其最经典的用法在于为PII(个人可识别信息)抽取、实体消歧、关系图谱推理及暴露风险分析提供确定性合成身份图谱。每个记录都包含经过验证的ground-truth答案键,使得研究者能够在无真实隐私数据风险的前提下,精确评测系统在精确跨度抽取、对抗性实体匹配、关系边证据覆盖及风险校准等核心任务上的表现。这些基准支持使用统一SDK进行任务化评估,并通过SHA-256校验确保跨时间与系统的得分可比性。
实际应用
实际应用中,SynthWorld为隐私合规与信息保护技术的落地提供了安全的测试沙箱。开发者可借助其生成器按需扩展合成世界规模,评估企业内部PII检测系统、数据脱敏流水线或身份解析服务的精确率与召回率。金融、医疗等强隐私行业可将其用作红队测试工具,在无任何真实人员数据泄露的环境下验证系统抵御链接攻击与身份推断的能力。此外,其产物被用作AI服务提供商的内部评估金标准,确保隐私保护功能在持续迭代中不退化。
衍生相关工作
基于SynthWorld的构建范式,已涌现多项提升隐私基准可靠性的经典工作。其确定性生成策略启发了一系列用于评估大型语言模型记忆与泄露风险的合成身份图谱。此外,该数据集促进了面向隐私任务的对抗性鲁棒性研究,衍生出专门针对PII抽取系统的后门攻击与防御方法论。其“机械安全”设计哲学更影响了对合成数据在公平性与偏见审计中的规范使用。SynthWorld的公开基线亦成为社区验证新型隐私度量指标之有效性的重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务