synthworld-benchmarks
收藏资源简介:
SynthWorld Frozen Benchmarks 是一个确定性的、连接的合成身份图谱数据集,专门设计用于测试和评估隐私保护、个人身份信息(PII)提取、实体解析以及暴露分析系统,其核心优势在于完全无需使用任何真实人物的数据。该数据集构建了一个由10个合成角色(personas)组成的微型社会网络,这些角色通过9条有明确证据支持的关系边(如家庭、同事、同学、邻居、社交关系)相互连接,形成一个完整的身份图谱。与常见的句子级PII语料库不同,本数据集强调记录间的关联性,为评估系统在复杂、关联场景下的性能提供了基础。数据集严格遵循产品安全设计原则,将公开的、可供系统处理的输入数据(如62个产品安全的PII提取页面、18个原始身份记录)与包含真实标签和答案的评估密钥物理分离,确保了评估的公正性。所有数据均为机械生成的、明确标记为虚假的合成数据,例如使用保留域名‘example.test’的邮箱、虚构的‘555-01xx’区号电话号码、位于‘Testville’的示例地址以及带有无效校验和的国家标识符,从根本上杜绝了隐私泄露风险。数据集适用于多种自然语言处理和隐私计算任务,主要包括:精确跨度的PII提取、对抗性实体解析、关系识别与证据覆盖评估以及风险校准。数据集规模较小(样本数少于1K),以JSON和JSONL格式提供,并可通过Hugging Face Datasets库便捷加载其不同配置,如‘personas’(角色信息)、‘relationships’(关系图谱)、‘public_extraction_pages’(PII提取公开页面)等。
SynthWorld Frozen Benchmarks is a deterministic, connected synthetic identity graph dataset specifically designed for testing and evaluating privacy protection, Personally Identifiable Information (PII) extraction, entity resolution, and exposure analysis systems, with the core advantage of not using any real person data. The dataset constructs a micro social network consisting of 10 synthetic personas, connected by 9 relationship edges with clear evidence (such as family, colleague, classmate, neighbor, and social relationships), forming a complete identity graph. Unlike common sentence-level PII corpora, this dataset emphasizes the correlation between records, providing a foundation for evaluating system performance in complex, interconnected scenarios. It strictly adheres to product safety design principles, physically separating publicly available input data (e.g., 62 product-safe PII extraction pages, 18 raw identity records) from evaluation keys containing ground truth labels and answers, ensuring fair evaluation. All data is mechanically generated, explicitly labeled as fake synthetic data, such as emails using the reserved domain example.test, fictional phone numbers with area code 555-01xx, example addresses in Testville, and national identifiers with invalid checksums, fundamentally eliminating privacy leakage risks. The dataset is suitable for various natural language processing and privacy computing tasks, including precise-span PII extraction, adversarial entity resolution, relationship identification and evidence coverage evaluation, and risk calibration. It has a small scale (fewer than 1K samples), is provided in JSON and JSONL formats, and can be easily loaded via the Hugging Face Datasets library with different configurations, such as personas (persona information), relationships (relationship graph), and public_extraction_pages (PII extraction public pages).
数据集概述:SynthWorld Frozen Benchmarks
SynthWorld Frozen Benchmarks 是一个用于测试隐私保护、PII 提取、实体解析和暴露分析系统的确定性、连通的合成身份图基准数据集。该数据集完全由合成数据构成,不包含任何真实个人信息。
核心特征
- 数据真实性:所有记录均明确标记为合成数据,确保无真实人物信息。
- 数据连通性:数据集中的人设构成一个连通的社会网络,包含显式的关系图(如家庭、同事、同学、邻居、社交关系),每条关系边都附带支持证据。
- 公共输入与答案分离:每个基准测试家族都将产品安全的公共输入与评估者专用的答案密钥物理隔离,确保评估的公正性。
数据规模与配置
- 数据规模:
n<1K(少于1000条记录) - 语言:英语 (en)
- 许可证:Apache-2.0
- 任务类别:Token 分类 (token-classification)
- 数据集配置 (configs):
personas:人设信息relationships:关系信息public_extraction_pages:公共 PII 提取页面extraction_answers:PII 提取答案密钥public_identity_records:公共身份记录
数据集结构
数据集包含两个主要目录:
frozen/目录:权威的、经过 SHA-256 校验的基准文件,与 Python 包内部文件字节一致。包含以下核心文件:golden-v1.json:暴露语料库,包含 10 个人设、9 条关系边及每个人的脚本化暴露历史。extraction-public-golden-v1.json&extraction-answer-golden-v1.json:精确跨度 PII 提取基准,包含 62 个产品安全页面和对应的答案密钥。connection-golden-v1.json&connection-public-golden-v1.json:对抗性实体解析基准,包含 18 条原始身份记录。risk-public-golden-v1.json&risk-answer-golden-v1.json:风险校准案例。
viewer/目录:JSONL 格式的投影文件,用于数据集查看器渲染表格,并非权威文件。
使用方式
-
浏览数据:可使用 🤗 Datasets 库加载,例如: python from datasets import load_dataset pages = load_dataset("Bluntmachetti7/synthworld-benchmarks", "public_extraction_pages")
-
评估系统:从 v0.8.0 版本开始,可使用 Python 包
idcognito-synthworld中的统一评估 SDK 进行评分,支持extraction、entity-resolution、relationship、risk等任务。 -
重新生成:可使用生成器从源头重新生成,支持自定义规模: bash synthworld generate --seed 20260719 --persona-count 100 --output world.json
生成与校验
- 数据集由 SynthWorld 生成器 生成,使用种子
20260719,包含 10 个人设,并经过 SHA-256 认证。 - 生成器的 CI 系统会在每次提交时重新生成数据集,确保字节完全一致,从而实现跨时间、跨系统的分数可比性。
数据安全性
- 所有合成数据均设计有明显的虚假特征:
- 每个对象带有
synthetic: true标记。 - 电子邮箱使用保留域名
example.test。 - 电话号码位于虚构的北美
555-01xx号码段。 - 地址位于示例街道、
Testville城市,邮政编码00000,国家ZZ。 - 国家身份证件以
SYN-为前缀,并带有无效校验和。
- 每个对象带有
链接




