zaggr-data
收藏资源简介:
荷兰执法实体解析基准数据集是一个专为实体解析和记录链接研究设计的合成基准数据集,模拟了荷兰及欧盟/欧洲经济区执法数据的真实模式。所有数据均为100%合成,不包含任何真实个人、车辆或犯罪历史信息,确保无隐私或法律问题。数据集基于真实世界的数据模式(如荷兰商会注册、人口基础注册、SIS II规范等)生成,并结合荷兰中央统计局(CBS)的真实人口统计数据,注入了多种错误模式以模拟荷兰及跨申根身份数据的特定挑战。 数据集包含三个主要部分: 1. **KvK董事记录**:模拟荷兰商会注册数据,包含公司董事信息,重点处理荷兰名字前缀(如'van', 'de')的变体和地址漂移问题。 2. **SIS II通缉和失踪人员记录**:基于申根信息系统II(SIS II)的模式,处理跨申根别名对、名字顺序差异、罗马化变体和非拉丁脚本别名等挑战。 3. **ANPR车辆通行记录**:模拟荷兰高速公路自动车牌识别(ANPR)数据,主要解决OCR单字符混淆问题(如0与O、1与I等)。 数据集规模从约8,984到50,000条记录不等,每个子集均包含真实匹配对和错误模式标注。未来计划添加更多数据集,如人口注册、刑事记录等。数据文件为UTF-8编码的CSV格式,采用CC BY 4.0许可证发布。
The Dutch Law Enforcement Entity Resolution Benchmark Dataset is a synthetic benchmark dataset designed specifically for entity resolution and record linkage research, simulating the real-world patterns of law enforcement data from the Netherlands and the EU/European Economic Area (EEA). All data is 100% synthetic, containing no real personal, vehicle, or criminal history information, thus eliminating any privacy or legal risks. The dataset is generated based on real-world data schemas (e.g., Dutch Chamber of Commerce registrations, Basic Registration of Persons, SIS II specifications, etc.), combined with real demographic data from Statistics Netherlands (CBS), and incorporates various error patterns to mimic specific challenges faced by Dutch and cross-Schengen identity data. The dataset comprises three core components: 1. **KvK Director Records**: Simulates Dutch Chamber of Commerce (KvK) registration data, containing corporate director information, with a focus on addressing variations of Dutch name prefixes (e.g., 'van', 'de') and address drift issues. 2. **SIS II Wanted and Missing Persons Records**: Built upon the schema of the Schengen Information System II (SIS II), this component tackles challenges including cross-Schengen alias pairs, discrepancies in name order, romanization variants, and aliases in non-Latin scripts. 3. **ANPR Vehicle Passage Records**: Simulates Dutch highway automatic number plate recognition (ANPR) data, primarily addressing OCR single-character confusion problems (e.g., 0 vs. O, 1 vs. I, etc.). The dataset size ranges from approximately 8,984 to 50,000 records, with each subset containing genuine matching pairs and annotated error patterns. Future plans involve expanding the dataset with additional resources such as population registries and criminal records. All data files are stored in UTF-8 encoded CSV format and released under the CC BY 4.0 license.
Dutch Law Enforcement Entity Resolution Benchmark 数据集概述
数据集基本信息
- 许可证: CC BY 4.0
- 支持语言: 荷兰语、英语、阿拉伯语、土耳其语
- 标签: 实体解析、记录链接、去重、执法、荷兰、荷兰人名、ANPR、SIS II、合成数据
- 数据集名称: Dutch Law Enforcement Entity Resolution Benchmark
- 规模: 100K < n < 1M
- 任务类别: 其他
数据集简介
这是一个用于实体解析和记录链接研究的合成基准数据集集合,基于真实的荷兰及欧盟/欧洲经济区执法数据模式建模。所有数据均为100%合成,不包含任何真实个人信息。
数据集构成
1. KvK Director Records
- 描述: 基于荷兰商会公司董事注册数据。同一人常注册多家公司,导致姓名变体、格式差异和地址漂移。
- 文件:
phase-01/kvk/kvk_director_flat.csvphase-01/kvk/ground_truth_pairs.csv
- 规模: 约10,000条记录,约3,600对真实匹配对。
- 关键字段:
kvkNummer、voornamen、tussenvoegsel、achternaam、geboortedatum、postcode等。 - 注入的错误模式: 中缀变体、缩写名、大小写和空格不一致、地址漂移。
2. SIS II Wanted and Missing Persons
- 描述: 基于申根信息系统II(SIS II)第26条(通缉人员)和第36条(失踪人员)模式的人员记录。核心挑战是跨申根地区的别名匹配。
- 文件:
phase-01/sis/sis_persons.csvphase-01/sis/ground_truth_alias_pairs.csv
- 规模: 约8,984条记录,约3,984对真实匹配对。
- 关键字段:
sis_id、categorie、voornamen、achternaam、alias_namen、geboortedatum、nationaliteit等。 - 注入的错误模式: 姓名顺序颠倒、罗马化变体、估计出生日期、非拉丁文字别名。
3. ANPR Vehicle Passages
- 描述: 基于荷兰自动车牌识别摄像头数据的高速公路通行事件。主要挑战是单字符OCR混淆。
- 文件:
phase-01/anpr/anpr_passages.csvphase-01/anpr/ground_truth_vehicle_pairs.csv
- 规模: 约50,000条记录,约2,490对真实匹配对。
- 关键字段:
passage_id、tijdstip、camera_id、kenteken、kenteken_betrouwbaarheid、snelheid_kmh等。 - 注入的OCR混淆对:
0<->O、1<->I、8<->B、5<->S、2<->Z。
数据生成特点
- 模式来源: 基于真实世界模式(如荷兰商会注册、人口登记、SIS II规范、荷兰ANPR数据流)。
- 人口统计分布: 使用荷兰中央统计局(CBS)的真实人口统计数据。
- 姓名分布构成:
- 荷兰语: ~55%
- 摩洛哥/阿拉伯语: ~20%
- 土耳其语: ~12%
- 其他: ~13%
文件格式
所有文件均为UTF-8编码的CSV格式,包含标题行。真实匹配文件均包含is_match列和match_type列。
许可证与引用
- 许可证: CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/)
- 引用方式: Dutch Law Enforcement Entity Resolution Benchmark (synthetic), arsalan-anwari, 2025




