遇见数据集

Animarium

收藏
arXiv2026-08-27 更新2026-08-29 收录
官方服务:

资源简介:

Animarium是一个开放、可复现的意大利城市合成人口数据集,由博洛尼亚大学创建,基于ISTAT发布的人口普查与登记表、市政开放数据等公开聚合数据生成。该数据集涵盖11个意大利城市,包含1,814,317名个体与887,937个家庭,每个个体拥有最多九项人口统计属性(通过最大熵联合模型生成)、23项态度与健康变量(完整向量来自真实调查受访者)、精确到普查区段的年龄与地址,以及受家庭规模分布约束的家庭结构。创建过程采用确定性流水线,分为四个环:联合模型训练、整向量捐赠、空间分配与家庭组装,可在单台工作站上33分钟内完全复现。数据集旨在为城市模拟、人口统计研究及大语言模型驱动的仿真提供无隐私风险的合成人口基底,避免使用真实个人数据。

Animarium is an open, reproducible synthetic urban population dataset created by the University of Bologna, generated from publicly aggregated data including census and registration records published by ISTAT and municipal open data. This dataset covers 11 Italian cities, containing 1,814,317 individuals and 887,937 households. Each individual has up to nine demographic attributes (generated via a maximum entropy joint model), 23 attitudinal and health variables (complete vectors derived from real survey respondents), age and address precise down to the census tract level, and household structure constrained by household size distributions. The creation process adopts a deterministic pipeline divided into four cycles: joint model training, whole vector donation, spatial allocation, and household assembly, which can be fully reproduced on a single workstation within 33 minutes. This dataset aims to provide a privacy-preserving synthetic population base for urban simulation, demographic research, and large language model (LLM)-driven simulations, avoiding the use of real personal data.

提供机构:
博洛尼亚大学
创建时间:
2026-08-27
原始信息汇总

数据集概述

基本信息

  • 标题:Animarium synthetic population dataset — technical report v1.0
  • 资源类型:报告(Report)
  • 发布者:Zenodo
  • DOI:10.5281/zenodo.22127581
  • 版本:v1
  • 发布日期:2026年8月27日
  • 许可证:Creative Commons Attribution 4.0 International

作者/贡献者

  • DEGLI ESPOSTI, MIRKO(研究员)
  • 所属机构:博洛尼亚大学(University of Bologna)

数据集描述

该数据集包含11个 pop.parquet 文件(处于公共领域,无姓名、无地址,坐标按分区随机化)以及两个JSON支持文件。这些文件由GSP生成,供Animarium使用。

文件信息

  • 文件名:animarium_dataset_report_v1.0.tar.gz
  • 文件大小:35.8 MB
  • MD5校验值:8a303af0bfa567c6be8efc2016b8dc11

关联作品

  • 衍生自:软件,DOI 10.5281/zenodo.22127410
  • 补充于:软件,DOI 10.5281/zenodo.22127473

使用统计

  • 总浏览量:3
  • 总下载量:0
  • 总数据量:0字节

引用格式示例

DEGLI ESPOSTI, M. (2026). Animarium synthetic population dataset — technical report v1.0. Zenodo. https://doi.org/10.5281/zenodo.22127581

搜集汇总
数据集介绍
Animarium 数据集图片
构建方式
Animarium数据集通过一个开放、可复现的流水线构建,以意大利国家统计局(ISTAT)的官方汇总数据为基础,覆盖十一个意大利城市的合成人口。其构建过程采用四环架构:第一环利用最大熵模型,在人口普查和登记数据的多维度约束下,生成包含九个人口统计属性的联合分布并抽样;第二环从ISTAT的公共微观数据(AVQ)中完整捐赠23个态度与健康变量,并通过分层抽样保证内部相关性;第三环将个体精确分配到人口普查区、单一年龄和地址,利用最大余数法确保确定性;第四环根据家庭规模分布和调查数据构建家庭结构。整个流水线从三个数据入口(SDMX、区域基础数据、市政开放数据)获取输入,所有源数据均经过注册、指纹验证和许可认证,确保可复现性和透明度。
特点
Animarium数据集的特点在于其高度的可复现性、严格的隐私保护和透明的数据溯源。流水线采用确定性算法,可从固定提交的代码逐字节重现所有输出,保证任何人在相同条件下能获得完全一致的结果。隐私方面,合成个体不包含真实个人信息,姓名和地址由程序化生成且保证碰撞性,坐标在普查区内随机化,符合公开数据使用规范。数据集的每个属性都有明确的来源声明,区分真实统计值、捐赠向量和派生信息,并通过四环架构清晰记录每个数据的生成方式和限制。此外,内置质量评估指标,如Kish有效样本量和基于零假设的z分数,确保统计推断的可靠性。
使用方法
Animarium数据集可通过多种方式使用。用户可通过其依赖无关的网页查看器进行交互式探索,该查看器支持基于URL的视图状态保存,便于引用和分享。数据集以开源格式(Parquet)提供,可下载并通过DuckDB等工具进行高效查询分析,适用于研究意大利城市的人口结构、社会经济学特征和空间分布。此外,数据集的叙事层可为LLM驱动的模拟生成个体档案,支持可控的社会实验,如验证信任水平对模拟个体行为的影响。使用时应尊重数据的隐私限制,避免将合成数据与实际个体关联,并参考官方文档了解每个属性的生成方法和适用场景。
背景与挑战
背景概述
Animarium数据集诞生于2026年,由博洛尼亚大学物理与天文学系的Mirko Degli Esposti主导构建,旨在生成意大利城市的高保真合成人口。该数据集覆盖十一个市镇,包含超过181万个体及88.8万户家庭,其核心创新在于仅基于公开聚合数据源——包括ISTAT普查与登记表、人口普查分区统计、国家地址登记册及六市开放数据门户——通过四环架构(最大熵联合模型、调查数据整向量捐赠、子市镇定位、家庭结构组装)实现端到端可复现的合成。该工作回应了社会模拟、流行病学及公共政策领域中对于高分辨率、隐私安全且可验证合成人口的需求,其影响力体现在字节级确定性复现能力(33分钟生成全部市镇)与开放许可(CC-BY-4.0)上,为相关研究提供了透明且可靠的基准数据。
当前挑战
Animarium面对的挑战首先在于源数据本身的深层复杂性:ISTAT各表在编码、时间参考及语义上存在显著差异(如登记表与普查表看似相差一年实则同一时刻),且部分表格缺乏子市镇级别的关键变量(如教育、职业状况的地理分布),需通过设计约束集时精确区分“无约束”与“禁止为零”的单元格,否则极易导致模型系统性偏差。构建过程中,数据获取受限于API速率(约4次/分钟)与异常值处理(如帕尔马家庭人数出现319的极端值);多源数据整合需应对许可证差异、陈旧数据(如Reggio 2013年的国籍表)及分类错误(如将“捷克共和国”误判为洲名)。此外,确保合成人口在统计上忠实于真实分布的同时,必须消除任何个人可识别风险,这要求所有属性来源明确声明,并采用最大熵方法避免种子偏差。最终,字节级可复现性与跨硬件一致性之间的张力(浮点运算差异)亦是亟待解决的长期挑战。
常用场景
经典使用场景
Animarium数据集的核心应用场景在于为意大利城市构建高精度、可复现的合成人口。该数据集基于官方统计源(如ISTAT)和公开数据,通过最大熵模型与数据捐赠等先进技术,生成多达九项人口统计属性、二十三项态度与健康变量的细粒度人群。其数据覆盖了从城市到街区、家庭到个人的完整层级,为城市模拟、流行病传播建模、交通规划及社会政策评估提供了基础数据支撑。尤其对于涉及个体行为的微观模拟,Animarium提供了无隐私风险且兼具真实统计结构的合成人口,使得研究者能够在可控条件下进行实验,从而成为城市计算与社会仿真领域不可或缺的基准数据资源。
解决学术问题
该数据集首先解决了合成人口生成中真实性与隐私保护的矛盾,通过严格的数据来源认证与披露控制,实现了可复现且无个人信息的替代数据。其次,它攻克了传统IPF等种子法在零细胞问题上的局限,采用最大熵分布确保了统计一致性与边际约束的精确吻合,显著提升了数据的科学严谨性。此外,Animarium为跨领域研究提供了将统计属性与态度、健康等细化指标相结合的综合视角,支持了社会科学中的因果推断、行为建模等复杂学术议题,推动了计算社会科学在城市尺度上的研究规范化与实证化进程。
衍生相关工作
Animarium的发布催生了一系列衍生研究工作。在方法论上,其最大熵求解器被独立开发并用于更大规模的状态空间拟合,推动了合成人口生成技术在计算效率与精度上的提升。在应用层面,研究人员利用该合成人群进行基于LLM的智能体仿真,探索在可控条件下模拟居民态度与行为反应的机制,并通过预注册实验验证了平台的稳定性和可调节性。同时,该数据集也被用作基准,用以评估不同人口合成算法在保留统计特征方面的效能,并促进了针对合成数据质量评估标准的讨论,为未来标准化、开放式的人口数据构建和使用提供了重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务