遇见数据集

microcosm-evaluation

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

Microcosm 跨数据集评估包是一个不可变的前端数据包,用于校准诊断仪表板的跨数据集页面。该数据集包含多个源(模型×数据集对或独立数据集)对同一司法管辖区的 Chronicle 事实进行评分的结果。每个评估结果分区都携带运行 ID、快照 ID 以及记录在 manifest.json 中的 SHA-256 哈希值。数据布局采用 <司法管辖区>/<运行ID>/frontend/ 结构,并通过 <司法管辖区>/latest.json 指向最新运行 ID。以比利时为例,评估源包括 Microcosm-BE v0.4 结合 Axiom 规则引擎、Microcosm-BE v0.4 结合 EUROMOD BE_2025,以及 EUROMOD BE_2025 基于 EU-SILC 的 JRC 国家报告。Microcosm-BE 数据本身由合成比利时人口构成,该人口校准到比利时行政和国民账户目标(Chronicle 事实的总和),调查数据仅用于验证;支持记录来自美国调查捐赠池并经过重新加权,未来的升级计划是使用比利时捐赠池。该数据集适用于跨模型和跨数据集的校准诊断与比较分析。

Microcosm is an immutable frontend data package for cross-dataset evaluation, used for the cross-dataset page of a calibration diagnostic dashboard. The dataset contains results from multiple sources (model×dataset pairs or standalone datasets) scoring Chronicle facts for the same jurisdiction. Each evaluation result partition carries a run ID, snapshot ID, and SHA-256 hash recorded in manifest.json. The data layout follows the structure <jurisdiction>/<runID>/frontend/, with <jurisdiction>/latest.json pointing to the latest run ID. Taking Belgium as an example, evaluation sources include Microcosm-BE v0.4 combined with Axiom rule engine, Microcosm-BE v0.4 combined with EUROMOD BE_2025, and EUROMOD BE_2025 based on EU-SILC JRC national report. The Microcosm-BE data itself consists of a synthetic Belgian population calibrated to Belgian administrative and national account targets (sum of Chronicle facts), with survey data used only for validation; support records come from a US survey donation pool and are reweighted, with future plans to use a Belgian donation pool. This dataset is suitable for cross-model and cross-dataset calibration diagnostics and comparative analysis.

创建时间:
2026-08-24
原始信息汇总

数据集概述

该数据集名为 Microcosm cross-dataset evaluation bundles,由 PolicyEngine 构建,用于校准诊断仪表板的跨数据集页面。其核心内容是将不同来源(模型×数据集组合或独立数据集)针对同一管辖区的 Chronicle 事实进行评分,并打包为不可变的前端资源包。

技术细节

  • 许可证:MIT
  • 资源格式:不可变前端包(cross_dataset.frontend_bundle.v1
  • 构建工具:由 PolicyEngine/calibration-diagnostics 仓库中的 scripts/run_full_chronicle_evaluation.pypublish_cross_dataset_frontend_bundle.py 生成
  • 版本控制:每个分区包含运行 ID、快照 ID 以及记录在 manifest.json 中的 SHA-256 哈希值

目录结构

数据集的布局为:

  • <jurisdiction>/<run_id>/frontend/
  • <jurisdiction>/latest.json(指向当前运行 ID)

当前内容(比利时)

  • 管辖区:比利时
  • 运行 IDevaluation-f28ca06a0b0d2baf13c87f2f
  • 评估来源
    • Microcosm-BE v0.4 × Axiom 规则引擎
    • Microcosm-BE v0.4 × EUROMOD BE_2025
    • EUROMOD BE_2025(基于 EU-SILC 数据,参照 JRC 国家报告)

数据来源说明

Microcosm-BE 为合成比利时人口数据,校准目标为比利时行政数据和国家账户数据(仅为 Chronicle 事实的总和),调查数据仅用于验证。当前支持记录来自美国调查捐赠池,并经过重新加权;计划升级为比利时本地捐赠池。

搜集汇总
数据集介绍
microcosm-evaluation 数据集图片
构建方式
microcosm-evaluation数据集源于PolicyEngine校准诊断流程,经由run_full_chronicle_evaluation.py与publish_cross_dataset_frontend_bundle.py脚本生成不可变前端捆绑包,供校准诊断仪表板的跨数据集页面使用。每个分区均携带运行标识符、快照标识符及记录于manifest.json中的SHA-256校验值,确保数据完整性与可追溯性。数据集按司法管辖区组织,布局为<jurisdiction>/<run_id>/frontend/,同时提供<latest.json>指向最新运行。其构建伊始便纳入多元评估源,如比利时评估集包含Microcosm-BE v0.4适配Axiom规则引擎、同版本适配EUROMOD BE_2025,以及后者基于EU-SILC数据的情景,从而实现对模型与数据集的交叉评分。
特点
该数据集的核心特征在于其跨界评估能力,每一个评估源(模型与数据集配对或独立数据集)均依据相同的Chronicle事实进行评分,确保了评估的公平性与一致性。所有数据不可变,且配套详尽的元数据,包括运行与快照标识符,增强了科学研究的可复现性。此外,其布局设计巧妙,支持多司法管辖区扩展,当前仅含比利时辖区,但结构具备普适性。数据来源详实,如Microcosm-BE基于合成比利时人群,校准至行政与国家账户目标,并注明调查数据仅用于验证,展现了对数据质量的严谨把控。
使用方法
使用时,用户可访问校准诊断仪表板的跨数据集页面,前端自动加载特定司法管辖区的数据。具体而言,通过解析latest.json获取当前运行标识符,进而定向获取frontend捆绑包中的评估结果。开发者也可直接以编程方式访问各分区,解析manifest.json以验证数据完整性,并结合Chronicle事实进行自定义分析或可视化。该数据集格式为前端优化设计,便于快速集成至现有可视化工具,无需复杂后端处理,适合政策模拟与模型比较研究场景。
背景与挑战
背景概述
Microcosm-evaluation数据集由PolicyEngine团队于近期构建,旨在为跨国政策模拟模型提供统一的交叉验证基准。该数据集整合了多种微观模拟引擎(如Axiom规则引擎与EUROMOD)在比利时辖区上的评估结果,并采用不可变前端捆绑包形式,确保评估过程的可复现性与可追溯性。其核心研究问题在于如何通过标准化的事实比对(Chronicle facts),对基于合成人口的政策模型进行系统性的校准与诊断。该数据集的出现填补了政策模拟领域缺乏跨模型、跨数据集统一评估框架的空白,为政策制定者与研究者提供了可靠的模型性能参考,推动了微观模拟模型的透明化与标准化进程。
当前挑战
该数据集所面临的挑战首先源于政策模拟领域的根本难题——模型评估需兼顾合成数据的真实性与行政统计目标的精确匹配,而Microcosm-BE当前采用美国调查数据作为捐赠池并重新加权,缺乏本土比利时人口样本,这引入了潜在的分布偏差。其次,构建过程中需协调多引擎(Axiom、EUROMOD)的异构输出结构与不同版本的快照管理,确保跨数据集的可比性,同时通过SHA-256哈希与清单文件保障数据完整性,但版本迭代与规则更新可能引发评估基准的漂移。最后,数据集的可扩展性亦受限于单一辖区的部署,未来向多辖区推广时,需应对不同国家的数据可得性与法律合规性挑战。
常用场景
经典使用场景
Microcosm-evaluation数据集主要用于跨模型与跨数据集的校准诊断评估。在政策模拟与微观计量经济学领域,研究者常需比较不同规则引擎(如Axiom与EUROMOD)在同一司法管辖区内的模拟结果。该数据集通过提供不可变的前端捆绑包,将各模型与数据集的评分结果标准化,使得研究者能够基于同一组Chronicle事实,对政策效应进行系统性比较与验证。其典型应用场景包括:评估比利时合成人口在行政与国民账户目标下的校准精度,以及对比不同微观模拟模型在税收-福利政策分析中的表现。这一数据集为政策模拟的交叉验证提供了标准化的基础设施,显著提升了评估流程的透明度和可复现性。
实际应用
在实际应用中,Microcosm-evaluation数据集为政府机构、智库及社会政策研究者提供了可靠的政策影响评估工具。借助该数据集,用户可快速对比不同模拟引擎(如基于Axiom规则引擎与EUROMOD)在执行最新税制与福利政策时的结果差异,从而辅助政策制定者预判政策调整对收入分配、贫困率及财政支出的影响。其跨数据集评估能力使得不同数据源(例如欧盟收入与生活条件统计EU-SILC)生成的模拟结果得以相互印证,提升了政策分析的稳健性。该数据集作为校准诊断仪表板的前端数据源,已支持比利时等国家的政策模拟实践,展现了从学术研究到公共决策的转化价值。
衍生相关工作
基于Microcosm-evaluation数据集,后续衍生出了一系列与政策微观模拟校准方法相关的研究工作。例如,研究者利用该数据集评估了合成人口校准技术在行政数据与调查数据融合中的表现,探讨了重加权技术在提高模拟精度方面的潜力,并推动了比利时本土捐赠者池的构建以替代初始的美国调查捐赠者池。此外,该框架启发了其他司法管辖区建立类似的跨模型评估基准,促进了国际间政策模拟模型的比较与改进。这些工作不仅丰富了微观模拟的理论方法,还强化了数据集作为评估基础设施在政策研究共同体中的持续影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务