遇见数据集

populace-us

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

populace-us 是一个为 PolicyEngine-US 税收福利微模拟模型构建的校准合成微观数据集。该数据集完全从主要调查和管理数据源构建,其中增强型当前人口调查(CPS)仅用作评估基准,而非构建输入。数据集以 HDF5 格式(USSingleYearDataset)每年发布,包含 308 个存储列,所有列均携带有效信号(没有全零列)。数据来源包括:人口普查 CPS ASEC(用于家庭结构、人口统计、收入、福利等)、IRS SOI 公共使用文件(用于税收细节)、美联储 SCF(用于财富数据)、人口普查 SIPP(用于小费收入、车辆信息)、CPS-ORG(用于小时工资、工会覆盖情况)、MEPS-IC 参数(用于雇主保险保费)以及人口普查 ACS(用于租金数据)。数据通过权重感知的分位数森林模型进行插补,并校准到包含 3,704 个 IRS/人口普查/项目目标的行政目标表面,同时施加严格的每记录权重边界。该数据集旨在作为增强型 CPS 的 API 兼容替代人口数据集,具有自己的校准权重、优势与已知差距(例如净财富略高、投资利息支出较薄)。适用于税收政策分析、福利项目模拟、收入与财富分布研究等微模拟任务。

populace-us is a calibrated synthetic micro-dataset built for the PolicyEngine-US tax-benefit microsimulation model. The dataset is constructed entirely from primary survey and administrative data sources, with the Enhanced Current Population Survey (CPS) used only as an evaluation benchmark, not as a construction input. It is released annually in HDF5 format (USSingleYearDataset), containing 308 stored columns, all carrying valid signals (no all-zero columns). Data sources include: Census CPS ASEC (for family structure, demographics, income, benefits, etc.), IRS SOI Public Use Files (for tax details), Federal Reserve SCF (for wealth data), Census SIPP (for tip income, vehicles), CPS-ORG (for hourly wages, union coverage), MEPS-IC parameters (for employer insurance premiums), and Census ACS (for rent). Data is imputed via a weight-aware quantile forest model and calibrated to an administrative target surface comprising 3,704 IRS/Census/program targets, with strict per-record weight bounds enforced. The dataset is designed as an API-compatible alternative population dataset to the enhanced CPS, with its own calibration weights, strengths, and known gaps (e.g., slightly higher net wealth, thinner investment interest expense). It is suitable for microsimulation tasks such as tax policy analysis, benefit program simulation, and income and wealth distribution research.

创建时间:
2026-06-11
原始信息汇总

数据集概述:populace-us

populace-us 是一个为 PolicyEngine-US 构建的校准合成微观数据集,完全由一手来源构建,仅将增强版 CPS 作为评分基准,而非构建输入。该数据集可作为增强版 CPS 的 API 兼容替代方案,并拥有自身校准权重。


主要特性

  • 许可协议:MIT
  • 用途:微观模拟、税收福利分析
  • 适用地区:美国

数据构建

每个年份对应一个独立的 HDF5 文件(USSingleYearDataset)。各数据层来源如下:

数据源 提供内容
人口普查局 CPS ASEC 家庭结构、人口统计、收入、福利、居住状况、工时、职业标志、健康保险覆盖、退休分配、育儿、上一年收入
IRS SOI 2015年公共使用文件(按比例更新) 税收细节:资本利得、股息、利息、逐项扣除输入、QBI/SSTB 成分、合伙自雇、遗产、学费
美联储 SCF 2022 财富:银行/股票/债券资产、净资产、抵押贷款余额提示
人口普查局 SIPP 小费收入(针对小费职业);家庭车辆(数量和价值)
CPS-ORG 小时工资、按小时付薪状态、工会覆盖
MEPS-IC 参数 雇主提供的保险保费
人口普查局 ACS 2022 租房家庭的租金

插补方法:使用权重感知的分位数森林模型,在每个捐赠者自身记录上拟合,并将所有插补值裁剪至该捐赠者自身实现的范围内(支持约束),不依赖增强版 CPS。最终结果校准到 PolicyEngine 的行政目标表面(3,704 个 IRS/人口普查局/项目目标),并采用严格的单记录权重上限(max_weight_ratio=50)。


验收标准

构建过程拒绝发布,除非所有门控条件通过:

  • Parity 0:所有增强版 CPS 可非退化填充的 PolicyEngine 输入层,该数据集也能填充(检查 169 个参考层)。
  • Exported-nonzero:所有 308 个存储列均包含信号,无全零填充。
  • 校准:3,704 个目标中 94.66% 在 10% 误差范围内(损失 0.022);最大家庭权重 379,623,零记录超过 50万(增强版 CPS 有 21 条,最大 105万)。
  • Smoke 聚合:3.328亿人口,SNAP 支出 980 亿美元,净资产 175.5 万亿美元(美联储 Z.1 约为 169 万亿美元),净短期资本利得 -774 亿美元(目标 -768 亿美元),小费 531 亿美元,租金 7597 亿美元。

验证结果

通过匹配样本(41,314 户)进行评分,在完整行政目标表面上进行对称权重重新拟合,双方均未见过保留目标。数值越低越好。

指标 populace-us 增强版 CPS
训练损失(2,965 个目标) 0.176 1.089
保留损失(739 个未见目标) 0.037 0.317
全表面损失(3,704 个目标) 0.213 1.406

在单个目标上,增强版 CPS 胜出次数更多(3,704 个目标中 2,528 次 vs populace 的 1,127 次,49 次平局)。populace 在胜出时优势显著,在失利时差距较小。


已知差距

  • 净资产比美联储 Z.1 约高 4%(175.5 万亿美元 vs 约 169 万亿美元):校准目标(160 万亿美元)低于 Z.1,实现的总额介于两者之间。
  • 投资利息支出较低(72 亿美元 vs IRS SOI 约 240 亿美元):PUF 剩余规则保守填充该层,计划通过专门 SOI 校准目标解决。
  • 与增强版 CPS 的逐目标对比差异:详见验证部分——聚合损失是比较的门控标准,但两个数据集的逐目标模式不同,结果不可互换。

相关资源

  • 校准仪表盘:https://populace.dev/dashboard
  • 方法论与证据:https://populace.dev
  • 加载器与注册表:https://github.com/PolicyEngine/populace(packages/populace-data 目录)
搜集汇总
数据集介绍
populace-us 数据集图片
构建方式
populace-us数据集采用完全基于原始数据源的构建策略,摒弃了对增强版当前人口调查(CPS)的依赖,仅将其作为评分基准。其构建过程通过整合多项权威统计资料实现:人口结构、收入与福利信息源自人口普查局CPS ASEC;税务细节取自美国国税局SOI公共使用文件(2015年,经时效调整);财富数据来自美联储SCF 2022;小费收入与车辆信息来源于SIPP;时薪与工会覆盖状态由CPS-ORG提供;雇主提供的保险保费参数来自MEPS-IC。在插补环节,该数据集运用了权重感知的分位数随机森林模型,每个插补值均被严格限制在对应数据源的实际观测范围内,以确保统计上的保守性与真实性。最终生成的结果会通过一个包含3704个行政目标(涵盖国税局与人口普查局项目)的校准框架进行优化,并施加严格的权重上限约束,从而避免少数高权重样本主导总体指标。
使用方法
该数据集的使用方法简便直观,用户可通过Python环境直接集成。首先,安装`populace-data[us]`包。随后,在代码中导入`policyengine_us`库的`Microsimulation`类与`populace.data`模块的`load`函数,通过实例化模拟对象并指定数据集为`load('us', 2024)`,即可调用`calculate`方法计算家庭净收入等核心指标。此外,用户也可通过`huggingface_hub`库的`hf_hub_download`函数直接下载HDF5格式的原始数据文件,实现离线或自定义分析。该数据集作为PolicyEngine-US的API兼容替代人口,可无缝替换增强版CPS,适用于税收与福利政策的微观模拟研究,其内置的校准权重确保了模拟结果的精确性与政策评估的可靠性。
背景与挑战
背景概述
populace-us数据集由PolicyEngine团队创建,于2024年发布,旨在为美国税收与福利政策的微观模拟提供一个完全基于原始数据源构建的合成人口数据集。该数据集的核心研究问题在于,如何替代传统的增强版当前人口调查(CPS)作为政策模拟的基准输入,从而摆脱对单一调查数据的依赖。通过整合美国人口普查局、国税局、美联储等多个权威机构的行政与调查数据,populace-us在微观层面实现了对家庭结构、收入、财富、税收及福利项目的精准刻画。其对政策模拟领域的影响力体现在提供了校准性更强、权重分布更均衡的替代方案,为PolicyEngine-US等工具提供了更可靠的模拟基础,推动了基于证据的政策分析向前发展。
当前挑战
populace-us数据集面临的核心挑战在于解决传统微观模拟数据源的局限性。在领域问题层面,增强版CPS虽然广泛使用,但其权重分布不均、部分变量缺失且依赖单一调查来源,导致对特定子群体(如高净值家庭、自雇人士)的刻画失真或低估。在构建过程中,团队需应对多源异构数据的融合难题,例如将IRS的税收数据、美联储的财富数据与人口普查的家庭结构数据进行时间对齐和变量匹配,同时避免信息泄露。此外,校准过程是一项技术挑战:需在3,704个行政目标约束下优化权重,确保宏观总量(如净财富、资本利得)与官方统计一致,并防止单一记录权重过高的极端情况。最终,数据集的验证还需克服与增强版CPS在逐目标精度上的差异,以证明其整体优越性而非在所有细分场景中替代传统数据源。
常用场景
经典使用场景
populace-us数据集作为PolicyEngine-US微观模拟引擎的核心数据基础,经典使用场景集中于税收-福利政策的模拟与评估。研究者通过加载该合成微观数据集,可对个人所得税抵免、补充营养援助计划(SNAP)、住房补贴等联邦及州级政策进行反事实分析。其独特之处在于完全基于底层原始行政调查数据构建,而非依赖增强版当前人口调查(CPS)的插补,从而规避了传统数据集中的嵌套偏差,为政策微调提供更纯净的因果推断依据。
解决学术问题
该数据集的核心学术贡献在于破解了微观模拟中的“校准困境”——即在有限样本量下同时匹配数千个行政目标时权重膨胀与代表性衰退的矛盾。通过引入硬权重约束(max_weight_ratio=50)与对抗性签名目标(如净短期资本利得),它实现了94.66%的校准目标误差在10%以内,同时将最大家庭权重控制在38万以下,显著优于增强版CPS的21个超重记录。这为不平等测度、福利依赖性研究等长期受困于极端权重影响的领域提供了更稳健的统计基础。
实际应用
在实际应用中,populace-us直接服务于政策制定者的预算影响测算与方案优化。例如,美国国会预算办公室或州级财政部门可利用该数据集模拟所得税率调整或儿童税收抵免扩围对联邦赤字、贫困率和区域经济分布的连锁效应。因其内置了财富、小费收入、租赁支出等精细维度,还可用于评估加密资产征税规则或医疗保费补贴改革对家庭财务弹性的异质性冲击,弥补了传统调查数据在高收入群体与资产细节上的系统性缺失。
数据集最近研究
最新研究方向
在微观模拟与税收-福利政策分析领域,populace-us数据集代表了合成人口数据构建的范式革新。该数据集完全基于Census CPS ASEC、IRS SOI、Fed SCF等原始行政与调查源构建,摒弃了对增强版CPS的依赖,通过权重感知分位数森林模型进行插补,并针对3,704个行政目标实现校准,在保持高精度(94.66%目标偏差在10%以内)的同时,严格限制极端权重(最大家庭权重379,623,无记录超50万),显著优于增强版CPS的全表面损失(0.213对1.406)。这一方法不仅解决了传统合成数据对基准数据集过度依赖的痛点,还为政策模拟提供了更透明、可复现的基础,尤其适用于税收抵免、福利支出和财富分配的前沿研究。其公开的验证指标与已知差距(如净财富略高于美联储Z.1约4%)进一步强化了学术可信度,成为连接微观数据与宏观政策建模的桥梁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务