populace-us
收藏资源简介:
populace-us 是一个为 PolicyEngine-US 税收福利微模拟模型构建的校准合成微观数据集。该数据集完全从主要调查和管理数据源构建,其中增强型当前人口调查(CPS)仅用作评估基准,而非构建输入。数据集以 HDF5 格式(USSingleYearDataset)每年发布,包含 308 个存储列,所有列均携带有效信号(没有全零列)。数据来源包括:人口普查 CPS ASEC(用于家庭结构、人口统计、收入、福利等)、IRS SOI 公共使用文件(用于税收细节)、美联储 SCF(用于财富数据)、人口普查 SIPP(用于小费收入、车辆信息)、CPS-ORG(用于小时工资、工会覆盖情况)、MEPS-IC 参数(用于雇主保险保费)以及人口普查 ACS(用于租金数据)。数据通过权重感知的分位数森林模型进行插补,并校准到包含 3,704 个 IRS/人口普查/项目目标的行政目标表面,同时施加严格的每记录权重边界。该数据集旨在作为增强型 CPS 的 API 兼容替代人口数据集,具有自己的校准权重、优势与已知差距(例如净财富略高、投资利息支出较薄)。适用于税收政策分析、福利项目模拟、收入与财富分布研究等微模拟任务。
populace-us is a calibrated synthetic micro-dataset built for the PolicyEngine-US tax-benefit microsimulation model. The dataset is constructed entirely from primary survey and administrative data sources, with the Enhanced Current Population Survey (CPS) used only as an evaluation benchmark, not as a construction input. It is released annually in HDF5 format (USSingleYearDataset), containing 308 stored columns, all carrying valid signals (no all-zero columns). Data sources include: Census CPS ASEC (for family structure, demographics, income, benefits, etc.), IRS SOI Public Use Files (for tax details), Federal Reserve SCF (for wealth data), Census SIPP (for tip income, vehicles), CPS-ORG (for hourly wages, union coverage), MEPS-IC parameters (for employer insurance premiums), and Census ACS (for rent). Data is imputed via a weight-aware quantile forest model and calibrated to an administrative target surface comprising 3,704 IRS/Census/program targets, with strict per-record weight bounds enforced. The dataset is designed as an API-compatible alternative population dataset to the enhanced CPS, with its own calibration weights, strengths, and known gaps (e.g., slightly higher net wealth, thinner investment interest expense). It is suitable for microsimulation tasks such as tax policy analysis, benefit program simulation, and income and wealth distribution research.
数据集概述:populace-us
populace-us 是一个为 PolicyEngine-US 构建的校准合成微观数据集,完全由一手来源构建,仅将增强版 CPS 作为评分基准,而非构建输入。该数据集可作为增强版 CPS 的 API 兼容替代方案,并拥有自身校准权重。
主要特性
- 许可协议:MIT
- 用途:微观模拟、税收福利分析
- 适用地区:美国
数据构建
每个年份对应一个独立的 HDF5 文件(USSingleYearDataset)。各数据层来源如下:
| 数据源 | 提供内容 |
|---|---|
| 人口普查局 CPS ASEC | 家庭结构、人口统计、收入、福利、居住状况、工时、职业标志、健康保险覆盖、退休分配、育儿、上一年收入 |
| IRS SOI 2015年公共使用文件(按比例更新) | 税收细节:资本利得、股息、利息、逐项扣除输入、QBI/SSTB 成分、合伙自雇、遗产、学费 |
| 美联储 SCF 2022 | 财富:银行/股票/债券资产、净资产、抵押贷款余额提示 |
| 人口普查局 SIPP | 小费收入(针对小费职业);家庭车辆(数量和价值) |
| CPS-ORG | 小时工资、按小时付薪状态、工会覆盖 |
| MEPS-IC 参数 | 雇主提供的保险保费 |
| 人口普查局 ACS 2022 | 租房家庭的租金 |
插补方法:使用权重感知的分位数森林模型,在每个捐赠者自身记录上拟合,并将所有插补值裁剪至该捐赠者自身实现的范围内(支持约束),不依赖增强版 CPS。最终结果校准到 PolicyEngine 的行政目标表面(3,704 个 IRS/人口普查局/项目目标),并采用严格的单记录权重上限(max_weight_ratio=50)。
验收标准
构建过程拒绝发布,除非所有门控条件通过:
- Parity 0:所有增强版 CPS 可非退化填充的 PolicyEngine 输入层,该数据集也能填充(检查 169 个参考层)。
- Exported-nonzero:所有 308 个存储列均包含信号,无全零填充。
- 校准:3,704 个目标中 94.66% 在 10% 误差范围内(损失 0.022);最大家庭权重 379,623,零记录超过 50万(增强版 CPS 有 21 条,最大 105万)。
- Smoke 聚合:3.328亿人口,SNAP 支出 980 亿美元,净资产 175.5 万亿美元(美联储 Z.1 约为 169 万亿美元),净短期资本利得 -774 亿美元(目标 -768 亿美元),小费 531 亿美元,租金 7597 亿美元。
验证结果
通过匹配样本(41,314 户)进行评分,在完整行政目标表面上进行对称权重重新拟合,双方均未见过保留目标。数值越低越好。
| 指标 | populace-us | 增强版 CPS |
|---|---|---|
| 训练损失(2,965 个目标) | 0.176 | 1.089 |
| 保留损失(739 个未见目标) | 0.037 | 0.317 |
| 全表面损失(3,704 个目标) | 0.213 | 1.406 |
在单个目标上,增强版 CPS 胜出次数更多(3,704 个目标中 2,528 次 vs populace 的 1,127 次,49 次平局)。populace 在胜出时优势显著,在失利时差距较小。
已知差距
- 净资产比美联储 Z.1 约高 4%(175.5 万亿美元 vs 约 169 万亿美元):校准目标(160 万亿美元)低于 Z.1,实现的总额介于两者之间。
- 投资利息支出较低(72 亿美元 vs IRS SOI 约 240 亿美元):PUF 剩余规则保守填充该层,计划通过专门 SOI 校准目标解决。
- 与增强版 CPS 的逐目标对比差异:详见验证部分——聚合损失是比较的门控标准,但两个数据集的逐目标模式不同,结果不可互换。
相关资源
- 校准仪表盘:https://populace.dev/dashboard
- 方法论与证据:https://populace.dev
- 加载器与注册表:https://github.com/PolicyEngine/populace(
packages/populace-data目录)




