ACIC 2018 Competition Datasets
收藏资源简介:
Complete datasets from the 2018 Atlantic Causal Inference Conference (ACIC) Data Analysis Challenge, containing 2,592 simulated datasets from 64 Data Generating Processes with variable sample sizes (1,000–50,000 observations). Each dataset draws a subsample from a shared covariate matrix of 100,000 individuals and 177 features. Binary treatment assignment with continuous outcomes. Ground truth individual potential outcomes (y0, y1) are provided for each dataset. Archive structure: x.csv: shared covariate matrix (100,000 × 177) scaling/scaling/params.csv: DGP metadata and ground truth parameters for all 2,592 datasets scaling/scaling/factuals/: 2,592 CSV files with observed treatment and outcome (z, y) scaling/scaling/counterfactuals/: 2,592 CSV files with potential outcomes (y0, y1)
本数据集为2018年大西洋因果推断会议(Atlantic Causal Inference Conference, ACIC)数据分析挑战赛的完整数据集,包含来自64个数据生成过程(Data Generating Process, DGP)的2592个模拟数据集,各数据集的样本量介于1000至50000条观测值之间。每个数据集均从包含10万名个体、177个特征的共享协变量矩阵中抽取子样本。本数据集采用二分类干预分配方式,结局为连续型变量。所有数据集均提供个体水平的真实潜在结局(y0, y1)。 数据集归档结构如下: x.csv:共享协变量矩阵(维度为100000 × 177) scaling/scaling/params.csv:涵盖全部2592个数据集的数据生成过程元数据与真实参数 scaling/scaling/factuals/ 目录:包含2592个CSV格式文件,存储观测到的干预与结局数据(z, y) scaling/scaling/counterfactuals/ 目录:包含2592个CSV格式文件,存储潜在结局数据(y0, y1)



