Synthetic Data Set for Uplift Modeling (One Trial)
收藏资源简介:
This dataset is designed and simulated for evaluating uplift modeling and feature selection methods. This dataset contains 10,000 samples and 36 features (one trial). The samples are equally split for control and treatment group. The generated data has three types of features: (1) uplift features influencing the treatment effect on the conversion probability; (2) classification features affecting the conversion probability but independent of the treatment effect; and (3) irrelevant features that are independent of both conversion probability and the treatment effect. To model the relationship between uplift features and the treatment effect and classification features and outcome probability, we implement six types of association patterns in the data generation process: linear, quadratic, cubic, ReLU (Rectified Linear Unit), trigonometric function sine, and cosine. In this data set, there are 36 features in total, including 10 classification features, 6 uplift features, and 20 irrelevant features. Column names: Experiment group label: 'treatment_group_key' Feature names: ['x1_informative',<br> 'x2_informative',<br> 'x3_informative',<br> 'x4_informative',<br> 'x5_informative',<br> 'x6_informative',<br> 'x7_informative',<br> 'x8_informative',<br> 'x9_informative',<br> 'x10_informative',<br> 'x11_irrelevant',<br> 'x12_irrelevant',<br> 'x13_irrelevant',<br> 'x14_irrelevant',<br> 'x15_irrelevant',<br> 'x16_irrelevant',<br> 'x17_irrelevant',<br> 'x18_irrelevant',<br> 'x19_irrelevant',<br> 'x20_irrelevant',<br> 'x21_irrelevant',<br> 'x22_irrelevant',<br> 'x23_irrelevant',<br> 'x24_irrelevant',<br> 'x25_irrelevant',<br> 'x26_irrelevant',<br> 'x27_irrelevant',<br> 'x28_irrelevant',<br> 'x29_irrelevant',<br> 'x30_irrelevant',<br> 'x31_uplift_increase',<br> 'x32_uplift_increase',<br> 'x33_uplift_increase',<br> 'x34_uplift_increase',<br> 'x35_uplift_increase',<br> 'x36_uplift_increase'] Outcome variable: 'conversion' True underlying control conversion probability: 'control_conversion_prob' True underlying treatment conversion probability: 'treatment1_conversion_prob' True treatment effect: 'treatment1_true_effect' Note columns names with '_transformed' suffix are feature variables used in the intermediate steps during the data generation, that should be excluded for model training.
本数据集专为评估提升建模(uplift modeling)与特征选择方法而设计并模拟生成,共包含10000个样本与36个特征(单次试验场景)。样本被均等划分为对照组与实验组。所生成的数据包含三类特征:(1) 提升特征:会影响干预对转化概率的作用效果;(2) 分类特征:仅对转化概率产生影响,但与干预效果无关;(3) 无关特征:与转化概率及干预效果均无关联。为建模提升特征与干预效果、分类特征与结果概率之间的关联关系,我们在数据生成流程中设置了六种关联模式:线性、二次、三次、ReLU(修正线性单元,Rectified Linear Unit)、正弦三角函数与余弦三角函数。本数据集总计包含36个特征,其中10个分类特征、6个提升特征与20个无关特征。各列命名规则如下:实验组标签列名为"treatment_group_key";特征名称列表为['x1_informative', 'x2_informative', 'x3_informative', 'x4_informative', 'x5_informative', 'x6_informative', 'x7_informative', 'x8_informative', 'x9_informative', 'x10_informative', 'x11_irrelevant', 'x12_irrelevant', 'x13_irrelevant', 'x14_irrelevant', 'x15_irrelevant', 'x16_irrelevant', 'x17_irrelevant', 'x18_irrelevant', 'x19_irrelevant', 'x20_irrelevant', 'x21_irrelevant', 'x22_irrelevant', 'x23_irrelevant', 'x24_irrelevant', 'x25_irrelevant', 'x26_irrelevant', 'x27_irrelevant', 'x28_irrelevant', 'x29_irrelevant', 'x30_irrelevant', 'x31_uplift_increase', 'x32_uplift_increase', 'x33_uplift_increase', 'x34_uplift_increase', 'x35_uplift_increase', 'x36_uplift_increase'];结果变量列名为"conversion";真实底层对照组转化概率列名为"control_conversion_prob";真实底层实验组转化概率列名为"treatment1_conversion_prob";真实干预效果列名为"treatment1_true_effect"。请注意:带有"_transformed"后缀的列名是数据生成中间步骤所使用的特征变量,不可用于模型训练。



