reczoo/Criteo_x4
收藏资源简介:
Criteo数据集是一个广泛用于点击率预测(CTR prediction)的基准数据集,包含大约一周的展示广告点击数据。该数据集包含13个数值特征字段和26个类别特征字段。按照AutoInt工作的设置,数据被随机分割为训练集、验证集和测试集,比例分别为8:1:1。数据集统计信息如下:Criteo_x4总共有45,840,617条数据,其中训练集36,672,493条,验证集4,584,062条,测试集4,584,062条。Criteo_x4_001和Criteo_x4_002是两种不同的预处理设置,分别采用了不同的离散化方法和类别特征处理方式。
Criteo数据集是一个广泛用于点击率预测(CTR prediction)的基准数据集,包含大约一周的展示广告点击数据。该数据集包含13个数值特征字段和26个类别特征字段。按照AutoInt工作的设置,数据被随机分割为训练集、验证集和测试集,比例分别为8:1:1。数据集统计信息如下:Criteo_x4总共有45,840,617条数据,其中训练集36,672,493条,验证集4,584,062条,测试集4,584,062条。Criteo_x4_001和Criteo_x4_002是两种不同的预处理设置,分别采用了不同的离散化方法和类别特征处理方式。
Criteo_x4 数据集概述
数据集描述
Criteo_x4 数据集是一个广泛使用的点击率(CTR)预测基准数据集,包含约一周的展示广告点击数据。该数据集包含13个数值特征字段和26个分类特征字段。数据集按照8:1:1的比例随机分为训练集、验证集和测试集。
数据集统计信息
| 数据集划分 | 总数 | 训练集 | 验证集 | 测试集 |
|---|---|---|---|---|
| Criteo_x4 | 45,840,617 | 36,672,493 | 4,584,062 | 4,584,062 |
数据预处理设置
Criteo_x4_001
在此设置中,我们按照Criteo挑战赛获胜者的解决方案,将每个整数值x离散化为⌊log2(x)⌋(如果x > 2),否则x = 1。对于所有分类字段,我们将不频繁的特征替换为默认的<OOV>标记,阈值设置为min_category_count=10。我们固定embedding_dim=16,与AutoInt一致。
Criteo_x4_002
在此设置中,我们按照Criteo挑战赛获胜者的解决方案,将每个整数值x离散化为⌊log2(x)⌋(如果x > 2),否则x = 1。对于所有分类字段,我们将不频繁的特征替换为默认的<OOV>标记,阈值设置为min_category_count=2。我们固定embedding_dim=40。
数据完整性校验
数据文件的md5校验和如下:
bash $ md5sum train.csv valid.csv test.csv 4a53bb7cbc0e4ee25f9d6a73ed824b1a train.csv fba5428b22895016e790e2dec623cb56 valid.csv cfc37da0d75c4d2d8778e76997df2976 test.csv




