相关数据集
criteo/criteo-uplift
该数据集是通过整合多个增量测试的结果构建的,这些测试是一种特定的随机试验程序,其中随机部分的人群被阻止接受广告。数据集包含2500万行,每行代表一个用户,包含11个特征、一个处理指标和两个标签(访问和转化)。特征值以浮点数形式表示,处理组和标签以二进制形式表示。为了保护隐私,数据进行了非均匀子采样,特征名称被匿名化,特征值被随机投影,以保持预测能力的同时防止恢复原始特征或用户上下文。数据集的主要用
Hugging Face2024-06-12 更新5521
criteo/CriteoClickLogs
Criteo 1TB点击日志数据集包含数百万条展示广告的特征值和点击反馈信息,主要用于点击率(CTR)预测算法的基准测试。数据集包含24个文件,每个文件对应一天的数据。数据集由24天的Criteo流量构成,每行代表一次由Criteo服务的展示广告,第一列表示广告是否被点击(1表示点击,0表示未点击)。数据集包括13个整数特征和26个分类特征,其中一些特征可能包含缺失值。数据按时间顺序排列,字段之间
Hugging Face2026-05-12 更新670
criteo/CriteoPrivateAd
CriteoPrivateAds是一个用于设计和测试隐私广告系统的真实世界匿名化竞价数据集。它由Criteo公司发布,包含了30天内来自Chrome浏览器第三方cookies流量的100M匿名样本,每个样本代表一次广告展示。数据集旨在帮助工程师和研究人员评估在没有用户跨域信号的情况下广告竞价的效果,设计私有的竞价优化方法,并评估聚合API提供的答案的相关性。
Hugging Face2025-03-28 更新170
criteo/criteo-attribution-dataset
该数据集是Criteo发布的实时流量数据样本,涵盖了30天的数据,每条记录对应一个展示给用户的横幅广告。数据集详细记录了每个广告展示的上下文信息、是否被点击、是否导致转化以及是否归因于Criteo。数据经过子采样和匿名化处理,以保护专有信息。数据集包含多个字段,如时间戳、用户ID、广告活动ID、是否转化、转化时间戳、转化ID、是否归因于Criteo、是否点击、点击位置、点击次数、成本、每次订单成本
Hugging Face2024-03-28 更新2880
criteo/FairJob
FairJob数据集由Criteo发布,旨在促进广告和AI系统中的公平性研究。数据集包含1072226行和55列,每行代表一个展示给用户的产品,用户可以在一个展示会话中看到多个产品。数据集的特征包括用户ID、产品ID、展示ID、匿名分类用户特征、匿名分类产品特征、匿名数值用户特征等。标签包括保护属性(性别代理)、职位级别、产品展示位置、点击等。数据集的局限性包括性别代理的近似性、历史偏见和市场不公
Hugging Face2024-07-04 更新460



