CriteoPrivateAd
收藏资源简介:
CriteoPrivateAd数据集是由Criteo AI Lab和Criteo共同创建的一个真实世界的匿名广告竞价数据集。该数据集包含连续30天的1000万次广告展示数据,超过100个相关特征,用于学习常见的竞价模型。数据集通过匿名化处理保护用户隐私,同时提供了丰富的特征和标签信息,用于模拟Privacy Sandbox API和用户级别的差分隐私,旨在帮助研究人员和工程师评估和设计私密的广告竞价系统。
The CriteoPrivateAd dataset is a real-world anonymous advertising bidding dataset jointly created by Criteo AI Lab and Criteo. It encompasses 10 million ad impression records spanning 30 consecutive days, with over 100 relevant features, and is intended for learning common advertising bidding models. The dataset has undergone anonymization to protect user privacy, while providing rich feature and label information to simulate the Privacy Sandbox API and user-level differential privacy, aiming to help researchers and engineers evaluate and design privacy-preserving advertising bidding systems.
数据集概述
数据集名称
CriteoPrivateAd
数据集描述
CriteoPrivateAd 是一个大规模的匿名化广告竞价数据集,旨在促进隐私保护机器学习在广告竞价场景中的应用。该数据集包含 30 天的 Criteo 实时数据样本,匿名化处理以模仿广告竞价引擎的生产性能,用于评估隐私限制下的广告性能。
数据集组成
- 数据集包含 100M 条匿名化记录,每条记录代表一个广告展示(banner)。
- 每条记录包含以下内容:
- 按广告系列、发布商、用户和日期细分的 ID。
- 4 个标签:点击、点击后访问广告商网站、点击后访问广告商网站(即访问后有一次广告商事件)、点击带来的销售数量。
- 超过 100 个特征,分为 5 个类别,根据其性质、隐私限制和推断时间点进行分组。
day_int字段用于数据集的划分和模型初始化。- 关于转化延迟的信息,以模拟 Privacy Sandbox API 的工作方式。
- 从请求时间戳到点击或销售事件的时间差。
- 同一天同一用户的展示顺序。
数据集格式
- 数据集分为 30 个 parquet 文件,每个文件代表一天的数据。
- 包含
event_per_user_contribution.csv文件,用于构建重要性抽样比率和用户级别的差分隐私。
性能指标
- 适用于点击和转化估计问题的最佳指标是日志似然性(LLH)和相对日志似然性提升(LLH-CompVN)。
- 校准度,定义为预测总和与验证标签总和的比率,对于竞价应用应接近 1。
基线模型
- 训练期为第 1 到 25 天,验证期为第 26 到 30 天。
- 选择的损失函数是加权 LLH-CompVN。
- 基线结果包括不同点击率(CTR)下的 Landed Click | Display、Sales | Landed Click 和 Sales | Display。
许可
- 数据集在 cc-by-sa-4.0 许可下发布。
引用
- 如果在研究中使用该数据集,请使用以下 BibTeX 引用格式。

- 1CriteoPrivateAd: A Real-World Bidding Dataset to Design Private Advertising SystemsCriteo AI Lab, Paris, France; Criteo, Paris, France · 2025年



