synthetic-attribution-benchmark
收藏资源简介:
该数据集是一个合成的多触点归因基准数据集,专门用于营销归因分析。它模拟了用户跨多个可解释渠道的旅程,并包含一个已知的数据生成过程,因此为每个转化旅程提供了每个渠道的真实信用(精确的沙普利值)作为地面真值。这使得研究者能够评估和比较各种归因启发式方法(如最终点击、首次点击、线性、时间衰减、马尔可夫或沙普利归因)的准确性。数据集包含三个主要文件:`touchpoints.parquet`(每行代表一个触点,包含旅程ID、步骤、渠道、时间(小时)和成本)、`journeys.parquet`(每行代表一个完整旅程,包含旅程ID、触点数量、渠道数量、是否转化、转化概率以及每个渠道的地面真值沙普利信用)和 `ground_truth.json`(包含数据生成过程的参数,如渠道权重、基础logit、半衰期以及聚合的真实渠道贡献)。数据生成过程基于七个渠道(付费搜索、社交、展示广告、电子邮件、自然搜索、直接访问和引荐),每个渠道具有定义的权重、分类混合权重和成本。转换遵循伯努利分布,其概率由逻辑函数计算,输入为基值加上各渠道权重与衰减曝光饱和值的总和。地面真值信用是每个渠道在该价值函数下的精确沙普利值。数据集适用于归因模型基准测试、表格分类(预测转化)以及营销归因和转化率优化的教学。数据集规模在1万到10万样本之间,使用CC BY 4.0许可证。
数据集概述
Synthetic Multi-Touch Attribution Benchmark 是一个合成的营销数据集,用于多触点归因分析。它包含用户在多渠道中的互动旅程,并提供了已知的数据生成过程(DGP),因此每条转化旅程都包含每个渠道的真实贡献(精确夏普利值)。
核心价值
- 提供真实基准:真实归因数据集(如Criteo)没有真实标签,无法判断归因方法是否正确。本数据集允许用户将任何归因启发式方法(如最后一次点击、线性、时间衰减等)与真实的夏普利值(
gt_shapley_*)进行比较。 - 完全可复现:通过种子(seed)可完全复现数据集,DGP参数存储在
ground_truth.json文件中。
文件结构
touchpoints.parquet:每个触点一行,包含字段:journey_id,step,channel,t_hours,cost。journeys.parquet:每个旅程一行,包含字段:journey_id,n_touch,n_channels,converted,conv_prob,以及每个渠道的真实贡献字段gt_shapley_<channel>(若渠道未出现或旅程未转化,则为0)。ground_truth.json:DGP参数,包括渠道权重、基础logit值、半衰期以及聚合的渠道真实贡献。
渠道与真实权重
DGP根据以下参数生成数据,mix_weight 是类别混合权重,而非独立到达率。每个旅程中的每个触点通过单一类别采样得到(从所有渠道中按此权重概率抽取),而非按渠道独立泊松过程生成。
| channel | weight | mix_weight | cost |
|---|---|---|---|
| paid_search | 1.1 | 0.9 | 1.2 |
| social | 0.7 | 0.85 | 0.8 |
| display | 0.35 | 0.8 | 0.4 |
| 0.9 | 0.5 | 0.05 | |
| organic_search | 0.8 | 0.6 | 0.0 |
| direct | 1.0 | 0.4 | 0.0 |
| referral | 0.5 | 0.3 | 0.1 |
其他参数:基础logit = -3.2;暴露半衰期 = 168小时;旅程窗口 = 720小时。
转化逻辑:转化 ~ Bernoulli(sigmoid(base + Σ_channel weight · saturate(decayed_exposure)))。真实贡献 = 在该价值函数下每个渠道的精确夏普利值。
建议用途
- 归因模型基准测试:评估最后一次点击、首次点击、线性、时间衰减、马尔可夫等归因模型,通过与
gt_shapley_*比较(使用渠道贡献份额的平均绝对误差MAE)。 - 表格分类:根据旅程特征预测是否转化(
converted)。 - 教学材料:用于转化率优化(CRO)和营销归因的教学。
许可协议
合成数据,不含个人身份信息(PII)。采用 CC BY 4.0 许可。





