遇见数据集

synthetic-attribution-benchmark

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

该数据集是一个合成的多触点归因基准数据集,专门用于营销归因分析。它模拟了用户跨多个可解释渠道的旅程,并包含一个已知的数据生成过程,因此为每个转化旅程提供了每个渠道的真实信用(精确的沙普利值)作为地面真值。这使得研究者能够评估和比较各种归因启发式方法(如最终点击、首次点击、线性、时间衰减、马尔可夫或沙普利归因)的准确性。数据集包含三个主要文件:`touchpoints.parquet`(每行代表一个触点,包含旅程ID、步骤、渠道、时间(小时)和成本)、`journeys.parquet`(每行代表一个完整旅程,包含旅程ID、触点数量、渠道数量、是否转化、转化概率以及每个渠道的地面真值沙普利信用)和 `ground_truth.json`(包含数据生成过程的参数,如渠道权重、基础logit、半衰期以及聚合的真实渠道贡献)。数据生成过程基于七个渠道(付费搜索、社交、展示广告、电子邮件、自然搜索、直接访问和引荐),每个渠道具有定义的权重、分类混合权重和成本。转换遵循伯努利分布,其概率由逻辑函数计算,输入为基值加上各渠道权重与衰减曝光饱和值的总和。地面真值信用是每个渠道在该价值函数下的精确沙普利值。数据集适用于归因模型基准测试、表格分类(预测转化)以及营销归因和转化率优化的教学。数据集规模在1万到10万样本之间,使用CC BY 4.0许可证。

创建时间:
2026-06-15
原始信息汇总

数据集概述

Synthetic Multi-Touch Attribution Benchmark 是一个合成的营销数据集,用于多触点归因分析。它包含用户在多渠道中的互动旅程,并提供了已知的数据生成过程(DGP),因此每条转化旅程都包含每个渠道的真实贡献(精确夏普利值)。

核心价值

  • 提供真实基准:真实归因数据集(如Criteo)没有真实标签,无法判断归因方法是否正确。本数据集允许用户将任何归因启发式方法(如最后一次点击、线性、时间衰减等)与真实的夏普利值(gt_shapley_*)进行比较。
  • 完全可复现:通过种子(seed)可完全复现数据集,DGP参数存储在 ground_truth.json 文件中。

文件结构

  • touchpoints.parquet:每个触点一行,包含字段:journey_id, step, channel, t_hours, cost
  • journeys.parquet:每个旅程一行,包含字段:journey_id, n_touch, n_channels, converted, conv_prob,以及每个渠道的真实贡献字段 gt_shapley_<channel>(若渠道未出现或旅程未转化,则为0)。
  • ground_truth.json:DGP参数,包括渠道权重、基础logit值、半衰期以及聚合的渠道真实贡献。

渠道与真实权重

DGP根据以下参数生成数据,mix_weight 是类别混合权重,而非独立到达率。每个旅程中的每个触点通过单一类别采样得到(从所有渠道中按此权重概率抽取),而非按渠道独立泊松过程生成。

channel weight mix_weight cost
paid_search 1.1 0.9 1.2
social 0.7 0.85 0.8
display 0.35 0.8 0.4
email 0.9 0.5 0.05
organic_search 0.8 0.6 0.0
direct 1.0 0.4 0.0
referral 0.5 0.3 0.1

其他参数:基础logit = -3.2;暴露半衰期 = 168小时;旅程窗口 = 720小时。

转化逻辑:转化 ~ Bernoulli(sigmoid(base + Σ_channel weight · saturate(decayed_exposure)))。真实贡献 = 在该价值函数下每个渠道的精确夏普利值。

建议用途

  • 归因模型基准测试:评估最后一次点击、首次点击、线性、时间衰减、马尔可夫等归因模型,通过与 gt_shapley_* 比较(使用渠道贡献份额的平均绝对误差MAE)。
  • 表格分类:根据旅程特征预测是否转化(converted)。
  • 教学材料:用于转化率优化(CRO)和营销归因的教学。

许可协议

合成数据,不含个人身份信息(PII)。采用 CC BY 4.0 许可。

搜集汇总
数据集介绍
synthetic-attribution-benchmark 数据集图片
构建方式
该数据集通过一个已知的数据生成过程(DGP)构建,模拟了多触点归因场景中用户在不同渠道间的旅程。每个接触点依据类别混合权重(mix_weight)从七个可解释的营销渠道(如付费搜索、社交、展示、电子邮件等)中单一抽样生成,而非独立泊松过程,体现了渠道间的竞争性关系。转化概率由基础对数几率(-3.2)、渠道权重、接触点时间衰减(半衰期168小时)及饱和效应共同决定,最终通过伯努利分布采样产生。每个转化旅程的真实渠道贡献被精确计算为Shapley值,并记录在数据集中,所有参数和种子均提供,确保完全可复现。
使用方法
该数据集主要用于基准测试多触点归因模型性能,可通过对比不同归因方法(如最后点击、线性衰减、马尔可夫链等)计算出的渠道贡献与真实Shapley值间的平均绝对误差(MAE)来评估。此外,可作为表格分类任务的训练数据,用于预测旅程转化概率,亦适用于教学场景,帮助理解归因模型原理。用户可直接加载Parquet文件进行数据分析,或利用ground_truth.json中的参数复现或扩展实验。
背景与挑战
背景概述
在数字营销领域,多渠道归因(Multi-Touch Attribution)是衡量各营销渠道对用户转化贡献的核心难题。传统的归因模型如末次点击、线性或时间衰减等,虽被广泛采用,却缺乏验证其准确性的客观基准。为填补这一空白,该数据集由研究团队于近年创建,旨在提供一个带有已知数据生成过程(DGP)的合成用户旅程数据集。其核心研究问题在于:如何准确评估不同归因算法的优劣?通过嵌入真实Shapley值作为黄金标准,该数据集为归因模型的比较提供了可靠依据,对营销科学和转化率优化(CRO)领域产生了重要影响,成为评估归因方法有效性的标杆资源。
当前挑战
该数据集所应对的领域挑战在于:真实世界的归因数据集(如Criteo)均经过哈希处理且缺乏真实标签,导致无法判断任何归因方法的正确性,阻碍了归因模型的理论进步。构建过程中,设计团队面临核心挑战:需生成既符合统计规律又具有业务解释性的合成数据,确保各渠道的交互行为(如曝光衰减、饱和效应)与真实营销场景一致。此外,如何通过DGP精确计算每个转化旅程中每个渠道的Shapley值,并确保其与转化概率模型(sigmoid逻辑函数)的因果链一致,也是一项复杂任务。这些设计保证了合成数据既能模拟现实复杂性,又为归因基准测试提供了清晰的验证框架。
常用场景
经典使用场景
在营销归因分析的研究领域中,synthetic-attribution-benchmark数据集作为一个具备真实归因基准的合成数据源,为多触点归因模型的评估提供了不可替代的黄金标准。该数据集的经典使用场景聚焦于归因算法的性能基准测试:研究者能够利用其中包含的精确Shapley值作为真值,对包括最后点击、首次点击、线性、时间衰减及马尔可夫链等常见归因模型进行系统性比较,并以通道信用分配的平均绝对误差作为核心评估指标。这种基于已知数据生成过程的验证框架,使得研究人员首次能够在实验室条件下客观衡量不同归因策略的准确性与合理性。
解决学术问题
该数据集精准回应了营销科学领域长期存在的核心困境——真实归因数据缺乏可验证的基准真相。传统的企业级归因数据集,如Criteo公开数据,因经过哈希处理且缺失底层生成机制,使得学术界无法判断各类归因模型输出的真伪。synthetic-attribution-benchmark通过完全参数化的数据生成过程,揭示了每个用户旅程中通道权重的真实贡献,从而解决了归因模型有效性验证这一基础性学术命题。这一突破性设计不仅推动了归因评估从定性比较迈向量化可信度分析,更为后续研究者构建更精准的营销计量模型提供了方法论基石。
实际应用
在商业智能与增长优化的实际场景中,该数据集为营销归因系统的选型与调优提供了可靠的离线测试平台。企业数据科学家可以借助此基准数据,在无需真实用户数据的前提下,评估不同归因引擎在广告预算分配、渠道效果排序以及转化率优化决策中的表现差异。例如,数字营销团队能够通过对比模型输出的通道贡献与真实Shapley值,精准识别出被高估或低估的投放渠道,从而调整付费搜索、社交媒体与展示广告之间的预算配比。此外,该数据集还可作为转化率预测任务的特征工程实验床,帮助从业者在受控环境中打磨机器学习管线的效果。
数据集最近研究
最新研究方向
合成多触点归因基准数据集的最新研究方向聚焦于破解真实归因数据中缺乏标准答案的困境,通过提供具有已知数据生成过程和确切Shapley值作为真值标签的合成用户旅程数据,推动营销归因模型的可验证评估。该数据集在计算广告与转化率优化领域的前沿应用中,为对比末次点击、线性、时间衰减、马尔可夫链及Shapley值等归因策略的准确性提供了黄金标准,从而支持研究者量化各渠道的真实贡献,尤其针对多渠道归因中信道交互效应与暴露衰减机制的建模挑战。这一基准的建立,不仅强化了机器学习在归因分析中的可解释性与鲁棒性,更通过开源框架推动了营销科技领域从经验规则向数据驱动决策的范式转变,为因果推断与公平分配渠道预算的热点议题奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务