遇见数据集

LLP-Bench

收藏
arXiv2024-03-05 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

LLP-Bench是一个包含70个LLP数据集的大型表格基准,这些数据集来自Criteo CTR预测和Criteo赞助搜索转换日志数据集,用于学习和标签比例相关的任务。

LLP-Bench is a large tabular benchmark consisting of 70 LLP datasets derived from the Criteo CTR prediction dataset and the Criteo sponsored search conversion logs dataset, tailored for learning and label ratio-related tasks.

创建时间:
2023-10-16
搜集汇总
数据集介绍
LLP-Bench 数据集图片
构建方式
LLP-Bench 的构建基于两个大规模表格数据集:Criteo CTR 预测数据集(约4500万实例,二分类任务)和 Criteo 赞助搜索转化日志数据集(约170万实例,回归任务)。从这两个数据集中,通过两种方式创建了70个LLP数据集:随机袋(固定袋大小64、128、256、512)和特征袋(基于至多两个分类特征进行分组)。特征袋的构建经历了袋过滤(剔除大小小于50或大于2500的袋)和数据集过滤(保留至少保留30%原始实例的数据集),最终从Criteo CTR获得52个特征袋和4个随机袋数据集,从Criteo SSCL获得10个特征袋和4个随机袋数据集。
使用方法
LLP-Bench 的使用方法包括:首先,对每个特征袋数据集进行5折训练/测试划分,在训练折中重新通过分组键创建袋级训练数据;随机袋数据集则直接对整体数据划分后分区。训练采用小批量方法,每批采样8个袋,进行前向传播计算袋级标签比例和实例级预测,然后根据各基线方法(如DLLP、GenBags、Easy-LLP、OT方法、SIM-LLP和Mean-Map)的损失函数进行反向传播。模型为2层感知机,使用Adam优化器、学习率1e-5,并采用早停策略。评估指标为二分类任务的AUC和回归任务的MSE。
背景与挑战
背景概述
在弱监督学习领域,从标签比例学习(LLP)作为一种保护隐私的范式,近年来受到广泛关注。该方法通过将训练数据聚合成“包”,仅提供每个包中标签的聚合比例,从而避免暴露个体标签。尽管图像领域已拥有基于CIFAR-*和MNIST的大规模LLP基准,但在表格数据领域,尤其是隐私敏感的应用(如在线广告中的用户建模),尚缺乏一个开放、大规模且多样化的基准。为填补这一空白,来自Google Research India的Anand Brahmbhatt、Mohith Pokala、Rishi Saket和Aravindan Raghuveer于2024年提出了LLP-Bench。该基准包含70个LLP数据集,源自Criteo CTR预测和Criteo SSCL数据集,涵盖了特征包和随机包两种构建方式。LLP-Bench是首个在构成数据集上具有广泛多样性的表格LLP大规模基准,为评估和推动LLP算法研究提供了重要平台。
当前挑战
LLP-Bench所解决的核心领域挑战在于表格数据环境下标签比例学习的固有困难:与图像数据不同,表格数据中特征包(即包内实例在特定特征上取值相同)更为常见,这导致包内实例的标签分布可能高度集中,使得模型难以从聚合信号中学习到有效的个体判别信息。此外,构建过程中面临多重挑战:首先,从海量原始数据(如Criteo CTR的4500万实例)中通过特征分组创建包时,会产生大量极端大小的包——过小的包无法保证隐私,过大的包则因信息损失严重而几乎无用。为此,研究团队设计了低阈值(50)和高阈值(2500)的过滤策略,并进一步剔除保留实例不足30%的数据集,最终从351个候选数据集中精选出62个特征包数据集。同时,为量化数据集难度,提出了四个硬度指标(标签比例标准差、包间分离比、平均包大小和包大小累积分布),以系统评估不同LLP技术在不同数据特性下的表现。
常用场景
经典使用场景
在标签比例学习(LLP)任务中,LLP-Bench 数据集主要用于评估从群体标签比例中学习个体标签的算法。该数据集从 Criteo CTR 预测和 Criteo 赞助搜索转化日志中构建了 70 个 LLP 数据集,涵盖特征袋和随机袋两种类型。其经典使用场景包括在隐私敏感的应用中,如在线广告的用户建模,其中广告点击或转化标签仅以聚合形式提供,从而保护用户隐私。研究者利用该基准测试不同 LLP 方法在表格数据上的表现,尤其是特征袋场景,其中袋由共享相同特征值的实例构成,模拟了现实世界中的数据聚合方式。
解决学术问题
LLP-Bench 解决了表格 LLP 领域缺乏大规模开放基准的学术问题。此前,大多数 LLP 研究集中在图像数据上,而表格数据仅依赖小规模 UCI 数据集,无法模拟真实应用的多样性和规模。该基准通过提供 70 个多样化数据集,使研究者能够系统评估 LLP 方法在分类和回归任务上的性能。它提出了四个硬度度量(如标签比例标准差、袋间分离比等),用于量化数据集的难度,从而推动了 LLP 算法设计的理论进展。该工作填补了表格 LLP 评估的空白,促进了隐私保护机器学习的发展。
实际应用
在实际应用中,LLP-Bench 数据集模拟了在线广告和医疗记录匿名化等隐私敏感场景。例如,在在线广告中,用户点击或转化数据常以聚合形式提供,以遵守隐私法规。该基准允许企业评估 LLP 模型在有限监督下的预测能力,从而在不暴露个体数据的情况下优化广告投放。此外,在医疗研究中,患者数据常以群体统计形式共享,LLP-Bench 为构建疾病预测模型提供了测试平台。其多样化的特征袋设计反映了现实世界中数据按特征(如设备类型或产品类别)聚合的常见模式。
数据集最近研究
最新研究方向
在标签比例学习(LLP)领域,随着隐私法规的日益严格,如何从聚合数据中有效学习个体标签成为前沿热点。LLP-Bench作为首个大规模表格型LLP基准,填补了该领域缺乏公开、多样化基准的空白。该基准基于Criteo CTR和SSCL数据集构建了70个LLP数据集,涵盖特征袋和随机袋两种构造方式,并提出了四项量化数据集难度的指标。研究通过评估9种主流LLP方法,揭示了不同方法在特征袋与随机袋上的性能差异,尤其是SIM-LLP在特征袋上表现优异,而Easy-LLP更适用于随机袋。这一工作不仅推动了LLP在隐私敏感场景(如在线广告、医疗记录)中的应用,还为未来算法设计提供了系统性的评估框架,具有重要的理论价值与实践意义。
相关研究论文
  • 1
    LLP-Bench: A Large Scale Tabular Benchmark for Learning from Label Proportions · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务