遇见数据集

AOL4FOLTR

收藏
arXiv2025-08-17 更新2025-11-27 收录
数据链接:
官方服务:

资源简介:

AOL4FOLTR是一个大规模的网页搜索数据集,包含约260万个查询,来自10,000名用户。该数据集旨在解决联邦在线学习排序(FOLTR)中隐私保护和数据真实性的问题。它基于2006年发布的AOL查询日志,通过互联网档案馆恢复了超过42万个网站的内容,并重建了每个查询的前20个结果集。数据集包含查询-文档对、用户ID、时间戳、点击和非点击文档等数据,并使用103个特征进行编码。该数据集为评估同步和异步FOLTR场景提供了重要的基准。

AOL4FOLTR is a large-scale web search dataset containing approximately 2.6 million queries sourced from 10,000 users. It is designed to tackle the challenges of privacy preservation and data authenticity in Federated Online Learning to Rank (FOLTR). Built on the AOL query logs released in 2006, the dataset recovers the content of over 420,000 websites via the Internet Archive and reconstructs the top-20 result sets for each query. The dataset encompasses query-document pairs, user IDs, timestamps, clicked and non-clicked documents, and is encoded using 103 features. It serves as a critical benchmark for evaluating both synchronous and asynchronous FOLTR scenarios.

创建时间:
2025-08-17
搜集汇总
数据集介绍
AOL4FOLTR 数据集图片
构建方式
在联邦在线学习排序(FOLTR)研究中,现有基准数据集普遍依赖经典学习排序数据集的随机分区以及模拟用户点击行为,这严重偏离真实场景。为弥补这一缺陷,AOL4FOLTR数据集基于2006年AOL搜索引擎公开的查询日志构建而成。研究团队利用互联网档案馆(Internet Archive)恢复查询时刻的原始网站内容,重建了超过42万个网站。在此基础上,针对每个查询日志,通过利用冗余查询提取自然候选文档,并结合BM25匹配策略补充缺失候选项,从而重建出top-20结果列表。最终,遵循LETOR格式,为每个查询-文档对提取了103维特征向量,生成了包含约260万条查询记录、涵盖1万名用户的大规模数据集。
特点
AOL4FOLTR数据集的核心独特性在于其真实反映了联邦学习场景中的两大关键挑战——数据异质性与异步性。与依赖独立同分布(IID)假设的传统基准不同,该数据集保留了真实的用户标识符、原始查询文本、点击日志及精确的时间戳,使得用户间的点击偏好差异(非IID特性)得以完整呈现。统计分析显示,用户活动呈现典型的幂律分布,少数用户贡献了大部分点击行为;同时,用户活动在时间维度上表现出突发性和不规律性,形成了天然的非同步更新模式。这些特征为模拟联邦在线学习中客户端数据分布不均、更新频率各异等现实困境提供了前所未有的研究基础。
使用方法
该数据集适用于构建和评估同步与异步联邦在线学习排序算法。使用时,研究人员可按用户标识符将数据分配给不同客户端,每个客户端基于自身点击日志训练本地排序模型,并通过联邦协议(如FedAvg)聚合更新。在同步场景下,所有客户端按固定轮次同步提交模型更新;而在异步场景下,可依据查询时间戳排序客户端更新,并采用FedAsync等算法处理由更新延迟导致的梯度陈旧问题。数据集已公开提供原始查询、文档内容及特征编码,研究者可自由设计新的排序特征,探索个性化策略,或在去中心化信息检索框架下进行实验,从而推动隐私保护型排序模型的深入研究。
背景与挑战
背景概述
在信息检索与隐私保护交汇的前沿领域,联邦在线学习排序(FOLTR)作为一种兼顾模型协作训练与用户数据隐私的范式,逐渐成为研究热点。然而,现有基准数据集多依赖于对经典离线排序数据集的随机划分、模拟用户点击行为以及同步客户端参与的假设,这严重偏离了真实世界的动态复杂性。为弥合这一鸿沟,由荷兰代尔夫特理工大学Marcel Gregoriadis等人于2025年创建的AOL4FOLTR数据集应运而生。该数据集基于2006年公开的AOL查询日志,通过互联网档案馆重现历史网页内容,并重构了每条查询对应的前20个结果列表,最终囊括了来自10,000名用户的约260万次搜索交互,涵盖用户标识符、真实点击数据与查询时间戳。作为首个面向FOLTR的真实世界大规模数据集,它不仅为异质性与异步联邦学习场景的模拟提供了坚实支柱,更推动了排序模型在隐私保护下的实证研究,对信息检索与分布式学习领域产生了深远影响。
当前挑战
AOL4FOLTR数据集所解决的领域问题核心在于联邦在线学习排序中客户端的异质性与交互异步性。传统方法基于独立同分布(IID)的随机划分与同步训练假设,无法捕捉用户间不同的文档偏好与非均匀的查询频率,导致模型收敛困难且泛化能力低下。同时,真实搜索行为呈现爆发式与不规则的时间模式,使得异步联邦设置中陈旧梯度问题尤为突出,严重干扰全局模型的稳定性。在构建过程中,数据集面临两大挑战:一是缺失原始搜索结果列表,需设计融合自然候选项与BM25匹配的模拟策略,并嵌入随机偏移以避免排序偏差;二是特征工程受限,无法复现PageRank等依赖历史数据的指标,最终仅能提取103个可计算特征,可能限制模型的表征能力。这些挑战共同定义了AOL4FOLTR作为真实基准的独特价值与改进空间。
常用场景
经典使用场景
在联邦在线学习排序(Federated Online Learning to Rank, FOLTR)的研究中,AOL4FOLTR数据集被广泛用于模拟真实世界中用户搜索交互的异质性与异步性。研究者利用其包含的用户标识符、查询时间戳、原始查询与文档内容,能够精准地构建符合实际分布的用户划分与行为模式。该数据集的核心应用场景在于替代传统基于随机划分经典学习排序数据集、模拟用户点击及同步客户端参与的简化评估架构,为同步与异步联邦学习场景提供高保真度的实验基准。通过其提供的超过260万条查询与10,000名用户的真实交互记录,研究者得以在非独立同分布(Non-IID)数据条件下评估排序算法的鲁棒性与收敛性。
解决学术问题
该数据集解决了联邦在线学习排序领域中长期缺乏真实用户交互数据的关键瓶颈。传统研究依赖离线学习排序数据集的随机划分与点击模型模拟,忽略用户间点击偏好与使用频率的异质性,导致非独立同分布问题被低估。AOL4FOLTR通过提供用户级别的真实点击数据与查询时间戳,首次使研究者能够在非理想化条件下评估同步与异步联邦排序算法。它揭示了异步设置中模型性能的不稳定性,这一现象在独立同分布基准中完全消失,从而凸显了真实数据对学术研究的必要性。该数据集推动了联邦学习领域对客户端异质性、模型陈旧性及公平性等核心问题的深入探讨,为理论分析与算法创新提供了不可替代的实验基础。
衍生相关工作
围绕AOL4FOLTR数据集,一系列衍生研究工作相继涌现。在算法层面,基于该数据集验证了FPDGD等联邦在线排序算法在同步与异步环境下的性能差异,推动了FedAsync等异步联邦协议在信息检索领域的适配。在特征工程方面,研究者利用数据集的原始文档内容,开发了超越传统关键词匹配的排序特征,探索了文档语义表示在异构客户端间的泛化能力。此外,该数据集还被用于个性化排序与用户建模研究,例如通过分析不同用户群体的点击偏好差异,提出了面向非独立同分布数据的局部微调策略。在系统架构层面,基于AOL4FOLTR的工作催生了去中心化搜索引擎原型(如SwarmSearch),验证了点对点网络中联合排序的可行性,为构建无中央服务器的隐私友好型搜索生态奠定了实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务