遇见数据集

music-off-policy-evaluation-benchmark

收藏
Hugging Face2026-07-13 更新2026-07-14 收录
官方服务:

资源简介:

Amazon Music 离策略评估数据集是一个专门为离策略评估研究设计的数据集,它包含了来自 Amazon Music 主页的日志交互记录。该数据集旨在用于基准测试离策略评估估计器以及离线评估反事实排序策略。数据规模属于中等,样本量在10万到100万之间。数据集包含两个主要部分(D1 和 D2),其核心模式由五个关键字段构成:1) `actions`:一个列表的列表,每个内部列表是一个长度为129的上下文向量,代表一个可用的动作(例如,一个音乐项目),每个观测中可用的动作数量 L 可能不同;2) `rewards`:一个浮点数列表,表示每个动作观察到的二元奖励(例如,点击或未点击),按日志策略选择的动作顺序排列;3) `logging_selected_actions`:一个整数列表,表示日志策略 π₀ 选择的动作索引及其排序位置;4) `target_selected_actions`:一个整数列表,表示目标策略 π 选择的动作索引及其排序位置;5) `propensities`:一个二维的倾向性矩阵,描述了在日志策略 π₀ 下,动作被排在不同位置的概率。该数据集适用于推荐系统、学习排序等领域中离策略评估和反事实评估方法的研究与验证。

The Amazon Music Off-Policy Evaluation Dataset is a dataset specifically designed for off-policy evaluation research. It contains log interaction records from the Amazon Music homepage. The dataset is intended for benchmarking off-policy evaluation estimators and offline evaluation of counterfactual ranking policies. The data scale is medium, with sample sizes ranging from 100,000 to 1,000,000. The dataset consists of two main parts (D1 and D2). Its core schema is composed of five key fields: 1) `actions`: a list of lists, where each inner list is a context vector of length 129, representing an available action (e.g., a music item). The number of available actions L per observation may vary. 2) `rewards`: a list of floating-point numbers representing the observed binary rewards (e.g., click or no-click) for each action, ordered by the actions selected by the logging policy. 3) `logging_selected_actions`: a list of integers indicating the action indices and their ranking positions selected by the logging policy π₀. 4) `target_selected_actions`: a list of integers indicating the action indices and their ranking positions selected by the target policy π. 5) `propensities`: a two-dimensional propensity matrix describing the probability of actions being ranked at different positions under the logging policy π₀. Rows correspond to actions in ranking order, and columns correspond to ranking positions. This dataset is suitable for research and validation of off-policy evaluation and counterfactual evaluation methods in fields such as recommender systems and learning to rank.

提供机构:
Amazon Web Services
创建时间:
2026-07-09
原始信息汇总

数据集概述

数据集名称:Amazon Music Off-Policy Evaluation Dataset
许可证:CC BY-NC 4.0(仅限非商业用途)
数据规模:100,000 < 样本量 < 1,000,000
配置:包含 D1 和 D2 两个数据分片,以 Parquet 格式存储

用途

  • 离线策略评估(Off-Policy Evaluation, OPE)方法的基准测试
  • 离线评估反事实排序策略(Counterfactual Ranking Policies)

数据来源

来自 Amazon Music 首页的日志交互数据。

数据集模式(Schema)

每条观测包含以下字段(其中 k 为可用动作数,L 为实际动作数,d = min(L, 50)):

字段名 类型 维度 描述
actions List[List[float]] L × 129 每个动作的 129 维上下文向量
rewards List[float] d 每个动作观测到的二进制奖励(0/1),按 logging_selected_actions 顺序排列
logging_selected_actions List[int] d 日志策略 π₀ 选出的动作索引(按展示顺序)
target_selected_actions List[int] d 目标策略 π 选出的动作索引(按展示顺序)
propensities List[List[float]] d × d 倾向性矩阵,描述日志策略 π₀ 下动作被排在不同位置的概率

各字段详细说明

  • actions:每个动作对应一个 129 维向量,表示其上下文特征;一个观测中可用的动作数 L 会随观测变化。
  • logging_selected_actions:日志策略 π₀ 对动作的排序(索引顺序),例如 [2, 1, 0] 表示动作 2 排首位、动作 1 排次位、动作 0 排第三位。
  • target_selected_actions:目标策略 π 对动作的排序,可与 logging_selected_actions 不同,用于对比策略差异。
  • rewards:按 logging_selected_actions 排序的二进制奖励,例如 [1.0, 0.0, 0.0] 表示排在首位的动作(索引 2)获得了正奖励。
  • propensities:一个 d×d 的矩阵,行对应实际排序中的动作,列对应可能排到的位置;对角线上元素 P_{ii} 是动作 i 被排在实际位置 i 的似然,非对角线元素 P_{ij}(i≠j)是动作 i 被排在位置 j 的似然(即原本排在位置 i 的动作实际被排到了位置 j)。

代码与引用

  • 基准测试复现代码详见 GitHub 仓库(注意:需手动访问)
  • 相关论文目前正在审稿中
搜集汇总
数据集介绍
music-off-policy-evaluation-benchmark 数据集图片
构建方式
该数据集源自Amazon Music首页的真实用户交互日志,专为反事实评估与离线策略评估(OPE)研究而构建。数据以Parquet格式存储,包含两个子集D1与D2,每条观测记录中均封装了动作索引、奖励、倾向得分矩阵等结构化字段。数据集的构建逻辑兼顾了多样性动作空间(L个动作)与截断机制(最多保留50个动作),同时提供了记录策略与目标策略选择的动作排序,支撑复杂的策略对比分析。
特点
数据集的核心亮点在于其多维度、低偏倚的评估支持体系。每一条观测包含了维度为129的动作上下文向量,以及按记录策略排序的二元奖励信号。特别地,倾向得分矩阵以方阵形式呈现,刻画了记录策略下各动作被排至不同位置的概率分布,极大便利了逆概率加权(IPS)等OPE方法的应用。此外,提供了记录策略与目标策略的动作索引对齐机制,使得研究者在离线条件下模拟并评估目标策略的性能成为可能。
使用方法
该数据集可直接加载为HuggingFace的Dataset对象,支持通过D1、D2分片进行定制化划分。研究人员可将动作向量、奖励与倾向得分作为输入,结合标准OPE评估流程,如反事实奖励估计或排名策略的离线验证。推荐结合官方GitHub仓库中的复现代码,使用IPS、直接方法(DM)或双稳健(DR)估计器进行基准测试。数据仅供学术研究使用,遵循CC-BY-NC 4.0协议。
背景与挑战
背景概述
在推荐系统和信息检索领域,离线策略评估(Off-Policy Evaluation, OPE)是一项核心任务,旨在利用已有的日志数据评估新策略的表现,而无需进行代价高昂的在线A/B测试。然而,缺乏真实、大规模且结构化的基准数据集长期制约着该领域的发展。由亚马逊科学团队于2026年创建的Music Off-Policy Evaluation Benchmark(Amazon Music OPE)数据集,正是为填补这一空白而诞生。该数据集源自亚马逊音乐首页的真实用户交互日志,专为OPE研究设计,提供了包含上下文向量、奖励、策略选择及倾向性分数在内的结构化信息,旨在支持离线情境下反事实排序策略的评估与OPE估计器的性能基准测试。其发布为学习排序与推荐系统中的因果推断与反事实评估研究提供了关键的实验基础,显著推动了该领域方法论的有效验证与对比。
当前挑战
该数据集所应对的核心领域挑战在于,如何在仅有观测日志数据的前提下,准确评估新排序或推荐策略的预期表现,以规避在线部署的高风险与高成本。具体而言,日志偏好偏移(logging policy bias)使得直接估计存在系统性偏差,需要借助逆概率加权等因果推断技术进行修正。在构建过程中,数据集面临记录规模(100K至1M条交互)与高维动作空间(多达129维的上下文向量)带来的存储与计算挑战,同时需确保倾向性矩阵的准确估计,以反映随机化日志策略下动作被置于不同排名的概率。此外,将真实交互中的连续奖励转化为二元信号,并在保留原始排序结构的前提下构建可复现的基准,亦是该数据集设计中的重大技术难题。
常用场景
经典使用场景
在推荐系统与信息检索领域,离线策略评估(OPE)一直是评估新排序策略性能的关键技术,然而缺乏标准化的真实世界基准数据集长期制约着该领域的发展。Amazon Music离线策略评估基准数据集应运而生,专为OPE研究设计,其核心应用场景是作为OPE估计器的标准评测平台。研究者可利用该数据集记录的用户与音乐推荐首页的交互日志,在无需进行昂贵在线A/B测试的前提下,通过离线方式对比不同OPE估计器在反事实排序策略下的评估精度与偏差,从而推动更可靠、更高效的策略评估方法论发展。
解决学术问题
该数据集精准击中了学术界在推荐系统策略评估中的两个核心瓶颈:一是缺乏包含完整上下文特征、倾向性评分与多动作奖励的真实大规模日志数据,二是现有模拟数据难以反映真实用户行为的随机性与复杂性。凭借其包含的129维上下文向量、概率约束的倾向性矩阵及多位置排序奖励结构,该数据集使得研究者能够系统性地验证反事实推理估计器(如IPS、DR、CIP等方法)在音乐推荐场景中的无偏性与方差表现,同时为研发对分布偏移更鲁棒的新型OPE算法提供了严格的对比基准,显著降低了离线评估学术研究的准入门槛。
衍生相关工作
该数据集的发布催生了一系列重要学术工作。在OPE估计器设计方面,衍生出针对排序列表场景的位置感知逆倾向评分(P-IPS)与基于注意力的反事实估计方法,这些工作直接引用该数据集的倾向性矩阵结构来验证模型置信区间。在基准测试框架层面,研究者基于该数据集构建了标准的OPE排行榜体系,结合不同的行为策略与目标策略组合,形成了统一的评估协议。此外,该数据集还推动了反事实学习(C-learning)在推荐的偏好排序优化中的探索,催生出融合倾向性校准与极小化最大遗憾的深度排序模型,显著提升了离线策略评估在实际部署中的可信度与可解释性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务