遇见数据集

AmazonESCI

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

Amazon ESCI 是一个用于产品搜索的大规模测试集合,包含一个约120万产品的英语语料库,以及训练、验证和测试查询集(分别约74,900、13,500和8,900个查询)。每个查询平均有约20.15个相关性判断,分为四个等级:Exact(精确匹配)、Substitute(替代品)、Complementary(互补品)和Irrelevant(无关品),并关联增益值1.0、0.1、0.01和0.0,评估时仅Exact产品被视为正例。数据集文件包括:catalog.jsonl(产品语料,含ID、标题、描述等字段)、<aspect>-mapping.json(方面映射)、以及训练/验证/测试集的<train/valid/test>_qrels.qrels(相关性判断)和<train/valid/test>_queries.jsonl(查询信息)。该数据集适用于文本检索和排序任务,特别针对电子商务产品搜索研究。

Amazon ESCI is a large-scale test collection for product search, consisting of an English corpus of approximately 1.2 million products, along with query sets for training, validation, and test (with about 74,900, 13,500, and 8,900 queries respectively). Each query has an average of about 20.15 relevance judgments categorized into four levels: Exact, Substitute, Complementary, and Irrelevant, associated with gain values of 1.0, 0.1, 0.01, and 0.0, where only Exact products are considered positive in evaluation. The dataset includes files such as catalog.jsonl (product corpus in JSONL format with fields like id, title, description), <aspect>-mapping.json (aspect mapping), and <train/valid/test>_qrels.qrels (relevance judgments in TREC format) and <train/valid/test>_queries.jsonl (queries in JSONL format). It is suitable for text retrieval and ranking tasks, particularly in e-commerce product search research.

创建时间:
2026-06-04
原始信息汇总

数据集名称

Amazon ESCI

基本概述

Amazon ESCI 是一个面向产品搜索的大规模测试数据集,旨在支持文本检索与排序任务。数据集基于亚马逊商品的英文部分构建,包含约120万件商品、超过9万条查询以及丰富的相关性标注。

数据规模

  • 商品语料库:包含约120万件产品。
  • 查询集
    • 训练集:74,900条查询
    • 验证集:13,500条查询
    • 测试集:8,900条查询
  • 相关性标注:平均每条查询包含20.15条评估,共计四个相关等级。

标注体系

相关性标注分为四个等级,各自对应不同的增益值:

  • Exact(精确匹配):增益值 1.0,仅此等级被视为正向产品。
  • Substitute(替代品):增益值 0.1
  • Complementary(互补品):增益值 0.01
  • Irrelevant(无关):增益值 0.0

文件构成

数据集包含以下主要文件:

  • catalog.jsonl:包含语料库中每个产品的完整信息,每条记录为 JSON 格式,字段包括:
    • id:产品唯一标识符
    • title:产品标题
    • description:产品描述
    • bullet_point:产品要点的拼接
    • categories:产品所属的层次化类别列表(最多4级)
    • details:附加键值对元数据
    • image:中等尺寸产品图片的 URL(不可用时为空字符串)
    • brand:品牌元数据(不可用时空字符串)
    • color:颜色元数据(不可用时空字符串)
    • price:产品价格整数值(例如 €39.99 存储为 3999,不可用时为 -1)
    • num_ratings:产品页面上的评分数量(不可用时为 -1)
    • avg_ratings:产品页面上的平均评分(不可用时为 -1.0)
    • template:亚马逊产品页面使用的页面模板(不可用时为空字符串)
    • labels:键值对字典,包含方面编号与对应标签(不可用时为 -100)
    • aspects:方面标签列表(不可用时为 -100)
  • <aspect>-mapping.json:方面名称与对应数值的映射,JSON 格式。
  • <train/valid/test>_qrels.qrels:训练、验证、测试集的相关性判断,采用 TREC 格式。
  • <train/valid/test>_queries.jsonl:训练、验证、测试集中每条查询的数据,JSON 格式,字段包括:
    • id:查询唯一标识符
    • text:查询文本内容
    • labels:键值对字典,包含方面编号与对应标签(不可用时为 -100)
    • aspects:方面标签列表(不可用时为 -100)

许可证与标签

  • 许可证:Creative Commons Attribution 4.0 International(CC-BY-4.0)
  • 语言:英语(en)
  • 任务类别:文本检索、文本排序
  • 标签:产品搜索(ProductSearch)
  • 数据规模类别:1M < N < 10M(百万至千万级别)
搜集汇总
数据集介绍
AmazonESCI 数据集图片
构建方式
AmazonESCI数据集旨在服务于产品搜索领域的文本检索与排序任务,其构建基于亚马逊电子商务平台的海量真实数据。该语料库囊括了约120万件商品的英文信息,每件商品均以JSON格式记录,包含标题、描述、要点、类别层级、元数据细节、图片链接、品牌、颜色、价格、评分数量与均值等丰富属性。同时,数据集收集了约7.49万条训练查询、1.35万条验证查询及0.89万条测试查询,每条查询亦以JSON形式呈现,并附带与商品相似的方面标签映射。相关性判断以TREC格式存储,每条查询平均拥有20.15条评估,依据Exact、Substitute、Complementary与Irrelevant四级标签进行标注,其增益值分别为1.0、0.1、0.01与0.0,仅将Exact视为正样本。
特点
该数据集的一大显著特点在于其精细化、多层次的相关性标注体系,超越了传统二元相关判断,引入替代品与互补品概念,精准模拟真实购物场景中的用户意图。此外,商品信息维度极为丰富,涵盖结构化与非结构化数据,如类别树、品牌、价格及用户评分,为多模态与多视角的产品检索研究提供了坚实基础。值得一提的是,数据集还整合了J-MADRAL框架中的方面标签与映射文件,支持细粒度的属性级分析,增强了其在复杂检索任务中的实用价值。整体规模达到百万级商品与十万级查询,兼具深度与广度,是评估与训练现代产品搜索模型的高质量基准。
使用方法
使用AmazonESCI数据集时,研究人员可依据任务需求灵活选取其组成部分。对于文本检索与排序任务,可直接加载catalog.jsonl作为语料库索引,结合<train/valid/test>_queries.jsonl中的查询文本与<train/valid/test>_qrels.qrels中的相关性标签进行监督学习或评估。标签体系支持多种加权策略,例如仅将Exact视为正例进行二分类训练,或利用增益值进行LambdaRank等排序模型的优化。此外,方面标签与映射文件为探索属性级检索提供了接口,便于构建面向特定产品属性的细粒度查询系统。价格、评分等数值字段也可用于特征工程,助力混合检索模型的开发。
背景与挑战
背景概述
在电子商务蓬勃发展的时代,产品搜索作为连接用户与海量商品的关键纽带,其检索精度直接影响用户决策与平台营收。Amazon ESCI数据集由亚马逊研究团队于近年构建并公开,旨在填补产品搜索领域大规模评测资源的空白。该数据集以超过120万件英文商品为语料库,汇聚了训练、验证与测试三阶段共逾9.7万条查询及其对应的相关性判断,通过精确匹配、替代品、互补品与不相关四类标签(收益分别为1.0、0.1、0.01与0.0)细粒度刻画用户意图。其发布不仅为信息检索社区提供了极具工业级规模的基准测试平台,更推动了产品搜索中多样化相关性建模的理论探索。
当前挑战
Amazon ESCI数据集所解决的领域核心挑战在于产品搜索中检索结果与用户意图的精细匹配。传统信息检索仅关注二元相关性,难以应对用户对替代品或互补品的潜在需求,而该数据集的四层标签体系迫使模型超越简单关键词匹配,学习区分商品间的语义关联层级。在构建过程中,研究者面临标注规范化的挑战:如何确保评估人员对“替代”与“互补”等模糊边界的标注一致性,并克服商品元数据(如描述、类别层次)的不完整性与噪声干扰。此外,跨海量查询-商品对的标注成本高昂,平均每次查询需权衡20.15条判断的精确度与规模扩展性,平衡了数据鲁棒性与实际部署的可行性。
常用场景
经典使用场景
AmazonESCI数据集广泛应用于产品搜索领域的检索与排序任务,其核心使用场景在于评估和改进搜索引擎对用户查询的响应质量。该数据集提供超过120万件商品的语料库,以及涵盖训练、验证和测试集的近10万条查询,每条查询附带细致的相关性标注,包括精确匹配、替代品、互补品和无关四类标签。研究者借助这些标注,能够训练和测试文本检索模型,尤其是学习如何区分不同层次的相关性,从而提升搜索结果对用户意图的精准捕捉。
解决学术问题
该数据集解决了产品搜索中多级相关性判断这一学术难题。传统检索数据集往往仅关注二元相关或不相关标注,而AmazonESCI通过引入精确、替代、互补和无关的四级标签体系,使研究者能够深入探讨查询与商品之间复杂的语义关联,例如理解用户何时寻求替代产品或互补商品。这一精细标注推动了学习排序、多任务学习及细粒度相关性建模等领域的发展,对提升电子商务搜索系统的召回率和精确度具有深远意义,促进了信息检索理论与商业实践的融合。
衍生相关工作
AmazonESCI数据集的发布催生了多项经典研究工作,尤其在神经检索和排序领域。许多研究利用其三级相关性标签探索了对比学习、负采样策略和列表级排序损失函数的优化。例如,基于该数据集的工作改进了双编码器和交叉编码器架构,用以捕获替代品与互补品的细微差异;同时,它促进了面向电子商务查询的预训练语言模型(如BERT的变体)在排序任务上的微调方法。这些衍生工作不仅丰富了信息检索的理论体系,也为实际电商搜索系统提供了可复现的基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务