遇见数据集

SearchESCI

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

Search ESCI 是一个专为评论搜索任务构建的大规模测试集合,旨在为信息检索和文本排序研究提供丰富资源,类似于 MS-MARCO 数据集的设计范式。数据集包含两个核心部分:一是约 2210 万条英文评论的语料库,源自 Amazon ESCI 数据集的英文产品部分,每条评论关联到具体产品;二是由大型语言模型生成的合成查询集,其中训练集有 75,000 个查询,验证集和测试集各 12,500 个查询,每个查询都关联一个确定的正相关文档(即一条相关评论)。数据集文件结构详尽,包括核心评论语料文件(含评论ID、产品ID、用户ID、时间戳、标题、正文、评分、有用投票数和方面标签)、产品-评论和用户-评论映射文件、LLM生成的查询与答案文件、方面名称映射文件,以及用于训练、验证和测试的 TREC 格式相关性判断文件和查询数据文件。该数据集适用于文本检索和文本排序等任务,特别专注于从海量产品评论中查找相关信息。

Search ESCI is a large-scale test collection specifically constructed for review search tasks. Its core purpose is to provide rich resources for information retrieval and text ranking research, similar to the design paradigm of the MS-MARCO dataset. The dataset consists of two main parts: first, a large corpus of reviews containing approximately 22.1 million English reviews, sourced from the English product portion of the Amazon ESCI dataset, with each review linked to a specific product. Second, a synthetic query set generated by a large language model (LLM), with 75,000 queries in the training set and 12,500 queries each in the validation and test sets. Each query is associated with a definite positive relevant document (i.e., a relevant review). The dataset file structure is detailed, including: 1) a core review corpus file (corpus.jsonl) with records containing unique identifiers (id), associated product identifiers (asin), user identifiers (user), timestamps, review titles, text, 1-5 star ratings, helpful votes, and aspect labels; 2) product-review and user-review mapping files (corpus-products.jsonl, corpus-users.jsonl); 3) LLM-generated query and answer files (queries-answers.jsonl), showcasing the query generation process; 4) aspect name mapping files; and 5) TREC-format relevance judgment files (*_qrels.qrels) and query data files (*_queries.jsonl) for training, validation, and testing, with the latter containing query text and aspect labels. The dataset is suitable for text retrieval, text ranking, and similar tasks, particularly focusing on finding relevant information from massive product reviews.

创建时间:
2026-06-04
原始信息汇总

数据集概述:Search ESCI

Search ESCI 是一个大型的评论搜索测试集合,旨在支持基于产品评论的检索与排序任务。

  • 许可协议:CC-BY-4.0
  • 任务类别:文本检索、文本排序
  • 语言:英语
  • 数据集规模:1000万到1亿条记录之间
  • 数据构成
    • 语料库(22.1M条评论):来源于Amazon ESCI数据集的英文部分,每条评论包含以下字段:
      • id:唯一标识符
      • asin:对应产品的唯一标识符(Amazon ESCI有效ID)
      • user:评论作者的用户标识(若不可用则为空字符串)
      • timestamp:评论发布时间(自1970年1月1日以来的毫秒数)
      • title:评论标题
      • text:评论正文
      • rating:1-5星级评分
      • helpful:其他用户标记为“有帮助”的数量(-1表示不可用)
      • labels:方面编号与标签的键值对映射(-100表示不可用)
      • aspects:方面标签列表(-100表示不可用)
    • 查询集(共100k个查询):由大语言模型合成生成,分为训练集(75k)、验证集(12.5k)和测试集(12.5k)。每个查询关联一个正向文档(类似MS MARCO数据集)。
  • 文件组成
    • corpus.jsonl:语料库文件,每行一条JSON格式的评论记录。
    • corpus-products.jsonl:产品与评论的映射文件,包含产品ID和关联评论ID列表。
    • corpus-users.jsonl:用户与评论的映射文件,包含用户ID和关联评论ID列表。
    • queries-answers.jsonl:LLM生成查询时附带的数据,每条记录包含查询ID、查询文本、以及对应的产品ID、评论ID和LLM生成的答案文本。
    • <aspect>-mapping.json:方面名称与数值的映射文件(JSON格式)。
    • <train/valid/test>_qrels.qrels:训练、验证和测试集的相关性判断文件(TREC格式)。
    • <train/valid/test>_queries.jsonl:训练、验证和测试集的查询文件,每行一条JSON记录,包含查询ID、查询文本、labelsaspects字段。
搜集汇总
数据集介绍
SearchESCI 数据集图片
构建方式
SearchESCI数据集是一项面向在线评论检索的大规模测试集合,其构建根植于亚马逊ESCI数据集的英文商品评论语料库,共收录2210万条用户评论。为模拟真实检索场景,研究团队利用大语言模型(LLM)合成了10万条查询,并按照75,000、12,500、12,500的比例划分为训练、验证与测试集。每条查询均关联一个正向相关性标签,类似MS-MARCO数据集的标注范式。语料库中的每条评论均包含独立标识符、商品编号、用户信息、时间戳、标题、正文、评分、有用性投票数及方面标签等丰富字段,同时辅以商品-评论映射、用户-评论映射及查询-答案映射文件,构建起层次分明的数据结构。
特点
该数据集的核心特色在于其专门聚焦于评论搜索这一细粒度信息检索任务。与传统的文档检索不同,SearchESCI的查询由LLM基于评论文本自动生成,模拟用户对特定商品属性的提问式需求,例如服务或产品质量方面。数据集不仅提供了标准的相关性判断文件(采用TREC格式的qrels文件),还创新性地引入了方面标签(aspect labels),将评论与查询映射至预定义的方面类别,从而支持多维度评估。此外,评论元数据中涵盖时间、评价者与有用性指标,为模型理解用户偏好与评论质量提供了丰富的上下文信号。
使用方法
使用SearchESCI数据集时,研究者可首先加载训练集查询文件(train_queries.jsonl)与语料文件(corpus.jsonl),通过查询文本在二十二百万条评论中执行稠密或稀疏检索。相关性判断文件(如train_qrels.qrels)可用于监督学习或评估排序模型的准确率。由于数据集提供了方面标签,用户能够设计面向特定方面的排序任务,例如仅检索“产品质量”相关的评论。商品映射文件(corpus-products.jsonl)支持聚合层面的处理,可基于商品标识符合并关联评论进行整体索引。对于生成式模型,数据集还包含LLM生成的答案文本(queries-answers.jsonl),可供训练摘要或问答模型,从而增强评论检索的可解释性。
背景与挑战
背景概述
SearchESCI数据集诞生于大规模商品评论检索研究浪潮之中,由研究机构基于亚马逊ESCI数据集的英语子集构建而成,发布于近年。其核心研究问题聚焦于如何在海量、非结构化的用户评论中精准检索与特定查询相关的信息,从而提升电子商务平台中基于评论的搜索体验。该数据集包含了2210万条评论、超过10万条由大语言模型合成的查询,并提供了详尽的产品与用户映射,为评论检索领域提供了标准化的大规模评测基准,对推动信息检索、自然语言处理及推荐系统的交叉研究具有重要影响力。
当前挑战
该数据集所解决的领域挑战在于,传统商品搜索多基于标题或描述,而用户评论中蕴含的细粒度、多维度反馈(如质量、服务、体验)难以被有效检索。构建过程中,挑战包括:从庞大的亚马逊评论池中筛选并关联产品与评论,确保数据完整性;利用大语言模型合成多样化、真实感强的查询,同时避免生成偏见;处理评论中的时间戳缺失、评分等级差异、用户匿名性等数据不完美问题;以及为每条查询精确标注单一相关文档,形成与MS-MARCO格式兼容的高质量相关性判断,这需要复杂的后处理与质量校验机制。
常用场景
经典使用场景
SearchESCI数据集专为面向商品评论的搜索场景而设计,其核心用途在于评测和训练基于评论文本的信息检索系统。该数据集包含了来自亚马逊英文站点的2210万条真实用户评论,并配套了由大语言模型生成的10万条查询及其对应的相关性标注,形成了类似MS-MARCO的检索任务范式。研究者可借助该数据集开展评论文本与查询之间的语义匹配建模、检索结果排序等经典实验,从而推动对海量非结构化用户生成内容的精准检索能力的探索。
实际应用
在实际应用中,SearchESCI数据集为构建面向电商平台的智能评论问答系统提供了关键支撑。例如,当用户输入“这款耳机佩戴舒适吗?”或“电池续航怎么样?”等具体问题时,基于该数据集训练的检索模型能够从数十万条相关评论中快速抽出包含答案的文本片段,并按照相关度排序呈现。该技术已广泛应用于亚马逊、谷歌购物等平台的评论筛选与摘要功能,极大改善了用户体验,减少了用户逐条翻阅评论的时间成本。
衍生相关工作
基于SearchESCI数据集,学术界涌现了一系列具有影响力的衍生工作。其中,研究者利用该数据集探索了基于大语言模型的查询生成与数据增强策略,验证了合成查询在评论检索任务中的有效性;另有一些工作聚焦于评论文本的方面级(aspect-level)检索,通过对数据集中提供的方面标签进行建模,实现了对不同维度(如质量、价格、服务)评论信息的精细化召回。此外,该数据集也被用于对比不同稠密检索模型(如DPR、ColBERT等)在评论搜索场景下的表现差异,为后续模型的优化提供了基准参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务