遇见数据集

Object_Search

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

该数据集是Amazon Appliances指令条件三元组数据集,来源于Amazon Reviews 2023 Appliances元数据。数据集旨在为指令条件检索任务提供训练和评估样本,每个样本包含一个查询(query)和一个正例(positive)和一个负例(negative),每个角色均包含指令(instruction)、产品文本描述(text)和产品图片URL(image)三个字段。查询的指令是用户可能输入的搜索文本(条件化字段),而正例和负例的指令固定为represent the input,形成不对称条件化:查询嵌入受搜索指令影响,候选嵌入不受影响。数据集共4326个样本,划分为训练集(4000条)、验证集(161条)和测试集(165条),且验证集和测试集与训练集商品不重叠(种子13),确保泄漏检测严格。数据构建采用关键词启发式方法:从元数据中选取两个产品共享关键词x和y,第三个产品仅共享x,前两个分别作为查询和匹配,第三个作为非匹配;然后由视觉语言模型根据三个产品的图片和元数据生成搜索文本。注释质量极高(5000/5000接受,高置信度4998条)。数据文件包括CSV拆分文件、原始标注JSONL文件(含完整产品信息)和生成清单。该数据集可直接用于指令条件文本-图像检索任务的训练与评估。

This dataset is the Amazon Appliances Instruction-Conditioned Triplet Dataset, derived from the Amazon Reviews 2023 Appliances metadata. It is designed to provide training and evaluation samples for instruction-conditioned retrieval tasks. Each sample contains a query, a positive example, and a negative example, each consisting of three fields: instruction, product text description, and product image URL. The querys instruction is the users potential search text (conditioned field), while the instructions for the positive and negative examples are fixed as represent the input, forming asymmetric conditioning: query embeddings are influenced by the search instruction, but candidate embeddings are not. The dataset contains 4326 samples, split into training (4000), validation (161), and test (165) sets, with no product overlap between validation/test and training sets (seed 13), ensuring strict leakage detection. Data construction uses a keyword heuristic method: two products sharing keywords x and y are selected from metadata, a third product shares only x, the first two serve as query and match, and the third as non-match; then a vision-language model generates search text based on the images and metadata of the three products. Annotation quality is extremely high (5000/5000 accepted, 4998 high confidence). Data files include CSV splits, original annotation JSONL files (with full product information), and generation manifests. This dataset can be directly used for training and evaluating instruction-conditioned text-image retrieval tasks.

创建时间:
2026-09-08
原始信息汇总

数据集概述:JojoQaQ/Object_Search

JojoQaQ/Object_Search 是一个基于「亚马逊评论2023-家电类目」构建的指令条件化检索三元组数据集,用于文本检索任务。

基本信息

  • 任务类型:文本检索 (Text Retrieval)
  • 数据规模:1K < N < 10K
  • 数据来源McAuley-Lab/Amazon-Reviews-2023 中的 meta_Appliances.jsonl,以种子 0 从 88668 条扫描记录中采样获得

数据集划分

划分 行数
训练集 4000
验证集 161
测试集 165

防泄漏设计:使用种子 13 确保物品不相交,验证集和测试集中的任何产品均未出现在训练集中,使泄漏检查可作为硬性门槛而非警示机制。注释者接受率为 5000/5000,置信度分布为 {high: 4998, medium: 2}

数据列说明

每个三元组包含三个角色(查询、正例、负例),每个角色含三个字段:

列名 含义
{role}_instruction 指令文本。查询侧的指令是用户会输入的搜索语句(唯一带条件的字段);回答侧固定为 represent the input
{role}_text 产品序列化文本,包含标题、类别、特性、描述、详情、店铺、评分及价格等
{role}_image 产品的图片 URL

此结构设计的关键在于不对称性:查询嵌入受搜索语句条件化,而候选嵌入不受条件化。

构建方式

  1. 候选生成:通过关键词启发式方法——两个产品共享关键词 xy,第三个产品仅共享 x;共享两个关键词的两者分别成为查询和匹配项,第三个则作为非匹配项。角色分配由构造决定,而非模型判定。
  2. 搜索文本生成:视觉语言模型在观看所有三个产品图像及其元数据后,仅负责编写搜索文本。

文件结构

  • data/*.csv — 上述三个数据划分的 CSV 文件(查看器显示的即是此文件)
  • raw/amazon_appliances_c3_triplet_annotations.jsonl — 注释器的原始输出,包含来源产品记录(特性、描述、详情、店铺、价格和评分)
  • raw/amazon_appliances_c3_triplet_annotations.hub_manifest.json — 校验和与生成清单
  • prompt/task_instructions.txt — 每一行共用的提示指令部分
  • prompt/demonstrations.json — 少样本示例池(每行从中抽取两个示例,以 triplet_id 为种子保证可复现)
  • prompt/example_prompt_*.txt — 特定行的完整提示渲染,图片已就地标记
搜集汇总
数据集介绍
Object_Search 数据集图片
构建方式
本数据集源于Amazon Reviews 2023 Appliances元数据,通过关键词启发式策略构建三元组,即两件商品共享关键词x与y,第三件仅共享x,由此确定查询、正例与负例。指令文本由视觉语言模型在观察三件商品图像及其元数据后自动生成,标注者仅需对生成的检索文本进行质量校验,最终以人工审核通过率100%且高置信度占比99.96%确保了数据质量。
特点
该数据集具备指令条件化的三元组结构,查询侧嵌入受检索指令影响,而候选侧则采用固定指令,凸显对称性设计以模拟真实检索场景。数据划分严格遵循物品不相交原则,有效杜绝信息泄漏。每个样本均保留原始商品详细信息,涵盖多模态字段,为跨模态检索研究提供丰富维度的评估基准。
使用方法
数据集划分为训练、验证与测试集,可直接用于微调嵌入模型。用户加载CSV文件后,应将每一行字段作为模型输入,其中查询文本、图像及指令构成query侧,正负样本对应positive与negative侧,实现端到端的指令感知检索训练与评估。通过调用再现标注提示的脚本,还可对样本生成过程进行透明化追溯。
背景与挑战
背景概述
Object_Search数据集由McAuley实验室于2023年构建,基于Amazon Reviews 2023的Appliances类别,旨在推动指令条件下的多模态产品检索研究。核心研究问题在于如何利用自然语言指令(如用户搜索表述)对商品进行精确匹配,并提供了包含三元组(查询、正例、负例)的监督数据。该数据集通过启发式关键词策略和视觉-语言模型生成搜索文本,确保样本既有语义关联又具判别性,可用于训练和评估嵌入模型的检索性能。其影响力体现在为产品检索领域提供了一个实例级、多模态的研究基准,尤其在处理真实电商场景的复杂指令上具有首创性,且通过物品级划分(seed 13)避免了数据泄露,为领域内后续研究奠定了可靠基础。
当前挑战
该数据集的核心挑战在于多模态对齐与语义歧义消解。具体而言,查询指令常以自然语言表达风格或功能性需求,如“same style with egg separator”要求理解抽象风格与具体部件的组合,而商品文本冗长且含噪声(如细节多寡不一),图像与文本互补但不完全同步,对跨模态语义融合构成挑战。构建过程中,三元组采样基于关键词交集启发式,虽保证标签构造的确定性,但可能引入粒度偏差——共享多关键词的商品对易被误判为正例,破坏负例的难区分性。此外,视觉-语言模型生成搜索文本时需平衡真实性与多样性,注释者在5000次接受中仅2次标记为中等置信,昭示模型评估的主观性边缘案例依然存在,提示未来研究需强化对抗性负例挖掘与指令语义的精细建模。
常用场景
经典使用场景
该数据集面向指令条件下的多模态检索任务,特别是在电子商务领域中对家电产品的搜索场景。每个样本包含查询指令、查询产品的文本与图像描述,以及匹配和不匹配的候选产品,旨在训练模型根据用户表达的自然语言搜索意图,从海量商品库中精准定位目标商品。其典型应用为构建跨模态语义对齐的检索系统,要求模型同时理解文本指令、商品视觉特征与结构化元数据,从而在细粒度品类中区分功能相近而细节有别的商品。
实际应用
在实际应用层面,该数据集可助力开发智能购物助手与电商平台搜索增强功能。例如,用户输入诸如“同款带打蛋器和打蛋碗的样式”等描述性查询,系统需从庞大商品库中筛选出风格相容的替代品。其数据构造模拟了真实用户的模糊表达,因此适用于训练和评估面向终端用户的商品推荐与检索系统。此外,该数据集还可用于优化多模态嵌入模型在零样本或少样本场景下的泛化能力,支持构建跨品类、跨域的商品搜索服务。
衍生相关工作
该数据集的公开有望催生一系列下游研究,如指令感知的视觉-语言检索框架、基于三元组损失的多模态嵌入优化、以及结合结构化元数据(如品牌、价格)的混合检索模型。其与Amazon Reviews 2023数据集的关联为大规模预训练模型的微调提供了宝贵资源,可能推动针对商品检索的专用基础模型出现。同时,数据集中注释的精细性与产品不相交的划分设计,为研究领域漂移和模型鲁棒性提供了实验场,未来或延伸出在无监督域适应、多模态知识蒸馏等方向上的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务