Marqo/marqo-GS-10M
收藏官方服务:
资源简介:
Marqo-GS-10M是一个多模态、细粒度的排名数据集,主要用于Google购物场景。数据集包含图像、查询、产品ID、位置、标题、配对ID、线性评分、倒数评分、无评分和查询ID等特征。数据集分为四个部分:in_domain、novel_document、novel_query和zero_shot。该数据集用于训练和评估广义对比学习(GCL)框架,以提高信息检索模型的排名性能。
The Marqo-GS-10M dataset is a multimodal, fine-grained ranking dataset for Google Shopping, featuring images, queries, product IDs, and various relevance scores. It is designed to facilitate research in Generalized Contrastive Learning (GCL) for improving retrieval and ranking performance, particularly for product search queries. The dataset is split into multiple subsets for training and evaluation, including textual and visual data.
提供机构:
Marqo搜集汇总
数据集介绍

构建方式
Marqo-GS-10M数据集以大规模多模态检索与排序任务为背景,通过采集Google Shopping平台上的商品搜索查询与对应产品文档,构建了包含精细相关性评分的大规模三元组数据集。其构建过程采用了独特的四维切分策略:沿查询与文档两个维度进行划分,形成领域内、新查询、新文档及零样本四个子集,每个子集均包含地面真值CSV文件以及验证与测试集。数据集涵盖图像、查询文本、产品ID、标题、位置及多种评分字段,并提供了完整图像档案与子集样本,为多模态细粒度排序研究提供了坚实基础。
使用方法
使用该数据集时,可通过Hugging Face的datasets库直接加载,或从官方链接下载完整数据与图像。评估需先安装GCL环境,并利用提供的脚本修改图像路径与模型参数后运行。对于模型应用,支持通过OpenCLIP加载预训练的ViT-B-32或ViT-L-14模型进行快速推理,也可通过Hugging Face Transformers加载微调的E5文本模型。用户可结合Marqo向量搜索工具,将模型集成至实际检索系统中,实现基于精细排序的多模态商品搜索功能。
背景与挑战
背景概述
在信息检索领域,多模态对比学习虽已广泛应用于产品搜索等任务,但现有方法多依赖于二元相关性标签,难以捕捉查询与文档间细微的排序差异。为突破这一局限,Marqo团队于2024年发布了Marqo-GS-10M数据集,该数据集源自谷歌购物平台,包含近千万个查询-文档对,并附有精细化的相关性评分。研究团队由Tianyu Zhu、Myong Chol Jung和Jesse Clark组成,他们基于此数据集提出了广义对比学习框架(GCL),旨在从细粒度排序信号中学习,显著提升检索模型的排序性能。该数据集及其配套方法在行业内引起了广泛关注,为多模态检索与排序研究提供了新的基准与资源。
当前挑战
Marqo-GS-10M数据集所应对的核心挑战在于,传统对比学习仅能处理二元相关性,无法有效利用连续或分级排序信息,导致模型在排序任务中表现欠佳。构建过程中,研究人员面临多重困难:首先,需从海量非结构化电商数据中提取高质量的查询-产品对,并确保评分的一致性与准确性;其次,需设计多维度数据拆分策略(如域内、新查询、新文档、零样本),以全面评估模型的泛化能力;此外,图像数据的清洗与对齐、多模态特征的融合,以及大规模数据的高效存储与访问,均为工程实现上的显著挑战。
常用场景
经典使用场景
Marqo-GS-10M数据集的核心经典使用场景在于多模态检索与排序任务的训练与评估。该数据集汇聚了来自Google Shopping的海量商品图文对,并提供了细粒度的相关性评分,使得研究者能够突破传统二元相关标签的局限,直接对检索模型的排序能力进行优化与度量。其内置的四维分割策略——涵盖域内、新查询、新文档及零样本场景——为构建泛化能力强大的多模态检索系统提供了标准化的基准测试平台。
解决学术问题
该数据集有效解决了对比学习中仅依赖二元相关标签而无法捕捉细粒度排序信息的学术困境。通过引入线性与倒数等多种细粒度评分机制,Marqo-GS-10M为多模态检索领域的排序学习提供了稀缺的大规模标注资源。它推动了广义对比学习(GCL)框架的诞生,显著提升了域内NDCG@10达94.5%,并在冷启动场景下实现了26.3%至48.8%的相对性能跃升,为信息检索领域注入了新的方法论活力。
实际应用
在实际应用中,Marqo-GS-10M数据集赋能了电商搜索引擎与推荐系统的智能化升级。基于该数据集训练的模型能够更精准地理解用户查询意图与商品之间的多模态语义关联,从而在商品匹配、搜索结果排序及个性化推荐等环节产出更具相关性的结果。例如,当用户搜索“复古风格女士牛津鞋”时,系统可依据图文联合表征优先呈现最符合预期的单品,显著提升购物体验与转化效率。
数据集最近研究
最新研究方向
在信息检索与多模态学习的交叉领域,Marqo-GS-10M数据集的最新研究方向聚焦于突破传统对比学习仅依赖二元相关性的局限,推动模型向细粒度排序能力演进。伴随电商搜索场景对精准排序的迫切需求,该数据集通过提供包含线性与倒数评分的大规模查询-产品对,为多模态检索模型引入了排序感知的监督信号。其配套的广义对比学习(GCL)框架,通过将排序分数转化为对比损失中的权重,显著提升了模型在域内及冷启动场景下的NDCG指标,最高提升达94.5%。这一工作不仅为多模态检索树立了新的排序评估基准,更推动了从‘相关与否’到‘相关程度’的范式转变,对构建更智能、更贴近用户真实意图的电商搜索引擎具有深远意义。
以上内容由遇见数据集搜集并总结生成



