遇见数据集

MERIT

收藏
arXiv2025-06-04 更新2025-11-28 收录
官方服务:

资源简介:

MERIT是一个多语言语义检索数据集,包含来自7个不同产品类别的135,000种产品,以及5种语言的320,000个检索查询。数据集旨在模拟真实世界的多条件检索场景,其中用户通过文本和图像描述多个属性。MERIT的数据收集过程包括高质量产品选择、产品属性标注、检索查询构建和过滤优化。数据集的创建旨在解决现有检索模型在处理多条件查询和图像信息表达方面的局限性,并为未来研究提供基础。

MERIT is a multilingual semantic retrieval dataset containing 135,000 products from 7 distinct product categories and 320,000 retrieval queries across 5 languages. This dataset is designed to simulate real-world multi-condition retrieval scenarios, where users describe multiple attributes via both text and images. The data collection process of MERIT includes high-quality product selection, product attribute annotation, retrieval query construction and filtering optimization. The creation of this dataset aims to address the limitations of existing retrieval models when handling multi-condition queries and image-based information expression, and provides a foundation for future research.

创建时间:
2025-06-04
搜集汇总
数据集介绍
MERIT 数据集图片
构建方式
MERIT数据集的构建始于从内部电商数据中精选来自东南亚六国、涵盖五种语言的优质商品。为确保产品多样性,研究团队依据流行度与美学评分进行筛选。针对实际检索场景中属性信息不足的问题,采用了开放集属性标注方法以扩充属性丰富度,并随后通过统计分析与闭合集标注提升精确度。在检索对的构建上,融合了三种采样算法:常规均匀采样、属性均匀采样以及高相似度商品优先采样,从而增强数据的多样性与分布均匀性。最后,数据集经历了自动化的规则与统计过滤,以及由精通五种语言的专业标注员进行的人工精炼与语义一致性审核,以剔除低质样本,全过程投入约一万小时的人工标注时间。
特点
MERIT是首个面向交错多条件语义检索的多语言数据集,其核心特点在于支持多语言、多图像与综合多条件查询的深度融合,突破了现有数据集在单语言、单图像或单一检索条件上的局限。数据集包含135,000件产品及320,000个检索对,覆盖英语、马来语、印尼语、越南语、泰语五种语言,横跨服装、电子产品、食品、家具等七个产品类别。每个查询至少包含两个条件,并可交织文本描述与视觉参考,真实反映用户在商品搜索中同时指定颜色、材质、图案等多重属性的现实需求。通过深入分析,该数据集揭示了现有模型仅依赖全局语义而忽略具体条件要素的关键缺陷。
使用方法
MERIT数据集被划分为包含310,000条训练样本和10,000条测试样本的标准子集,用于训练与评测语义检索模型。使用时,模型需处理由多个图像和文本条件交织构成的复杂查询,并通过计算查询与候选产品嵌入间的相似度来召回相关商品。为了有效应对该数据集的挑战,研究团队提出了CORAL微调框架,该方法在对比学习提取全局语义的基础上,创新性地融入了多模态嵌入重构机制,旨在保留查询中的细粒度条件要素。实验表明,应用CORAL框架后,模型在MERIT上的召回率相比传统方法提升了45.9%,同时其强大的泛化能力也在八个权威检索基准上得到了充分验证。
背景与挑战
背景概述
语义检索作为现代信息系统的核心任务,在人工智能领域占据着举足轻重的地位。然而,现有研究长期局限于单一语言、单一图像或单一检索条件的狭窄框架,未能充分释放视觉信息的表达潜力。为此,字节跳动与浙江大学的研究团队于2025年联合发布了MERIT数据集,旨在填补交错多条件语义检索这一关键空白。该数据集涵盖13.5万件商品、32万条查询,支持英语、马来语、印尼语、越南语和泰语五种语言,覆盖服装、电子产品、食品等七大品类。MERIT的提出不仅为多模态检索提供了首个多语言、多条件的标准化评测平台,更通过揭示现有模型在细粒度条件理解上的根本性缺陷,推动了语义检索向真实世界复杂场景迈进的进程。
当前挑战
MERIT所面临的挑战主要体现在两个层面。在领域问题层面,现有模型仅聚焦于全局语义信息的提取,严重忽视了查询中具体条件要素的精确捕获,导致属性误判与视觉内容误解频发。尽管多模态大语言模型具备处理交错图像输入的能力,但现有检索模型在微调后反而丧失了这一优势,图像拼接方式的表现显著优于序列输入。在数据集构建层面,团队投入了1万人工小时以应对数据获取的艰巨挑战:采用开放属性标注以提升多样性、闭合属性标注以保障精确率与召回率,并设计了三种采样算法来增强数据的丰富性与分布均匀性。经过多轮严格的自动化与人工筛选,最终才形成了符合严苛学术标准的高保真数据集。
常用场景
经典使用场景
在跨语种电商检索场景中,MERIT 数据集为研究者提供了首个融合多语言、多模态与多条件交织查询的标准化评测平台。用户在实际购物中常以文本描述叠加参考图片(如“与图一相同材质、与图二相同色彩”)的方式表达检索意图,而 MERIT 精准复现了这一复杂检索链路,覆盖服装、电子、食品等七类商品,囊括五种东南亚语言。该数据集的核心价值在于填补了现有语义检索基准仅支持单语言、单图像或单条件检索的空白,为验证模型在真实商业检索中的综合表现奠定了严苛的测试基础。
衍生相关工作
MERIT 的发布催生了多项具有里程碑意义的后续研究。其提出的 CORAL 微调框架首次将嵌入重建与对比学习结合,通过掩码多模态重建保留细粒度条件语义,在 MERIT 上实现 45.9% 的性能提升,并成功泛化至 8 个标准检索基准。此外,该数据集激发了针对交织多图像理解能力退化的探索——实验发现现有模型因训练数据仅含单图像而丧失序列输入处理能力,在 MERIT 上序列输入性能可提升 14.3%,直接推动了 GME-Qwen2VL、LLaVE 等模型在交织输入架构上的优化迭代,为多模态检索模型的设计范式提供了关键的反向验证证据。
数据集最近研究
最新研究方向
在语义检索领域,现有研究大多局限于单一语言、单张图像或单一检索条件,难以应对现实场景中交织多条件查询的复杂需求。MERIT数据集应运而生,作为首个多语言交织多条件语义检索基准,汇集了32万条查询、13.5万件商品及5种语言,横跨7大产品类别,旨在弥合现有方法的性能鸿沟。前沿研究聚焦于揭示现有模型过度依赖全局语义而忽略条件化细节的内在缺陷,并由此催生了CORAL微调框架,通过嵌入重建保留细粒度条件、结合对比学习萃取全局语义,在MERIT上实现了45.9%的性能跃升,同时展现出在8个既有多模态检索基准上的强泛化能力。这一突破不仅为多语言多条件检索设立了新标杆,更为构建更贴近用户真实搜索行为的智能系统奠定了坚实基础。
相关研究论文
  • 1
    通过字节跳动公司, 浙江大学 · 2025年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务