遇见数据集

srpone/hm-eval

收藏
Hugging Face2026-06-30 更新2026-07-22 收录
官方服务:

资源简介:

H&M时尚评估数据集是一个用于时尚图像-文本检索的评估基准,基于公开的H&M个性化时尚推荐目录构建。该数据集包含105,100个产品(包括图像和结构化文本)和2,000个零样本查询,支持文本到图像、图像到文本和文本到文本检索任务。数据遵循BEIR风格结构,便于与ZooClaw-Fashion等其他基准使用相同代码路径进行评估。查询通过两阶段管道生成:首先从产品名称和随机属性(如颜色、图案、人口统计类别)组合,然后使用Gemma-4-31B-IT模型重写为自然搜索查询。数据集主要用于测试跨分布泛化能力,特别是在单品牌、大语料库零售目录场景下,是zoodata.ai和ZooClaw平台数据代理基准的一部分。

The H&M Fashion Evaluation Dataset is an evaluation benchmark for fashion image-text retrieval, constructed based on the public H&M personalized fashion recommendation catalog. This dataset contains 105,100 products (including images and structured text) and 2,000 zero-shot queries, supporting text-to-image, image-to-text, and text-to-text retrieval tasks. The dataset follows the BEIR-style structure, enabling compatible evaluation with other benchmarks such as ZooClaw-Fashion via identical code pipelines. Queries are generated through a two-stage pipeline: first, combinations of product names and random attributes (e.g., color, pattern, demographic categories) are created, then rewritten into natural search queries using the Gemma-4-31B-IT model. The dataset is primarily used to test cross-distribution generalization capabilities, especially in single-brand, large-corpus retail catalog scenarios, and is part of the data agent benchmarks for the zoodata.ai and ZooClaw platforms.

提供机构:
srpone
搜集汇总
数据集介绍
srpone/hm-eval 数据集图片
构建方式
H&M-eval 数据集源自公开的 H&M 个性化时尚推荐商品目录,严格遵循 BEIR 风格构建,以保证与同类基准测试框架的兼容性。其构建涵盖两个核心阶段:首先,从商品库中随机抽取 2,000 件产品作为种子,将产品名称与随机选取的颜色、图案、人群及品类属性拼接;随后,利用 Gemma-4-31B-IT 大语言模型将这些拼接信息重写为自然的搜索查询语句,并随机化颜色词的位置以模拟真实电商检索的多样性。最终,每个查询仅对应一件原始产品,形成精确的 1:1 标注映射。
特点
该数据集的核心特色在于其严苛的零样本评测环境与庞大的单品牌商品语料库,共计 105,100 件商品,涵盖从裤子、连衣裙到 T 恤等丰富的品类,并细致划分了儿童、女性、中性及男性等人口统计群体。查询平均长度约 5 个词,高度贴合现实电商搜索习惯。此外,数据集支持文本到图像、图像到文本及文本到文本三种检索任务,为评估跨模态与单一模态的模型性能提供了全面而公正的测试平台,尤其适合检验模型在细粒度区分上的鲁棒性。
使用方法
使用 H&M-eval 数据集极为便捷,用户可通过 Hugging Face Hub 的 `snapshot_download` 函数一键下载包含全部 10 万余张图像与 JSON 元数据的完整文件。下载后,可直接读取 `text2image` 等子目录中的 `queries.json`、`corpus.json` 与 `ground_truth.json` 文件,利用查询 ID 与语料库 ID 的映射关系进行检索评估。例如,通过解析查询索引并匹配对应的真实标签,即可快速验证模型在给定文本下能否从海量商品中准确召回目标图像,整体流程与 BEIR 风格评测框架无缝衔接。
背景与挑战
背景概述
H&M-eval是由Serendipity One Inc.团队于2025年发布的时尚图像-文本检索评估基准,其核心研究问题在于构建一个高难度、多任务的检索评估框架,以衡量单品牌大规模电商场景下的跨模态泛化能力。该数据集基于H&M官方商品目录构建,包含105,100件商品和2,000条零样本查询,支持文本到图像、图像到文本及文本到文本三项检索任务。作为ZooClaw-Fashion的补充基准,H&M-eval已集成至zoodata.ai平台,并随ZooClaw-FashionSigLIP2模型一同发布,在时尚检索领域推动了对分布外泛化性能的严格评测,促进了相关研究方向的发展。
当前挑战
H&M-eval所应对的领域挑战聚焦于单品牌、大语料库场景下细粒度检索的评估困难,其105K规模的干扰项显著增加了文本-图像匹配的难度,要求模型具备跨品牌、跨分布的鲁棒泛化能力。数据构建过程中,挑战主要体现在查询生成的合理性与多样性平衡上,团队通过两阶段流水线将商品属性随机拼接并借助大语言模型进行自然语言改写,同时控制颜色词位置分布以模拟真实电商搜索,保证了查询质量。此外,海量图像的存储与组织、精准的1:1真值标注,以及零样本设置下的评测体系设计,均是确保基准可靠性的关键难题。
常用场景
经典使用场景
在时尚领域的多模态检索研究中,hm-eval被广泛用作评估模型在文本到图像、图像到文本及文本到文本三种检索任务上性能的标杆。该数据集涵盖了超过十万件H&M品牌商品,每件商品均配备图像与结构化文本描述,并精心构造了两千条零样本查询,每条查询与单一目标产品一一对应,模拟真实电商场景中用户对精准匹配的需求。研究者常利用其大规模、高噪声的候选集,衡量检索模型在细粒度区分与跨模态对齐方面的能力,尤其关注召回率与平均倒数排名等核心指标。
衍生相关工作
hm-eval的发布催生了一系列相关研究工作,最直接的成果是伴随其一同开源的ZooClaw-FashionSigLIP2模型,该模型通过知识蒸馏技术在时尚检索任务上取得了显著性能提升。此外,研究者们借鉴其BEIR风格的评估框架,开发了可同时测试多个数据集的统一检索基准LookBench。该数据集还启发了对硬负样本挖掘、跨域泛化等课题的深入探索,推动了诸如Marqo-fashionSigLIP、LLM2CLIP等方法的性能对标与改进。围绕hm-eval形成的评估生态,为时尚多模态检索领域的系统性进步奠定了坚实基础。
数据集最近研究
最新研究方向
当前,hm-eval数据集正引领时尚领域多模态检索的前沿研究,尤其是围绕跨分布泛化与细粒度对齐能力的深度评估。其构建的105K单品单一品牌语料库,结合零样本查询范式,为检验模型在真实电商场景下的检索鲁棒性提供了苛刻测试床。最新发布于arXiv的ZooClaw-FashionSigLIP2研究,通过蒸馏微调策略在hm-eval上实现显著性能突破,R@10达0.136,超越了SigLIP2等基线模型,揭示了针对特定品牌海量目录优化嵌入表示的重要性。这一基准的推出,伴随LookBench评估框架与zoodata.ai的持续数据更新服务,正推动时尚检索从通用模型向高精度、可落地的产业级应用迈进,为个性化推荐与智能购物助手的开发奠定了坚实的评测基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务