遇见数据集

Physicsmile/WISER

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

WISER数据集是用于训练免费零样本组合图像检索研究的数据集,包含FashionIQ和CIRR两个基准数据集。FashionIQ数据集专注于时尚领域的图像检索,而CIRR数据集则用于更一般的组合图像检索任务。这些数据集支持WISER框架的评估,该框架通过更广泛的搜索、自适应融合和更深入的思考来提升检索性能。数据集以压缩文件形式提供,包括fashion-iq.7z(978MB)和CIRR.zip(4.55GB),可通过Hugging Face下载。

The WISER dataset is a collection of benchmark datasets for training-free zero-shot composed image retrieval research, including the FashionIQ and CIRR datasets. FashionIQ focuses on fashion-related image retrieval, while CIRR is used for general composed image retrieval tasks. These datasets support the evaluation of the WISER framework, which enhances retrieval performance through wider search, adaptive fusion, and deeper thinking. The dataset is provided as compressed files: fashion-iq.7z (978MB) and CIRR.zip (4.55GB), available for download via Hugging Face.

提供机构:
Physicsmile
搜集汇总
数据集介绍
Physicsmile/WISER 数据集图片
构建方式
在组合图像检索领域,现有方法多依赖训练数据与监督信号,而WISER数据集则基于零样本设定构建,无需任何训练即可完成检索任务。其构建过程模拟人脑的“搜索-验证-反思”机制:首先通过编辑器同时生成文本与图像查询,执行双路径检索,将各自的Top-K结果聚合为统一的候选池;随后利用验证器对候选结果进行置信度评分,对高分结果直接应用多层级融合策略输出;对低分结果则触发细化器,分析未满足的修改需求并生成针对性建议,反馈至编辑器进行迭代。此过程循环直至预设迭代上限,实现无需训练数据的复杂图像检索。
特点
WISER数据集的核心特点在于其“广搜索、深思考、自适应融合”的三阶段架构,突破了传统训练依赖方法的局限。它在CIRCO数据集上实现mAP@5相对改进45%,在CIRR数据集上Recall@1提升57%,甚至超越许多需要训练的方法,展现出卓越的泛化能力。该数据集涵盖FashionIQ与CIRR两大主流基准,提供完整的图像、文本及检索评估配置,支持零样本场景下的跨模态交互。其模块化设计使得编辑器、验证器与细化器可独立优化,为未来组合检索研究提供了灵活的实验框架。
使用方法
使用WISER数据集时,用户可首先通过Hugging Face快速下载压缩包,解压后获得FashionIQ与CIRR数据集。随后,需在配置文件中更新数据路径与参数,并运行脚本生成图库描述(Step1)。完成描述生成后,执行推理脚本(Step2)即可输出检索结果。代码基于Python 3.10与Conda环境构建,依赖项已集成于requirements.txt中。用户亦可从CIReVL项目手动下载数据并整理,确保兼容性。该流程设计为即开即用,降低零样本组合图像检索研究的入门门槛。
背景与挑战
背景概述
WISER数据集由Tianyue Wang、Leigang Qu等研究人员于2026年提出,旨在解决零样本组合图像检索(Zero-Shot Composed Image Retrieval)这一前沿课题。该任务要求模型在无需训练的情况下,根据用户提供的参考图像与修改文本,精准检索目标图像,对跨模态理解与推理能力提出严苛挑战。WISER的核心创新在于构建了“更宽搜索、更深思考、自适应融合”(Wider Search, Deeper Thinking, and Adaptive Fusion)框架,通过引入编辑器、验证器与优化器,实现多路径检索与动态反馈迭代。该工作被CVPR 2026接收,其在CIRCO和CIRR基准上分别实现了45%和57%的相对性能提升,显著超越了现有无训练方法,甚至部分超越有训练方法,为无训练组合检索领域树立了新标杆。
当前挑战
WISER所应对的领域挑战在于:零样本组合图像检索无需依赖标注训练数据,但传统方法受限于单一检索路径与固化相似度度量,难以同时兼顾检索广度与精度。具体而言,现有无训练方法在复杂修改语义(如细粒度属性变化)和跨模态对齐上表现不佳,易导致漏检或误检。构建过程中亦面临多重难点:如何高效融合文本与图像双模态查询结果以避免候选池冗余;如何设计验证器动态评估候选置信度并决定是否触发精细优化;以及如何在有限迭代次数内平衡检索深度与计算开销。此外,数据集整合了FashionIQ与CIRR两大基准,需统一异构格式与跨域特征,进一步增加了预处理与适配的复杂度。
常用场景
经典使用场景
WISER数据集专为组合图像检索(Composed Image Retrieval, CIR)任务而设计,其核心应用场景在于通过融合文本描述与参考图像,精准定位目标视觉内容。该数据集囊括了FashionIQ和CIRR两大经典基准,前者聚焦时尚领域内的细粒度属性修改(如颜色、款式变化),后者则涵盖自然场景中基于语义关系的复杂检索需求。研究者可借助此数据集,零样本评估模型在未见类别上的泛化能力,尤其适用于探索无需额外训练的检索范式,从而推动视觉与语言跨模态理解的前沿发展。
解决学术问题
长久以来,组合图像检索面临两大核心挑战:如何高效融合视觉与文本模态的语义鸿沟,以及如何在零样本设定下摆脱对标注三元组的依赖。WISER数据集的提出,巧妙解决了训练自由(Training-Free)场景下的检索效率与精度权衡问题。其附带的WISER框架通过宽搜索、深度思考与自适应融合三大机制,在CIRCO上实现mAP@5相对提升45%,在CIRR上Recall@1提升57%,甚至超越诸多依赖训练的方法。这一突破不仅验证了无需参数微调的检索可行性,更重塑了跨模态检索领域对零样本能力的认知边界。
衍生相关工作
WISER数据集的发布催生了一系列具有影响力的研究方向。在其框架启发下,后续工作如CIReVL聚焦于可解释性检索,通过可视化推理路径增强模型透明度;另有研究将自适应融合策略推广至多模态知识蒸馏任务,以提升轻量级模型的检索保真度。此外,WISER所验证的迭代式深度思考机制,为符号化推理与视觉理解的结合开辟了新路径,衍生出诸如协同学搜索、基于置信度触发的精炼策略等前沿课题。这些工作共同推动组合检索从实验室走向更广阔的真实世界应用场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务