遇见数据集

ret-sample

收藏
Hugging Face2026-09-11 更新2026-09-12 收录
官方服务:

资源简介:

ret-sample 是一个用于组合图像检索(CIR)的数据集,包含 3,127 对查询-正样本图像对,总大小约 341 MB,分为 8 个分片。每对样本由一张查询图像和一条文本指令构成,用于检索目标正样本图像。数据集专为 williamium3000/Qwenvl2d5 项目设计,支持流式加载,无需外部凭据。列字段包括:q_image(查询图像,PIL格式)、pos_image(正样本图像)、instruction(检索指令文本)、caption(正样本图像的描述)、q_key 和 pos_key(基于Blake3哈希的内容标识符)、group_id(近重复聚类ID)、n_text_tokens(指令的Qwen2.5-VL分词器长度)、task(固定为cir)、subset(来源子集)。注意:数据集中不包含硬负例,训练时使用批内InfoNCE损失;图像以未解码的原始JPEG字节存储,预处理时解码为PIL图像,保证无损。数据集源图像来自jeffrey/reasoning_retrieval数据集。

ret-sample is a dataset for Composed-Image-Retrieval (CIR), containing 3,127 query-positive image pairs, total size approximately 341 MB, split into 8 shards. Each pair consists of a query image and a text instruction used to retrieve a target positive image. The dataset is designed for the williamium3000/Qwenvl2d5 project, supports streaming loading, and requires no external credentials. Columns include: q_image (query image in PIL format), pos_image (positive image), instruction (retrieval instruction text), caption (description of positive image), q_key and pos_key (content identifiers based on Blake3 hash), group_id (near-cluster ID), n_text_tokens (instruction token length for Qwen2.5-VL tokenizer), task (fixed as cir), and subset (source subset). Note: The dataset does not contain hard negatives and uses in-batch InfoNCE loss during training. Images are stored as raw JPEG bytes without decoding and are decoded to PIL images during preprocessing to ensure lossless quality. Source images come from the jeffrey/reasoning_retrieval dataset.

创建时间:
2026-09-09
原始信息汇总

Icey444/ret-sample 数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/Icey444/ret-sample
  • 许可证:MIT
  • 语言:英语(en)
  • 任务类别:图像到图像(image-to-image)、视觉文档检索(visual-document-retrieval)
  • 标签:retrieval、multimodal、composed-image-retrieval
  • 数据规模:1K < n < 10K
  • 配置名称:default

数据集简介

该数据集为 Composed-image-retrieval(CIR)风格的配对数据:由一个查询图像 + 指令检索一个目标图像。图像直接嵌入在 parquet 文件中,训练或浏览时无需依赖任何外部资源。

  • 3,127 对数据 · 8 个分片 · 341 MB
  • williamium3000/Qwenvl2d5ret-streaming-retsample 分支)构建,可由其流式加载且无需 S3 凭证。

数据划分

  • train:路径为 pairs_img/train-*.parquet

列说明

列名 类型 含义
q_image Image() 查询图像(访问时为 PIL;以原始 JPEG 字节存储)
pos_image Image() 正样本/目标图像
instruction string 查询指令(需要检索什么)
caption string 正样本的标题
q_key, pos_key string blake3(raw file bytes)[:16] 内容 ID
group_id int 近重复簇 ID(teacher 余弦相似度 ≥ 0.98)
n_text_tokens int 指令的精确长度,基于 Qwen2.5-VL 分词器
task, subset string cir;来源子集(results / instruct / …)

使用方式

加载数据集: python from datasets import load_dataset ds = load_dataset("Icey444/ret-sample", split="train") r = ds[0] r["q_image"] # PIL.Image r["instruction"] # "What would I need to use to navigate through a place like this?" r["pos_image"] # PIL.Image

训练(在上述仓库中): bash bash scripts/sft_ret_sample_streaming.sh # --dataset ret_sample%100

备注

  • 无难负样本(No hard negatives)。 训练代码使用 in-batch InfoNCE;其 collator 明确不支持每个实例的第 3 个条目,因此挖掘的负样本会被携带但永远不会被读取。
  • 图像以未解码形式存储,并在预处理时一次性解码为 PIL —— 无损(已验证通过流水线后字节一致),且无需每个 epoch 重新编码。
  • 源图像来自 zillion2 存储上的 jeffrey/reasoning_retrieval_key 列为这些精确字节的内容哈希。
搜集汇总
数据集介绍
ret-sample 数据集图片
构建方式
在组合图像检索(Composed Image Retrieval, CIR)任务中,构建高质量的查询-目标图像对需兼顾指令语义与视觉内容的对齐。ret-sample数据集源自zillion2存储中的jeffrey/reasoning_retrieval数据,通过提取查询图像、目标图像及自然语言指令,形成三元组结构。每对样本均经由教师模型余弦相似度聚类,将相似度不低于0.98的样本归入同一近重复簇,并赋予组标识。图像以原始JPEG字节形式嵌入parquet文件,同时基于blake3哈希生成内容标识,确保数据完整性与可追溯性。最终构建了3127对样本,分布于8个分片,总规模约341 MB,专为流式训练与浏览设计。
使用方法
使用该数据集时,可借助Hugging Face datasets库直接加载训练分片:调用load_dataset("Icey444/ret-sample", split="train")即可获取样本,每条记录包含查询图像、正例图像、指令、描述、内容标识、近重复簇标识、指令长度及任务与子集标签。图像字段在访问时自动解码为PIL对象,无需额外处理。对于训练,可参照williamium3000/Qwenvl2d5仓库中的ret-streaming-retsample分支,执行提供的流式微调脚本,其中数据集标识为ret_sample%100,表示按比例采样。整个流程不依赖S3凭证,支持无缝集成至组合图像检索模型的训练与评估流水线中。
背景与挑战
背景概述
组合图像检索(Composed Image Retrieval, CIR)旨在实现以图加文的复合查询范式,弥合视觉与语言模态之间的语义鸿沟,近年来在跨模态检索领域引发广泛关注。ret-sample数据集正是面向该任务构建的查询—正例配对资源,其query图像与指令联合检索目标图像的设计,为推理式检索研究提供了结构化监督信号。数据集由williamium3000构建,包含3,127对样本,存储于8个分片共341 MB的Parquet文件中,并直接内嵌图像字节以规避外部依赖。该数据集服务于Qwenvl2d5训练流程,通过流式加载支持无凭证访问,推动了多模态检索在推理场景下的可复现研究。
当前挑战
组合图像检索领域面临的核心挑战在于模型需同时理解查询图像的视觉内容与指令的语义修改意图,并据此精准定位目标图像,这对跨模态对齐与细粒度语义推理提出了极高要求。构建ret-sample过程中亦存在显著困难:源图像来自jeffrey/reasoning_retrieval,需通过内容哈希确保字节级一致性,且需将图像以未解码形式存入Parquet以保证无损;近重复聚类依赖教师模型余弦相似度阈值0.98,可能遗漏语义等价但视觉差异较大的样本。此外,数据集刻意不设难负例,因训练代码的批内InfoNCE损失无法接纳第三项,这虽简化了流程,却也限制了对比学习的判别力度,构成当前评估与优化的潜在瓶颈。
常用场景
经典使用场景
在跨模态检索研究领域,组合图像检索(Composed Image Retrieval, CIR)旨在通过一幅查询图像与一段自然语言指令的联合表征,精准定位语义相符的目标图像。ret-sample数据集正是为此类任务量身打造,其每条样本均以“查询图像+指令”对的形式呈现,并配以正例目标图像。该数据集最为经典的使用场景在于训练和评估模型执行指令引导的图像检索,例如模型需根据“用什么工具才能在这种地方导航?”的指令,结合查询图像中的场景线索,从候选库中检索出正确的目标图像。这一过程要求模型深度融合视觉与语言信息,对跨模态对齐能力提出较高要求。
解决学术问题
该数据集有效缓解了组合图像检索领域高质量配对数据稀缺的困境。过往研究常受限于数据规模不足或指令与图像语义关联薄弱,难以充分训练和验证模型。ret-sample通过提供三千余组经过内容哈希校验的查询-目标图像对,并附带细粒度指令与描述文本,为学术研究提供了可复现的基准。其意义在于推动指令感知检索模型的发展,使研究者能够系统探究视觉-语言联合嵌入空间中的语义组合规律,进而提升模型在开放场景下的泛化能力与检索鲁棒性。
实际应用
在实际应用中,ret-sample可服务于电商导购、素材检索与智能助理等场景。例如,用户上传一件衣服的图片并附上“寻找类似风格但长袖的款式”的指令,系统便能依据该数据集训练的模型快速定位符合条件的商品图像。同样,在设计素材库中,创作者可通过手绘草图加文字描述的方式检索到匹配的参考图。数据集内嵌图像字节的存储方式消除了外部依赖,使得流式加载与在线部署更为便捷,为工业级检索系统的快速原型验证提供了便利。
数据集最近研究
最新研究方向
在组合图像检索(Composed Image Retrieval, CIR)领域,ret-sample数据集正推动以指令驱动的多模态检索范式向推理密集型任务演进。当前研究聚焦于利用查询图像与自然语言指令的联合嵌入,实现目标图像的细粒度匹配,并探索无需显式负样本的批内对比学习策略。该数据集与Qwen2.5-VL等视觉语言模型的流式训练流程深度耦合,支持无云存储依赖的高效微调,为可复现的CIR研究提供了标准化基准。其内容哈希标识与近似重复聚类机制,亦促进了数据去偏与检索鲁棒性分析,对构建可解释、可扩展的多模态检索系统具有前沿意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务