RUC-NLPIR/DISBench
收藏官方服务:
资源简介:
DISBench是首个针对视觉历史中上下文感知图像检索的基准数据集。它包含57名用户的122个查询和109,467张照片,要求基于语料库级上下文进行多步推理。
DISBench is the first benchmark for context-aware image retrieval over visual histories. It contains 122 queries across 57 users and 109,467 photos, requiring multi-step reasoning over corpus-level context.
提供机构:
RUC-NLPIR搜集汇总
数据集介绍

构建方式
DISBench 是首个面向视觉历史上下文感知图像检索的基准数据集,源于 YFCC100M 数据集所保留的用户—照片集—照片层级结构。该数据集涵盖 57 位用户的 109,467 张照片,并从中精心筛选出 122 条查询,每条查询均包含自然语言描述与对应真实目标照片 ID。查询按事件类型分为事件内与跨事件两类,构建过程借助人工标注与严格筛选,以确保查询的多样性与挑战性。所有图像均基于 Creative Commons 许可公开共享,数据集未向模型提供照片集边界信息,从而模拟真实检索场景中缺乏明确界限的复杂上下文。
特点
DISBench 的核心特点在于其强调跨照片集的上下文推理能力,要求模型在用户庞大的视觉历史中进行多步搜索与定位。查询平均历史跨度达 3.4 年,每个查询平均包含 3.84 个目标照片,且查询保留率仅 6.1%,凸显了数据集的精选与高难度。此外,数据集通过 0.91 的高交并比保证了标注一致性,并按事件内与事件间两类查询划分,分别占比 46.7% 与 53.3%,有效评估模型在单一事件内部与跨事件场景下的检索性能。
使用方法
使用 DISBench 时,推荐通过 Hugging Face 命令行工具一键下载数据集至本地。研究者可基于官方提供的 ImageSeeker 智能体框架快速开展实验,通过配置嵌入模型与语言模型,运行代理脚本完成上下文感知的图像检索任务。数据集以 queries.jsonl 文件记录查询及其对应答案,每用户独立存储照片元数据与 ID 列表,便于按用户维度进行遍历与评估。同时,支持通过下载脚本批量获取图像文件,整体设计旨在简化复现流程并促进公平比较。
背景与挑战
背景概述
DISBench是由中国人民大学NLPIR团队于2026年提出的首个面向视觉历史的情境感知图像检索基准数据集。该数据集源自YFCC100M多媒体数据集,包含57位用户的122条查询与109,467张照片,旨在评估多模态智能体在理解用户视觉历史序列、挖掘跨照片语境内隐关联方面的能力。通过将检索任务细分为事件内与事件间两类子任务,DISBench揭示了现有模型在复杂时空推理与多步语义查询上的薄弱环节,为多模态信息检索领域提供了全新的评测范式与标准化平台。
当前挑战
DISBench聚焦的核心挑战在于弥合离散图像检索与连续视觉历史理解之间的鸿沟。现有模型难以对横跨数年的用户照片序列进行语境界定,例如将某次音乐会的多张照片从大量日常快照中正确识别。另一方面,数据构建面临高标注难度与低查询保留率的困境——从2000条候选查询中仅保留122条(保留率6.1%),且需通过严苛的交叉验证实现0.91的交并比。此外,时空元数据的稀疏性(部分照片缺地址与GPS信息)进一步加剧了模型对环境线索的依赖困境。
常用场景
经典使用场景
DISBench作为首个面向视觉历史的情境感知图像检索基准,其经典使用场景在于评估多模态智能体在复杂视觉历史中进行多步推理与检索的能力。该数据集精心构建了122个自然语言查询,覆盖57位用户的逾十万张照片,要求模型不仅理解当前查询的语义,还需结合用户过往拍摄事件的时间顺序、地理位置及设备信息,在跨越数年的大量图像中精准定位目标。这种设置模拟了人类日常回忆与搜索照片时的真实认知过程,为检验多模态大模型在长程视觉记忆与跨事件关联推理方面的性能提供了标准化测试平台。
解决学术问题
DISBench旨在解决传统图像检索研究中忽视历史情境与多步推理能力的学术短板。现有基准大多聚焦于单张图像或简单场景的匹配,难以评估模型对用户视觉历史中事件边界、时序逻辑与上下文依赖关系的理解。该数据集通过精细标注的室内事件(同一活动内检索)与跨事件查询,揭示了当前多模态智能体在整合时空碎片、解决视觉歧义上的局限性。其发布推动了检索范式从静态匹配向动态推理的演进,为衡量智能体在真实世界记忆检索任务中的智能水平树立了重要标尺。
衍生相关工作
围绕DISBench已衍生出一系列富有影响力的经典工作,其中最具代表性的是其配套提出的ImageSeeker智能体框架。该框架设计了一套完整的感知-推理-检索流水线,通过集成多模态嵌入模型与迭代式视觉语言推理,在DISBench基准上展现出显著的性能优势。此外,研究者基于该数据集的挑战性布局,陆续探索了分层检索策略、事件图构建与视觉记忆压缩等前沿课题。这些工作共同促进了多模态智能体在长程视觉历史理解领域的蓬勃发展,使DISBench成为评估和加速该领域创新的核心驱动力。
以上内容由遇见数据集搜集并总结生成



