遇见数据集

O3-D

收藏
Hugging Face2026-06-27 更新2026-06-29 收录
官方服务:

资源简介:

O3-D (Odd-One-Out Depth) 是一个多模态视觉数据集,核心特点是包含受控的单目/图像深度线索。该数据集结合了“找不同”任务和深度排序任务,专门用于分析和评估视觉语言模型(VLMs)的指代表达理解能力和基础深度感知能力。数据集包括4个合成图像子集和3个真实世界图像子集,总计提供超过1000个具有不同指代清晰度级别的独特视觉问题。所有合成图像均提供对应的深度图,同时所有图像都附带了目标物体和干扰物的分割掩码。这些丰富的标注信息(如深度图和分割掩码)使数据集可广泛用于单目深度估计和显著目标检测等通用计算机视觉任务。数据集根据深度线索的受控程度和类型进行了子集划分,包括零线索基线、单线索、双线索、线性透视测试子集以及用于验证的真实世界子集。数据集采用 CC-BY-4.0 许可证发布。

O3-D (Odd-One-Out Depth) is a multimodal vision dataset characterized by controlled monocular/image depth cues. It combines the odd-one-out task with depth ordering tasks, specifically designed to analyze and evaluate the referential expression understanding and basic depth perception capabilities of vision-language models (VLMs). The dataset consists of 4 synthetic image subsets and 3 real-world image subsets, providing over 1000 unique visual questions with varying levels of referential clarity. All synthetic images come with corresponding depth maps, and all images include segmentation masks for target objects and distractors. These rich annotations (including depth maps and segmentation masks) also make the dataset widely applicable to general computer vision tasks such as monocular depth estimation and salient object detection. The dataset is divided into subsets based on the degree and type of depth cue control, including zero-cue baseline, single-cue, double-cue, linear perspective test subsets, and real-world subsets for validation. It is released under the CC-BY-4.0 license.

创建时间:
2026-06-23
原始信息汇总

数据集概述

数据集名称:Odd-One-Out Depth (O3-D)

许可协议:Creative Commons Attribution 4.0 International (CC-BY 4.0)

任务类别:视觉问答、深度估计

语言:英语

数据规模:10K < n < 100K

GitHub 仓库:https://github.com/lyiqian/o3-d


数据集简介

O3-D 是一个多模态数据集,专注于受控的单眼/图像深度线索。该数据集结合了“找出异类”(Odd-One-Out)与“深度排序”任务,旨在分析视觉语言模型(VLM)的指代表达理解能力和基础深度感知能力。数据集还提供了深度图和分割掩码,可用于单目深度估计、显著目标检测等通用任务。


数据集子集构成

O3-D 包含 4 个合成图像子集3 个真实世界图像子集

配置名称 类型 说明
kb-0cue 合成 零线索(负基线)
kb-1cue 合成 单一受控线索
kb-2cue 合成 两种受控线索
kb-no-lp 合成 小样本子集,用于测试线性透视(LP)线索
real-012cue 真实 受控线索,用于验证
real-012cue-cropped 真实 裁剪后的子集,专门用于深度排序任务
real-mcue 真实 非受控线索
visual_questions - 视觉问答子集

数据特征

各子集特征大致相同,包含:

  • image_name:图像名称(字符串)
  • env_cat / env_id:环境类别与ID
  • obj_cat / obj_id:目标物体类别与ID
  • odd_position:异类物体位置
  • cues:线索类型
  • cue_strength:线索强度(部分子集为null)
  • depth_scale:深度尺度
  • image:RGB图像
  • depth_map:深度图(仅合成子集)
  • targ_seg / dist_seg:目标与干扰物的分割掩码
  • augmented_image / marked_image:增强或标注图像(部分真实子集)
  • 深度相关特征:targ_min_depth, targ_med_depth, targ_max_depth, dist_min_depth, dist_med_depth, dist_max_depth, med_depth_diff(仅 real-mcue
  • 视觉问答特征:question, ques_clarity, icl, cot(仅 visual_questions

数据集规模

子集 训练样本数 总大小
kb-0cue 1,443 ~1.23 GB
kb-1cue 13,598 ~17.41 GB
kb-2cue 21,112 ~21.28 GB
kb-no-lp 592 ~809 MB
real-012cue 97 ~347 MB
real-012cue-cropped 97 ~83 MB
real-mcue 171 ~114 MB
visual_questions 147,552 ~28 MB

受控图像线索(Glossary)

  • OC:遮挡(Occlusion)
  • LS:光影(Light and Shadow)
  • TG:纹理梯度(Texture Gradient)
  • LP:线性透视(Linear Perspective)
  • HP:平面高度(Height-in-Plane)
  • RS:相对大小(Relative Size)
  • FS:熟悉大小(Familiar Size)
  • SA:饱和度(Saturation)
  • FO:聚焦程度(Focusness)

数据加载示例

python from datasets import load_dataset

加载特定子集

dataset = load_dataset("liuyiqian/O3-D", "kb-1cue")

访问第一个样本

sample = dataset[train][0] rgb_image = sample[image] depth_map = sample[depth_map] # 返回 PIL Image target_mask = sample[targ_seg] # 返回 PIL Image distractor_segmts = sample[dist_seg] # 返回 PIL Image


论文与引用

该数据集对应的论文已被 ECCV2026 接收(占位链接)。引用信息为占位符,请参考后续发布的正式版本。

搜集汇总
数据集介绍
O3-D 数据集图片
构建方式
O3-D数据集旨在系统性地评估视觉语言模型在深度感知与指代理解方面的能力,通过将“找出不同”任务与深度排序任务相结合而构建。其主体由四组合成图像子集与三组真实世界图像子集构成,每组子集均针对单目深度线索进行精确控制。合成图像经由3D场景渲染生成,每个场景包含五个同类物体,其中目标物体在尺寸与深度层次上均与干扰物相异。通过调控相机视角、光源位置等参数,研究者生成了具有零个、一个或两个受控深度线索的2D视图,并配合多样化的文字提示模板,从而构建出层次分明的多模态评估体系。
特点
该数据集的一大特色在于其精细的受控深度线索设计,涵盖遮挡、光影、纹理梯度、线性透视、相对尺寸等九类单眼深度线索,支持力度可控的消融分析。所有合成图像均配备深度图、目标与干扰物的分割掩码,适用于单目深度估计及显著性检测等下游任务。此外,数据集包含超过14万条视觉问答样本,其指代清晰度各异,能够深入检验模型在语言理解与空间推理上的鲁棒性。真实世界子集则进一步验证了合成数据的生态效度。
使用方法
研究者可通过HuggingFace Datasets库便捷加载该数据集的任一子配置,例如使用`load_dataset("liuyiqian/O3-D", "kb-1cue")`获取单线索合成图像子集。每条样本均提供RGB图像、深度图及分割掩码,可直接用于模型训练与评估。视觉问答子集则包含问题文本及其清晰度标注,适用于零样本或上下文学习场景下的VLM性能诊断。建议用户依据需要选择不同线索数量的子集进行对照实验,以分析特定深度线索对模型感知能力的影响。
背景与挑战
背景概述
O3-D(Odd-One-Out Depth)数据集由研究者构建,发表于ECCV2026,旨在系统评估视觉语言模型对指代表达的理解与基础深度感知能力。该数据集创造性地将“找出不同”任务与深度排序任务相结合,通过精细控制单目/图示深度线索,生成合成与真实场景的多模态图像。数据集包含4个合成子集和3个真实子集,提供深度图、分割掩码以及涵盖不同清晰度等级的视觉问答对。O3-D填补了现有基准在精细深度线索控制与语言-视觉交叉评估上的空白,为探究多模态模型的深度知觉、语言一致性与推理能力提供了标准化测试平台,对视觉与语言融合研究具有重要推动作用。
当前挑战
O3-D首先应对的核心领域挑战是视觉语言模型在三维空间理解上的严重不足:现有模型在处理依赖单目深度线索(如遮挡、光影、纹理梯度)的相对深度排序任务时,表现近乎随机猜测,远逊于专用深度估计模型,暴露了其对物理世界的浅层认知。其次,数据集的构建面临高难度控制性挑战,需在合成场景中独立操纵光照、相机位置、物体尺寸等变量以产生单一或组合深度线索,同时确保真实场景采集克服装配与光照干扰。此外,需设计不同语言明晰度的指代问题以测试模型语言理解与深度推理的交叉影响,平衡数据规模与噪声控制,最终生成高质量、可复现的多模态评估资源。
常用场景
经典使用场景
在视觉与语言交叉领域,O3-D数据集为评估视觉语言模型(VLM)的深度感知与指代理解能力提供了精细化的基准测试平台。其核心设计围绕“奇异项检测”与“深度排序”两类任务,通过合成与真实场景中精心调控的单眼深度线索(如遮挡、光影、纹理梯度等),构造出具有不同线索组合与指代清晰度的图像-问题对。研究者可利用该数据集系统性地剖析模型在何种视觉线索下能够准确判断物体间的深度关系,从而揭示当前VLM在三维空间理解上的根本局限。
解决学术问题
该数据集直面视觉语言模型在深度感知与语言一致性上的双重困境。已有工作表明,许多先进的VLM在深度排序任务上的表现近乎随机猜测,且其语言输出的置信度与回答正确性之间存在显著漂移。O3-D通过引入可量化、可控制的深度线索变体与指代模糊程度的视觉问题,为学界提供了严谨的对照组,用以隔离和诊断模型失败的具体原因——究竟是语言理解偏差、视觉特征提取缺陷,还是线索融合失效。这推动了从整体性能评估向细粒度认知能力剖析的学术范式转变。
衍生相关工作
围绕O3-D衍生出一系列探索视觉语言模型空间理解机制的研究工作。其中最具代表性的是将深度图作为显式监督信号引入VLM训练,或设计线索感知的注意力模块以增强模型对单眼深度信息的利用。此外,基于该数据集的深度排序任务催生了结合对比学习与语言引导的视觉定位方法,以及用于分析模型错误模式的“语言-视觉一致性”评估指标。这些工作共同推动了跨模态推理领域向更具可解释性和认知合理性的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务