遇见数据集

SIP (Salient Person) dataset

收藏
arXiv2020-07-12 更新2024-06-21 收录
官方服务:

资源简介:

SIP数据集是由南开大学计算机学院创建的,包含约1K高分辨率图像,涵盖了多样化的真实世界场景,如不同的视角、姿势、遮挡、光照和背景。该数据集特别关注人类在视觉场景中的显著性检测,旨在为移动设备上的RGB-D模型应用提供支持。数据集中的图像经过精心设计,以覆盖多种挑战性情况,并提供了像素级的真实标注。此外,SIP数据集还提供了RGB和灰度图像,这些图像由双目相机捕获,有助于多种研究方向,如立体匹配、深度估计和以人为中心的检测等。数据集的应用领域包括提高智能手机摄像头的性能,以及在监控探头和工业机器人中的应用,旨在解决利用深度信息进行显著对象检测的问题。

The SIP Dataset was developed by the College of Computer Science at Nankai University. It contains approximately 1,000 high-resolution images covering diverse real-world scenarios, including varying viewpoints, poses, occlusions, lighting conditions and backgrounds. This dataset specifically focuses on human-centric visual saliency detection, aiming to support the deployment of RGB-D models on mobile devices. The images in the dataset are meticulously designed to cover a wide range of challenging situations, and are accompanied by pixel-level ground truth annotations. Additionally, the SIP Dataset provides both RGB and grayscale images captured by a binocular camera, which can facilitate multiple research directions such as stereo matching, depth estimation and human-centered detection. The application fields of this dataset include enhancing the performance of smartphone cameras, as well as applications in surveillance cameras and industrial robots, with the objective of addressing the problem of salient object detection using depth information.

创建时间:
2019-07-16
搜集汇总
数据集介绍
SIP (Salient Person) dataset 数据集图片
构建方式
SIP(Salient Person)数据集是针对真实人类活动场景中的显著目标检测而精心构建的。该数据集利用华为Mate 10智能手机的后置双摄像头(12MP RGB与20MP单色传感器)采集了约1000张高分辨率图像,深度图由手机自动估计生成。采集过程中,九名身着不同颜色服装的个体在多种真实户外场景中执行特定动作,涵盖了不同视角、姿态、遮挡、光照和背景条件下的挑战性情境。随后,通过六名标注者依据第一直觉绘制边界框,并采用投票机制筛选出1000张一致性最高的图像,再由另外五名标注者对显著目标进行精确的像素级轮廓标注,最终经过质量筛选保留了929张高质量图像。
特点
SIP数据集具有显著区别于现有RGB-D数据集的特点。首先,它是首个以人为中心的显著目标检测数据集,专注于真实智能手机拍摄场景中的多显著人物检测。其次,数据集提供了RGB图像、灰度图像以及由双摄像头估计的深度图,为立体匹配、深度估计等研究提供了新的方向。此外,SIP数据集包含了多样化的背景对象(如草地、汽车、道路等)、不同的光照条件(如低光照、晴朗)以及每个图像中1至5个不等的显著目标,且标注质量高,边界精细,克服了现有数据集中心偏差大、目标单一等问题。
使用方法
SIP数据集主要用于评估和训练RGB-D显著目标检测模型,尤其适用于面向智能手机应用的人类活动场景。研究人员可将数据集划分为训练集和测试集,或直接使用全部929张图像进行测试。数据集提供了像素级的地面真值标注,支持使用F-measure、MAE、S-measure和E-measure等标准指标进行性能评估。此外,SIP数据集还提供了一个在线评估平台,支持公平的模型比较。该数据集与模型代码、评估工具一同公开发布,便于研究者复现实验并推动该领域的进一步发展。
背景与挑战
背景概述
在计算机视觉领域,显著目标检测(SOD)旨在模拟人类视觉注意机制,自动识别图像中最具吸引力的区域。随着智能手机双摄技术的普及,RGB-D数据为SOD提供了丰富的空间几何线索,但现有数据集多基于Kinect或光场相机采集,难以反映真实移动设备场景中的人体活动。为此,南开大学程明明教授团队联合Google AI于2020年构建了SIP(Salient Person)数据集,该数据集包含929张由华为Mate10手机采集的高分辨率图像,聚焦于现实户外环境中多姿态、多遮挡、多光照条件下的显著人物检测。SIP首次提供了智能手机原生深度图与灰度图,并配备像素级与实例级标注,其中心偏差低、物体尺度分布广,为移动端RGB-D SOD研究树立了新的基准。
当前挑战
SIP数据集所面临的核心挑战体现在三个层面:其一,领域问题层面,现有RGB-D SOD方法多依赖高质量深度图,而真实手机深度图常因低光照、远距离或运动模糊而质量低下,导致跨模态特征融合失效,亟需设计能自动判别并过滤低质量深度图的鲁棒模型。其二,构建过程层面,数据采集需平衡九位着装各异的演员在八类背景(如草地、车辆、路障)中的动作自然性与挑战覆盖度,同时通过六名标注员投票筛选、五名标注员精细勾画,耗时完成约2500张候选图的边界框与轮廓标注,最终仅保留929张高一致性样本,标注成本极高。其三,评估层面,现有指标(如F-measure)阈值策略不统一,且多数基准仅测试1-4个数据集,难以全面衡量模型泛化性,SIP需联合6个经典数据集建立含18种算法的公平对比平台。
常用场景
经典使用场景
SIP(Salient Person)数据集专注于真实世界人类活动场景下的RGB-D显著性物体检测,其经典使用场景在于为智能手机等移动设备提供面向人体的显著性检测基准。该数据集包含929张高分辨率图像,覆盖多种视角、姿态、遮挡、光照和背景,深度图由华为Mate10双摄手机真实采集,填补了此前数据集缺乏真实手机深度数据的空白。研究者利用SIP可评估模型在复杂户外环境(如暗光、多目标、遮挡)下对人体的检测能力,推动算法从实验室环境向实际移动摄影场景的迁移。
实际应用
在实际应用中,SIP数据集直接服务于移动摄影和智能监控领域。基于该数据集训练的D3Net模型能够以65fps的速度在单GPU上实现背景更换功能,用户上传照片后系统可自动提取人体前景并替换为专业设计的模板背景,如书籍封面制作。此外,RGB-D显著性检测还可用于手机人像模式的景深虚化效果、自动驾驶中的行人检测、工业机器人的环境感知以及监控视频中的可疑目标发现,显著提升了智能设备在复杂场景下的视觉理解能力。
衍生相关工作
SIP数据集衍生了一系列经典工作,包括作者团队提出的D3Net模型,其深度净化单元(DDU)首次显式过滤低质量深度图,性能超越CPFP、TANet等先前最优方法。后续工作如UCNet引入条件变分自编码器建模不确定性,JL-DCF提出联合学习与密集协作融合框架,GFNet采用跨模态自适应门控生成对抗网络,DMRA利用深度诱导的多尺度循环注意力,这些方法均在SIP上进行了评估,推动了RGB-D显著性检测向多目标、复杂交互场景的实用化方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务