遇见数据集

Underwater Diver Activity (UDA) dataset

收藏
arXiv2026-06-11 更新2026-06-12 收录
数据链接:
官方服务:

资源简介:

UDA数据集是由明尼苏达大学研究团队创建的首个水下潜水员活动数据集,旨在解决水下人机协作场景中活动识别数据稀缺的难题。该数据集包含2640张经过语义分割标注的高清图像(分辨率1920×1080),涵盖六类关键交互活动,数据来源于封闭水域环境中真实的人机协作试验视频片段。数据集通过SAM模型生成像素级标注并经过人工校验,精确标注了潜水员、机器人及目标物体的边界信息。该数据集主要应用于水下机器人感知与决策领域,为训练深度学习模型提供基础数据支持,助力实现智能水下协作系统的开发。

The UDA dataset is the first underwater diver activity dataset created by the research team at the University of Minnesota. It was developed to solve the problem of scarce activity recognition data in underwater human-robot collaboration scenarios. This dataset includes 2640 high-definition images with a resolution of 1920×1080, all annotated with semantic segmentation labels, covering six key interactive activities. The data is derived from real human-robot collaboration test video clips taken in confined water environments. Pixel-level annotations for this dataset were generated using the SAM model and manually verified, with precise boundary annotations for divers, underwater robots and target objects. This dataset is mainly applied in the field of underwater robot perception and decision-making, providing foundational data support for training deep learning models and facilitating the development of intelligent underwater collaborative systems.

创建时间:
2026-06-11
原始信息汇总

数据集名称

Underwater Diver Activity (UDA) Dataset

数据集概述

该数据集是首个专门用于水下潜水员活动识别的数据集,旨在帮助自主水下航行器(AUV)理解并识别潜水员的当前活动,以促进有效的人机协作。

数据集内容

  • 图像数量:超过2400张经过语义分割的图像。
  • 场景:多个人类-机器人协作环境下的水下场景,展示了潜水员的各种活动。
  • 标注信息:图像具有像素级别的标注,标注对象包括潜水员、机器人和感兴趣的目标物体。

数据用途

用于训练和评估基于Transformer的活动识别框架,该框架通过学习场景中的关键元素(如潜水员、机器人及其交互)的时空特征,实现对潜水员活动的识别。

获取方式

数据集可通过Google Drive链接下载: https://drive.google.com/file/d/1mVapKpNWNM8bUro2kssiElckZDdccEtI/view?usp=sharing

搜集汇总
数据集介绍
Underwater Diver Activity (UDA) dataset 数据集图片
构建方式
水下多人类-机器人协作场景中,数据稀缺严重制约了潜航员活动识别研究的发展。为此,研究团队在封闭水域环境中,利用GoPro相机采集了多组人类与机器人协同作业的视频片段,分辨率为1920×1080像素。每个片段时长约3秒,涵盖1至3名潜航员、1至2台机器人及1至3个任务相关物体。借助Segment Anything Model生成初始分割掩码后,经由人工仔细校验与修正,最终构建了包含2640张像素级标注图像的首个水下潜航员活动数据集UDA。数据集涵盖六类典型活动:潜航员向机器人分配任务、潜航员空闲、潜航员忙碌、潜航员间互动、潜航员与机器人协作及机器人与潜航员交互。
特点
UDA数据集具有显著的领域独创性与语义丰富性。作为首个聚焦水下多人类-机器人协作中潜航员活动识别的数据集,它弥补了该领域大规模标注数据的空白。每条图像均配备像素级分割标注,精准标记潜航员、机器人与感兴趣物体,为模型提供精细的空间语义监督。相较于仅记录潜航员存在或运动的水下数据集,UDA以任务驱动为核心理念,每一活动类别均包含多样化的视觉实例,如潜航员数量、机器人距离、交互模式及物体配置的差异,确保了丰富的类内变异性,从而支撑更具鲁棒性的深度学习模型训练。
使用方法
UDA数据集专为水下潜航员活动识别任务设计,适用于端到端的深度学习模型训练与评估。使用时,视频片段被处理为64帧的时空块,并缩放到320×256像素的空间分辨率。研究者可将该数据集作为训练集与验证集,结合论文提出的DAR-Net框架,利用其多损失联合优化策略(融合分类交叉熵损失与分割二元交叉熵损失),引导模型聚焦于场景中的潜航员、机器人等关键区域。数据集提供80/20的默认划分比例,便于复现基准实验。此外,该数据集已公开于指定网址,供研究社区用于开发、验证及对比各类活动识别算法,推动水下人机协作感知能力的进步。
背景与挑战
背景概述
水下自主机器人(AUV)与人类潜水员的高效协作是拓展水下高风险作业能力的关键,然而现有研究多聚焦于潜水员存在性检测或简单手势识别,缺乏对复杂多人员、多机器人交互场景中潜水员活动的精细分类。为填补这一空白,明尼苏达大学的研究人员Sadman Sakib Enan与Junaed Sattar于2026年提出了首个水下潜水员活动数据集(UDA),该数据集收录了超过2600张像素级语义标注图像,涵盖六类典型活动(如潜水员分配任务给机器人、潜水员-机器人协作等),旨在为深度学习模型提供训练基础,推动水下多人员-机器人协作系统的智能化发展。该数据集不仅为解决水下活动识别数据稀缺问题奠定了基石,也以其语义引导的标注策略提升了模型对低能见度环境的鲁棒性,对水下人机交互领域具有开创性影响。
当前挑战
水下环境为潜水员活动识别带来严峻挑战:首先,高水压、低光照、湍流及温度极端等物理条件导致数据采集极为困难,使水下大规模标注数据集长期缺失,与陆地活动识别领域形成鲜明对比;其次,构建UDA过程中,研究人员需在封闭水域模拟真实协作任务,并克服IRB审批、安全风险及物流复杂性,最终仅获取2640帧有限样本,远不足以支撑Transformer等大模型的充分训练。此外,现有活动识别模型常将注意力分散至背景噪声(如池底标志线),而潜水员“忙碌”与“机器人-潜水员交互”等类别因视觉特征高度相似(如单一潜水员与机器人共处、姿态模糊),易产生混淆,亟需通过语义引导的注意力机制与多任务损失函数来解耦细粒度时空线索,从而在数据稀缺条件下提升分类精度。
常用场景
经典使用场景
在水下多人与机器人协作的复杂环境中,识别潜水员的实时活动是实现有效人机协作的关键前提。Underwater Diver Activity (UDA) 数据集为此提供了首个大规模、像素级标注的资源,涵盖了六种典型潜水员活动类别,包括分配任务给机器人、空闲、忙碌、潜水员间互动、与机器人协作以及机器人发起的互动。研究者通常将其用于训练和验证基于视频的潜水员活动识别模型,特别是那些需要结合时空特征与语义理解的深度学习架构。该数据集的经典使用方式是将连续视频片段作为输入,通过解析场景中潜水员、机器人与任务对象的交互模式,输出高置信度的活动分类结果,从而为水下自主机器人赋予情境感知能力。
解决学术问题
在水下人机协作研究领域,关键瓶颈之一是缺乏标注精细、面向任务驱动的潜水员活动数据集,导致现有模型多局限于陆地场景或简单的水下静态识别。UDA 数据集从根本上填补了这一空白,解决了数据稀缺性这一长期阻碍学术研究的问题。它使研究者得以首次系统性地探索语义引导下的活动识别范式,即通过像素级标签强制模型关注潜水员、机器人和目标物体等关键语义区域,而非受限于低能见度、光线不均带来的背景噪声。该数据集的发布推动了端到端语义-活动联合学习架构的发展,显著提升了分类准确率,并为后续研究提供了可复现的基准,助力建立水下活动识别的理论框架与评估标准。
衍生相关工作
UDA 数据集的提出直接催生了 DAR-Net 这一变革性框架,该网络采用Transformer架构融合像素级场景语义,通过多损失联合优化实现卓越的时空特征提取能力。在此基础上,研究者进一步探索了针对视觉相似活动的解耦策略,如Diver Busy与Robot-Diver Interaction的细粒度区分。数据集中暴露的混淆案例激励了后续关于水下短时序动作增强表示的研究,包括引入长时特征记忆库和基于大语言模型的跨模态推理。此外,该数据集也为合成数据生成与域自适应提供了基准,推动了从闭合水域到开放海域的泛化方法探索,形成了以UDA为核心的水下人机协作研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务