syedashfaq/Beluga
收藏官方服务:
资源简介:
该数据集包含白鲸(Delphinapterus leucas)的预裁剪图像和个体识别信息。这些数据是在2016年至2019年间在阿拉斯加库克湾通过船载相机和无人机相机收集的。数据集包括5,902张照片和1,617次独特遭遇的元数据。图像被标注了全图边界框和视角标签(顶部、左侧、右侧),并由训练有素的专家手动识别了788只白鲸个体。数据集以Microsoft COCO .json格式发布,并用于一个名为“Where’s Whale-do?”的识别竞赛。
该数据集包含白鲸(Delphinapterus leucas)的预裁剪图像和个体识别信息。这些数据是在2016年至2019年间在阿拉斯加库克湾通过船载相机和无人机相机收集的。数据集包括5,902张照片和1,617次独特遭遇的元数据。图像被标注了全图边界框和视角标签(顶部、左侧、右侧),并由训练有素的专家手动识别了788只白鲸个体。数据集以Microsoft COCO .json格式发布,并用于一个名为“Where’s Whale-do?”的识别竞赛。
提供机构:
syedashfaq原始信息汇总
数据集概述
数据内容
- 包含5,902张预裁剪的白鲸(Delphinapterus leucas)图像。
- 1,617次独特的遭遇记录,每次遭遇时间不超过1小时。
- 图像来自船载相机和无人机俯瞰相机。
- 788只白鲸通过专家手工识别,主要依据疤痕模式和其他视觉标记。
数据格式
- 训练数据集采用Microsoft COCO .json格式。
- 所有图像的最大尺寸调整为1,200像素。
- 元数据包括轴对齐边界框、视角、物种ID、源图像ID、个体字符串ID名及其他杂项值。
- 图像的时间顺序可从元数据中确定。
数据用途
- 数据集与DrivenData主办的“Where’s Whale-do?” ID竞赛同步发布,与竞赛中使用的公共训练集相同。
- 鼓励研究人员尝试处理个体观测次数不平衡和分布混乱的新方法。
搜集汇总
数据集介绍

构建方式
该数据集聚焦于白鲸(Delphinapterus leucas)的个体识别,源自2016至2019年间在美国阿拉斯加库克湾开展的协作性数据采集与种群建模工作。研究团队通过船载相机与无人机俯拍视角,共收集了5,902张图像,对应1,617次独特相遇事件(每次时长不超过1小时)。每张图像均经过预处理裁剪,并由训练有素的专家依据疤痕模式及其他视觉标记手工标注,最终识别出788个白鲸个体。数据集采用Microsoft COCO .json格式发布,将所有样本归入单一“train”标签,而“val”与“test”留空,旨在鼓励研究者探索应对个体出现次数不均衡与分布混乱的新颖方法。所有图像均已调整至最大边长为1,200像素,标注信息包含轴对齐边界框、视角(顶部、左侧、右侧)、物种ID、源图像ID及个体字符串ID等元数据,且图像的时间顺序可通过元数据追溯。
特点
本数据集的核心特色在于其真实世界生态数据的高复杂度与挑战性。首先,个体出现频次极度不均衡,呈现出典型的“长尾分布”,这模拟了野外监测中常见的数据稀疏与偏斜现象,为个体重识别算法提供了严苛的测试场景。其次,数据来源多元,融合了船载与无人机两种拍摄平台,视角涵盖顶部、左侧及右侧,极大丰富了图像异质性,增强了模型对姿态变化的鲁棒性。此外,数据集与DrivenData举办的‘Where’s Whale-do?’识别竞赛同步发布,其公开训练集内容一致,便于研究者复现与比较实验结果。所有标注均由生态学专家手工完成,确保了标注质量与生物学准确性,使该数据集不仅服务于计算机视觉研究,亦为白鲸种群动态监测与保护工作提供了坚实的数据基础。
使用方法
研究者可基于Microsoft COCO .json格式直接加载训练数据,利用边界框与个体ID标签开展白鲸个体重识别模型的训练与评估。鉴于数据集将全部样本整合为单一训练集,建议采用交叉验证或自定义划分策略,以应对个体出现次数的不均衡分布。测试数据因竞赛后另行添加而格式不同,需联系数据集所有者获取详细信息。在应用时,可充分利用视角标签、时间元数据等附加信息,设计多视角融合或时序建模方法,以提升识别性能。该数据集特别适合用于验证小样本学习、长尾分布处理及野生动物自动监测等前沿研究方向,并鼓励创新性实验,以推动计算机视觉在生态保护领域的实际落地。
背景与挑战
背景概述
白鲸(Delphinapterus leucas)作为北极和亚北极海域的旗舰物种,其种群动态监测对于生态保护至关重要。syedashfaq/Beluga数据集诞生于2016年至2019年间,由Wild Me非营利组织联合多学科团队,在美国阿拉斯加库克湾开展系统性数据采集与种群建模工作。该数据集包含来自5902张影像的1617次独立相遇记录,通过船载相机与无人机俯拍获取,并由训练有素的专家依据疤痕模式等视觉特征手工识别出788头个体白鲸。作为DrivenData主办的“Where’s Whale-do?”个体识别竞赛的公开训练集,该数据以Microsoft COCO标准格式发布,旨在推动计算机视觉技术在野生动物个体识别领域的发展,为生态学研究提供高精度标注的基准资源。
当前挑战
该数据集面临的核心挑战源于个体观测频次的高度不平衡与时空分布的无序性。在领域问题层面,白鲸个体识别需解决在开放水域中利用有限视觉线索(如疤痕、体色变异)进行精准匹配的难题,这要求算法具备对光照、视角及部分遮挡的鲁棒性。构建过程中,团队需应对野外采集数据的天然噪声,包括不同年份间个体外观的自然变化(如季节性褪皮)、无人机与船载相机视角差异导致的标注一致性维护,以及将原始影像统一缩放至1200像素时可能丢失的细粒度特征。此外,数据集的COCO格式虽利于模型训练,但将全部数据归为单一“训练”标签的设计,迫使研究者自行设计策略应对每头个体观测次数从单次到数十次不等的极端分布,这对度量学习与少样本泛化能力提出了严峻考验。
常用场景
经典使用场景
白鲸数据集(Beluga Dataset)是面向海洋生态与计算机视觉交叉领域的重要资源,其核心使用场景集中于个体识别与重识别任务。该数据集提供了来自阿拉斯加库克湾2016至2019年间采集的5902张白鲸图像,涵盖788只个体,每只个体通过疤痕模式等视觉特征由专家手工标注。图像附有边界框、视角标签(顶部、左侧、右侧)及元数据,支持研究人员在非均衡样本分布条件下探索创新的个体识别算法,尤其适用于基于外观的野生动物摄影-捕获-再捕获研究范式。
衍生相关工作
该数据集催生了一系列经典衍生工作,其中最显著的是DrivenData平台举办的“Where’s Whale-do?”个体识别竞赛,吸引了全球团队探索基于深度度量学习、注意力机制和生成式数据增强的创新方法。后续研究包括将白鲸识别模型迁移至其他鲸豚类物种的跨物种识别框架,以及结合时空元数据构建的个体行为预测系统。此外,该数据集还启发了针对水下图像去噪和视角不变特征提取的专项算法开发,成为野生动物计算机视觉领域验证模型泛化能力的重要基准之一。
数据集最近研究
最新研究方向
当前,基于深度学习的个体识别技术正成为海洋生物保护领域的前沿热点。Beluga数据集作为首个大规模、多视角的白鲸个体识别基准,其发布推动了计算机视觉在野生动物生态研究中的实际应用。研究者围绕该数据集,重点探索了面向小样本、类别不平衡及个体重识别难题的新型模型架构,如结合注意力机制与度量学习的精细化特征提取方法。此外,该数据集与DrivenData竞赛的联动,催生了融合时空信息与多视图几何约束的识别策略,为从非结构化野外影像中高效追踪濒危鲸类种群提供了关键数据支撑。这一研究方向不仅提升了自动监测系统的鲁棒性,更助力于阿拉斯加库克湾白鲸种群动态评估与保护决策的智能化转型。
以上内容由遇见数据集搜集并总结生成



