遇见数据集

vapaau/autofish

收藏
Hugging Face2025-01-09 更新2025-04-12 收录
官方服务:

资源简介:

AUTOFISH数据集包含1500张在传送带上的高质量鱼类图像,共454种独特的鱼,包含类标签、ID、手动测量的长度和18640个实例分割掩码。鱼类分为25组,每组有14到24条鱼,每条鱼仅在一个组中出现。每个组分为三个子集:Set1、Set2和All。Set1和Set2包含一半的鱼,没有重叠或接触,All子集包含所有鱼,故意放置在高度重叠的位置。每组包含每个子集的20张图像,通过改变鱼的位置和方向引入变化。数据集还包含两个高重叠的无标签组和相机校准图像。

The AUTOFISH dataset comprises 1500 high-quality images of fish on a conveyor belt, featuring 454 unique fish with class labels, IDs, manual length measurements, and a total of 18,160 instance segmentation masks. The fish are divided into 25 groups, with 14 to 24 fish in each group, and each fish appears in only one group. Each group is split into three subsets: Set1, Set2, and All. Set1 and Set2 contain half of the fish each without overlap or contact, while All contains all the fish placed in positions with high overlap. Each group includes 20 images per subset, with variations introduced by changing the position and orientation of the fish. The dataset also includes two high-overlap unlabeled groups and camera calibration images.

提供机构:
vapaau
搜集汇总
数据集介绍
vapaau/autofish 数据集图片
构建方式
AUTOFISH数据集聚焦于渔业自动化背景下的细粒度鱼类图像分析,其构建过程严格模拟真实工业场景。数据集包含1500张传送带上的鱼类高清图像,涵盖454条独特个体,并配备类别标签、唯一标识符、人工测量长度以及总计18,160个实例分割掩码。鱼类被划分为25个组,每组包含14至24条鱼,每条鱼仅出现在单一组中,便于训练集的划分。每组进一步细分为三个子集:Set1和Set2各含半数不重叠的鱼,而All子集则包含全部鱼并刻意制造高重叠摆放。每组每个子集采集20张图像,通过改变鱼的位置、朝向以及翻转状态引入多样性,从而构建出结构清晰且贴近实际的数据体系。
使用方法
用户可通过HuggingFace的datasets库便捷加载该数据集,默认配置下执行`datasets.load_dataset('vapaau/autofish', revision='script', trust_remote_code=True)`即可获取数据。加载后的数据集包含图像与对应标注,可直接用于实例分割、掩码生成或目标检测任务的训练与评估。其分组结构允许用户按需选择特定组或子集进行实验,例如利用Set1和Set2进行监督学习,或使用All子集测试模型在高重叠场景下的表现。未标注组与校准图像可进一步拓展至无监督学习或相机标定研究。建议引用相关论文以尊重原作者贡献,并遵循CC-BY-4.0许可协议使用数据。
背景与挑战
背景概述
在计算机视觉与海洋生态交叉研究领域,鱼类细粒度分析对渔业资源评估与可持续管理具有关键意义。AutoFish数据集由丹麦奥尔堡大学Stefan Hein Bengtson、Daniel Lehotský等研究人员于2025年创建,旨在解决工业场景下鱼类自动检测与分割的标准化基准缺失问题。该数据集包含1500张传送带上的鱼类高质量图像,涵盖454条独特个体、6个物种类别及18,160个实例分割掩膜,并创新性地设计了25组伪随机分配的分组结构,模拟真实渔业场景中鱼类分布的不确定性。其核心研究问题聚焦于高重叠场景下的细粒度实例分割与个体识别,通过提供鱼类ID、长度测量及侧位标注等多元信息,为精准渔业中的自动化监测系统奠定了数据基础。该数据集以CC-BY-4.0许可发布,已成为推动水下图像分析领域从粗粒度分类向细粒度解析转型的重要里程碑。
当前挑战
AutoFish数据集所面临的挑战体现在两个层面。在领域问题层面,其核心挑战在于解决高重叠鱼群场景下的精准实例分割与个体追踪难题——传统分割算法在鱼类相互遮挡、姿态多变时性能显著下降,而该数据集通过设置Set1(无重叠)、Set2(无重叠)与All(高重叠)三组子集,专门为评估算法对重叠目标的鲁棒性提供了严苛测试基准。在构建过程中,研究团队面临鱼体自然形态差异导致的标注歧义性挑战,例如“Other”类别需涵盖非目标物种的泛化表征,同时需确保454条鱼个体的唯一性标注与18,160个掩膜的空间一致性。此外,传送带动态环境下的光照变化、鱼体翻转(半数为翻转图像)及不同分组间物种分布的伪随机平衡,均对数据采集的标准化与标注质量的统一性提出了极高要求。
常用场景
经典使用场景
在海洋渔业资源评估与自动化监测领域,AutoFish数据集为细粒度鱼类实例分割与多属性分析提供了标准化的基准平台。其经典使用场景聚焦于传送带环境下的鱼类个体识别与分割任务,通过提供454条独特鱼类的18,160个实例分割掩码、类别标签、长度测量及侧位信息,研究者可系统性地训练和评估基于深度学习的视觉模型。数据集的25个分组设计巧妙模拟真实捕捞场景中的鱼类混合与遮挡情况,每个分组内包含低重叠和高重叠子集,特别适用于验证模型在复杂拥挤环境中的鲁棒分割能力。该数据集还内置了无标注高重叠组与相机校准图像,为半监督学习和域自适应研究提供了天然实验场。
解决学术问题
AutoFish数据集系统性地解决了水产业计算机视觉研究中长期存在的两大瓶颈:细粒度鱼类实例标注的稀缺性与真实场景遮挡问题的基准缺失。学术界此前缺乏一个同时包含个体身份、精确长度、侧位朝向及密集遮挡情况的标准化鱼类图像库,导致鱼类生长监测、种群计数等研究的模型泛化能力难以客观评估。该数据集通过精心设计的实验协议——确保每条鱼仅出现在一个分组中且分组内鱼类不重复——消除了数据泄露风险,使得基于个体ID的跨组别泛化研究成为可能。其高重叠子集直接挑战现有实例分割算法在极端遮挡条件下的性能极限,推动了遮挡建模与推理机制的理论突破。
实际应用
在实际产业应用中,AutoFish数据集直接服务于海洋渔业的数字化转型与可持续管理。基于该数据集训练的实例分割模型可部署于渔获物自动分拣系统,实时识别鳕鱼、黑线鳕、牙鳕等商业鱼种并精确测量个体长度,替代传统人工抽样测量方式,大幅提升港口卸货效率与数据采集频次。数据集中包含的鱼类侧位朝向信息可辅助自动化生产线调整鱼体姿态,优化后续加工流程。此外,通过连续跟踪个体鱼类的长度变化,渔业科学家能更准确地估算种群年龄结构与生长速率,为制定科学捕捞配额提供数据驱动决策支持,对遏制过度捕捞、维护海洋生态平衡具有重要实践价值。
数据集最近研究
最新研究方向
在计算机视觉与海洋生物资源管理交叉领域,AUTOFISH数据集为细粒度鱼类分析开辟了新的前沿研究方向。该数据集包含1500张传送带上的高分辨率鱼类图像,涵盖454条独特个体、18,160个实例分割掩码及长度测量等精细标注,其独特的组划分设计(25组、每组含无重叠的Set1/Set2与高重叠All子集)精准模拟了真实工业分拣场景中的遮挡与密集排列挑战。当前研究热点聚焦于基于此数据集的少样本学习与域自适应分割模型开发,旨在解决渔业自动化中品种识别(鳕鱼、黑线鳕等六类)与长度估测的鲁棒性问题。该数据集的发布恰逢全球渔业数字化转型加速期,其提供的标注一致性基准与无标签高重叠组,为开发面向复杂环境的多目标跟踪与掩码生成算法提供了关键验证平台,对推动海洋资源可持续管理中的智能监控技术具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务