遇见数据集

project-oceania/planktonzilla-17M

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

Planktonzilla-17M 是一个大规模、全面的数据集,整合了来自所有公开可用、已标记浮游生物数据集的1700万张浮游生物图像。该统一集合使研究人员能够训练鲁棒的深度学习模型,用于在不同成像系统和海洋学环境中进行浮游生物识别和分类。数据集整合了来自FlowCAM、ISIIS、UVP5/UVP6、ZooScan、ZooCAM、PlanktoScope、IFCB以及无透镜显微镜系统的图像,为浮游生物研究提供了分类学上一致且可用于研究的资源。它是Inria Challenge OcéanIA倡议的一部分。每张图像都包含标准化的分类学层次结构(界、门、纲、目、科、属、种),并映射到世界海洋物种名录(WoRMS),以及丰富的元数据,包括浮游生物分类(活体浮游生物与非浮游生物)和生存状态(活体生物与碎屑/惰性物)的布尔指标,以及捕获采集位置、深度、采样条件和环境背景的地理环境元数据。保留了与源数据集和原始标签的完全可追溯性,以确保完全透明。迄今为止,Planktonzilla-17M代表了有史以来组装的最大、分类学最完整的浮游生物数据集,涵盖了所有主要分类群中的601个不同浮游生物类别,以及具有完整分类谱系的201个已知物种。数据集捕获了从微浮游生物(20微米)到大型浮游动物(>300微米)的生物体,采集时间从2008年到2025年,地点涵盖全球海洋、沿海区域和淡水环境。

Planktonzilla-17M is a large-scale, comprehensive dataset combining 17 million plankton images from all publicly available, labeled plankton datasets. This unified collection enables researchers to train robust deep learning models for plankton identification and classification across diverse imaging systems and oceanographic environments. The dataset integrates imagery from FlowCAM, ISIIS, UVP5/UVP6, ZooScan, ZooCAM, PlanktoScope, IFCB, and lensless microscopy systems, providing a taxonomically consistent and research-ready resource for plankton research. It is part of the Inria Challenge OcéanIA initiative. Each image includes a standardized taxonomic hierarchy (Kingdom, Phylum, Class, Order, Family, Genus, Species) mapped to the World Register of Marine Species (WoRMS), along with rich metadata including boolean indicators for plankton classification (live plankton vs. non-plankton) and living status (living organisms vs. detritus/inert), as well as geo-environmental metadata capturing collection location, depth, sampling conditions, and environmental context. Complete traceability to source datasets and original labels is preserved for full transparency. To date, Planktonzilla-17M represents the largest and most taxonomically complete plankton dataset ever assembled, encompassing 601 distinct plankton classes across all major taxonomic groups and covering 201 known species with complete taxonomic lineage. The dataset captures organisms ranging from microplankton (20 μm) to large zooplankton (>300 μm), collected from 2008-2025 across global oceans, coastal regions, and freshwater environments.

提供机构:
project-oceania
搜集汇总
数据集介绍
project-oceania/planktonzilla-17M 数据集图片
构建方式
Planktonzilla-17M 数据集通过整合全球公开的浮游生物图像数据集构建而成,共汇聚了来自15个不同成像系统与海洋观测项目的逾1700万张图像,涵盖 UVP5、显微成像、ZooScan、FlowCAM 等多种采集平台。研究者对原始标签进行了轻量级清洗与标准化处理,通过人工核对的方式将每一条原始类别标签匹配至世界海洋物种名录(WoRMS)中的对应分类条目,并据此填充完整的生物分类层级(界门纲目科属种)。此外,通过回溯或推断采样地点,为各样本补充了地理与环境元数据,从而形成统一、可追溯且具备完整分类谱系的大规模数据集。
特点
该数据集最为显著的特点在于其规模之大与分类之全,迄今共涵盖599个不同的浮游生物类别,包含198个已知物种的完整分类谱系,采集时间横跨2008年至2025年,空间覆盖全球海洋、近岸及淡水环境。每个样本除图像外,还附带了丰富的元数据字段,包括浮游生物与非浮游生物的布尔标识、活体与碎屑/惰性物的分类、采样深度与温度等环境参数,以及 Wikidata、EcoTaxa、NCBI 等多源标识符,极大便利了多模态研究与跨数据集的联合分析。
使用方法
用户可通过 Hugging Face Datasets 库便捷地加载该数据集,只需调用 `load_dataset("project-oceania/planktonzilla-17M")` 即可获取训练集,每一条样本均以字典形式返回图像对象及所有附带的标签与元数据字段。研究人员可直接利用这些字段进行图像分类、细粒度识别或多任务学习等任务,也可根据 `dataset` 字段筛选特定来源数据,或依据 `plankton`、`root_class` 等布尔与类别型字段进行子集划分。该数据集尤其适用于训练鲁棒的浮游生物识别模型,并支持跨成像系统的迁移学习与生态学机理探索。
背景与挑战
背景概述
Planktonzilla-17M数据集由智利Inria研究中心的研究团队于2026年构建,汇聚了全球15个公开浮游生物图像数据集,共计超过1700万张图像,覆盖599个浮游生物类别和198个已知物种,是迄今为止规模最大、分类最全面的浮游生物图像数据集。该数据集旨在解决海洋生态学中浮游生物自动识别与分类的核心问题,通过整合来自不同成像系统(如UVP5、ZooScan、FlowCAM等)和地理区域的异构数据,为深度学习模型提供统一训练基准。其影响力体现在为气候变化研究、海洋食物网动态监测及生物多样性评估提供关键数据支撑,推动了跨学科海洋科学的发展。
当前挑战
该数据集面临的主要挑战包括:1)浮游生物图像分类的领域难题,如类间变异大、类内差异小(同物种不同发育阶段形态悬殊),以及光照、浑浊度等环境因素导致的图像质量参差,需模型具备强鲁棒性;2)构建过程中的跨数据集整合挑战,包括15个来源在标签体系、成像分辨率、采集条件(2008–2025年)和地理覆盖上的高度异质性,需通过WoRMS标准化分类层级并手动匹配原始标签,同时纠正拼写错误与同义名变异,工作量繁重且易引入标注噪声。
常用场景
经典使用场景
Planktonzilla-17M作为迄今规模最大、分类最完备的浮游生物图像数据集,聚合了来自全球十五个主流成像系统与海洋观测计划的逾一千七百万张图像,涵盖从微浮游生物(20微米)至大型浮游动物(超过300微米)的完整体型谱系。其核心应用场景在于为深度学习中细粒度图像分类任务提供海量、多源、多尺度的训练语料,研究者可借助该数据集训练高鲁棒性的浮游生物识别模型,从而精准区分形态相似、类间差异微妙的物种,并实现对不同成像设备和环境条件下采集图像的泛化分类。此外,其丰富的分层级分类体系支持从光合自养型浮游植物到异养型浮游动物的全面表征,为海洋生态监测与生物多样性评估的自动化解析奠定了坚实的数据基础。
衍生相关工作
依托Planktonzilla-17M的构建与公开,衍生出多项开创性研究工作。在模型层面,研究者已在HuggingFace平台(project-oceania)上发布了多组基于该数据集微调的可解释浮游分类模型,融合视觉-语言多模态技术提升细粒度判别能力。在数据驱动生态学方面,该数据集催生了跨域学习与域适应方法的探索,旨在解决不同成像系统间的特征分布偏移问题,从而实现数据源间的无缝知识迁移。此外,基于其丰富的空间与环境元数据,衍生出浮游生物地理分布建模与物种分布预测等方向的工作,结合气候变化场景模拟未来浮游群落结构的变迁。这些相关成果共同推动了海洋生态计算领域从理论模型走向大规模可部署应用,为全球海洋生物多样性与碳循环研究开辟了新范式。
数据集最近研究
最新研究方向
Planktonzilla-17M的构建标志着海洋浮游生物视觉识别领域迈入大规模多模态融合的新纪元。该数据集以1700万张图像、599个浮游生物类别和涵盖全球海域的时空环境元数据,为深度学习模型在跨成像系统、跨生态区域的泛化能力研究提供了前所未有的基准。其核心前沿方向在于:利用统一至WoRMS的分类层级与多源地理环境信息(如温度、深度),推动面向海洋生态监测的多模态可解释AI架构(如CLIPS)发展,并支持气候变化背景下浮游生物群落动态的自动化高通量分析。该数据集不仅解决了此前分散标注数据难以协同训练的痛点,更通过整合2008至2025年间跨大洋和淡水生态系统的观测记录,为海洋碳循环、生物多样性评估及环境政策制定提供了数据驱动的科学支撑,成为连接计算机视觉与海洋学实证研究的关键枢纽。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务