遇见数据集

NEON-plant-subplot-pilot

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集包含来自美国国家生态观测网络(NEON)两个站点(CPER和SCBI)共7个样方的植物多样性子样方图像。每张图像覆盖1平方米的子样方,并标注了存在的植物物种。该数据集作为试点研究,旨在标准化NEON子样方图像的标注流程,并利用BioCLIP 2进行物种分类实验。数据集支持多标签图像分类任务,每张图像关联多个物种标签。数据由图像文件和标签文件组成:图像按样方分文件夹存储,命名格式为<plot_id>_PlantDiversity_<subplot_id>_<time>-straightened.jpg;标签文件为每个样方一个CSV,包含原始标签、经TaxonoPy解析后的二项式名称、科学名称、分类学标签、解析状态、标签数量及未映射标签等信息。元数据文件metadata.csv记录图像文件名、样方ID和子样方ID。数据集仅用于测试,规模小于1000个样本。图像采用CC BY 2.0许可,改编自NEON原始图像,经透视裁剪和标签对齐处理。

This dataset contains plant diversity subplot images from 7 plots across two NEON (National Ecological Observatory Network) sites (CPER and SCBI). Each image covers a 1-square-meter subplot and is annotated with the plant species present. It serves as a pilot study to standardize the annotation pipeline for NEON subplot images and to conduct species classification experiments using BioCLIP 2. The dataset supports multi-label image classification tasks, with each image associated with multiple species labels. Data consists of image files and label files: images are stored in folders by plot, named in the format <plot_id>_PlantDiversity_<subplot_id>_<time>-straightened.jpg; label files are CSV files per plot, containing original labels, binomial names parsed by TaxonoPy, scientific names, taxonomic labels, parsing status, label counts, and unmapped labels. A metadata file (metadata.csv) records image filenames, plot IDs, and subplot IDs. The dataset is intended for testing only, with fewer than 1000 samples. Images are licensed under CC BY 2.0, adapted from original NEON images with perspective cropping and label alignment.

创建时间:
2026-08-19
原始信息汇总

NEON 植物存在与覆盖度子样方试点图像数据集

数据集概述

该数据集包含来自国家生态观测站网络(NEON)两个站点(CPER 和 SCBI)的 7 个样方的多标签植物图像,用于植物多样性的多标签分类和检测任务。这是一个试点数据集,旨在验证使用 NEON 子样方图像检测植物多样性的处理流程。

数据集详情

  • 许可证: CC-BY-2.0
  • 语言: 英语
  • 任务类别: 图像分类(多标签)
  • 规模: 少于 1,000 个样本(n<1K)
  • 数据来源: 国家生态观测站网络(NEON),代码库位于 PlotDiversiVision

数据集结构

数据集包含图像和标签两个主要目录:

  • images/ 目录:包含 7 个样方的图像,以 plot_id 分文件夹存放,图像命名格式为 <plot_1>_PlantDiversity_<subplot_1>_<time>-straightened.jpg
  • labels/ 目录:包含 7 个样方的子样方标签 CSV 文件(<plot_N>_subplot_labels.csv
  • metadata.csv:链接图像文件与其对应的 plot_idsubplot_id

数据字段

metadata.csv:

  • file_name:图像文件路径
  • plot_id:样方 ID(如 CPER_001)
  • subplot_id:子样方 ID(如 31_1_1,X_Y_Z 格式,Y 表示子样方大小)

plot_N_subplot_labels.csv:

  • plotID:样方 ID
  • subplotID:子样方 ID
  • original_labels:NEON 技术人员提供的原始物种标签列表
  • resolved_labels:TaxonoPy 生成的解析二名法名称列表
  • resolved_scientific_names:TaxonoPy 生成的解析学名列表
  • resolved_taxonomic_labels:TaxonoPy 生成的解析分类标签列表
  • taxonopy_resolution_status:每个标签的解析状态
  • label_count:NEON 技术人员为每张图像标记的物种数量
  • unmapped_original_labels:无法映射的原始标签

数据划分

该数据集全部用于测试。

数据采集与处理

  • 数据来源于 NEON 的两个站点(CPER 和 SCBI),选择基于其清晰的方形边界和植物分布多样性,分别随机选取 3 个和 4 个样方
  • 图像使用 imageonline 工具从原始 NEON 图像进行透视裁剪预处理
  • 标签处理流程:使用 TaxonoPy 处理原始标签,获取 7 级分类标签,确保与 BioCLIP 2 训练对齐
  • 物种列表来源于四个渠道:NEON 报告的观测物种、CONUS 州级物种列表、BONAP 区域物种列表、GBIF 区域物种列表,经过去重和过滤(去除分类标签少于 5 级的条目)

标注人员

  • Sooyoung Jeon、Braedon Lineman 和 Arpita Chowdhury 负责使用 imageonline 创建图像裁剪
  • Jianyang Gu 负责使用 TaxonoPy 创建对齐的物种标签

偏差、风险与局限性

  • 该数据集仅从 NEON 子样方图像的一小部分进行初始筛选,作为概念验证,用于构建处理流程和使用 BioCLIP 2 预测植物物种
  • 标签通过 TaxonoPy 处理,主要旨在与 BioCLIP 2 对齐,因此可能存在标签与特定使用场景不一致的风险

引用信息

作者:Dave Barnett、Arpita Chowdhury、Jianyang Gu、Leanna House、Sooyoung Jeon、Eugene Law、Braedon Lineman

数据集卡片联系人

Jianyang Gu (gu.1220@osu.edu)

搜集汇总
数据集介绍
NEON-plant-subplot-pilot 数据集图片
构建方式
该数据集源自美国国家生态观测网(NEON)的亚样方植物影像,聚焦于两个代表性站点(CPER与SCBI)的七个样方,每个样方涵盖一平方米的亚样方图像。研究者通过透视裁剪工具对原始影像进行标准化预处理,确保图像边界清晰规整。在标签构建方面,整合了NEON观测物种、CONUS州级物种清单、BONAP区域名录及GBIF数据库,经由TaxonoPy工具进行多源解析与去重,剔除分类层级不足五级的条目,最终形成与BioCLIP 2模型对齐的物种标注体系。这一流程兼顾了生态学野外数据与模型训练需求,为后续生态多样性自动化监测奠定了数据基础。
特点
该数据集以多标签图像分类为核心特性,每幅图像关联多个植物物种标签,充分反映亚样方内物种共存的复杂性。图像命名规则编码了样方与亚样方信息,便于追溯与整合;标签文件则细致区分了原始标签、解析学名及分类学解析状态等层级,保障了数据可解释性。此外,数据集严谨遵循CC BY 2.0许可协议,确保学术共享与再利用的合法性。作为试点性成果,其规模虽小(不足千张),却系统验证了从影像采集、预处理到标签整合的完整流水线,为大规模生态监测数据集开发提供了可复制的范式。
使用方法
该数据集专为多标签图像分类任务设计,适合用作测试集以评估生态学视觉模型(如BioCLIP 2)对植物多样性的识别性能。使用者可通过`metadata.csv`关联图像文件与样方、亚样方标识,并结合各样方的`subplot_labels.csv`文件获取对应的物种标签列表。由于标签已与BioCLIP 2的训练体系对齐,研究者可直接输入图像并输出物种预测,进而与解析后的科学名称进行比对,快速验证模型精度。代码库PlotDiversiVision提供了完整的处理与预测流程,便于复现实验或迁移至其他生态位场景。
背景与挑战
背景概述
NEON-plant-subplot-pilot数据集由Imageomics研究所于2026年创建,核心研究人员包括Dave Barnett、Jianyang Gu等,旨在利用国家生态观测网络(NEON)的亚样方图像进行植物多样性检测。该数据集作为概念验证,从CPER和SCBI两个站点选取7个样方,通过透视裁剪和TaxonoPy标签解析,构建了与BioCLIP 2对齐的多标签图像分类基准。其研究问题聚焦于标准化生态图像处理流程,并评估基础模型在物种分类中的适用性,为后续大规模植物多样性监测与自动化评估奠定基础,对生态信息学与计算机视觉交叉领域具有引领意义。
当前挑战
该数据集面临的领域挑战包括:生态图像中植物物种的多标签分类需处理高度类内变异与类间相似性,且野外环境导致背景复杂、遮挡频繁,对模型鲁棒性要求严苛。构建过程中,需整合NEON观测物种、CONUS州级列表、BONAP与GBIF区域列表等多源物种信息,利用TaxonoPy统一分类层级,面临数据不一致与解析歧义;同时,从原始NEON图像生成透视裁剪需人工干预,且仅选取7个样方,样本量有限,标签解析可能引入误差,限制了大规模泛化与基准测试的可靠性,亟需扩充数据覆盖并优化自动化处理流程。
常用场景
经典使用场景
NEON-plant-subplot-pilot数据集是生态学与计算机视觉交叉领域的一项创新性资源,源自美国国家生态观测网(NEON)的亚样方影像,覆盖CPER和SCBI两个典型生态站点。每张图像对应1平方米的样方,并标注了其中存在的植物物种,为多标签图像分类任务提供了独特的基准。该数据集作为概念验证,旨在探索利用亚样方图像进行植物多样性自动检测的可行性,其经典使用场景聚焦于多标签植物物种识别模型的训练与评估,尤其与BioCLIP 2模型结合,推动生态监测的智能化进程。
衍生相关工作
该数据集作为先驱性工作,催生了若干衍生研究方向。其一,基于此类亚样方图像,研究者可开发更强的视觉基础模型(如改进版BioCLIP)以适配细粒度植物识别,推动分类性能的持续提升。其二,该数据集的构建流程可被复用于构建更大规模、多站点的生态影像数据集,促进跨区域物种分布建模。其三,结合时间序列影像,可衍生出物候变化检测、群落演替分析等新任务。此外,数据集的标签解析方法(TaxonoPy应用)亦为其他生态数据集提供了范本,助推了分类学自动化工具的完善与标准化。这些衍生工作共同拓展了计算机视觉在生态学中的应用边界,形成了良性发展的研究生态。
数据集最近研究
最新研究方向
基于NEON亚样方影像的植物多样性多标签分类研究正迈向标准化与大规模自动化分析的新阶段。该数据集作为先导性探索,聚焦于整合国家生态观测网络的高分辨率地面影像与先进视觉-语言模型BioCLIP 2,通过精细的物种标签解析与对齐,构建高效、可扩展的生态监测范式。其前沿意义在于推动计算机视觉技术向生态学深层渗透,实现从人工样方调查到智能识别与量化评估的跨越,为生物多样性快速编目、植被动态追踪及全球变化响应研究提供关键数据支撑与算法验证平台,预示着生态信息学与人工智能融合的广阔前景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务