遇见数据集

Random Sampling dataset

收藏
arXiv2026-08-12 更新2026-08-14 收录
数据链接:
官方服务:

资源简介:

该数据集由波尔图大学与里斯本大学联合创建,是首个公开可用的几内亚比绍全国腰果果园遥感检测数据集。内容包含4498个随机采样像素,涵盖8类土地覆盖类型(如腰果果园、森林、红树林等),基于Sentinel-2卫星影像提取360维光谱、时间及空间特征。数据集通过完全远程的主动学习流程构建,以随机采样为基线,旨在优化标注成本并提升分类器性能。该数据集主要应用于大规模腰果果园制图,旨在解决西非地区因腰果种植扩张导致的森林砍伐监测与土地覆盖分类难题,为环境可持续管理提供关键数据支撑。

This dataset was jointly developed by the University of Porto and the University of Lisbon, serving as the first publicly available nationwide remote sensing detection dataset for cashew orchards in Guinea-Bissau. It contains 4,498 randomly sampled pixels covering 8 land cover categories (e.g., cashew orchards, forests, mangroves, etc.), with 360-dimensional spectral, temporal, and spatial features extracted from Sentinel-2 satellite imagery. Constructed via a fully remote active learning pipeline with random sampling as the baseline, this dataset aims to optimize annotation costs and enhance classifier performance. Primarily applied to large-scale cashew orchard mapping, it addresses the challenges of deforestation monitoring and land cover classification caused by cashew cultivation expansion in West Africa, providing critical data support for sustainable environmental management.

创建时间:
2026-08-12
原始信息汇总

数据集概述

ALFICC(Active Learning For Improved landCover Classification)是一个与硕士论文项目相关的开放数据集,旨在利用哨兵-2(Sentinel-2)地表反射率地理空间数据,通过机器学习(ML)方法识别腰果种植园。研究区域(ROI)包括几内亚比绍全国及邻国几内亚共和国延伸至科贡河(Kogon)的区域。数据集包含标签样本和土地覆盖图,标签对应2021年。


数据集内容

1. 样本数据集

创建了两个标注像素数据集,均以CSV格式存储:

  • 随机采样数据集:包含 4,498 个样本,在ROI内随机选择,地理分布较广,样本多样性较高。
  • 边缘采样数据集:包含 1,816 个样本,通过边缘采样启发式方法选择,地理分布较集中,多样性较低,但在机器学习任务中表现良好。

标签类别:共8类(编号1-8):

  1. 封闭森林(Closed Forest)
  2. 开放森林(Open Forest)
  3. 红树林(Mangrove)
  4. 稀树草原(Savanna,稀疏植被)
  5. 腰果(Cashew)
  6. 非森林(Non-Forest)
  7. 水体(Water)
  8. 非腰果(Non-Cashew)

其中类别8(非腰果)包含明确不是腰果但混合其他类别或无法归类的像素,适用于二分类场景(区分腰果与非腰果),但在其他场景中建议丢弃。

文件信息

  • CSV文件包含像素坐标(EPSG:4326投影)和类别标签。
  • 像素以3×3多边形/斑块获取,每斑块有唯一编号(列名:polygonID),便于空间分布和相关性分析。
  • 67列 为机器学习特征,包括Sentinel-2光谱波段、GLCM空间特征和CCDC时间系数。
  • normalizers.csv 存储各特征的min、max、mean、std值,用于特征归一化。

2. 土地覆盖图

roi.geojson 存储了ROI中两个区域(几内亚比绍和几内亚共和国部分)的地理数据。仓库提供两幅土地覆盖图:

  • initial_map_7class:早期阶段生成,基于机器学习预测,仅涉及类别1-7(排除类别8)。训练数据为RSeT专有数据集(非本论文数据集)。
  • final_map:最终生成,基于完整边缘采样数据集训练的模型,仅识别腰果和非腰果(包含类别8)。

精度评估

  • 初始图:平衡准确率 82.2%,腰果F1分数 88.4%
  • 最终图:平衡准确率 94.0%,腰果F1分数 89.5%
  • 测试集不同:初始图使用RSeT数据集的20%测试,最终图使用随机采样数据集的约50%测试。

文件与工具

  • 文件列表:两个CSV样本集、normalizers.csvroi.geojson、两幅土地覆盖图。
  • 编程语言:脚本使用 JavaScript(Google Earth Engine)和 Python
  • Python依赖库:numpy, pandas, sklearn, geopandas, rasterio, rioxarray。

引用信息

  • 作者:Miguel Ribeiro Pereira(波尔图大学理学院硕士)
  • 指导教师:João Pedro Pedroso(波尔图大学),Sofia Cardoso Pereira(INESC TEC及波尔图大学工程学院)
  • 完整论文:可在波尔图大学开放存储库获取。
  • 引用建议:使用时需正确引用本工作和资源来源。
搜集汇总
数据集介绍
Random Sampling dataset 数据集图片
构建方式
Random Sampling dataset的构建源于对几内亚比绍全国腰果园遥感监测的需求。研究团队基于Sentinel-2卫星影像,在2021年4月干季末期选取了覆盖全国及邻国几内亚科贡河区域的样本像素,通过随机抽样策略,从八个土地覆盖类别中选取了4498个像素点。每个像素点的标签由遥感专家结合Google Earth Pro历史影像进行人工标注,同时记录3×3邻域像素以加速标注过程。该数据集采用完全远程的方式构建,避免了实地调查的成本与限制,为主动学习算法提供了基线对比数据集。
特点
Random Sampling数据集具有显著的空间代表性和类别多样性。其样本覆盖几内亚比绍全国及邻国区域,保证了地理分布的广泛性。数据集包含八个详细的土地覆盖类别,从茂密森林到腰果园,从红树林到水域,囊括了西非地区典型的地表类型。其中腰果园类别样本数量充足(993个像素),为腰果种植监测提供了关键训练数据。该数据集的随机选择特性确保了样本的客观性和无偏性,使其成为评估主动学习采样策略优劣的黄金标准基线。
使用方法
Random Sampling数据集主要用作机器学习分类器的训练和测试基准。研究中将其按空间分组进行50-50划分,确保训练集和测试集相互独立,避免空间自相关影响评估结果。该数据集可用于训练支持向量机(SVM)或随机森林(RF)等分类器,实现腰果园与自然植被的精确区分。同时,作为被动采样的代表,它可与Margin Sampling等主动学习数据集进行性能对比,量化主动学习策略在减少标注样本数量同时提升分类精度方面的优势。研究人员可直接从公开的GitHub仓库获取该数据集,用于西非土地利用分类相关研究。
背景与挑战
背景概述
Random Sampling dataset是2026年由葡萄牙多所大学与研究机构联合构建的遥感地物分类数据集,旨在解决几内亚比绍腰果种植园的大规模测绘问题。该数据集由Miguel Pereira等人创建,基于Sentinel-2卫星影像,通过随机采样方式生成,包含4498个像素样本,覆盖八种土地覆盖类型,其中腰果园样本993个。作为主动学习基准数据集,它提供了无偏且代表性的训练样本,为西非地区腰果种植监测提供了基础数据支撑,首次实现了该国全域腰果园制图,推动了环境可持续性研究。
当前挑战
该数据集面临的挑战包括:腰果园与森林在光谱特征上高度相似,导致传统分类方法难以区分;几内亚比绍地形复杂,混合像元频繁出现,增加了标注难度;随机采样虽保证了代表性,但样本信息冗余度高,需要大量标注才能达到理想精度。此外,卫星影像中云覆盖和季节变化影响特征提取,高维特征空间(360个波段)对分类器性能提出更高要求。研究团队需平衡标注成本与模型性能,而主动学习策略的引入虽提高了效率,仍需解决标注者主观差异和样本不确定性等难题。
常用场景
经典使用场景
Random Sampling dataset作为基准采样策略的典范,广泛应用于遥感图像分类中训练样本的随机选取。在基于Sentinel-2影像的腰果果园检测任务中,该数据集通过无偏、分散的像素标注,为机器学习模型提供了多样且具代表性的训练样本,尤其适用于与主动学习策略的对比实验。其经典使用场景在于评估随机采样与主动学习(如Margin Sampling)在样本效率和模型性能上的差异,从而揭示不同采样策略对分类精度的潜在影响。此外,该数据集还可用于多类别土地覆盖分类、特征选择及超参数调优等基础研究环节,为大规模区域尺度的作物制图提供可靠的基准参照。
解决学术问题
该数据集有效解决了遥感领域在缺乏实地标注条件下训练样本获取困难的核心问题,尤其针对西非几内亚比绍腰果果园与森林光谱特征高度相似、难以区分的技术瓶颈。通过随机采样策略,该数据集为构建全国尺度的腰果种植分布图提供了海量且均衡的标注样本,打破了传统依赖现场勘察的局限,大幅降低了数据采集成本。其学术意义在于证明了纯遥感手段结合机器学习实现大规模作物制图的可行性,并为后续主动学习方法的性能对比提供了标准化基线,推动了对腰果种植扩张与森林退化、生物多样性丧失等环境问题的量化研究。
衍生相关工作
该数据集驱动的衍生工作包括基于Margin Sampling主动学习构建的高效样本采集方法,其在较少标注样本下显著提升了腰果检测的F1分数,验证了主动学习在遥感分类中的优越性。后续研究可借鉴其框架,探索不同主动学习启发式(如不确定性采样、版本空间缩减)或深度学习架构(如patch-based CNN)以进一步提升制图精度。此外,该数据集与时空特征(如CCDC时间序列、GLCM纹理)的结合为动态土地覆盖变化检测提供了新思路,衍生出针对腰果种植扩张与保护区重叠区域的时空分析,为理解土地利用变化与生物多样性丧失的关联提供了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务