遇见数据集

arva

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

ARVA数据集是伴随ARVA论文发布的实证评估资源集合,旨在支持地球观测基础模型在变化的目标区域标签访问条件下的地理迁移研究。数据集核心内容包含用于评估的冻结模型表示、预定义的训练/验证/测试划分分配,以及详细的实验结果表格。数据构成主要包括:多个随机种子下的评估指标、预测结果和可追溯性文件;针对区域性能、原始输入与学习表示对比、校准、划分敏感性、目标标签分配、区域筛选和选择性预测的分析表格;基准数据集(CropHarvest、EuroCropsML、BreizhCrops、PASTIS-R)的组装缓存;以及冻结的模型和原始输入嵌入表示。数据集以结构化目录形式组织,并包含机器可读的发布元数据和完整文件清单。该数据集适用于地球观测、农业遥感、地理迁移学习、模型鲁棒性评估等研究任务,其数据和衍生成果受各自上游基准数据的原始许可证约束。

The ARVA dataset is an empirical evaluation resource collection released alongside the ARVA paper, designed to support geographic transfer learning research for earth observation foundation models under varying target region label access conditions. The core content includes frozen model representations for evaluation, predefined train/validation/test splits, and detailed experimental result tables. Data composition primarily consists of: evaluation metrics, prediction results, and traceability files under multiple random seeds; analysis tables for regional performance, raw input vs. learned representation comparisons, calibration, split sensitivity, target label allocation, region filtering, and selective prediction; assembled caches of benchmark datasets (CropHarvest, EuroCropsML, BreizhCrops, PASTIS-R); as well as frozen models and raw input embeddings. The dataset is organized in a structured directory format and includes machine-readable release metadata and a complete file inventory. It is suitable for research tasks in earth observation, agricultural remote sensing, geographic transfer learning, and model robustness evaluation, with data and derived outputs subject to the original licenses of their respective upstream benchmark datasets.

创建时间:
2026-07-27
原始信息汇总

数据集概述:ARVA(Agricultural Robustness across Varied Areas)

ARVA 数据集是农业鲁棒性研究论文的配套数据集,专注于评估地球观测基础模型在地理迁移场景下的表现。

研究目标

  • 研究地球观测基础模型在不同地理区域之间的迁移能力。
  • 在保持目标测试样本固定的前提下,变化目标区域的标签访问方式。

数据集内容

数据集提供用于论文实证评估的冻结表示、分割分配和结果表格,包含以下主要组成部分:

  • 结果数据

    • results/consolidated-final-grid-8seed-8b647d1/:八种子评估的每轮运行指标、预测结果和来源信息。
    • results/final-analysis-8seed-8b647d1/:区域性能分析表、学习与原始对比、校准、分割敏感性、目标标签分配、区域筛选和选择性预测分析。
  • 分割信息

    • splits/splits.json:冻结的分割分配及其中央清单。
  • 缓存数据

    • cache/benchmark/:CropHarvest、EuroCropsML、BreizhCrops 和 PASTIS-R 数据集的组装缓存。
    • cache/embeddings/:冻结模型和原始输入的表示。
  • 元数据

    • RELEASE_SCOPE.jsonFILE_INVENTORY.tsv:机器可读的发布元数据和完整文件清单。

复现说明

  • 相关代码和使用文档可在 https://github.com/akshithio/arva 获取。
  • 报告中的评估使用科学修订版本 8b647d1ea9747bb80a4da44ebedea76cd0628e9d
  • 结果目录包含完成清单和工件哈希,用于复现或扩展分析前的来源验证。

许可信息

  • 基准数据、模型输出和衍生工件均受其各自上游许可和条款约束,数据集许可为 other
搜集汇总
数据集介绍
arva 数据集图片
构建方式
ARVA数据集专为地球观测基础模型的地理迁移性研究而设计,旨在系统评估模型在改变目标区域标签可访问性时的鲁棒性。其构建过程围绕固定目标测试样本展开,通过冻结表示、分割分配和结果表格来记录实证评估的完整细节。数据集内含八个随机种子下的逐次运行指标、预测结果及来源追踪,并提供了区域性能、学习与原始特征对比、校准、分割敏感性以及目标标签分配等分析表格。此外,数据集中还包含了CropHarvest、EuroCropsML、BreizhCrops和PASTIS-R等基准数据集的预组装缓存,以及冻结模型与原始输入的嵌入表示。
特点
ARVA数据集的核心特色在于其严谨的重现性设计,所有实验基于科学修订版本8b647d1ea9747bb80a4da44ebedea76cd0628e9d的可复现代码。数据集提供了机器可读的发布元数据和完整文件清单,确保用户能够通过完成清单和工件哈希值对来源进行核查。其分析维度涵盖区域性能比较、学习特征与原始特征的对比、校准效果、分割敏感性、目标标签分配策略、区域筛选以及选择性预测等多个方面,为地理迁移学习提供了全面的评估框架。
使用方法
使用ARVA数据集时,用户可首先通过提供的代码库(https://github.com/akshithio/arva)复现论文中的实证评估。数据集中的结果目录包含了完成清单和工件哈希值,便于在复现或扩展分析前验证数据来源的完整性。研究人员可直接加载预组装的基准数据集缓存和嵌入表示,针对特定区域性能、标签分配策略或模型校准等维度开展深入研究。所有基准数据、模型输出及衍生工件的使用需遵循各自的上游许可协议与条款。
背景与挑战
背景概述
ARVA(Agricultural Robustness across Varied Areas)数据集诞生于地理迁移学习与地球观测基础模型交叉领域,由研究团队为解决农业遥感模型在跨区域泛化中的鲁棒性评估问题而构建。该数据集聚焦于区域转移场景下,目标区域标签可获取性变化对模型性能的影响,通过固定测试样本、变化标签访问量来系统评估基础模型的迁移能力。ARVA整合了CropHarvest、EuroCropsML、BreizhCrops及PASTIS-R等多源农业遥感基准,为领域提供了标准化的评估框架,其影响力在于推动了地理科学中基础模型鲁棒性验证的规范化,为农业监测、粮食安全等应用提供了可靠的模型选择依据。
当前挑战
ARVA旨在应对两大核心挑战:一是农业遥感模型的地域泛化难题,即同一模型在不同地理区域因作物物候、种植结构及遥感像元差异导致性能剧烈波动,现有数据集缺乏对跨区域标签稀缺情境的系统评估;二是构建过程中需整合异构基准数据,面临标签分布不均、时空分辨率不一致及上游许可协议兼容性等工程挑战。此外,冻结表征与分裂分配的精确复现、八种子实验的随机性控制及结果可追溯性,均对数据集的元数据管理和版本化提出了严苛要求,确保科学验证的严谨性和可拓展性。
常用场景
经典使用场景
ARVA数据集专为农业领域的地理迁移鲁棒性研究而设计,其典型应用场景涵盖跨区域农作物分类与土地覆盖制图。通过整合CropHarvest、EuroCropsML、BreizhCrops及PASTIS-R等基准数据集的冻结表征与分裂分配,研究人员能够系统性地评估地球观测基础模型在不同地理区域的泛化能力。该数据集支持在固定目标测试样本的前提下,灵活调整目标区域的标签获取比例,从而模拟现实场景中标签稀缺或分布不均的挑战。这种设计使其成为验证模型地理迁移性能的理想工具,尤其适用于分析区域性能差异、校准效果及分裂敏感性等核心问题。
实际应用
在实际应用中,ARVA数据集为精准农业与粮食安全监测提供了关键支撑。它支持基于卫星影像的作物类型自动识别系统,帮助农业部门在不同地域部署统一模型时预判性能衰减风险。例如,在利用预训练基础模型对欧洲与南美农场进行作物分类时,该数据集可揭示因气候、种植制度差异导致的性能落差,从而指导数据增强策略或局部微调方案。此外,其标签分配灵活性使发展中国家的低资源地区也能通过少量标注实现模型适配,降低了农业遥感技术的落地门槛。这些特性使其成为推动全球农业监测自动化与公平化的重要基础设施。
衍生相关工作
ARVA数据集已衍生出多个方向的经典研究工作。基于其提供的预测记录与分析表格,研究者发表了关于区域性能度量的方法论创新,提出了更有效的分割敏感性检验框架。该数据集还催生了针对地球观测基础模型校准效果的专项研究,相关成果改进了跨域迁移中的不确定性估计技术。在标注效率优化方面,ARVA启发了目标标签分配策略的改进工作,这些工作探索了如何用最少的人工标注达到最优的地理泛化效果。此外,该数据集与下游基准测试的集成推动了选择性预测机制的发展,为实际部署中拒绝低置信度预测提供了理论依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务