遇见数据集

CAFOSat

收藏
arXiv2026-05-30 更新2026-06-05 收录
官方服务:

资源简介:

CAFOSat是由弗吉尼亚大学研究团队创建的一个用于集中动物饲养操作(CAFO)高分辨率遥感测绘的强标注数据集。该数据集包含超过45,000个图像块,覆盖美国20个州,整合了高分辨率NAIP影像与多源CAFO位置清单,数据量约4.5万条。数据集通过结合人工智能标注器、GradCAM定位和几何聚类的人机协同流程,将公开的弱地理标注转化为精炼点标注,并采用土地覆盖引导采样构建困难负样本。该数据集主要应用于环境监测、公共卫生风险评估和流行病学建模领域,旨在解决CAFO设施精准识别、基础设施属性标注以及跨区域泛化能力不足等关键问题。

CAFOSat is a strongly annotated dataset developed by a research team at the University of Virginia for high-resolution remote sensing mapping of Concentrated Animal Feeding Operations (CAFOs). The dataset contains over 45,000 image patches, covering 20 states across the United States, and integrates high-resolution NAIP imagery with multi-source CAFO location inventories, totaling approximately 45,000 entries. It adopts a human-AI collaborative workflow combining AI annotators, GradCAM localization and geometric clustering to convert publicly available weak geographic annotations into refined point annotations, and constructs hard negative samples via land cover-guided sampling. This dataset is mainly applied in the fields of environmental monitoring, public health risk assessment and epidemiological modeling, aiming to address key issues such as accurate identification of CAFO facilities, infrastructure attribute annotation and insufficient cross-regional generalization capability.

创建时间:
2026-05-30
原始信息汇总

数据集概述

CAFOSat 是一个遥感数据集,专门用于识别和分类美国多个州的集中动物饲养操作(CAFOs)。数据集包含高分辨率图像块、基础设施标注、边界框以及多种实验性的训练-测试划分。

数据集规模

  • 图像数量:10,000 到 100,000 张(10K<n<100K)。

数据内容与结构

数据集解压后包含以下文件夹:

  • STATE_filtered/:按美国州别组织的原始图像块(例如 IA_filtered/, AL_filtered/)。
  • negative_samples/:经核实的非CAFO样本。
  • barn/, manure_pond/, others/:按基础设施类型增强的合成图像块。

元数据文件CAFOSat.csv,包含标签、边界框和划分标志等信息。

文件引用

元数据中的 patch_file 字段提供图像文件的相对路径。示例:

  • IA_filtered.tar.gz::IA_filtered/crop_4517_patch_10147_Swine_Nursery_IA.tif
  • barn.tar.gz::barn/aug_patch_00123.tif
  • negative_sample.tar.gz::barn/neg_patch_00098.tif

特征字段 (CAFOSat.csv)

字段 描述
patch_file 图像文件的路径
label 类别的整数标签 (0–6)
barn, manure_pond, grazing_area, others 表示基础设施类型的二进制标志
geom_bbox 边界框坐标 [x1, y1, x2, y2]
geometry 勾勒CAFO区域的地理空间多边形
poly_crs, patch_crs 用于几何和图像块的坐标参考系
category CAFO类别名称 (如 Swine, Dairy)
state 图像块所在的美国州
verified_label 标签是否经过人工验证的布尔值
CAFO_UNIQUE_ID 每个CAFO设施的唯标识符
image_type 图像变体类型:augmented 或其他(真实)
orig_patch_file 原始图像的路径(仅适用于增强图像)
prompt 用于生成或语义用途的文本提示
weak_x, weak_y, refined_x, refined_y CAFO中心坐标(弱监督和优化后)
patch_res 图像块的空间分辨率(米/像素)
split columns 多种训练/测试/验证划分的二进制标志

数据划分

数据集包含多种预定义的训练/测试/验证划分,由布尔标志(True/False)在元数据中指示,例如:

  • cafosat_verified_training_*
  • cafosat_all_training_*
  • cafosat_training_set1_*, set2_*
  • cafosat_merged_training_*
  • cafosat_augmented_training_*

标签类别

类别ID 类别名称
0 Negative (非CAFO)
1 Swine (猪)
2 Dairy (奶牛)
3 Beef (肉牛)
4 Poultry (家禽)
5 Horses (马)
6 Sheep/Goats (羊)

预期用途

  • CAFO设施检测与分类
  • 使用边界框进行CAFO区域定位
  • 农业基础设施制图(如谷仓、粪池)
  • 弱监督和半监督学习
  • 遥感基准测试开发

许可证

本数据集采用 CC BY 4.0 许可证。在注明出处的前提下,可自由分享和改编数据。

联系方式

搜集汇总
数据集介绍
CAFOSat 数据集图片
构建方式
CAFOSat数据集的构建始于多源CAFO位置数据的整合,涵盖联邦、州及学术记录的弱监督地理坐标。研究团队设计了一条人机协同的标注流水线:首先利用基于ResNet的AI标注器对候选图像块进行高置信度预筛选,随后通过GradCAM热力图与单链聚类算法将粗粒度坐标精炼至设施级别的精准点位。在此基础上,结合土地覆盖引导的分层负样本采样策略(设置1.5公里空间排除缓冲区),并经过人工验证为4,513个样本标注了棚舍、粪池、放牧区等基础设施层级标签,最终生成包含超过45,000个NAIP图像块的数据集。
特点
该数据集的核心特点在于其强标注性与基础设施感知能力。覆盖美国20个州、四种主要CAFO类型(猪、禽、牛、奶牛),提供了分类标签与细粒度的基础设施属性(如棚舍计数、粪池存在性),支持从粗粒度分类到细粒度结构识别的多层级任务。同时,数据集精心整理了20,771个困难负样本,利用土地覆盖信息增强边界案例的区分度。此外,引入基于提示引导的扩散模型数据增强流水线,通过GroundingDINO定位基础设施并用Stable Diffusion进行语义一致的填补,生成6,454个标签保持的合成变体,显著提升了模型的分布外泛化鲁棒性。
使用方法
CAFOSat以标准化影像块(833×833像素,0.6米分辨率)形式发布,并附带六种预定义的训练/验证/测试划分方案,便于可重复基准测试。用户既可将其直接用于CAFO二元分类或八类别分类任务的模型训练,也可利用基础设施级标注进行多标签属性预测。数据集通过Hugging Face平台公开共享,配套提供PyTorch数据加载器、处理脚本及Jupyter笔记本示例,覆盖模型训练、评估与可视化全流程。研究者还可结合合成增强子集探索数据扩充策略,或在跨数据集场景下评估模型的泛化性能。
背景与挑战
背景概述
集约化动物饲养 operations (CAFOs) 作为大规模工业化畜牧设施,既是疾病监测与气候韧性规划的关键节点,也因其环境污染与公共卫生风险而备受关注。然而,受限于异构数据源、噪声定位、不一致标注及系统性漏报等问题,CAFO 的可扩展制图始终举步维艰。在此背景下,由弗吉尼亚大学及生物复杂性研究所的研究团队(Oishee Bintey Hoque、Nibir Chandra Mandal 等)于近期创建的 CAFOSat 数据集应运而生。该数据集融合高分辨率 NAIP 影像与多源、多州的 CAFO 位置清单,通过结合 AI 标注器、GradCAM 定位与几何聚类的人工-循环流程,将弱监督的地理坐标转化为精确点标注,并涵盖了美国 20 个州超过 45,000 个影像块,为跨多种 CAFO 类型的基础设施感知映射提供了强有力的支撑。
当前挑战
CAFOSat 面临的核心挑战来自数据构建与领域任务的多重困境。首先,CAFO 位置数据分散于联邦、州与学术记录,覆盖范围有限且地理多样性不足,导致模型异地泛化能力薄弱。其次,公开监管坐标常为地块质心或通路入口,而非设施真实足迹,这种弱标注与影像空间错位严重降低了分类性能。第三,未获许可或小型养殖场的系统性漏报引入大量假阴性,污染训练质量。此外,CAFO 在动物类型、地域与季节间的视觉变异极大,现有数据难以囊括其全貌。最后,人工精化与验证这些位置并将其与影像对齐流程耗时费力,成为构建高质量训练集的瓶颈所在。
常用场景
经典使用场景
CAFOSat数据集在高分辨率遥感影像的语义理解领域开辟了独特的应用路径,尤其聚焦于集约化动物养殖场(CAFO)的设施级识别与空间定位。其经典使用场景表现为基于NAIP航空影像的CAFO设施自动检测与分类任务。研究人员可利用该数据集训练深度学习模型,在0.6米空间分辨率的影像中对养殖场类型(猪、禽、牛、奶牛)进行多类判别,并结合基础设施级标注(如畜棚、粪池、放牧区)实现精细化的设施结构解析。该数据集通过提供超过45000张影像切片和精心构建的难负样本,为在跨州尺度上建立高泛化能力的CAFO识别系统奠定了数据基础。
实际应用
CAFOSat在环境监管、公共卫生与农业治理等多个领域展现出显著的实际应用价值。在环境执法方面,该数据集可用于构建自动化的养殖设施监测系统,协助监管机构捕捉未获许可的新建设施或违规扩建行为,尤其适用于对水质氮磷污染和温室气体排放源的动态追踪。在公共卫生领域,基于CAFOSat训练的模型能够支撑高致病性禽流感等人畜共患病的风险建模,通过精准定位养殖设施分布与密度,助力流行病学分析中空间暴露参数的估计。同时,该数据集还可服务于农业保险与气候适应规划,通过大范围设施识别的能力支持耕地使用评估与脆弱性分析,为减缓和适应气候变化提供数据驱动的决策支持。
衍生相关工作
CAFOSat的提出催生了若干具有延续性的研究方向与方法创新。在标注精化层面,其基于GradCAM激活图与连通域聚类的地理坐标精炼框架,为其他遥感弱监督定位任务(如工业设施、温室大棚识别)提供了可复制的方法论模板。在模型训练策略方面,工作展示了视觉语言模型(如GroundingDINO)与扩散模型(如Stable Diffusion)相结合的提示引导图像增强管道,这一范式启发了后续在遥感场景中利用生成式模型进行数据扩充的研究方向。此外,CAFOSat对跨体系结构的全面评估——从卷积神经网络到视觉Transformer,再到CLIP、DINOv2等预训练模型——为理解不同模型在农业遥感分类任务中的表现差异奠定了实证基础,并推动了针对CAFO特定识别的模型轻量化和域自适应技术探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务