遇见数据集

fmow-fake-small

收藏
arXiv2026-08-05 更新2026-08-07 收录
官方服务:

资源简介:

fmow-fake-small是由橡树岭国家实验室构建的卫星图像操纵与深度伪造定位基准数据集,旨在弥补现有遥感伪造数据集缺乏高质量真值掩码与元数据的不足。该数据集包含60张图像,其中30张经过精心伪造的图像(包括简单随机拼接、对象语义拼接和扩散模型修复三种操纵类型)与30张真实图像,每张图像均配有像素级真值掩码和采集元数据。数据集基于fMoW卫星影像库,通过地理配准、尺度对齐和人工辅助的掩码定义等流程创建,确保伪造内容的高真实感。该数据集适用于图像取证算法评估与地理空间深度伪造定位研究,旨在为检测与定位方法提供更具挑战性的标准化测试基准。

fmow-fake-small is a benchmark dataset for satellite image manipulation and deepfake localization, constructed by Oak Ridge National Laboratory. It aims to address the shortcoming that existing remote sensing forgery datasets lack high-quality ground-truth masks and metadata. This dataset contains 60 images in total, including 30 meticulously manipulated fake images covering three manipulation types: simple random splicing, object semantic splicing, and diffusion model inpainting, and 30 real images. Each image is paired with a pixel-level ground-truth mask and acquisition metadata. Built upon the fMoW satellite image repository, this dataset is created through processes such as georegistration, scale alignment, and human-assisted mask definition, ensuring high realism of the forged content. This dataset is applicable to image forensics algorithm evaluation and geospatial deepfake localization research, and aims to provide a more challenging standardized test benchmark for detection and localization methods.

创建时间:
2026-08-05
搜集汇总
数据集介绍
fmow-fake-small 数据集图片
构建方式
fmow-fake-small数据集源于Functional Map of the World (fMoW)数据集,选取其中RGB三通道、8位全色锐化图像,并依据元数据对其进行地理配准与投影,存储为GeoTIFF格式。该数据集包含30幅经过精心篡改的图像与30幅真实图像。篡改图像通过三种方式构建:简单拼接,从源图像随机裁剪不同尺寸(16×16至256×256像素)的区块并粘贴至目标图像;对象拼接,借助Segment Anything Model分割源图像中的特定实体,再经人工筛选与定位后粘贴至合理位置;扩散模型修复,采用微调后的RSPaint模型,将参考图像中的内容修复至目标图像指定区域,并通过裁剪与重采样确保物体尺度的一致性。
特点
该数据集的主要特点在于其高真实性与精细标注。相较于现有遥感深伪数据集,fmow-fake-small中的篡改图像视觉伪影更少,更具挑战性。每个样本均配备像素级真实掩码,精确标注篡改区域,支持定位性能评估。此外,数据集提供详尽的采集元数据,包括地理参考信息与成像参数,便于分析检测性能与图像采集条件的关系。篡改类型覆盖传统拼接与现代生成模型修复,物体尺度多样,从车辆、建筑物到大型基础设施,且通过尺度一致性处理,保证了修复内容的物理合理性,为深伪检测与取证研究提供了高质量基准。
使用方法
该数据集适用于遥感图像深伪检测与定位任务的评估。使用者可利用真实掩码计算像素级定位指标,如IoU或Dice系数,评估模型对篡改区域的识别精度。同时,借助采集元数据,可分析不同成像条件(如分辨率、传感器类型)对检测性能的影响。由于数据集规模较小(共60幅图像),更宜作为评估基准而非训练集,用于检验算法在高质量深伪样本上的泛化能力。研究者还可将真实图像作为负样本,结合篡改图像进行二分类实验,或开发半监督学习策略以利用未标注数据。数据集可从Hugging Face平台获取,便于复现与比较。
背景与挑战
背景概述
随着生成式人工智能的飞速发展,卫星图像的真实性验证变得日益重要。恶意生成的逼真合成图像(即深度伪造)对遥感领域构成严重威胁,因为该数据是科学研究、规划、物流和监测的基础信息来源。然而,现有遥感深度伪造数据集存在诸多不足:要么缺乏用于评估伪造定位的ground truth掩码,要么完全由GAN或扩散模型生成的整幅图像组成,无法有效衡量定位性能。为填补这一空白,美国橡树岭国家实验室的Jacob Arndt等研究人员于2026年构建了fmow-fake-small基准数据集,源自fMoW数据集,包含30幅经过精心篡改的图像(涵盖简单拼接、对象拼接和扩散模型修复三类操作)和30幅真实图像,每幅图像均配有像素级ground truth掩码及采集元数据。该数据集旨在支持遥感图像取证和地理空间深度伪造检测研究,提供了高质量、细粒度的篡改样本,相较于现有数据集(如RSFAKE-1M、FLDCF等)具有更高的真实感和更全面的评估能力,为相关领域树立了新的基准。
当前挑战
当前数据集面临多重挑战。领域层面,遥感深度伪造检测的核心难题在于现有数据集的伪造样本常带有明显视觉伪影(如模糊、低分辨率、变形特征等),难以有效挑战人类感知和检测算法;且多数数据集不支持像素级定位评估。构建过程中,挑战尤为突出:一是数据集规模极小(仅30对图像),多样性有限,仅涵盖三类操作且仅一种来自生成模型,难以全面代表AI生成内容的广泛性;二是对象拼接和修复流程依赖大量手动操作,包括人工策划对象掩码、合理放置位置及修复区域定义,导致扩展性差,限制了数据量的增加。此外,扩散模型修复在物体尺度一致性和掩码比例(需占图像面积15%-30%)方面存在天然局限,虽通过裁剪和物理尺度调整有所缓解,但处理复杂场景时仍可能产生不真实结果。这些因素制约了数据集在训练检测器方面的应用,更宜作为高质量评估基准。
常用场景
经典使用场景
作为遥感图像深伪检测与定位的基准数据集,fmow-fake-small 的核心应用在于评估算法对传统拼接操作与基于扩散模型的修复生成内容的识别能力。其精心设计的三种篡改类型——简单复制粘贴、对象级拼接及扩散模型重绘——覆盖了从粗粒度到细粒度的伪造场景,配合逐像素的 ground truth 掩码,为像素级定位度量提供了标准测试平台。数据集中的每幅图像均附带采集元数据,支持研究者探索成像参数对检测性能的影响,从而在可控条件下系统评估不同检测方法的鲁棒性与泛化能力。
实际应用
在实际应用中,该数据集可服务于卫星图像真实性验证系统,用于监测和识别针对遥感数据的恶意篡改行为。其应用场景涵盖国防安全、关键基础设施监控、城市规划及灾害响应等领域,其中影像数据的可信度至关重要。借助数据集中混入的多样化伪造样本,相关系统能够检验深伪检测算法在真实操作条件下的可靠性,从而为自动化影像审核机制提供测试依据。此外,数据集的元数据还可辅助溯源分析,帮助分析人员理解不同卫星传感器的成像特征与伪造痕迹之间的关联,提升实际取证工作的精度与效率。
衍生相关工作
基于 fmow-fake-small 数据集,研究者已探索多条衍生研究路径。该数据集支持训练与评估定位导向的深伪检测网络,促进了对篡改区域分割和显著性特征学习的新算法开发。其引入的尺度一致性地理空间对象重绘方法,为生成式图像编辑领域提供了新的技术路线,可用于改进扩散模型在遥感影像上的修复质量。此外,数据集的元数据与掩码结构也启发了对多模态信息融合、跨传感器泛化及伪造痕迹时空分析的研究,形成了一个连接图像取证、生成模型与遥感科学的交叉研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务