遇见数据集

ai-detection-dataset-v2

收藏
Hugging Face2026-06-21 更新2026-06-22 收录
官方服务:

资源简介:

AI-Generated Image Detection Dataset v2 是一个专门用于训练和评估AI生成图像检测器的配对数据集。该数据集的核心设计理念是通过为每个真实图像配对多个AI生成的对应图像,并共享基于图像的描述,从而迫使检测模型关注合成指纹(如纹理、频率和渲染伪影),而非图像场景内容本身。数据集包含10,000张真实图像(来自COCO和ImageNet-1k数据集,标签为0)和来自6个不同生成模型的60,000张AI生成图像(标签为1),构成10,000个配对(每个真实图像对应6个不同生成器的AI图像)。所有图像均通过相同的规范化预处理流水线(pipeline_version=1.2)处理,统一为512×512分辨率的RGB PNG格式,以消除分辨率、色彩空间和JPEG伪影等可能使模型作弊的潜在捷径。数据采用确定性配对级划分(种子为42),按70%/15%/15%的比例分为训练集、验证集和测试集,确保每个真实图像及其所有AI伙伴图像位于同一数据划分中。使用的生成模型包括stable-diffusion-v1-5、stable-diffusion-xl-base-1.0、FLUX.1-schnell、kandinsky-2-2-decoder、PixArt-Sigma-XL-2-1024-MS和stable-cascade,覆盖了当前主流的文本到图像生成技术。真实图像的描述由Salesforce/blip2-opt-2.7b模型生成,并经过清理和截断,随后被所有AI生成器复用。数据集模式包含图像ID、配对源ID、标签、生成器、来源数据集、提示词、图像二进制数据、尺寸、原始尺寸、生成模型ID、生成参数、种子、描述模型、流水线版本、SHA256哈希和创建时间戳等字段。数据集旨在用于非商业研究目的,特别适用于开发和评估针对文本到图像生成模型的AI图像检测器。

AI-Generated Image Detection Dataset v2 is a paired dataset specifically designed for training and evaluating AI-generated image detectors. The core design philosophy is to pair each real image with multiple AI-generated counterparts, sharing image-based descriptions, thereby forcing detection models to focus on synthetic fingerprints (such as textures, frequencies, and rendering artifacts) rather than the image scene content itself. The dataset contains 10,000 real images (from COCO and ImageNet-1k datasets, labeled as 0) and 60,000 AI-generated images from 6 different generative models (labeled as 1), forming 10,000 pairs (each real image corresponds to 6 AI images from different generators). All images are processed through the same standardized preprocessing pipeline (pipeline_version=1.2), unified into 512×512 resolution RGB PNG format, to eliminate potential shortcuts like resolution, color space, and JPEG artifacts that could allow models to cheat. The data is split deterministically at the pair level (seed=42) into training, validation, and test sets in a 70%/15%/15% ratio, ensuring that each real image and all its AI partner images are in the same data split. The generative models used include stable-diffusion-v1-5, stable-diffusion-xl-base-1.0, FLUX.1-schnell, kandinsky-2-2-decoder, PixArt-Sigma-XL-2-1024-MS, and stable-cascade, covering current mainstream text-to-image generation technologies. Descriptions for real images are generated by the Salesforce/blip2-opt-2.7b model, cleaned and truncated, and then reused by all AI generators. The dataset schema includes fields such as image ID, pair source ID, label, generator, source dataset, prompt, image binary data, dimensions, original dimensions, generative model ID, generation parameters, seed, description model, pipeline version, SHA256 hash, and creation timestamp. The dataset is intended for non-commercial research purposes, particularly suitable for developing and evaluating AI image detectors for text-to-image generation models.

创建时间:
2026-06-11
原始信息汇总

数据集概述

数据集名称: AI-Generated Image Detection Dataset v2

任务类型: 图像分类(AI生成图像检测)

语言: 英语

标签: AI生成图像检测、合成图像检测、扩散模型

数据集规模: 10,000 < N < 100,000

许可协议: 其他(非商业研究用途)


数据集构成

  • 真实图像: 10,000张,来自COCO和ImageNet-1k数据集,标签为0
  • AI生成图像: 60,000张,由6种不同的生成器生成,标签为1
  • 配对方式: 每张真实图像对应6张AI生成图像(每个生成器一张),形成10,000个配对组。
  • 图像分辨率: 512×512 RGB PNG格式。
  • 预处理: 所有真实和AI图像均经过相同的标准化处理流程(pipeline_version=1.2),包括EXIF旋转、中心裁剪、Lanczos缩放、JPEG均衡化和PNG压缩,以消除分辨率、色彩空间和JPEG伪影等快捷捷径。
  • 主种子: 42,用于控制生成种子和数据集划分。
  • 数据划分: 基于配对级别的70/15/15划分(训练/验证/测试),每张真实图像及其对应的6张AI图像始终位于同一划分中。

生成器列表

生成器标识符 模型ID 原生分辨率 步数 指导尺度
sd15 stable-diffusion-v1-5/stable-diffusion-v1-5 512 20 7.0
sdxl stabilityai/stable-diffusion-xl-base-1.0 1024 8 7.0
flux_schnell black-forest-labs/FLUX.1-schnell 1024 4 0.0
kandinsky22 kandinsky-community/kandinsky-2-2-decoder 768 25 4.0
pixart_sigma PixArt-alpha/PixArt-Sigma-XL-2-1024-MS 1024 20 4.5
sd_cascade stabilityai/stable-cascade 1024 [20, 10] [4.0, 0.0]

配对与标题

  • 真实图像的标题由Salesforce/blip2-opt-2.7b模型生成,经过清理并截断至75个CLIP标记。
  • 所有6个生成器使用完全相同的标题(字节级一致),促使检测器关注合成指纹而非场景内容。
  • 每个AI图像的source_real_id字段关联回其配对真实图像。

数据划分详情

划分 图像数量
训练集 49,392
验证集 10,122
测试集 10,486

划分信息存储在splits.parquet文件中,完整索引存储在manifest.parquet文件中。


数据模式(Schema)

列名 类型 描述
image_id 字符串 全局唯一标识符,如real_000001 / sdxl_000001
source_real_id 字符串 配对键,对于真实图像行等同于image_id
label int8 0 = 真实图像, 1 = AI生成图像
generator 字符串 realsd15sdxlflux_schnellkandinsky22pixart_sigmasd_cascade
source_dataset 字符串 cocoimagenet<generator>
prompt 字符串 AI图像使用的标题;真实图像为null
image 二进制 标准化后的512×512 RGB PNG字节
width / height int16 始终为512
orig_width / orig_height int32 原始尺寸,仅用于溯源,不能用作训练特征
gen_model_id 字符串 Hugging Face模型ID
gen_steps / gen_guidance / gen_native_res int16 / float32 / int16 生成参数
seed int64 基于主种子、生成器和source_real_id的哈希值
caption_model 字符串 使用的标题生成模型
pipeline_version 字符串 1.2
sha256 字符串 PNG字节的十六进制摘要
created_utc 字符串 ISO-8601 UTC时间戳

预期用途与限制

  • 预期用途: 训练和评估AI图像检测器。
  • 许可限制: ImageNet内容仅限非商业研究用途;COCO图像来自Flickr(Creative Commons许可);AI图像各自遵循其生成模型的许可。数据集整体遵循最严格的条款:非商业研究用途
  • 局限性:
    • 核心数据集仅包含文本到图像生成(不包括图像到图像或参考条件生成)。
    • 标题质量受限于BLIP-2模型生成的简洁句子,限制了提示多样性。
    • Stable Cascade和Flux模型在T4 GPU上使用CPU卸载运行,生成条件与高端GPU设置略有差异。
    • 每个模型的步数已减少以模拟现实世界的快速推理场景。
搜集汇总
数据集介绍
ai-detection-dataset-v2 数据集图片
构建方式
该数据集专为AI生成图像检测任务设计,由10,000张真实图像(源自COCO和ImageNet-1k)与60,000张AI生成图像构成,每一张真实图像均对应六种不同生成器(包括Stable Diffusion v1.5、SDXL、Flux Schnell、Kandinsky 2.2、PixArt Sigma和Stable Cascade)生成的AI伙伴。所有真实图像首先通过BLIP-2模型生成描述性文本,随后该文本被六个生成器直接复用,从而保证每对图像仅在合成指纹(如纹理、频率域特征和渲染伪影)上存在差异,而非场景内容。图像均经统一预处理管线处理,包括EXIF矫正、中心裁剪、Lanczos缩放至512×512分辨率,并以JPEG均衡和PNG压缩存储,消除分辨率、色彩空间及JPEG伪影等潜在捷径。数据集按源真实图像ID进行确定性配对级划分,比例为70/15/15的训练/验证/测试集。
使用方法
研究者可通过Hugging Face Hub加载数据集,首先使用`huggingface_hub`库下载`manifest.parquet`文件获取完整索引信息,随后按需读取分片(shard)中的图像二进制数据,利用PyArrow和Pillow库解码为PIL图像对象。数据集以列式Parquet格式存储,每行包含图像ID、配对键(source_real_id)、标签(0为真实,1为AI)、生成器名称、原始数据集来源、描述文本、图像字节、分辨率及详尽生成参数,便于高效筛选和批量处理。推荐使用配对级划分进行训练与评估,确保同组图像不跨折叠,避免数据泄露。由于数据集中部分真实图像源自ImageNet(仅限非商业研究)和COCO(知识共享许可),AI图像受各自模型许可约束,整体数据集仅限非商业研究用途,适用于训练和评估AI生成图像检测模型,具体验证报告参见`validation_report.json`。
背景与挑战
背景概述
随着扩散模型等生成式人工智能技术的迅猛发展,AI合成图像在逼真度与多样性上已臻至以假乱真的境地,这一方面推动了创意产业的革新,另一方面也催生了深度伪造、虚假信息传播等严峻的网络安全挑战。为应对这一困境,AI生成图像检测领域亟需高质量、标准化、且能有效抵御捷径学习的基准数据集。在此背景下,AI-Generated Image Detection Dataset v2(简称ai-detection-dataset-v2)于2024年由研究者Shanmuk等人构建发布,旨在为AI图像检测器的训练与评估提供严谨的配对数据支撑。该数据集的核心创新在于其“配对”设计:每张真实图像对应来自六个不同主流扩散生成器(如Stable Diffusion、FLUX、Kandinsky等)的六张AI生成图像,且共享同一基于BLIP-2生成的精确文本描述,迫使检测器聚焦于合成指纹(如纹理、频率伪影、渲染瑕疵)而非场景内容,从而直指图像溯源与真伪鉴定的根本研究问题。作为当前领域内规模较大、控制变量最为严格的开源数据集之一,ai-detection-dataset-v2对推动AI生成内容检测技术的可信与鲁棒性发展具有重要影响力。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:AI生成图像检测本质上是一场“猫鼠游戏”,生成器迭代速度极快且架构多样(如扩散模型、对抗生成网络等),检测器需不断适应新型合成指纹,而现有数据集往往局限于单一或少部分生成器,ai-detection-dataset-v2虽集成了六种生成器,但仍难以覆盖全部生成范式,特别是未来新兴的隐空间扩散或基于Transformer的生成模型。其次,构建过程中存在显著挑战:为避免检测器利用分辨率、色彩空间或JPEG伪影等低级捷径,数据集对真实与AI图像实施了完全相同的规范化预处理流水线(中心裁剪、Lanczos缩放、JPEG均质化等),这要求严密的泄漏审计与参数标准化;此外,各生成器的推理步数、引导尺度等参数因硬件(如T4 GPU上CPU offload)限制而不得不进行折中调整,导致生成条件与理想高端场景存在细微差异,可能影响检测器在实际部署中的泛化性能;同时,文本提示来源单一(BLIP-2生成短句)限制了提示工程的多样性,亦为构建通用鲁棒检测器增添了难度。
常用场景
经典使用场景
在人工智能生成图像检测领域,ai-detection-dataset-v2被广泛用作基准数据集,用于训练和评估区分真实图像与扩散模型合成图像的分类器。其核心设计在于为每张真实图像配备来自六种不同生成器(如Stable Diffusion、SDXL、FLUX等)的AI配对图像,且共享同一文本描述,迫使模型聚焦于合成指纹而非场景内容。这种结构使该数据集成为检测对抗性图像生成技术(如快速推理、低步数采样)的理想训练场,尤其在图像取证和数字媒体真实性验证中发挥着关键作用。
解决学术问题
该数据集有效解决了学术界长期面临的AI生成图像检测泛化性不足与数据泄露问题。通过统一预处理流程消除分辨率、色彩空间和JPEG伪影等捷径特征,确保了模型学习真正的合成痕迹。其配对式设计允许研究者系统探究不同生成器间的特征差异,推动了对扩散模型伪影(如纹理异常、频域特征)的深入理解。该数据集的发布显著提升了检测器对抗未见生成器(如Flux、PixArt)的鲁棒性,为构建可信赖的数字内容审计系统奠定了数据基础。
实际应用
在实际应用中,该数据集驱动的检测模型被部署于社交媒体平台、新闻机构及数字版权管理系统中,用于自动识别并标记由AI生成的误导性图像。尤其在打击深度伪造、虚假新闻传播和在线身份欺诈等场景中,此类检测器能够有效降低合成图像被滥用于制造虚假证据或操纵公众舆论的风险。此外,该数据集还服务于内容创作者和版权方,通过鉴定图像来源以维护原创作品的合法权益,体现了其在维护数字生态真实性方面的实用价值。
数据集最近研究
最新研究方向
当前,随着扩散模型等生成式人工智能技术的迅猛发展,AI合成图像在互联网上泛滥,对信息真实性构成严峻挑战。该数据集聚焦于AI生成图像检测这一前沿安全课题,通过为每张真实图像精准匹配来自六种主流扩散模型(如Stable Diffusion、FLUX、Kandinsky等)的合成图像,并严格控制配对间的场景内容一致性,迫使检测模型专注于学习生成算法独有的纹理、频率及渲染伪影等合成指纹特征。其规范化的预处理流程从源头消除了分辨率、色彩空间等非语义捷径,为跨生成器可泛化的鲁棒检测器训练提供了高保真基准。这一精细化的数据构建范式,直接回应了深度伪造内容鉴别中对抗性生成带来的攻防升级压力,对打击虚假信息传播、维护数字内容可信生态具有重要的技术奠基意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务