ai-detection-dataset-v2
收藏资源简介:
AI-Generated Image Detection Dataset v2 是一个专门用于训练和评估AI生成图像检测器的配对数据集。该数据集的核心设计理念是通过为每个真实图像配对多个AI生成的对应图像,并共享基于图像的描述,从而迫使检测模型关注合成指纹(如纹理、频率和渲染伪影),而非图像场景内容本身。数据集包含10,000张真实图像(来自COCO和ImageNet-1k数据集,标签为0)和来自6个不同生成模型的60,000张AI生成图像(标签为1),构成10,000个配对(每个真实图像对应6个不同生成器的AI图像)。所有图像均通过相同的规范化预处理流水线(pipeline_version=1.2)处理,统一为512×512分辨率的RGB PNG格式,以消除分辨率、色彩空间和JPEG伪影等可能使模型作弊的潜在捷径。数据采用确定性配对级划分(种子为42),按70%/15%/15%的比例分为训练集、验证集和测试集,确保每个真实图像及其所有AI伙伴图像位于同一数据划分中。使用的生成模型包括stable-diffusion-v1-5、stable-diffusion-xl-base-1.0、FLUX.1-schnell、kandinsky-2-2-decoder、PixArt-Sigma-XL-2-1024-MS和stable-cascade,覆盖了当前主流的文本到图像生成技术。真实图像的描述由Salesforce/blip2-opt-2.7b模型生成,并经过清理和截断,随后被所有AI生成器复用。数据集模式包含图像ID、配对源ID、标签、生成器、来源数据集、提示词、图像二进制数据、尺寸、原始尺寸、生成模型ID、生成参数、种子、描述模型、流水线版本、SHA256哈希和创建时间戳等字段。数据集旨在用于非商业研究目的,特别适用于开发和评估针对文本到图像生成模型的AI图像检测器。
AI-Generated Image Detection Dataset v2 is a paired dataset specifically designed for training and evaluating AI-generated image detectors. The core design philosophy is to pair each real image with multiple AI-generated counterparts, sharing image-based descriptions, thereby forcing detection models to focus on synthetic fingerprints (such as textures, frequencies, and rendering artifacts) rather than the image scene content itself. The dataset contains 10,000 real images (from COCO and ImageNet-1k datasets, labeled as 0) and 60,000 AI-generated images from 6 different generative models (labeled as 1), forming 10,000 pairs (each real image corresponds to 6 AI images from different generators). All images are processed through the same standardized preprocessing pipeline (pipeline_version=1.2), unified into 512×512 resolution RGB PNG format, to eliminate potential shortcuts like resolution, color space, and JPEG artifacts that could allow models to cheat. The data is split deterministically at the pair level (seed=42) into training, validation, and test sets in a 70%/15%/15% ratio, ensuring that each real image and all its AI partner images are in the same data split. The generative models used include stable-diffusion-v1-5, stable-diffusion-xl-base-1.0, FLUX.1-schnell, kandinsky-2-2-decoder, PixArt-Sigma-XL-2-1024-MS, and stable-cascade, covering current mainstream text-to-image generation technologies. Descriptions for real images are generated by the Salesforce/blip2-opt-2.7b model, cleaned and truncated, and then reused by all AI generators. The dataset schema includes fields such as image ID, pair source ID, label, generator, source dataset, prompt, image binary data, dimensions, original dimensions, generative model ID, generation parameters, seed, description model, pipeline version, SHA256 hash, and creation timestamp. The dataset is intended for non-commercial research purposes, particularly suitable for developing and evaluating AI image detectors for text-to-image generation models.
数据集概述
数据集名称: AI-Generated Image Detection Dataset v2
任务类型: 图像分类(AI生成图像检测)
语言: 英语
标签: AI生成图像检测、合成图像检测、扩散模型
数据集规模: 10,000 < N < 100,000
许可协议: 其他(非商业研究用途)
数据集构成
- 真实图像: 10,000张,来自COCO和ImageNet-1k数据集,标签为
0。 - AI生成图像: 60,000张,由6种不同的生成器生成,标签为
1。 - 配对方式: 每张真实图像对应6张AI生成图像(每个生成器一张),形成10,000个配对组。
- 图像分辨率: 512×512 RGB PNG格式。
- 预处理: 所有真实和AI图像均经过相同的标准化处理流程(
pipeline_version=1.2),包括EXIF旋转、中心裁剪、Lanczos缩放、JPEG均衡化和PNG压缩,以消除分辨率、色彩空间和JPEG伪影等快捷捷径。 - 主种子:
42,用于控制生成种子和数据集划分。 - 数据划分: 基于配对级别的70/15/15划分(训练/验证/测试),每张真实图像及其对应的6张AI图像始终位于同一划分中。
生成器列表
| 生成器标识符 | 模型ID | 原生分辨率 | 步数 | 指导尺度 |
|---|---|---|---|---|
sd15 |
stable-diffusion-v1-5/stable-diffusion-v1-5 |
512 | 20 | 7.0 |
sdxl |
stabilityai/stable-diffusion-xl-base-1.0 |
1024 | 8 | 7.0 |
flux_schnell |
black-forest-labs/FLUX.1-schnell |
1024 | 4 | 0.0 |
kandinsky22 |
kandinsky-community/kandinsky-2-2-decoder |
768 | 25 | 4.0 |
pixart_sigma |
PixArt-alpha/PixArt-Sigma-XL-2-1024-MS |
1024 | 20 | 4.5 |
sd_cascade |
stabilityai/stable-cascade |
1024 | [20, 10] | [4.0, 0.0] |
配对与标题
- 真实图像的标题由Salesforce/blip2-opt-2.7b模型生成,经过清理并截断至75个CLIP标记。
- 所有6个生成器使用完全相同的标题(字节级一致),促使检测器关注合成指纹而非场景内容。
- 每个AI图像的
source_real_id字段关联回其配对真实图像。
数据划分详情
| 划分 | 图像数量 |
|---|---|
| 训练集 | 49,392 |
| 验证集 | 10,122 |
| 测试集 | 10,486 |
划分信息存储在splits.parquet文件中,完整索引存储在manifest.parquet文件中。
数据模式(Schema)
| 列名 | 类型 | 描述 |
|---|---|---|
image_id |
字符串 | 全局唯一标识符,如real_000001 / sdxl_000001 |
source_real_id |
字符串 | 配对键,对于真实图像行等同于image_id |
label |
int8 | 0 = 真实图像, 1 = AI生成图像 |
generator |
字符串 | real 或 sd15 或 sdxl 或 flux_schnell 或 kandinsky22 或 pixart_sigma 或 sd_cascade |
source_dataset |
字符串 | coco 或 imagenet 或 <generator> |
prompt |
字符串 | AI图像使用的标题;真实图像为null |
image |
二进制 | 标准化后的512×512 RGB PNG字节 |
width / height |
int16 | 始终为512 |
orig_width / orig_height |
int32 | 原始尺寸,仅用于溯源,不能用作训练特征 |
gen_model_id |
字符串 | Hugging Face模型ID |
gen_steps / gen_guidance / gen_native_res |
int16 / float32 / int16 | 生成参数 |
seed |
int64 | 基于主种子、生成器和source_real_id的哈希值 |
caption_model |
字符串 | 使用的标题生成模型 |
pipeline_version |
字符串 | 1.2 |
sha256 |
字符串 | PNG字节的十六进制摘要 |
created_utc |
字符串 | ISO-8601 UTC时间戳 |
预期用途与限制
- 预期用途: 训练和评估AI图像检测器。
- 许可限制: ImageNet内容仅限非商业研究用途;COCO图像来自Flickr(Creative Commons许可);AI图像各自遵循其生成模型的许可。数据集整体遵循最严格的条款:非商业研究用途。
- 局限性:
- 核心数据集仅包含文本到图像生成(不包括图像到图像或参考条件生成)。
- 标题质量受限于BLIP-2模型生成的简洁句子,限制了提示多样性。
- Stable Cascade和Flux模型在T4 GPU上使用CPU卸载运行,生成条件与高端GPU设置略有差异。
- 每个模型的步数已减少以模拟现实世界的快速推理场景。




