wildfake-eval-subset
收藏资源简介:
WildFake Eval Subset 是 WildFake 数据集的评估子集,专为 AI 生成内容(AIGC)检测任务设计,以 parquet 格式重新打包,便于一行代码加载。数据集包含多个配置,每个配置对应不同的图像来源、预处理方式和数据规模,全部仅提供验证集(validation split)。核心字段包括:image(图像)、label(类别标签,0 为真实,1 为虚假)、source(来源,如 coco_val2017、dalle3_advanced、laion5b、midjourney_v5、sdxl、gigagan 等)、orig_path(在原始 WildFake 存档中的路径)、id(唯一标识符,格式为 "{source}/{basename}")。部分配置(如 _transformed 后缀的配置)还包含 transform_chain、primary_transform、n_transforms 等字段,记录图像变换链信息。
The WildFake Eval Subset is an evaluation subset of the WildFake dataset, designed for AI-generated content (AIGC) detection tasks, repackaged in parquet format for easy loading with a single line of code. The dataset contains multiple configurations, each corresponding to different image sources, preprocessing methods, and data scales, all providing only the validation split. Core fields include: image, label (0 for real, 1 for fake), source (e.g., coco_val2017, dalle3_advanced, laion5b, midjourney_v5, sdxl, gigagan), orig_path (path in the original WildFake archive), and id (unique identifier in format "{source}/{basename}"). Some configurations (e.g., those with _transformed suffix) also include fields such as transform_chain, primary_transform, and n_transforms, recording image transformation chain information.
WildFake Eval Subset 数据集详情
该数据集是 WildFake 基准数据集的一个子集,专为 AIGC(AI生成内容)检测赛道设计,从 ModelScope 重新打包为 parquet 格式。数据集仅供演示和验证模型性能使用,严禁用于训练,因为最终测试集来自同一语料库,训练会导致数据泄露。
核心配置
| 配置名称 | 样本数 | 内容构成 | 分辨率 | 用途 |
|---|---|---|---|---|
default |
13,841 | 4,998 张 COCO val2017(真实)+ 8,843 张 DALL·E 3(虚假) | 原始分辨率 | 匹配官方规范 |
normalized |
13,841 | 与 default 相同图像 | 200x200 | 去除尺寸泄漏的基准 |
laion_matched |
7,652 | 3,826 张 LAION-5B + 3,826 张 DALL·E 3 | 512x512 | 最具参考意义的评估配置 |
cross_generator |
5,494 | 1,500 张 LAION 真实 + 多种生成器虚假图像 | 256x256 | 测试跨生成器泛化能力 |
关键警告与数据特征
default配置存在严重尺寸泄漏:所有真实图像均为 200x200,所有虚假图像均非该尺寸,仅靠图像尺寸即可达到 AUC 1.000 的完美分类效果。laion_matched配置存在亮度泄漏:基于平均亮度可实现 AUC 0.734 的区分,这反映了网络图像与 AI 生成图像的真实风格差异。- 类别分布不均衡:
default配置中真实图像占 36%,虚假图像占 64%,建议使用 AUC 或平衡准确率评估。
数据字段说明
所有配置共享以下字段:
image:嵌入在 parquet 文件中的图像数据label:类别标签,0=真实,1=虚假source:来源标识(如coco_val2017、dalle3_advanced、laion5b等)orig_path:上游 WildFake 档案中的原始路径id:格式为"{source}/{basename}"
python
加载示例
from datasets import load_dataset ds = load_dataset("techjam-aigc/wildfake-eval-subset", "laion_matched", split="validation")
数据来源与许可
数据通过 HTTP 范围读取方式从 ModelScope 上的 WildFake 数据集构建,每个文件均经过 CRC 验证。数据来源包括 COCO、LAION-5B、DALL·E 3、Midjourney v5、SDXL 和 GigaGAN。使用需遵循上游 WildFake 的非商业研究条款,底层图像保留各自版权条款。




