遇见数据集

SGData

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

SGData是一个面向语义感知的虚假图像/视频检测数据集,与SGDFD方法一同提出。该数据集涵盖来自ILSVRC2012的1000个语义类别,每个类别的真实图像由七种最先进的文本到图像生成器(StableDiffusion 3.5、FLUX.2、PixelArt-Σ、Kandinsky 5.0、HiDream-I1、Lumina-Image 2.0、Qwen-Image)根据QWEN3-VL自动生成的文本提示一对一地合成伪造图像。此外,还引入了额外的人脸语义类别,其中真实图像来自FaceCaptionHQ-4M,真实视频来自CelebV-Text,伪造人脸视频由三种视频生成模型(SANA-Video、HunyuanVideo 1.5、SkyReels-V2)生成。SGData的测试集中的人脸数据未经过对齐或中心裁剪处理,以模拟真实部署场景。数据集规模:训练集包含700,700张真实图像和700,700张伪造图像;验证集包含70,070张真实图像和70,070张伪造图像;测试集包含630,630张真实图像、630,630张伪造图像、600段真实视频和600段伪造视频。总计1,401,400张真实图像、1,401,400张伪造图像、600段真实视频和600段伪造视频。语义类别总数为1001,生成模型总数为10。数据组织方式为:真实图像和视频需用户自行从原始来源(ImageNet2012、FaceCaptionHQ-4M、CelebV-Text)下载,伪造图像和视频以tar包形式提供,按语义类别和生成器名称组织。

SGData is a semantic-aware fake image/video detection dataset proposed alongside the SGDFD method. It covers 1000 semantic categories from ILSVRC2012, with real images for each category and fake images synthesized by seven state-of-the-art text-to-image generators (StableDiffusion 3.5, FLUX.2, PixelArt-Σ, Kandinsky 5.0, HiDream-I1, Lumina-Image 2.0, Qwen-Image) based on text prompts automatically generated by QWEN3-VL. Additionally, an extra face semantic category is introduced, where real images are from FaceCaptionHQ-4M, real videos from CelebV-Text, and fake face videos are generated by three video generation models (SANA-Video, HunyuanVideo 1.5, SkyReels-V2). Face data in the test set of SGData are not aligned or center-cropped to simulate real deployment scenarios. Dataset scale: training set contains 700,700 real images and 700,700 fake images; validation set contains 70,070 real images and 70,070 fake images; test set contains 630,630 real images, 630,630 fake images, 600 real videos, and 600 fake videos. Total: 1,401,400 real images, 1,401,400 fake images, 600 real videos, and 600 fake videos. There are 1001 semantic categories and 10 generative models. Data organization: real images and videos need to be downloaded by users from original sources (ImageNet2012, FaceCaptionHQ-4M, CelebV-Text), while fake images and videos are provided as tar packages organized by semantic category and generator name.

创建时间:
2026-08-31
原始信息汇总

SGData 是一个用于伪造内容检测的语义感知数据集,支持图像与视频两类媒体,总计包含约 280 万张图像与 1200 个视频。真实图像覆盖 ILSVRC2012 的全部 1000 个语义类别,并额外引入“人脸”类别(共 1001 类);虚假图像由 7 种先进的文生图模型按类别一对一生成,虚假视频由 3 种视频合成模型生成,且测试集中的人脸图像刻意不做对齐或中心裁剪,以贴近真实应用场景。数据规模按子集划分:训练集含真实/虚假图像各 700,700 张;验证集各 70,070 张;测试集各 630,630 张,并含真实/虚假视频各 600 段。生成模型方面,图像来自 StableDiffusion 3.5、FLUX.2、PixelArt-Σ、Kandinsky 5.0、HiDream-I1、Lumina-Image 2.0、Qwen-Image(每个模型对 1000 个类别各生成 200 张,并对人脸类别额外生成 200 张);视频来自 SANA-Video、HunyuanVideo 1.5、SkyReels-V2(各生成 200 段人脸视频,条件来源于 CelebV-Text)。数据集真实媒体需用户自行获取:真实图像来源于 ImageNet2012 与 FaceCaptionHQ-4M,需同意相应访问条款;真实视频来源于 CelebV-Text,亦需同意其条款。仓库结构为:真实图像(需自行下载)、fake 目录下按语义类别存放生成器压缩包、真实视频(需自行下载)、fake_videos 目录下存放各生成器的视频压缩包。数据集许可为 MIT,总规模在 1 亿至 10 亿条之间。

搜集汇总
数据集介绍
SGData 数据集图片
构建方式
SGData是一个面向语义感知深度伪造检测的大规模数据集,其构建策略融合了真实与生成内容的严格配对设计。真实图像源自ILSVRC2012全部1000个语义类别,并扩展了人脸这一特殊语义类别(取自FaceCaptionHQ-4M),真实视频则来自CelebV-Text。伪造图像由七种先进的文本到图像生成模型依据QWEN3-VL自动生成的文本提示逐类合成,每类生成200幅,共形成140万对图像。伪造视频由三种视频生成模型以CelebV-Text为条件生成,每类200个片段。训练、验证、测试子集按比例分配,确保类别均衡与模型泛化性评估的合理性。
特点
SGData的核心特色在于其规模宏大且语义覆盖空前,涵盖1001个语义类别,总计超过280万张图像(真实与伪造各半)及1200个视频片段,由10种不同的生成模型制造,能够有效考验检测器对多种生成痕迹的辨识能力。尤其值得关注的是,测试集中的人脸样本刻意未经任何对齐或裁剪预处理,真实模拟了实际部署中可能遭遇的多样性与复杂干扰,使得评估结果更具说服力与挑战性。所有数据均源自公开许可或需授权访问的真实数据库,构建过程注重伦理合规性。
使用方法
使用SGData时,由于原始真图像与真视频受访问条款约束,需使用者自行从ImageNet2012、FaceCaptionHQ-4M及CelebV-Text官方渠道获取并同意相应许可。数据集目录结构清晰,伪造数据按语义类别和生成模型分门别类存放为独立的tar压缩包,方便按需加载。研究者可基于此进行训练、验证和测试,尤其推荐利用其语义标签评估模型在未见类别上的泛化能力,或针对生成模型签名进行溯源分析。具体下载协议与更新状态可参见HuggingFace仓库说明,当前完整数据上传尚在推进之中,建议关注后续版本以获得完整资源。
背景与挑战
背景概述
SGData数据集由研究团队于近期构建,旨在应对生成式人工智能迅猛发展所带来的深度伪造检测挑战。该数据集依托ILSVRC2012的1000个语义类别以及人脸这一额外类别,利用QWEN3-VL自动生成文本提示,并由七种先进的文本到图像生成模型与三种视频合成模型合成对应的伪造内容,规模庞大,涵盖真实与伪造图像共计280余万张及视频1200段。其研究核心在于为伪造检测方法提供语义丰富、生成模型多样的大规模基准,推动该领域从传统的二分类检测向细粒度、跨模型的泛化能力研究演进,对多媒体取证与内容安全领域具有重要影响力。
当前挑战
SGData数据集所解决的领域挑战主要集中在深度伪造内容的准确识别与泛化检测上。当前生成模型迭代迅速,伪造痕迹趋于细微且模式多变,现有数据集往往局限于少数生成器或特定语义类别,难以应对真实世界中类别多样、模型异构的伪造场景。在构建过程中,挑战亦十分显著:既要保证真实图像与伪造图像在语义上的严格一一对应,又需协调多个来源的许可协议以合法分发;数据规模庞大导致上传与存储耗时;人脸测试集刻意不做对齐或中心裁剪,模拟真实部署条件,进一步加剧了检测算法对姿态与构图变化的鲁棒性要求。
常用场景
经典使用场景
SGData作为首个覆盖1001个语义类别的大规模语义感知生成伪造检测数据集,其经典使用场景聚焦于图像与视频的深度伪造识别。该数据集以ILSVRC2012的1000类真实图像为基础,借助七种顶尖文生图模型与三种视频合成模型,构建了与真实样本一一对应的伪造样本,并额外引入人类面部类别以模拟现实场景中高风险的篡改目标。研究者可借此训练和评估跨生成模型的伪造检测算法,尤其适用于检验模型在未知生成器或未见语义类别上的泛化能力。测试集中人脸样本未经对齐或裁剪处理,更贴近实际部署条件,为开发鲁棒性的二分类或细粒度伪造溯源系统提供了理想基准。
解决学术问题
该数据集精准回应了生成式AI时代伪造检测面临的三大核心挑战:语义多样性覆盖不足、生成模型演化迅速以及评测基准的生态效度缺失。既有数据集多局限于有限类别或单一生成器,难以支撑模型对语义感知特征的习得;SGData则通过千类级图像与视频的规模化对齐,促使检测算法摆脱对特定纹理或伪影的依赖,转而学习高层语义一致性线索。其设计解决了跨模型泛化难题——训练集与测试集采用不同生成器,可客观度量方法在未见伪造技术上的迁移能力;同时,未处理的人脸数据还原了现实中社交平台传播的原始状态,显著提升了评测结果对真实应用场景的指导意义。
衍生相关工作
SGData的发布将催生一系列衍生研究方向,例如基于语义一致性验证的伪造取证网络、面向未知生成器的域自适应检测框架,以及多模态大模型引导的深度伪造溯源架构。经典工作可能包括利用对比学习强制拉近真实样本的特征分布、利用扩散模型逆向过程鉴别伪影,或结合视觉-语言模型实现伪造类别与生成器的联合识别。数据集中额外的文本提示生成流程(如自动驾驶标注)也为文本-图像对齐研究提供了新场景。未来,以SGData为基准的检测算法有望扩展至视频时序建模、频域分析等方向,进而推动生成式内容认证与可信AI生态的标准化建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务