遇见数据集

Omni-Fake-OOD

收藏
Hugging Face2026-06-28 更新2026-06-29 收录
官方服务:

资源简介:

Omni-Fake-OOD是Omni-Fake项目的分布外(OOD)基准测试分割数据集,用于评估深度伪造检测模型在未见过的生成器和平台上的跨领域泛化能力。它与分布内训练数据集Omni-Fake-SET配套使用,覆盖图像、音频、视频以及音频-视频说话头四种模态,统一采用三分类标签体系:真实、完全合成和篡改。数据规模中等偏大,在10万到100万样本之间;具体到OOD视频部分,包含22,000个视频片段,其中1,000个真实、1,000个完全合成和20,000个篡改样本。数据集提供多个配置:image配置包含图像、掩码(用于指示篡改区域)和标签;audio配置包含音频、标签及伪造时间区间;video和avth配置包含视频和标签等字段。该数据集适用于图像分类、音频分类、视频分类等任务,尤其专注于深度伪造检测、多媒体取证和多模态学习领域的研究与评估。

Omni-Fake-OOD is the out-of-distribution (OOD) benchmark split dataset of the Omni-Fake project, designed to evaluate the cross-domain generalization capability of deepfake detection models on unseen generators and platforms. It is used in conjunction with the in-distribution training dataset Omni-Fake-SET, covering four modalities: image, audio, video, and audio-video talking head (AV-TH), and uniformly adopts a three-class label system: real, fully synthetic, and tampered. The dataset size is medium to large, ranging from 100,000 to 1,000,000 samples; specifically for the OOD video part, it includes 22,000 video clips, with 1,000 real, 1,000 fully synthetic, and 20,000 tampered samples. The dataset contains multiple configurations: the image configuration includes images, masks (for indicating tampered regions), and labels; the audio configuration includes audio, labels, and forgery time intervals; the video and avth configurations include video, labels, and other fields. It is suitable for tasks such as image classification, audio classification, and video classification, with a particular focus on research and evaluation in deepfake detection, multimedia forensics, and multimodal learning.

创建时间:
2026-06-25
原始信息汇总

数据集总览

Omni-Fake-OODOmni-Fake 基准的分布外(OOD)评测子集,专为衡量深度伪造检测模型在跨域泛化场景下的表现而设计。其样本来自训练集中未出现的生成器与平台,与分布内(ID)训练数据集 Omni-Fake-SET 配合使用。数据集涵盖图像、音频、视频及**音视频说话人脸(AV-TH)**四种模态,所有样本均采用统一的三分类标签:real(真实)、full_synthetic(全合成)及 tampered(篡改)。


数据集规模与构成

模态 配置名称 数据总量 详细构成
图像 image 未明确总数 包含 imagemasklabelgeneratorfilenamesplit 字段
音频 audio 未明确总数 包含 audiolabelgeneratorfilenamesplitspoof_intervals 字段
视频 video 22,000 个片段 1,000 真实 + 1,000 全合成 + 20,000 篡改
音视频说话人脸 avth 未明确总数 包含 videolabelgeneratorfilenamesplit 字段

视频模态特别说明:

  • 真实 + 全合成 片段(共 2,000 个)来源于 GenBuster-200K 封闭基准中的 8 个商业生成器,以 data/Video/video-ood.7z 压缩包形式提供,解压后按 real / full_synthetic 目录存放。
  • 篡改 片段(共 20,000 个)来源于 Omni-Fake PartialEdit OOD,以 Parquet 格式文件 data/Video/test-*.parquet 存储。

数据加载与使用

通过 Hugging Face datasets 库可按配置加载:

python from datasets import load_dataset

图像(默认配置)

ds_img = load_dataset("JamalLee/Omni-Fake-OOD", "image")

音频

ds_aud = load_dataset("JamalLee/Omni-Fake-OOD", "audio")

视频(仅篡改部分,通过 Parquet 加载)

ds_vid = load_dataset("JamalLee/Omni-Fake-OOD", "video")

真实 + 全合成部分需解压 data/Video/video-ood.7z

音视频说话人脸

ds_avth = load_dataset("JamalLee/Omni-Fake-OOD", "avth")


各模态数据字段说明

模态 数据字段
图像 image(图像)、mask(篡改掩码)、label(标签)、generator(生成器)、filename(文件名)、split(划分)
音频 audio(音频)、label(标签)、generator(生成器)、filename(文件名)、split(划分)、spoof_intervals(欺骗时间区间,序列)
视频(Parquet 格式,仅篡改) video(视频)、label(标签)、generator(生成器)、filename(文件名)、split(划分)
视频(.7z 压缩包,真实+全合成) 解压后目录结构为 real / full_synthetic,直接按文件名访问片段
音视频说话人脸 video(视频)、label(标签)、generator(生成器)、filename(文件名)、split(划分)

标签取值: realfull_synthetictampered(图像与视频均采用此三分类体系)。


数据集查看器

在 Hugging Face 数据集页面中,Dataset Viewer 选项卡默认选中 image 子集,可预览 image 列的缩略图;当 mask 可用时,可显示篡改区域。切换子集至 videoaudioavth 可查看其他模态的数据。


引用方式

bibtex @article{li2026omnifake, title={Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection}, author={Li, Tianxiao and Huang, Zhenglin and Wen, Haiquan and others}, journal={arXiv preprint arXiv:2605.01638}, year={2026} }

搜集汇总
数据集介绍
Omni-Fake-OOD 数据集图片
构建方式
Omni-Fake-OOD 是 Omni-Fake 基准数据集的跨领域泛化测试子集,旨在评估深度伪造检测模型在未见生成器与平台上的表现。其构建方式基于精心划分的分布外(OOD)策略:图像、音频、视频及音视频说话人头部(AV-TH)四种模态的数据均源自训练集中未包含的生成器与平台。对于视频模态,真实样本与全合成样本从 GenBuster-200K 闭源基准测试的 8 个商业生成器中采集,共计 2,000 条;而 20,000 条篡改视频则源自 Omni-Fake PartialEdit OOD 数据集,以 Parquet 格式存储。该数据集遵循与 Omni-Fake-SET 一致的三分类标签体系:真实、全合成与篡改。
使用方法
用户可通过 Hugging Face Datasets 库便捷加载该数据集。加载图像模态时,执行 `load_dataset('JamalLee/Omni-Fake-OOD', 'image')` 即可获取包含图像、掩码、标签和生成器信息的样本;切换至音频模态使用参数 `'audio'`,其返回的样本附带伪造区间元数据。对于视频模态,篡改部分以 Parquet 格式提供,可直接加载;而真实与全合成部分需手动解压 `data/Video/video-ood.7z` 文件,并依据 `real` 与 `full_synthetic` 目录组织使用。AV-TH 模态的加载方式与视频类似。所有配置均支持通过 `split` 字段进行数据划分,便于集成至现有训练与评估流程。
背景与挑战
背景概述
在深度伪造技术迅猛发展的时代,社交媒体平台上充斥着由各类生成模型创造的合成内容,对信息真实性构成了严峻挑战。Omni-Fake-OOD数据集由Tianxiao Li等人于2026年创建,是Omni-Fake项目的重要组成部分,专注于评估多模态深度伪造检测模型在跨域场景下的泛化能力。该数据集涵盖图像、音频、视频及音视频说话人头部(AV-TH)四种模态,所有样本均来自训练阶段未见过的生成器与平台,旨在衡量模型面对未知分布数据时的鲁棒性。作为学术界首个统一的多模态跨域深度伪造检测基准,Omni-Fake-OOD为研究跨模态通用伪造特征提供了标准化测试平台,显著推动了数字取证领域向真实应用场景的迈进。
当前挑战
该数据集所解决的领域核心挑战在于,现有深度伪造检测模型往往仅在特定生成器或封闭数据集上表现优异,而面对社交媒体中不断涌现的新生成技术和真实场景下的分布偏移时,泛化能力急剧下降。Omni-Fake-OOD通过引入严格分布的样本设计,迫使检测系统必须学习与生成器无关的本质伪造痕迹。在构建过程中,研究人员面临多模态数据对齐与规模平衡的困难,特别是视频模态中需整合来自GenBuster-200K封闭基准的2,000个真实与完全合成片段,以及20,000个通过Omni-Fake PartialEdit流程生成的篡改样本,确保不同模态间的标签一致性与跨域代表性,这对数据采集与标注精度提出了极高要求。
常用场景
经典使用场景
在深度伪造检测领域,模型的跨域泛化能力是衡量其鲁棒性的核心指标。Omni-Fake-OOD作为一个多模态分布外基准数据集,专为评估检测模型在未见生成器和平台上的表现而设计。经典使用场景涵盖图像、音频、视频及音视频说话人头部四大模态,通过提供从未出现在训练集中的合成样本,检验模型对全新伪造类型的感知与识别能力。研究者常利用该数据集的图像分支测试视觉伪造检测器对未知生成算法生成的虚假图片的响应,音频分支则用于评估语音深度伪造检测方法对陌生语音合成工具的泛化水准。视频与音视频说话人头部数据更进一步,以真实、全合成与篡改三类标签构成的三分类任务,全面衡量模型在复杂动态场景中的适应性与判别精确性。
解决学术问题
该数据集精准回应了深度伪造检测研究中的关键学术挑战——现有检测模型在面对分布外样本时性能急剧下降的固有问题。传统检测基准多依赖与训练数据同分布或相近分布的测试集,难以反映模型在真实世界中遇到全新伪造技术时的真实表现。Omni-Fake-OOD通过精心筛选来自独立生成器和平台的样本,系统性地构建了跨域泛化测试环境,使研究者得以量化模型在分布偏移条件下的退化程度。该工作推动了检测领域从封闭世界假设向开放世界认知的范式转变,激励学术界探索更稳定的特征表示学习策略、域自适应方法以及元学习框架,从而提升模型对未来未知伪造技术的预判与防御能力。
实际应用
在社交媒体海量内容的真实性校验、多媒体证据的司法鉴定以及深度伪造跨平台传播拦截等实际场景中,Omni-Fake-OOD发挥着不可替代的基准作用。例如,社交媒体平台的内容审核系统可借助该数据集评估其面对新涌现的合成工具生成内容时的检测可靠性,为部署更具韧性的自动过滤机制提供参考。音频检测模块可应用于电话诈骗防范,验证模型对从未见过的语音克隆技术是否具备拒伪能力。视频与音视频数据则直接服务于深度伪造视频取证,帮助执法机构或新闻核查团队判断现有检测工具在面对与训练集生成技术迥异的篡改视频时的实际可信度,从而降低漏报与误报风险。
数据集最近研究
最新研究方向
当前,深度伪造检测领域正从单一模态向多模态融合与跨域泛化方向演进,Omni-Fake-OOD数据集应运而生,聚焦于真实世界场景中分布外(OOD)样本的鲁棒性评估。该数据集精选了图像、音频、视频及音视频说话头(AV-TH)四种模态,并引入训练阶段未见过的生成器与平台数据,旨在检验检测模型在跨域迁移时的泛化能力。其设计紧密关联社交媒体验证、虚假信息治理等热点议题,通过统一的三分类标注体系(真实、全合成、篡改)为多模态深度伪造防御提供了标准化测评基准,推动研究从实验室理想条件迈向复杂开放环境的实用化突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务