遇见数据集

X-AVDT

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集(MMDF)是为论文“X-AVDT: 用于鲁棒深度伪造检测的音频-视觉交叉注意力”构建的,主要用于音频-视觉多模态深度伪造检测任务。数据集包含真实和伪造的视频片段。原始视频数据经过预处理,包括提取视频帧和音频文件,随后通过Hallo特征提取方法生成多种特征表示。最终用于训练的数据组织形式为:在根目录下,按照数据分割(如训练集、验证集)、标签(真实/伪造)、深度伪造模型ID和视频剪辑ID进行层级划分,每个剪辑目录下包含以.pt文件格式存储的多种预计算特征,例如原始特征、反转特征、重建特征、残差特征和注意力特征。这些特征文件以16帧为块进行切片,适用于训练基于音频-视觉交叉注意力机制的深度伪造检测模型。

This dataset (MMDF) is constructed for the paper X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection and is primarily used for audio-visual multimodal deepfake detection tasks. It contains both genuine and fake video clips. The original video data undergoes preprocessing, including extraction of video frames and audio files, followed by the Hallo feature extraction method to generate various feature representations. The data organization for training is structured as follows: under the root directory, it is hierarchically divided by data splits (e.g., training set, validation set), labels (genuine/fake), deepfake model IDs, and video clip IDs. Each clip directory contains multiple precomputed features stored in .pt file format, such as original features, inversion features, reconstruction features, residual features, and attention features. These feature files are sliced into blocks of 16 frames, suitable for training deepfake detection models based on audio-visual cross-attention mechanisms.

创建时间:
2026-07-22
原始信息汇总

数据集概述:X-AVDT

数据集名称:MMDF(用于X-AVDT方法)

用途:用于训练和评估音频-视觉交叉注意力深度伪造检测模型X-AVDT,重点在于提升对未见深度伪造生成器的鲁棒性。

来源:由韩国科学技术院(KAIST)视觉媒体实验室(Visual Media Lab @ KAIST)的研究团队发布,相关论文被CVPR 2026接收。

关联论文X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

数据下载地址:https://huggingface.co/datasets/zaqxsw0526/MMDF

数据预处理与特征提取

  1. 视频转换:将原始视频转换为帧文件夹和wav文件,需使用ffmpeg
  2. Hallo特征提取:对每个片段提取original.mp4inverted.mp4reconstructed.mp4residual.mp4attn_map.mp4以及attn_feat.pt特征文件。
  3. 特征打包:将片段级特征拆分为16帧的.pt块文件,形成训练所需的目录结构。

训练与评估

  • 训练:使用打包后的特征文件,运行训练脚本。
  • 评估:需下载预训练的X-AVDT检测器权重(下载链接),然后运行评估脚本。

目录结构

特征提取后,训练数据应组织为如下格式(针对真实和伪造两个根目录):

<root>/<split>/<label>/<model_id>/<clip_id>/ original/.pt inverted/.pt reconstructed/.pt residual/.pt attn_feat/*.pt

引用

bibtex @article{kim2026x, title={X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection}, author={Kim, Youngseo and Yun, Kwan and Hong, Seokhyeon and Cha, Sihun and Koo, Colette Suhjung and Noh, Junyong}, journal={arXiv preprint arXiv:2603.08483}, year={2026} }

搜集汇总
数据集介绍
X-AVDT 数据集图片
构建方式
X-AVDT数据集源于MMDF数据集,通过精心设计的流水线进行构建。原始视频首先被转换为帧文件夹和WAV音频文件,随后利用Hallo模型进行特征提取,生成涵盖原始、反转、重构、残差及注意力特征等多种表征的剪辑级输出。最后,这些输出被切分为16帧的PyTorch张量块,形成标准的训练目录结构,为后续的音频-视觉交叉注意力学习奠定基础。
特点
该数据集的核心特色在于其深度融合的音频-视觉表征与扩散反演特征。通过Hallo模型提取的多模态特征,包括原始、反向和重构特征,结合音频信息,实现了对深层伪造痕迹的精细捕捉。数据集不仅涵盖了多种未知的深度伪造生成器,还通过残差和注意力特征图提供了异常区域的直观指示,显著提升了检测器在未见过的伪造场景下的鲁棒性。
使用方法
使用X-AVDT数据集时,用户需首先从HuggingFace下载MMDF原始数据。之后,运行特征提取脚本将原始视频转化为所需的特征文件,并通过打包命令生成适用于训练的PT文件。训练阶段,直接指定数据目录即可启动模型。评估时,需加载预训练的X-AVDT检测器权重,并在相同数据格式上运行评测脚本,以验证模型对复杂深度伪造的识别能力。
背景与挑战
背景概述
在深度伪造技术迅猛发展的背景下,如何有效鉴别由各类生成模型制造的虚假视频已成为信息安全领域的关键议题。由韩国科学技术院(KAIST)视觉媒体实验室的Youngseo Kim、Kwan Yun、Seokhyeon Hong等六位研究者于2026年提出的X-AVDT数据集,聚焦于通过音频-视觉跨注意力机制提升深度伪造检测的鲁棒性。该数据集的核心研究问题在于应对未知生成器产生的伪造视频,其影响力体现在为跨模态伪造检测提供了标准化的数据支撑与基准方法。论文已被计算机视觉顶级会议CVPR 2026接收,标志着该数据集在推动视听联合伪造防御方面迈出了重要一步。
当前挑战
当前的深度伪造检测面临双重挑战。一是领域问题层面,现有检测器对训练中未见的生成器(如扩散模型、对比学习框架等)泛化能力不足,且单模态方法易受音频噪声或视觉压缩的影响,难以在现实复杂场景中保持稳定性能。二是构建过程中,X-AVDT需克服多模态数据对齐难题,确保每一视频片段在语音、面部动作及时序上精确同步;同时,对大规模伪造视频进行高效预处理和特征提取,包括从原始视频中切帧、提取音频、并借助预训练模型生成多种跨模态特征(如原始帧、反转特征、重构残差等),这要求数据流水线具备极高的计算资源与自动化协调能力。
常用场景
经典使用场景
X-AVDT数据集专为音频-视觉跨模态深度伪造检测而设计,其核心应用场景在于评估和训练能够同时利用面部视觉特征与同步语音信号的检测模型。该数据集基于MMDF(多模态深度伪造数据集)构建,提供了大量经过精心标注的真实与伪造人脸视频样本,每个样本均包含完整的视觉帧序列和对应的音频波形。研究者通过引入扩散反演特征与跨注意力机制,使得模型能够在时间维度上对齐并融合音视频模态间的互补信息,从而显著提升对未知生成器产生的伪造内容的泛化识别能力。这一数据集已成为多模态伪造检测领域的重要基准,推动了从单模态视觉检测向视听协同鉴伪范式的演进。
实际应用
在现实世界应用中,X-AVDT数据集支撑的检测技术可部署于视频会议安全验证、社交媒体平台虚假内容审核、新闻媒体真实性核验以及司法鉴证领域。例如,在实时视频通信场景下,系统可同步分析人脸动态与语音频谱的异常匹配度,有效拦截利用换脸技术或语音合成的欺诈行为。对于社交媒体平台,该数据集训练的模型能够对用户上传的复杂伪造视频实现自动化筛查,减少人工审核成本。此外,在法庭证据采信环节,音视频交叉验证技术可辅助专家判断录像文件是否经过AI篡改,为司法公正提供技术保障。这些应用均受益于数据集所强化的跨模态伪造特征识别能力。
衍生相关工作
X-AVDT数据集及其核心方法催生了一系列衍生的学术贡献,主要包括:基于扩散模型反演过程的音视频伪造痕迹增强技术,提升了低质量伪造样本的可检测性;面向音视频异步伪造场景的多尺度时间特征对齐方法,拓展了跨模态检测的适用范围;以及轻量化视听交叉注意力网络的设计,使得模型能够在移动端或边缘设备上高效运行。此外,该数据集还被用于对比研究不同模态融合策略(如早期融合、晚期融合与交叉注意力)对检测性能的影响,并启发了将知识蒸馏技术应用于多模态伪造检测模型压缩的后续工作。这些衍生研究共同丰富了深度伪造防御领域的技术体系,推动了从实验室基准到落地部署的转化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务