遇见数据集

MIDV-DynAttack

收藏
arXiv2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

MIDV-DynAttack是由IDnow研究中心与EPITA研究实验室联合创建的公开数据集,专注于身份文档光学可变设备的动态攻击检测。该数据集在原有MIDV-Holo基础上扩展了1200个视频序列,涵盖静态模板攻击(如自然光/激光照射的纸质塑料模板)和动态模板攻击(如手工添加全息层的复杂伪造),数据通过智能手机在真实场景中采集。数据集通过手工制作模板与多环境捕获流程,模拟了工业化场景中可复现的威胁模型,专门用于评估身份文档全息防伪特征验证系统对未知动态攻击的泛化能力。

MIDV-DynAttack is a public dataset jointly created by the IDnow Research Center and the EPITA Research Laboratory, focusing on dynamic attack detection for optical variable devices of identity documents. This dataset extends 1200 video sequences based on the original MIDV-Holo, covering static template attacks (e.g., paper and plastic templates irradiated by natural light or laser) and dynamic template attacks (e.g., complex forgeries with manually added holographic layers). The data was collected in real-world scenarios using smartphones. Through manual template fabrication and multi-environment capture processes, the dataset simulates a reproducible threat model in industrial scenarios, and is specifically designed to evaluate the generalization ability of identity document holographic anti-counterfeiting feature verification systems against unknown dynamic attacks.

创建时间:
2026-07-08
原始信息汇总

数据集概述

该数据集(MIDV-DynAttack 和 MIDV-Holo)用于研究身份证件中动态全息行为的验证,相关论文被 ICDAR 2025 接收。

数据集构成

  • 源数据:
    • video: 采集的视频
    • tracking: 每帧(15fps)的文档定位坐标
  • 派生数据:
    • images: 视频按15fps提取的帧
    • rectified: 利用定位信息校正后的文档图像
    • cropped: 包含人脸区域和主全息图的感兴趣区域(ROI)
    • cropped_sub: 经预处理后的ROI

数据子集划分

  • MIDV-DynAttack(本文提出的数据集):
    • 静态模板: fraud/no_holo/(无层压)、fraud/plastified_lowreflect/(最小反射层压)、fraud/plastified_noholo/(多光源反射层压)、fraud/laser/(红色激光移动)、fraud/plastified_led/(多色LED灯环照明)、fraud/swap/(两文档交换)、fraud/swap_three/(三文档交换)
    • 动态模板: fraud/plain_holo/(均匀全息材料)、fraud/leaf_holo/(叶片状多边形光图案)、fraud/double_sticker/(花朵形激光膜+真贴纸组合)、fraud/holo_star_world/(花朵形状+世界地图全息图案)、fraud/holo_completemask/(粗糙全息蒙版覆盖整个文档)
  • MIDV-Holo(来源:SmartEngines/midv-holo):
    • origins/fraud/photo_holo_copy/fraud/pseudo_holo_copy/fraud/copy_without_holo/fraud/photo_replacement/

数据处理流程

  1. 帧提取: 使用 FFmpeg 以15fps提取视频帧
  2. 文档校正: 基于 tracking 注释进行几何校正
  3. ROI提取: 从校正图像中提取人脸和主全息图的ROI
  4. 背景减除与伪标签生成: 执行 jobs/dataset/bg_sub.shjobs/dataset/pseudolabel.sh

下载方式

  • 快速复现: 从 Zenodo 下载 cropped.tar.gz 并解压到 data/midvdynattack/cropped/,然后生成 cropped_sub 和伪标签
  • 完整流程: 下载源数据(MIDV-Holo、MIDV-DynAttack、15fps跟踪注释),自行生成派生数据

实验任务与方法

  • MIDVHolo Approach: 校准方法
  • Weakly Supervised Learning: 弱监督学习训练
  • Direct Classifier: 直接二分类器(MobileViT)
  • HoloVerif(本文提出): 完整流水线(MobileViT,带/不带数据增强),以及轻量级方法(HOG+SGD分类器)
  • Pseudo Labels: 仅使用伪标签校准

计算环境要求

  • 主实验(5fps): 使用1 GPU+8 CPU(wsl、classifier、holoverif),30 CPU(midvholo),6 CPU(hog-sgd、pseudo_labels)
  • 补充实验(15fps): 类似配置

结果分析

使用 notebooks/export_test_results.ipynb 或查看预计算结果的HTML版本 notebooks/export_test_results.html

引用

  • 本文: Pouliquen et al., ICDAR 2025
  • 相关工作: Pouliquen et al., ICDAR 2024; Koliaskina et al., 2023 (MIDV-Holo)
搜集汇总
数据集介绍
构建方式
在身份文档防伪验证领域,动态全息行为的自动检测长期受限于数据匮乏,现有数据集多聚焦于静态攻击,缺乏对真实动态伪造手段的覆盖。为突破这一瓶颈,MIDV-DynAttack数据集基于原MIDV-Holo框架进行了系统性扩展,通过手工伪造技术构建了1200段全新攻击视频序列。数据集涵盖静态模板攻击(如自然光下无层压证件、LED多色光照、激光扫描及多模板替换)与动态模板攻击(如随机全息覆层及模仿原始全息图样的针对性伪造),所有样本均由手持智能手机在室内外真实环境下采集,模拟工业流程中易复现且具威胁性的欺诈场景。该数据集专为测试模型对未见攻击的泛化能力设计,不提供训练或验证划分,需与原数据集联合使用以确保身份不跨分集重复。
使用方法
使用MIDV-DynAttack数据集时,需严格遵循其专用的评估协议:该数据集的全部1200段视频应作为测试集使用,不可用于模型训练或参数校准,以避免数据泄漏并准确衡量模型对未知攻击的泛化能力。实践中,研究者应基于原MIDV-Holo数据集的合法样本与已知静态攻击样本进行模型训练与验证,随后将训练好的模型直接应用于MIDV-DynAttack各类攻击视频,通过计算帧级全息行为检测比例并设定阈值生成序列级判决(合法/非法)。推荐结合提供的文档配准与背景减除预处理流程以增强全息信号,并依据论文公开代码中的分组分层交叉验证策略进行结果评估,确保各分集间身份不重叠。最终性能可通过全类型攻击召回率与ROC曲线下面积(AUC)进行综合度量,尤其关注动态攻击上的表现以测试模型对新颖攻击的鲁棒性。
背景与挑战
背景概述
MIDV-DynAttack数据集由法国IDnow研究中心与EPITA研究实验室的研究人员于2026年联合创建,核心成员包括Glen Pouliquen、Joseph Chazalon等。该数据集聚焦于身份证件上光学可变器件(OVD,即全息图)的远程真伪验证问题,旨在弥补现有公开数据集在动态攻击样本方面的缺失。研究背景根植于身份验证的自动化需求——传统依赖人工检验的全息图在智能手机等通用摄像头的远程场景下,其安全特征难以被机器可靠捕获。MIDV-DynAttack在已有MIDV-Holo数据集基础上,新增1200个视频序列,覆盖静态模板攻击(如自然光模拟、LED光照、激光照射及文档交换)与动态模板攻击(如随机全息覆盖层、模仿原始全息图),将攻击样本数量扩充至原数据集的3倍,专门用于测试模型对未知攻击的泛化能力。该数据集遵循知识共享许可协议,相关代码与数据已公开,为全息图验证领域提供了首个包含复杂动态欺诈场景的标准化基准,对推动远程身份认证系统的安全评估具有重要影响力。
当前挑战
MIDV-DynAttack所应对的领域挑战根植于全息图验证的核心困境:传统攻击检测(AD)可识别静态伪造(如纸复印),但无法抵御动态攻击(如手工仿制全息图),这是因为动态攻击模拟了全息图的光学变化行为,却缺少与真实设备一致的外观与过渡状态。现有模型验证(MV)方法或仅检验部分视觉外观,或只检测色彩变化阈值,导致对全息图替换等新型攻击失效。此外,构建该数据集本身亦面临严峻挑战:需手工制作10种不同类型的动态欺诈模板,包括以塑料覆膜模拟反射、用多色LED灯环伪造色彩变化、甚至通过多文档交换制造多样外观,每一种均需精细设计以逼近真实威胁场景;同时,视频采集需在手持设备自然拍摄条件下完成,涵盖室内外多环境变量,确保捕捉到真实的运动模糊、反光、遮挡等伪影,这对数据集的场景逼真度与攻击多样性提出了极高要求。
常用场景
经典使用场景
在身份验证与文档安全领域,MIDV-DynAttack数据集主要用于评估和提升自动全息图验证系统的鲁棒性。研究者常利用该数据集训练模型,区分真实证件中的动态光学可变装置(OVD)与各类伪造攻击——包括静态攻击(如纸质复印件、屏幕翻拍)及更具挑战性的动态攻击(如手工伪造的全息层、灯光反射模拟)。该数据集提供1200段视频序列,覆盖自然光、LED灯、激光笔等多种光照条件下的静态模板攻击,以及包含随机全息覆盖、模拟原始全息形状的动态模板攻击,为全景式评估算法在未知攻击上的泛化能力提供了标准化测试平台。
解决学术问题
该数据集的发布解决了远程证件验证领域中一个关键学术难题:现有方法大多针对已知类型的静态伪造有效,但缺乏对动态、未见过的伪造手段的检测能力。MIDV-DynAttack通过引入手工制作的动态全息攻击样本——例如使用多文档切换欺骗系统的Swap攻击、利用彩色LED灯制造伪动态效果的照明攻击——填补了公开数据集的空白。它使得研究者能够系统性地评估模型在真实复杂攻击下的泛化能力,推动全息验证从单一的“攻击检测”迈向更全面的“模型验证”,即不仅检查全息区域是否出现,更验证其动态光学行为是否与真品一致,显著提升了学术研究中对安全协议鲁棒性的评估标准。
实际应用
在实际应用中,MIDV-DynAttack数据集直接服务于金融机构、边境管控、远程身份认证平台(如KYC流程)中的安全升级。数据集模拟了攻防双方的实际对抗:攻击方使用日常材料(打印机、全息贴纸、激光笔)制造伪造证件,防御方则需通过普通智能手机摄像头采集的视频识别真伪。这一场景高度还原了工业级验证系统面临的挑战——例如用户在家中自助认证时,可能使用屏幕翻拍、纸质复制品或手工伪装的全息贴纸试图蒙混过关。因此,该数据集为开发能在低资源、非受控环境下可靠运行的验证算法提供了关键支撑,有助于降低身份盗用和欺诈交易的风险。
数据集最近研究
最新研究方向
MIDV-DynAttack数据集聚焦于身份文档中光学可变器件(即全息图)的动态行为验证,旨在应对远程自动身份验证中日益复杂的新型攻击。该研究前沿方向涵盖基于动态模板的真实伪造攻击检测,例如手工制作的全息覆盖、光照操控及文档替换等,挑战现有方法对未见攻击的泛化能力。通过引入1200段全新攻击视频,将攻击样本数量扩大三倍,该数据集填补了动态攻击场景的公共数据缺失,推动了自动验证系统从静态模式向动态行为分析的范式转变。其提出的HoloVerif方法利用背景抑制与伪标签训练,在检测动态攻击时展现了最先进的性能,对提升身份文档在移动设备上的安全性具有里程碑式意义,尤其在金融、边境管控等高风险场景中影响深远。
相关研究论文
  • 1
    Verification of Dynamic Holographic Behavior in Identity DocumentsIDnow研究中心; EPITA研究实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务