遇见数据集

CASIA-SURF

收藏
arXiv2023-03-16 更新2024-06-21 收录
官方服务:

资源简介:

CASIA-SURF是由中国科学院自动化研究所创建的大型多模态人脸反欺骗数据集,包含1000个主题的21000个视频,涵盖RGB、深度和红外三种模态。数据集通过多种攻击手段(如打印和切割打印攻击)进行丰富,旨在提高人脸识别系统的安全性。创建过程中,研究者们采用了先进的传感器技术和深度学习方法,确保数据集的质量和多样性。该数据集广泛应用于多模态人脸反欺骗技术的研究和开发,特别是在提高模型对各种模态和攻击类型的适应性方面。

CASIA-SURF is a large-scale multimodal face anti-spoofing dataset created by the Institute of Automation, Chinese Academy of Sciences. It consists of 21,000 videos from 1,000 subjects, covering three modalities: RGB, depth, and infrared. The dataset is enriched with various attack types such as printed and cut-print attacks, aiming to enhance the security of facial recognition systems. During its development, researchers adopted advanced sensor technologies and deep learning methods to ensure the quality and diversity of the dataset. This dataset has been widely applied in the research and development of multimodal face anti-spoofing technologies, particularly in improving the model's adaptability to diverse modalities and attack categories.

创建时间:
2022-02-17
搜集汇总
数据集介绍
CASIA-SURF 数据集图片
构建方式
CASIA-SURF数据集由中国科学院自动化研究所与澳门科技大学等机构联合构建,旨在解决现有人脸反欺骗基准中主体数量有限(≤170)和模态单一(≤2)的瓶颈。数据采集采用Intel RealSense SR300相机,同步捕获RGB、深度和红外三种模态的视频,分辨率分别为1280×720和640×480。每位受试者包含1段真实视频和6段伪造视频,伪造方式通过对A4纸打印的彩色照片进行裁剪(如挖去眼部、鼻部或嘴部区域)并弯曲处理,生成6种攻击样式。数据经Dlib人脸检测和PRNet三维对齐预处理后,最终获得492,522张图像,涵盖1,000名不同性别、年龄和室内环境的中国受试者。
特点
该数据集在主体数量和模态丰富度上均创下公开人脸反欺骗数据集之最,包含1,000名受试者、21,000个视频片段及RGB、深度和红外三种互补模态。深度数据对平面攻击敏感,红外数据可测量面部热辐射,RGB则提供丰富纹理细节,三者融合显著提升检测鲁棒性。数据集引入ROC曲线作为主要评估指标,支持在10⁻²至10⁻⁴假阳性率下计算真阳性率,更贴合真实应用需求。同时,提供模态内和跨模态两种评估协议,跨模态协议允许模型在一种模态上训练后于其他模态测试,为探索异构反欺骗开辟新方向。
使用方法
数据集已划分为训练集(300人)、验证集(100人)和测试集(600人),并公开了标准化评估工具和协议。研究者可基于提供的多模态多尺度融合基线方法进行实验,该方法通过挤压激励融合模块对不同模态的特征进行通道级重加权,并在ResNet的多个尺度上融合。数据使用前需将裁剪后的人脸区域缩放至112×112,并采用随机翻转、旋转、裁剪和色彩失真等增强手段。预训练实验表明,在CASIA-SURF上训练的模型可显著提升在Oulu-NPU、SiW等下游数据集上的泛化性能,例如将Oulu-NPU协议1的ACER从5.8%降至2.6%。
背景与挑战
背景概述
人脸反欺骗技术是保障人脸识别系统安全性的关键环节,旨在区分真实人脸与打印、视频重放或面具等伪造攻击。随着深度学习驱动的识别系统在手机解锁、门禁及支付等场景中的广泛应用,其面临的欺骗威胁日益严峻。为应对现有数据集在样本数量和模态多样性上的不足,中国科学院自动化研究所联合澳门科技大学等机构于2018年发布了CASIA-SURF数据集。该数据集由张士峰、刘阿健、万军等研究者主导构建,包含1000名受试者的21000段视频,每段样本均涵盖RGB、深度和红外三种模态,成为当时规模最大、模态最丰富的人脸反欺骗基准。其核心研究问题在于通过多模态融合提升系统对打印攻击的泛化能力,并引入ROC曲线等全面评估指标,推动了该领域从实验室环境向真实应用场景的跨越。
当前挑战
CASIA-SURF数据集所面临的挑战体现在领域问题与构建过程两个层面。在领域问题方面,现有方法在单一RGB模态下对复杂攻击(如弯曲或裁剪的打印照片)的检测精度有限,且跨模态评估中模型泛化能力极差,例如RGB训练模型在深度或红外模态下的真阳性率不足17%,暴露出模态间语义鸿沟的严峻性。在构建过程中,数据采集需协调Intel RealSense SR300相机在0.3至1.0米距离内同步录制三种模态视频,并设计六种精细化的打印攻击方式(如裁剪眼、鼻、口区域),同时通过Dlib和PRNet进行人脸检测与对齐预处理,最终从超过500万帧中筛选出约49万张高质量图像。此外,为模拟真实场景的复杂性,训练与测试集采用不同的攻击类型组合(如训练集使用攻击4-6,测试集使用攻击1-3),进一步加剧了算法对未知攻击的适应难度。
常用场景
经典使用场景
在生物特征识别领域,面部反欺骗是保障人脸识别系统安全性的关键环节。CASIA-SURF数据集作为目前规模最大的多模态面部反欺骗基准,其经典使用场景集中于多模态融合的活体检测任务。研究者利用该数据集的RGB、深度和红外三种模态信息,设计并验证了多种融合策略,例如通过挤压激励融合模块对不同尺度的特征进行通道级重加权,从而有效区分真实人脸与打印攻击。该数据集提供了1,000名受试者的21,000段视频,并包含六种不同类型的裁剪打印攻击,为评估算法在复杂攻击下的鲁棒性提供了标准化平台。
实际应用
在实际应用中,CASIA-SURF数据集为高安全性场景的面部反欺骗系统提供了关键支撑。例如,在移动支付和门禁控制中,该数据集训练的模型能够通过融合深度信息有效抵御平面照片攻击,并通过红外模态增强对光线变化的适应性。其提供的跨模态评估协议还模拟了设备升级或传感器切换时的场景,使得算法在不同硬件配置下仍保持可靠性。此外,该数据集作为预训练资源,可迁移至其他数据集(如Oulu-NPU),显著提升跨数据集泛化能力,推动了工业级反欺骗系统的落地部署。
衍生相关工作
CASIA-SURF数据集衍生了一系列经典工作,其中最具代表性的是多尺度挤压激励融合方法。该方法通过在不同卷积层后对RGB、深度和红外特征进行通道重加权,实现了从局部细节到全局语义的多层次融合,在TPR@FPR=10⁻⁴指标上达到92.4%。此外,基于该数据集,研究者提出了FAS-TD-SF方法,利用深度监督信号进行时序建模,并在Oulu-NPU的四个协议上刷新了最低平均分类错误率记录。这些工作不仅验证了大规模多模态数据对算法性能的提升作用,还启发了后续关于跨模态知识蒸馏和异构面部反欺骗的研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务