遇见数据集

大型自然主义数据集

收藏
arXiv2021-11-16 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

本研究使用了一个包含约55,000个视频的大型自然主义数据集,这些视频记录了来自90多个国家的参与者在自然环境下的面部表情。数据集中的视频经过专业训练的FACS编码员标注了不同的动作单元(AU)。数据集的创建旨在解决面部表情识别中的自然性和多样性问题,通过提供大量自然环境下的面部表情数据,支持深度学习模型在动作单元检测任务中的训练和评估。

This study employs a large-scale naturalistic dataset containing approximately 55,000 videos, which capture facial expressions of participants from over 90 countries in naturalistic environments. All videos in the dataset were annotated with distinct Action Units (AUs) by professionally trained FACS coders. This dataset was developed to address the challenges of naturalness and diversity in facial expression recognition, and by providing abundant naturalistic facial expression data, it supports the training and evaluation of deep learning models for Action Unit detection tasks.

提供机构:
智能眼公司
创建时间:
2021-11-16
搜集汇总
数据集介绍
大型自然主义数据集 数据集图片
构建方式
该数据集构建于自然主义环境下,通过基于网络的采集方法,从全球90多个国家收集了约5.5万段参与者观看商业广告的视频。视频在野外条件下录制,分辨率、帧率和时长因设备差异而各异。所有视频均由经过训练的面部动作编码系统编码员对多种动作单元进行标注,同时标注了性别和种族信息。数据集被划分为训练集、验证集和测试集,分别包含约4.09万、0.59万和0.82万段视频。
特点
数据集规模宏大,涵盖丰富的年龄、性别和种族多样性,且完全自发性的面部表情使其具备高度的生态效度。视频采集于真实世界场景,光照、角度等条件多变,增强了数据的复杂性和代表性。此外,数据集对12种动作单元进行了精细标注,并提供了性别与种族的元信息,为研究不同人口统计学因素对面部表情分析的影响提供了独特资源。
使用方法
使用时,首先需对视频帧进行预处理:通过野外训练的检测器定位人脸,检测眼外角、鼻尖和下巴四个关键点以水平对齐眼睛,随后将人脸转为灰度图并缩放到96×96像素。模型可基于卷积神经网络进行训练,采用过采样平衡数据,并使用二元交叉熵损失函数。建议使用样本级中心化或归一化处理输入,结合多样化数据增强(如翻转、平移、缩放),并优先增加标注受试者数量而非帧数以提升性能。
背景与挑战
背景概述
大型自然主义数据集由Smart Eye AB的研究团队于2021年创建,核心研究人员包括Mina Bishay、Ahmed Ghoneim、Mohamed Ashraf和Mohammad Mavadati。该数据集旨在解决面部动作单元(AU)检测中深度学习模型与训练设置选择的系统性问题,包含约5.5万段来自90多个国家参与者的自然主义视频,涵盖多样化的年龄、性别和种族背景。与以往局限于实验室环境或人口统计单一的数据集(如DISFA、BP4D)不同,本数据集在真实野外条件下采集,具有完全自发的面部表情和丰富的录制设备差异,为AU检测领域提供了大规模、高生态效度的基准资源。其研究不仅推动了卷积神经网络在AU检测中的泛化性能评估,还通过系统对比10种CNN架构、多种训练策略及数据集结构,为社区提供了实用的建模指导,显著提升了该领域对真实场景应用的适应能力。
当前挑战
该数据集面临的核心挑战包括三个方面。首先,在领域问题层面,AU检测需解决高度不平衡的数据分布问题——多数AU的正负样本比例悬殊,导致分类器易偏向多数类,需通过过采样、欠采样或成本操纵等平衡技术来缓解,但不同方法的性能增益差异显著(如过采样提升1.5%而欠采样仅0.2%)。其次,在模型选择上,不同CNN架构(如轻量级LightCNN-9与深层VGG-16)在计算复杂度与精度间存在权衡,需根据资源约束优化选择。最后,在构建过程中,视频采集于野外环境,分辨率、帧率和时长因设备而异,增加了预处理与对齐的难度;同时,数据标注依赖训练有素的FACS编码员,人工成本高昂,且需确保跨文化、跨设备条件下的标注一致性。此外,研究揭示增加标注主体数量比增加帧数更能提升性能,这对未来数据收集策略提出了新要求。
常用场景
经典使用场景
在面部动作单元(AU)检测领域,该大型自然主义数据集因其包含约5.5万段在自然环境下采集的视频,成为评估不同卷积神经网络(CNN)架构性能的经典基准。研究者常利用其丰富的自发面部表情和多样化的人口统计学特征,系统比较浅层与深层CNN(如VGG-16、LightCNN-29等)在AU识别中的准确率与计算开销,从而为特定应用场景下网络结构的优选提供可靠依据。
解决学术问题
该数据集有效解决了AU检测中训练设置影响不明与数据规模不足的学术难题。通过对比输入归一化、数据增强强度及类别平衡策略等训练参数,揭示了样本级归一化与过采样可提升约1-4%性能的规律。同时,它首次证实增加标注受试者数量比增加帧数更能显著改善模型泛化能力,为未来数据采集与标注策略的优化提供了关键指导。
衍生相关工作
该数据集衍生了多项经典工作,包括AM-FED与AM-FED+子集的公开,促进了跨领域AU检测研究。后续工作如SchINet利用其标注进行精神分裂症症状评估,而DeepSiamese网络则基于该数据探索时间一致性自监督学习。此外,针对其不平衡分布提出的代价敏感损失函数与多标签融合方法,已成为后续AU检测研究的基准框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务