遇见数据集

Multi-Modal-Anxiety-Dataset

收藏
Hugging Face2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

HCFSLN是一个多模态生理与行为特征数据集,主要用于情感计算或状态识别相关研究。数据集以结构化文件夹形式组织,核心数据位于Dataset/M2AD目录下,包含四种模态的特征数据:音频特征(使用librosa提取的频谱、时域和频域特征)、皮肤电活动特征(EDA,包含皮肤电导水平和峰值)、光电容积脉搏波特征(PPG,使用NeuroKit处理的清洁信号)以及视频特征(使用OpenFace从原始视频中提取的面部动作单元、头部姿态和眼动注视特征)。所有特征数据均以CSV文件存储,遵循统一命名规范(如P7_audio_features.csv),通过参与者标识符确保不同模态数据的对齐。标签信息由独立的Label.csv文件提供,包含参与者标识和实验条件。数据集还提供了完整的特征提取代码(Jupyter Notebook)、多种基线模型实现以及作者提出的HCFSLN模型,支持消融实验。使用前需安装librosa、NeuroKit等依赖库,并按照指定文件夹结构放置特征文件和标签。

创建时间:
2026-07-21
原始信息汇总

数据集概述

  • 数据集名称:Multi-Modal Anxiety Dataset(M2AD)
  • 许可证:CC-BY-NC-4.0
  • 用途:多模态焦虑分析研究

数据集结构

数据集根目录结构如下:

HCFSLN ├── Code ├── Dataset ├── Feature_Extraction └── readme.txt

Dataset 文件夹内部结构

Dataset → M2AD → Audio, EDA, PPG, Video, Label.csv

  • Audio:包含使用 librosa 提取的频谱、时域和频域特征。
  • EDA:包含皮肤电导水平(SCL)和峰值数据。
  • PPG:包含使用 NeuroKit 处理的干净 PPG 信号。
  • Video:包含使用 OpenFace 提取的面部表情特征,如行动单元(AUs)、头部姿态和视线方向。
  • Label.csv:提供参与者标识符和实验条件。

文件命名规范

每个 CSV 文件遵循标准化命名约定,例如 P7_audio_features.csv。其中 P7 为参与者标识符,便于跨模态关联。示例:

  • P7_audio_features.csv:参与者 P7 的音频特征
  • P7_video_features.csv:参与者 P7 的视频特征
  • P7_eda_features.csvP7_ppg_features.csv 同理

特征提取

提供 Jupyter notebook 进行特征提取:

  • Audio_Features_Extraction.ipynb:使用 librosa 提取音频特征。
  • EDA_Cleaning_Components.ipynb:使用 NeuroKit 处理 EDA 信号。
  • PPG_Cleaning.ipynb:提取 PPG 信号。

视频特征使用 OpenFace(仓库地址:https://github.com/TadasBaltrusaitis/OpenFace)从原始视频文件中提取,需提供完整数据集路径。

提取的文件需保存在 Feature_Extraction 目录下的指定文件夹中。

代码部分

Code 文件夹包含:

  • 基线模型和提出的模型实现
  • 工具脚本(utils.py)、运行脚本(runner.py)和配置文件(config.py)

config.py 用于设置参数和选择特征列表。每个模型 .py 文件也会初始化自身参数。

基线模型:cplnet.py、emotracer.py、eshms.py、hyperboliccontrastive.py、nohub.py、tamnet.py。

评估与绘图:所有绘图和评估代码位于 utils.py 中,主执行由 runner.py 处理。

config.py 中需设置的重要路径

  • ROOT_DATA = "":存储数据集子文件夹(如 D1、D2、D3)的根目录
  • RESULTS_ROOT = "results":每次运行的详细结果目录(如 CSV、t-SNE 图)
  • FINAL_ROOT = "final":汇总最终结果的目录

提出的模型(HCFSLN)

运行 hcfsln.py 以单独存储结果。需分别提供每个模态文件夹和标签 CSV 的路径,例如:

python audio_folder = /home/Audio eda_folder = /home/EDA ppg_folder = /home/PPG video_folder = /home/Video labels_path = /home/Label.csv

消融实验

消融实验需在 hcfsln_ablation.py 中设置数据集路径并运行,所有消融实验均包含在该文件中。

使用指南

  • 处理前安装所需依赖库(librosa、NeuroKit)。
  • 在运行模型前,将提取的特征和标签放置在正确的文件夹结构中。
  • 使用本工作时请引用相关工具和数据集。
搜集汇总
数据集介绍
Multi-Modal-Anxiety-Dataset 数据集图片
构建方式
Multi-Modal-Anxiety-Dataset(M2AD)是一个多模态焦虑数据集,旨在通过整合生理与行为信号来捕捉焦虑状态。该数据集从音频、皮肤电导(EDA)、光电容积脉搏波(PPG)和视频四个模态进行特征提取。音频特征通过librosa提取频谱、时域和频域信息;EDA信号利用NeuroKit处理得到皮肤电导水平与峰值;PPG信号经NeuroKit清洗后保留干净的波形;视频特征则借助OpenFace提取面部动作单元、头部姿态和视线方向。所有特征文件与标签文件按标准化命名规则存储,如“P7_audio_features.csv”,其中P7表示参与者编号,便于跨模态关联。数据集文件夹结构清晰,包含Audio、EDA、PPG、Video子文件夹及标签文件Label.csv,为模型训练提供了规范化输入。
特点
该数据集的核心特点在于其多模态融合的设计,能够从视听及生理信号中全面反映焦虑状态。数据组织方式高度结构化,每个参与者的特征文件以统一前缀命名,简化了跨模态数据对齐过程。特征提取流程依托成熟工具(librosa、NeuroKit、OpenFace),确保信号处理的专业性和可复现性。此外,数据集附带了基准模型与提出的HCFSLN模型实现,支持多种深度学习架构的对比实验,如CPLNet、EmoTracer等。HCFSLN模型可通过单独配置文件灵活设定各模态路径与标签文件,便于扩展和参数调整。消融实验代码集成在同一脚本中,使得模型性能的逐级剖析成为可能。
使用方法
使用该数据集时,首先需安装librosa和NeuroKit等依赖库,并确保OpenFace环境配置正确。随后,通过提供的Jupyter笔记本分别提取音频、EDA和PPG特征,同时利用OpenFace处理原始视频文件生成视频特征。所有提取的特征应存入Feature_Extraction目录下的对应子文件夹。接着,在config.py中设置数据根目录、结果存储路径等核心参数,并根据需要选择特征列表。运行runner.py即可执行基准模型训练与评估;若使用HCFSLN模型,需在hcfsln.py中手动指定各模态文件夹与标签文件路径。消融实验同样简便,仅需在hcfsln_ablation.py中修改数据集路径后运行即可。所有结果,包括评估指标与可视化图表,均自动保存至指定目录。
背景与挑战
背景概述
随着情感计算与心理健康的交叉研究日益深入,多模态生理信号在焦虑状态识别中展现出独特价值。Multi-Modal-Anxiety-Dataset(M2AD)由研究团队构建,旨在通过整合音频、皮肤电导(EDA)、光电容积脉搏波(PPG)及面部视频等多模态数据,系统探究焦虑情绪的非侵入式量化方法。该数据集发布于CC-BY-NC-4.0许可下,其命名规范与结构化文件夹设计(如HCFSLN组织方式)为多模态特征对齐提供了标准化基础。研究核心聚焦于利用深度学习模型(如HCFSLN)融合异质模态特征,以提升焦虑状态分类的准确性与鲁棒性。M2AD的发布填补了面向焦虑研究的精细多模态数据集空白,为情感计算领域推动从实验室环境到真实应用场景的泛化能力研究提供了关键资源。
当前挑战
该数据集所解决的领域问题核心在于焦虑状态的客观量化与多模态信息融合。当前挑战包括:1)多模态数据的时间同步与特征层级对齐,由于音频、视频、EDA与PPG信号采样率各异,如何有效融合非对齐的序列特征成为模型设计难点;2)个体差异与情境干扰,如不同参与者的生理基线差异及实验环境噪声会降低模型的泛化性能;3)数据标注稀疏性与标签歧义,基于自评量表或实验条件的标签可能无法精确反映瞬时焦虑波动,导致弱监督学习问题。在构建过程中,团队需应对多源传感器数据清洗与预处理挑战,例如利用NeuroKit处理PPG信号中的运动伪迹、通过OpenFace提取面部动作单元时受光照与遮挡影响的鲁棒性,以及不同特征提取工具(librosa、OpenFace)之间的输出格式统一问题。此外,确保跨参与者(如P7标识)数据的模态完整性与隐私合规性(如CC-BY-NC许可限制)也增加了数据集构建的复杂度。
常用场景
经典使用场景
在情感计算与心理健康研究领域,多模态数据融合是理解人类情绪状态的关键途径。该数据集汇集了音频、面部表情、皮肤电导和光电容积脉搏波四种模态的特征,为探索焦虑状态的自动识别提供了标准化基准。研究者可借此构建多模态融合模型,利用语音频谱特征、面部动作单元、皮肤电导水平及脉搏信号中的时间与频率域信息,实现对焦虑水平的精细刻画与分类。这种跨模态的协同分析,不仅能够捕捉情绪表达的多维性,还为模型泛化能力的验证提供了丰富的数据基础。
衍生相关工作
该数据集衍生了一系列创新性学术工作,其中最具代表性的是基于层次化对比学习的少样本融合网络。相关工作还包括改进的多模态掩码融合策略与超图拓扑建模,它们在跨被试泛化任务中展现出优异性能。此外,研究者借鉴了情感计算领域的前沿框架如CPLNet与HyperbolicContrastive,通过引入图神经网络或双曲空间嵌入,进一步提升了数据利用效率。这些工作共同推动了多模态情感分析从实验室环境向真实动态场景的迁移,形成了丰富的方法论生态。
数据集最近研究
最新研究方向
多模态焦虑数据集(Multi-Modal-Anxiety-Dataset)的提出,标志着情感计算领域在心理健康监测方向迈出了关键一步。该数据集整合了音频、EDA、PPG与视频四种模态数据,提取了包括声学特征、皮肤电导水平、光电容积脉搏波信号以及面部动作单元在内的多维度信息,为构建融合生理信号与行为表现的焦虑识别模型提供了高保真基准。近年来,随着深度学习技术在情感识别中的广泛应用,焦虑检测的研究热点已从单一模态转向多模态融合,尤其是利用层级对比学习与超双曲空间映射等前沿方法来实现跨模态对齐与特征互补。此数据集不仅支持基线模型(如CPLNet、EmoTracker)的复现与评估,更通过提出的HCFSLN模型探索了少样本学习在临床级焦虑诊断中的潜力,其研究结果对于推动非侵入式、可穿戴设备驱动的实时情绪监测系统具有深远意义,尤其在疫情后全球心理健康危机加剧的背景下,此类数据集为开发普适、高效的焦虑筛查工具提供了数据基础与方法论支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务