遇见数据集

wbxlala/Dreamer_Arousal_shuffled

收藏
Hugging Face2023-11-19 更新2024-03-04 收录
官方服务:

资源简介:

--- dataset_info: features: - name: image sequence: sequence: sequence: float64 - name: label dtype: float64 splits: - name: train num_bytes: 499671504.0 num_examples: 414 download_size: 492836658 dataset_size: 499671504.0 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息: 特征: - 名称:图像(image),结构为三层嵌套序列,元素类型为64位浮点型(float64) - 名称:标签(label),数据类型为64位浮点型(float64) 数据集划分: - 划分名称:训练集(train),占用字节数:499671504.0,样本数量:414 下载大小:492836658 数据集总大小:499671504.0 配置项: - 配置名称:默认配置(default),数据文件: - 对应划分:训练集(train),文件路径:data/train-*

提供机构:
wbxlala
原始信息汇总

数据集概述

特征信息

  • 图像
    • 数据类型:float64
  • 标签
    • 数据类型:float64

数据分割

  • 训练集
    • 样本数量:414
    • 数据大小:499671504.0 字节

数据集大小

  • 下载大小:492836658 字节
  • 实际大小:499671504.0 字节

配置信息

  • 默认配置
    • 数据文件路径:data/train-*
搜集汇总
数据集介绍
wbxlala/Dreamer_Arousal_shuffled 数据集图片
构建方式
在情感神经科学与计算机视觉的交叉领域中,唤醒度(Arousal)作为情感维度理论的核心指标,其量化建模对多模态情感计算研究至关重要。Dreamer_Arousal_shuffled数据集基于公开的Dreamer脑电-面部表情同步数据集进行重构,通过将原始脑电信号对应的唤醒度标签与面部图像序列进行随机配对,构建了包含414个训练样本的跨模态对齐数据集。每个样本由一组时序连续的64×64像素灰度图像序列构成,标签为浮点型唤醒度值,数据以标准HuggingFace数据集格式存储于Parquet文件中。
特点
该数据集的核心特点在于其独特的随机化设计策略,通过打乱原始数据中的脑电-面部对应关系,有效打破了模态间的固有耦合,为研究面部视觉特征与唤醒度标签间的统计关联提供了去偏基准。414个样本规模虽小,但每个样本包含完整的时序图像序列,保留了动态面部表情的时空结构信息。标签采用连续浮点值而非离散类别,更符合唤醒度的连续心理物理属性,便于进行回归任务建模。
使用方法
使用时可通过HuggingFace Datasets库的load_dataset函数直接加载,指定配置名为'default'即可获取训练集。数据以图像序列形式组织,适合采用3D卷积网络或时序Transformer等架构进行时空特征提取。建议将浮点型标签进行Z-score标准化处理以加速模型收敛,可依据任务需求对时序长度进行采样或插值。由于样本量有限,推荐使用迁移学习或数据增强策略提升模型泛化能力,并采用交叉验证方式评估唤醒度预测性能。
背景与挑战
背景概述
在情感计算与脑机接口领域,梦境情绪的量化分析一直是研究的前沿课题。Dreamer_Arousal_shuffled数据集由wbxlala团队于近期构建,专注于记录梦境诱发的大脑皮层电信号与对应的唤醒度标签,核心研究问题在于探索脑电信号与主观情绪唤醒水平之间的映射关系。该数据集包含414个训练样本,每个样本以高维时间序列图像形式呈现,为深度学习模型提供了独特的训练素材。其发布有望推动情绪解码、睡眠监测及人机交互等方向的发展,尤其在非侵入式情感识别技术中具有重要参考价值。
当前挑战
当前数据集面临的首要挑战在于样本量有限(仅414例),难以支撑大规模深度神经网络的泛化训练,易导致过拟合现象。其次,脑电信号本身具有高噪声与个体差异性,构建过程中如何从原始记录中提取稳定、可重复的特征并清洗伪迹,是数据预处理的关键难点。此外,唤醒度标签的连续浮点值标注依赖主观报告,不同受试者的评分标准差异增加了标签一致性的维护难度,制约了模型在跨个体场景下的鲁棒性。
常用场景
经典使用场景
在情感神经科学与脑机接口领域,Dreamer_Arousal_shuffled数据集以EEG脑电信号为媒介,捕捉受试者在观看情感视频片段时的生理反应,其核心应用在于构建基于脑电的唤醒度预测模型。研究人员利用该数据集的图像序列特征与连续型唤醒度标签,训练深度学习架构如卷积神经网络或循环神经网络,以解码大脑活动与情感唤醒水平之间的非线性映射关系。由于标签经过随机打乱处理,该数据集特别适用于探索模型对无关噪声的鲁棒性,以及验证特征提取方法在对抗过拟合时的有效性,从而推动情感计算中弱监督或自监督学习范式的发展。
衍生相关工作
围绕Dreamer_Arousal_shuffled数据集,学术界已衍生出若干经典研究方向。在特征工程方面,研究者提出了基于多频段功率谱密度与微分熵的融合表示方法,显著提升了唤醒度回归精度。在模型架构领域,引入了注意力机制与图卷积网络,以捕捉脑区之间的功能连接动态。此外,该数据集催生了关于标签噪声建模的理论工作,如将贝叶斯深度学习与噪声转移矩阵相结合,以校正打乱标签带来的偏差。这些工作不仅深化了对EEG情感解码机理的理解,也为跨数据集迁移学习提供了鲁棒性更强的预训练范式。
数据集最近研究
最新研究方向
该数据集聚焦于梦境诱发脑电信号中 arousal(觉醒度)的动态表征研究,属于情感神经科学与睡眠计算的前沿交叉领域。当前热点方向包括利用深度学习模型从高维脑电序列中提取与 arousal 状态相关的时空特征,以探索梦境意识与情绪调控的神经机制。该数据集通过提供经过洗牌处理的标准化训练样本,为验证模型在非平稳脑电数据上的泛化能力与去偏鲁棒性提供了关键基准,对推动情感脑机接口在睡眠监测与梦境干预中的实际应用具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务