遇见数据集

Human Understanding AI Paper Challenge 2024 Dataset

收藏
arXiv2024-03-25 更新2024-06-21 收录
官方服务:

资源简介:

Human Understanding AI Paper Challenge 2024 Dataset是由韩国电子与电信研究所创建的多模态传感器数据集,旨在通过分析日常生活中的行为数据来理解人类行为。数据集包含超过10,000小时的传感器数据,来源于22名参与者使用智能手机和智能手表的记录。数据集创建过程中,使用了多种传感器和技术来收集数据,包括加速度计、心率监测器和睡眠追踪器等。该数据集主要用于研究睡眠模式、情绪状态和压力水平,以开发能够识别这些指标的机器学习模型。

The Human Understanding AI Paper Challenge 2024 Dataset is a multimodal sensor dataset developed by the Electronics and Telecommunications Research Institute (ETRI), Republic of Korea. It is designed to gain insights into human behavior through the analysis of daily behavioral data. The dataset contains over 10,000 hours of sensor data collected from 22 participants using their smartphones and smartwatches. During the dataset's development, a range of sensors and technologies were employed for data collection, including accelerometers, heart rate monitors, sleep trackers, and other related devices. This dataset is primarily used for research on sleep patterns, emotional states, and stress levels, with the aim of developing machine learning models that can recognize these indicators.

创建时间:
2024-03-25
搜集汇总
数据集介绍
Human Understanding AI Paper Challenge 2024 Dataset 数据集图片
构建方式
该数据集源自2020年至2023年间对22名参与者的长期生活日志采集,涵盖智能手机、智能手表及睡眠传感器等多模态数据。训练集基于2020年采集的508天数据,验证集与测试集则分别来自2023年新招募的4名参与者,各包含105天和115天的记录。所有数据通过统一协议收集,并经过标准化处理,以形成可用于机器学习模型训练的独立变量(X)与依赖变量(Y)。
特点
数据集以七项二分类指标为核心,包括主观睡眠质量(Q1)、睡前情绪(Q2)、压力水平(Q3),以及基于国家睡眠基金会指南的客观睡眠指标(S1至S4)。其独特之处在于训练集与验证/测试集参与者不同,且后者包含更丰富的传感器数据(如环境光强、声音标签),同时允许大量缺失值存在,更贴近真实场景。
使用方法
参与者需利用智能手机和智能手表传感器数据作为输入特征,训练模型以预测每日的七项二分类指标。最终提交结果需以CSV格式呈现,包含参与者ID、日期及对应指标的二元值(0或1)。评估采用宏F1分数对各指标分别计算后取平均,但各指标权重可能随竞赛规则调整,需关注官方公告以优化模型策略。
背景与挑战
背景概述
人类日常行为的复杂性源于多模态感知数据与主观记录的深度交织,如何从海量生活日志中挖掘睡眠、情绪与压力的内在规律,成为人工智能领域的前沿课题。2024年,韩国电子通信研究院(ETRI)的Se Won Oh、Hyuntae Jeong等研究人员在第三届Human Understanding AI Paper Challenge中发布了该数据集,旨在推动基于智能设备传感数据的学习模型研究。核心问题聚焦于从智能手机与智能手表采集的加速度、心率、GPS及应用使用等多维数据中,推断睡眠质量、情绪状态与压力水平等七项二分类指标。该数据集整合了2020年与2023年两阶段收集的超过10,000小时传感数据,涵盖26名参与者的日常记录,为行为理解研究提供了跨时间、跨设备的真实场景基准,对可穿戴计算与健康监测领域具有显著影响力。
当前挑战
该数据集面临的核心挑战在于多源异构传感数据的融合与不完整性问题。首先,训练集与验证/测试集在采集年份、设备型号(如Empatica E4与Galaxy Watch)及采样频率上存在差异,导致特征分布偏移,需设计域适应或标准化策略以提升模型泛化能力。其次,验证与测试集存在大量缺失数据,如GPS坐标与光强记录的稀疏性,要求模型具备鲁棒的空值处理机制。此外,主观问卷与客观传感器数据的对齐是另一个难点,睡眠质量、情绪等指标基于个体均值二值化,但个体间基线差异显著,需引入个性化校准。最后,七项分类任务的类别不平衡问题突出,例如睡眠效率低于平均的天数可能远少于高于平均的天数,需采用重采样或代价敏感学习方法以优化宏观F1分数。
常用场景
经典使用场景
该数据集的核心应用场景在于利用智能手机与智能手表采集的多模态传感器数据,构建能够推断个体每日睡眠质量、情绪状态与压力水平的机器学习模型。研究者通过处理加速度计、心率、GPS、环境光强、活动类别及应用使用统计等时序数据,结合每日自评问卷与睡眠传感器记录,开展七项二分类任务,涵盖主观睡眠感知(Q1)、睡前情绪(Q2)、睡前压力(Q3)以及客观睡眠指标如总睡眠时间(S1)、睡眠效率(S2)、入睡潜伏期(S3)和醒后清醒时间(S4)。该场景强调跨设备数据融合与时间对齐,尤其适用于处理真实环境下数据缺失与采样频率不一致的挑战。
解决学术问题
该数据集旨在解决从可穿戴传感器中鲁棒推断日常心理生理状态的学术难题,特别是如何将非结构化的多模态时序数据映射至离散的睡眠与情绪标签。它推动了针对个体差异的个性化模型研究,例如利用跨参与者泛化能力评估模型在未见人群中的表现。此外,数据集通过引入2020年与2023年两阶段采集的异构数据,促进了领域自适应与迁移学习方法的发展,以应对传感器配置变化与分布漂移问题。其意义在于为计算行为科学提供标准化基准,助力探索日常经历对睡眠与情绪影响的因果机制,并推动可解释AI在健康监测中的应用。
衍生相关工作
该数据集衍生了一系列基于时序特征工程与深度学习架构的经典工作,包括利用Transformer模型捕捉传感器序列的长程依赖关系以预测睡眠阶段,以及采用对比学习框架从无标签数据中提取通用行为表征,再微调至七项分类任务。研究者还开发了多任务学习模型,联合优化睡眠与情绪预测以利用任务间的互补信息。此外,基于图神经网络的方法被提出以建模传感器通道间的空间关联性。在迁移学习方面,涌现出适应2020年与2023年数据分布差异的域对抗训练技术。这些工作不仅提升了预测精度,还为可穿戴健康分析领域奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务