遇见数据集

Read My Mind

收藏
arXiv2023-03-07 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

Read My Mind是一个大规模的多模态视频数据集,旨在通过对象-上下文关系预测人类信念,以促进人机交互领域的发展。该数据集包含900个视频,总计347,490帧,涉及15个不同的上下文,通过非言语沟通信号如眼神、手势、姿态等捕捉人类行为。数据集的创建涉及使用多种技术如对象检测、姿态估计和眼神追踪,以精确标注参与者的隐含信念。此数据集的应用领域主要集中在理解和预测人类信念,以优化人机协作环境中的互动效率。

Read My Mind is a large-scale multimodal video dataset that predicts human beliefs via object-context relationships, with the goal of advancing the field of human-computer interaction. Comprising 900 videos totaling 347,490 frames, the dataset covers 15 distinct contexts and captures human behaviors through nonverbal communication cues such as eye gaze, gestures, and postures. The construction of this dataset utilizes multiple technologies including object detection, pose estimation, and eye tracking to accurately annotate the implicit beliefs of participating subjects. The primary application scenarios of this dataset focus on understanding and predicting human beliefs, so as to optimize interaction efficiency in human-computer collaboration environments.

提供机构:
新加坡国立大学
创建时间:
2023-03-07
搜集汇总
数据集介绍
Read My Mind 数据集图片
构建方式
在人类协作中,理解他人意图是实现高效人机交互的核心。为此,我们构建了Read My Mind数据集,聚焦于基于物体-情境关系的人类信念预测。数据采集涉及10对参与者(5对朋友与5对陌生人),在15种不同情境中完成。每对参与者中,演示者获得隐含情境任务并选择相关物体,通过非言语方式向预测者传达意图,预测者则需推断任务并选出对应工具。实验全程使用降噪耳麦记录参与者的口头信念更新,并借助Leap Motion采集手势数据,同时通过后处理方式整合了物体检测(基于Detecto)、姿态估计(OpenPose)与视线追踪(Gaze360)等多模态信息。最终从900个第一人称与第三人称视频中提取了347,490帧标注帧,形成了约3.2小时的视频数据。
特点
该数据集的核心特点在于其多模态性与情境驱动的设计。每个视频序列平均时长约8秒(250帧,30fps),同步记录了音频与视觉信息。通过构建物体-情境关系矩阵,数据集精确映射了不同情境下物体与上下文的关联频率,可作为先验知识用于模型训练。此外,数据涵盖了朋友与陌生人两种社会关系,为研究社会认知差异提供了独特视角。非言语交流(如手势、视线、姿态)与隐含信念的同步标注,使得模型能够学习从细微线索中推断他人心理状态,挑战了传统意图预测任务的边界。
使用方法
该数据集适用于训练和评估基于视频的人类信念预测模型。研究者可利用提供的多模态标注(物体、姿态、视线、手势)作为输入,设计端到端或分步推理框架。物体-情境关系矩阵可作为先验知识嵌入模型,增强对上下文的理解。建议将数据划分为训练集与测试集,通过预测者最终选择的工具与真实情境任务的一致性来评估模型性能。此外,可结合对比学习或注意力机制,探索不同社会关系(朋友vs陌生人)对信念推断的影响,或利用音频信息辅助非言语线索的解析,推动人机交互领域的发展。
背景与挑战
背景概述
在人类-机器人交互领域中,理解他人意图是实现高效协作的关键,而这通常依赖于对非言语沟通信号(如目光、姿态和物体-情境关系)的推断。2023年,由华盛顿大学、新加坡国立大学及新加坡A*STAR前沿人工智能研究中心的研究人员共同构建了名为“Read My Mind”的大规模多模态视频数据集,旨在推动人工智能系统对人类信念预测能力的发展。该数据集包含来自10对参与者(朋友与陌生人各半)在15种不同情境下录制的900段第一人称与第三人称视频,共计约3.2小时、347,490帧经过精细标注的影像。核心研究问题聚焦于如何通过物体-情境关系矩阵,使智能体能够从非言语行为中推断人类隐含信念,为协作式人机交互提供了重要的基准资源。
当前挑战
该数据集所面临的挑战主要体现在两个层面。其一,在领域问题层面,人类信念预测本身具有高度复杂性和不确定性,不同于传统的图像分类或动作识别,它要求模型理解隐式的社会认知信号,并整合多模态信息(如目光、手势、姿态及物体上下文),这超越了现有视觉模型的推理能力。其二,在数据构建过程中,研究者需要克服参与者信念状态实时标注的困难——通过让参与者佩戴降噪耳机并口头汇报信念更新来实现帧级对齐,同时需同步采集来自Leap Motion的手势数据以及通过后处理获取的物体检测、姿态估计和视线追踪等多模态信息,确保跨模态数据在时间与空间上的一致性与准确性,这对实验设计与数据处理流程提出了极高要求。
常用场景
经典使用场景
在人类-机器人交互(HRI)研究领域,理解非言语交流中的意图推断是构建智能协作系统的核心挑战。Read My Mind数据集通过多模态视频记录,捕捉了演示者与预测者在物体-上下文关系中的非言语互动行为,包括手势、目光注视、姿态和物体选择。该数据集最经典的使用场景是训练和评估AI模型从第一人称和第三人称视角视频中推断人类信念的能力,尤其是在缺乏语言线索的协作任务中。研究者可借助这些标注精确的帧序列,探索如何基于物体与上下文的关联性来预测人的隐性意图,从而推动社会认知计算的发展。
衍生相关工作
基于Read My Mind数据集,衍生出多项具有影响力的研究工作。例如,有研究利用该数据集的多模态特征(如姿态、注视和物体检测)训练端到端的信念预测网络,证明了融合上下文信息的图卷积模型在意图推断上优于纯视觉基线。另一些工作则聚焦于构建物体-上下文关系的先验知识嵌入,通过对比学习增强模型对罕见物体-任务对的泛化能力。此外,该数据集还被用于验证生成式模型(如变分自编码器)在模拟人类信念动态变化中的有效性,为探索AI的因果推理与反事实思考开辟了新路径。这些衍生工作共同推动了从感知到认知的HRI研究范式转变。
数据集最近研究
最新研究方向
在人工智能与机器人协作日益紧密的当下,理解人类意图成为人机交互领域的核心挑战。Read My Mind数据集通过大规模多模态视频与精细的物体-情境关系标注,为推断人类信念开辟了前沿研究方向。该数据集聚焦于非语言交流信号(如目光、手势、姿态)在隐含任务传递中的作用,结合了自我中心视角与第三人称视角的同步记录,并利用Leap Motion、Gaze360和OpenPose等技术提取手势、注视与姿态数据。这一资源推动了一系列热点研究,包括基于物体-情境关系矩阵的信念预测模型、跨模态意图推理算法,以及在人机协作中实现更自然交互的AI系统。其意义在于,它不仅填补了非语言信念推断数据集的空白,还为构建具备社会认知能力的智能体提供了关键基准,有望在制造、医疗和服务等领域实现更高效、直觉化的人机协同。
相关研究论文
  • 1
    Read My Mind: A Multi-Modal Dataset for Human Belief Prediction新加坡国立大学 · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务