MEDIC
收藏arXiv2025-09-30 收录
数据链接:
官方服务:
资源简介:
该数据集包含71,198张图片,分为七大类别:地震、火灾、洪水、飓风、山体滑坡、其他灾害以及非灾害。在数据划分上,训练集占70%,验证集占20%,测试集占10%。经过筛选后,图片数量从71,198张减少至38,094张。在规模上,筛选后有38,094张图片。该数据集的任务是多模态灾害分类。
This dataset contains 71,198 images, which are classified into seven major categories: earthquakes, wildfires, floods, hurricanes, landslides, other disasters, and non-disaster samples. Regarding data splitting, 70% of the total data is assigned to the training set, 20% to the validation set, and the remaining 10% to the test set. After filtering, the number of images was reduced from 71,198 to 38,094, which is the final size of the dataset. The task of this dataset is multimodal disaster classification.
提供机构:
CrisisMMD, AIDR, DMD搜集汇总
数据集介绍

构建方式
在心理治疗领域,共情是咨访互动成功的基石,然而此前缺乏面向计算方法的共情理解多模态数据集。MEDIC数据集正是为填补这一空白而构建,其数据源自UM心理学咨询案例视频,涵盖婚姻关系、职业困境、家庭教育等多种主题。原始视频经人工去除隐私信息后,依据对话轮次进行裁剪,每个轮次对应一个样本,共计771个视频片段。每个样本同时包含文本、音频与视觉三种模态:文本通过语音识别工具提取并人工校对,音频提取MFCC特征,视觉则利用OpenPose提取面部、躯干与手臂的关键点坐标以保护隐私。最终,数据集包含约11小时、总计678分钟的视频内容,平均每个样本时长约53秒。
使用方法
MEDIC数据集适用于多模态共情预测任务,研究者可基于提供的视觉关键点、音频MFCC特征及文本BERT嵌入,构建分类模型来预测EE、ER与CR三类标签。论文中已建立了三个基线模型——张量融合网络(TFN)、情感词感知融合网络(SWAFN)及简单拼接模型,并进行了消融实验。实验结果表明,三模态融合的效果优于双模态或单模态,其中文本模态贡献最为显著,视觉与音频模态也提供了重要补充。数据集按7:1:2划分为训练集、验证集与测试集,评估指标采用平均准确率与宏平均F1分数。该数据集已公开,可供学术研究使用。
背景与挑战
背景概述
在心理治疗领域,共情能力是咨询师与来访者建立有效治疗联盟的基石,其对于促进积极治疗结果具有不可替代的作用。然而,现有计算模型对共情的理解多局限于文本或音频等单一模态,难以捕捉面对面咨询中丰富的非语言信息,如面部表情、肢体动作与语音韵律等。为弥补这一空白,Zhou’an Zhu等人于2023年构建了MEDIC数据集,该数据集由来自中国UM心理学咨询案例视频的771个轮次对话片段组成,涵盖文本、音频与视觉三大模态。研究团队创新性地提出了三种标注维度——经历表达、情绪反应与认知反应,以全面刻画咨询师与来访者之间的共情互动。MEDIC数据集的发布为计算心理学领域提供了首个多模态共情基准资源,推动了从单一文本分析向多模态融合理解的范式转变,对自动化共情评估与人机交互研究具有重要影响。
当前挑战
MEDIC数据集面临的核心挑战源自于共情这一概念的复杂性与多维度本质。首先,共情包含认知与情绪双方面,现有评估量表如MISC与MITI多侧重于认知共情,而忽视情绪维度,MEDIC需设计兼顾两者的标注体系,确保标签的区分度与可靠性。其次,数据收集与处理过程中存在隐私保护与伦理问题,原始视频需经脱敏处理(如去除个人信息、使用OpenPose提取关键点而非原始图像),这增加了数据预处理的难度。此外,多模态数据(文本、音频、视觉)的同步与对齐要求高精度的技术手段,而各模态特征提取(如BERT、MFCC、OpenPose)的融合策略仍需优化。最后,数据样本量有限(771个轮次)且类别分布不均(如情绪反应标签中无表达占比60%),导致模型在少量样本类别上泛化能力不足,需借助重采样或焦点损失等方法缓解不平衡问题。
常用场景
经典使用场景
MEDIC数据集为心理咨询领域中多模态共情理解提供了开创性的基准资源。该数据集聚焦于面对面心理咨询场景,通过采集771段包含文本、音频与视觉模态的对话片段,并引入表达体验、情绪反应与认知反应三个标注维度,系统刻画了咨询师与来访者之间的共情动态。研究者可基于此数据集开展多模态融合的共情预测任务,利用张量融合网络、情感词感知融合网络等典型模型,探索不同模态信息在共情识别中的互补作用,从而推动计算心理学在真实咨询情境中的发展。
解决学术问题
MEDIC数据集有效填补了心理咨询领域缺乏多模态共情标注数据的空白,解决了以往研究仅依赖文本或音频模态、忽视视觉线索(如面部表情与身体姿态)的局限性。通过提出兼顾情绪共情与认知共情的三标签标注体系,该数据集克服了传统MISC与MITI量表仅关注认知层面的不足,为细粒度、多维度共情建模提供了可靠标注。其高标注一致性(ICC与Fleiss' Kappa均达良好水平)确保了数据质量,使得共情预测任务得以在真实咨询场景中实现,显著提升了计算模型对复杂共情现象的理解能力。
实际应用
在实际应用中,MEDIC数据集可赋能智能心理咨询辅助系统的开发,例如通过实时分析咨询对话的多模态信号,自动评估咨询师的共情水平,并提供即时反馈以优化治疗过程。此外,该数据集还可用于培训新手咨询师,通过模拟共情交互场景帮助其提升情绪识别与认知回应能力。在远程心理服务平台中,基于MEDIC训练的模型能够监测咨询质量,识别来访者的情绪表达强度,从而促进更精准、更具支持性的心理健康干预,降低因共情不足导致的治疗中断风险。
数据集最近研究
最新研究方向
在当前心理健康领域对计算共情理解日益迫切的需求背景下,MEDIC数据集作为首个面向心理咨询场景的多模态共情数据集,开辟了融合视觉、音频与文本模态进行共情预测的前沿方向。该数据集创新性地提出了体验表达、情绪反应与认知反应三维标签体系,精准刻画了咨询双方在对话轮次中的共情动态。其研究不仅验证了多模态融合在共情预测中的显著优势,尤其揭示了文本模态承载的核心语义价值与视觉模态对情绪反应的补充作用,还通过标注可靠性分析确认了专业咨询师倾向于认知共情而非情绪共情的临床现象。这一工作为计算精神病学中自动化共情评估系统的开发奠定了关键数据基础,推动了智能心理干预技术向更精细化、多维度理解人类情感交互的方向演进。
相关研究论文
- 1MEDIC: A Multimodal Empathy Dataset in CounselingUM心理学 · 2023年
以上内容由遇见数据集搜集并总结生成



