遇见数据集

CARE v1.0 (Conversational Audio-visual Recordings of health Experiences)

收藏
arXiv2026-07-29 更新2026-07-30 收录
数据链接:
官方服务:

资源简介:

CARE v1.0是由瓦伦西亚理工大学等机构联合构建的多模态健康交流数据集,旨在通过视频访谈记录支持语音和非语言行为的计算分析。该数据集包含4281个短视频片段,总计约144小时,涵盖612名参与者,涉及哮喘、慢性疼痛、抑郁症等12种医疗状况及对照组,数据源自HEXI平台的公开访谈档案,并提供了语音、面部活动、凝视模式和身体运动的预计算多模态描述符。数据集的创建过程包括从HEXI平台筛选相关医疗条件和参与者,并利用大型语言模型自动提取结构化元数据,如药物使用和情感表达。该数据集主要应用于自动疾病检测、症状监测、情感语境下的多模态建模,以及疾病轨迹和应对过程的计算研究,致力于推动数字生物标志物在神经、精神和呼吸系统疾病中的创新应用。

CARE v1.0 is a multimodal health communication dataset jointly constructed by the Universitat Politècnica de València and other institutions, aiming to support computational analysis of speech and non-verbal behaviors through video interview recordings. This dataset includes 4,281 short video clips, totaling approximately 144 hours, covering 612 participants, and involves 12 medical conditions such as asthma, chronic pain, and depression, as well as a control group. The data is sourced from public interview archives on the HEXI platform, and provides pre-computed multimodal descriptors for speech, facial activities, gaze patterns, and body movements. The dataset creation process involves screening relevant medical conditions and participants from the HEXI platform, and automatically extracting structured metadata such as medication use and emotional expressions using Large Language Models (LLMs). This dataset is primarily applied in automatic disease detection, symptom monitoring, multimodal modeling in emotional contexts, as well as computational studies of disease trajectories and coping processes, and is dedicated to promoting innovative applications of digital biomarkers in neurological, psychiatric, and respiratory diseases.

创建时间:
2026-07-29
搜集汇总
数据集介绍
CARE v1.0 (Conversational Audio-visual Recordings of health Experiences) 数据集图片
构建方式
CARE v1.0数据集源自HEXI平台,该平台收集了患者与照护者关于疾病经历的访谈视频。构建过程分为两步:首先,基于文献证据筛选出与言语和非言语沟通相关的12种疾病条件(如帕金森病、抑郁症、哮喘等),并选取了照护者、丧亲者等作为对照组;其次,对每份档案进行筛选,确保至少包含一段完整视频及对应的叙述文本。随后,利用大语言模型GPT-oss-120b从叙述中自动提取结构化元数据,涵盖人口统计学、临床信息、情绪状态等字段,最终形成了包含622份档案、4281段视频片段、总计143.5小时的多模态语料库。
特点
该数据集的核心特点在于其多样性与多模态性。横跨12种疾病条件,覆盖神经运动障碍、呼吸系统疾病、慢性疼痛及精神健康障碍四大类别,且对照组由具有真实健康经历的照护者、丧亲者等构成,提供了更具语境相关性的参考群体。每个视频片段均提供预计算的语音、面部表情、注视方向、头部与身体运动等模态描述符,并结合从叙述中提取的丰富元数据(如药物使用、共病情况、情绪状态)。这种多层次、跨疾病的异构设计,为研究言语与非言语行为在健康沟通中的表征提供了前所未有的广度。
使用方法
CARE v1.0专为非商业研究用途发布,需签署数据使用协议方可获取。数据集以Hugging Face Dataset仓库形式分发,包含样本级与档案级元数据CSV文件、预计算的多模态特征(约119GB),以及利用LLM提取的结构化元数据。研究者在使用时,可基于提供的特征提取脚本复现管线,亦可参考附带的示例评估流程——以档案级的五折交叉验证为例,通过预防重复参与者泄漏、平衡性别分布、聚合话轮级特征等步骤,训练线性支持向量机进行分类任务。该语料库支持疾病检测、情绪建模、病程轨迹分析等多种下游应用。
背景与挑战
背景概述
CARE v1.0(Conversational Audio-visual Recordings of health Experiences)数据集由David Gimeno-Gómez、Catarina Botelho及其合作者于2026年创建,主要来自西班牙瓦伦西亚理工大学、葡萄牙INESC-ID与高等理工学院等机构。该数据集聚焦于通过多模态语音与非言语行为分析来检测和监测多种神经系统、精神及呼吸系统疾病这一快速发展的研究领域。CARE v1.0包含约144小时的短访谈视频,覆盖612名个体和12种医学病症,配有丰富的临床元数据和多模态描述符,显著促进了疾病检测、情绪建模及疾病轨迹研究的发展。其广度与异质性使其成为多模态数字生物标志物研究的重要基准资源。
当前挑战
CARE v1.0主要应对两大挑战。首先,在领域问题上,现有公开数据集普遍规模偏小、仅聚焦单一病症且局限于音频模态,缺乏对教育程度、用药、共病和情绪状态等关键混杂变量的充分记录,影响计算分析的可靠性与可解释性。其次,在构建过程中,需从HEXI平台海量访谈中筛选12种与言语和非言语沟通相关的病症,并过滤掉视频损坏、隐私受限或人工伪造的样本;同时需自动从叙述文本中提取结构化元数据,并通过大语言模型验证确保情绪类别严格限定于Ekman八类,最终实现多模态特征的一致提取与高质量标注。
常用场景
经典使用场景
CARE v1.0数据集作为多模态健康交流研究的标杆性资源,其最经典的使用场景在于自动检测与监测多种神经、精神及呼吸系统疾病。研究者可借助其中长达144小时的视频访谈记录,利用语音、面部表情、视线方向及身体动作的预计算描述符,构建跨病种的计算模型,实现诸如帕金森病、抑郁症、新冠肺炎等12种医学状况的自动分类与症状严重度评估,尤其适用于在情感负荷较高的对话情境下分析言语与非言语行为的协同变化。
实际应用
在实际应用中,CARE v1.0可直接服务于远程医疗与数字健康监测平台的开发。基于其预计算的多模态特征,医疗机构可训练轻量级模型,用于自动筛查帕金森病患者的面部运动减退(hypomimia)、抑郁症患者的异常注视模式或精神分裂症患者的情绪表达减弱。该数据集还可辅助设计智能语音助手,在患者与医生的对话中实时捕捉言语流利度与肢体语言的微妙变化,为早期干预与疗效评估提供量化依据。
衍生相关工作
CARE v1.0的发布已催生了一系列衍生研究,包括基于跨病种多模态特征的迁移学习方法,用于在数据稀缺条件下提升少数病种的分类性能;利用LLM从叙述文本中自动抽取结构化元数据的工作流,亦为可解释性分析树立了范本。此外,该数据集还推动了面向情感识别与对话分析的基线模型更新,例如结合XLS-R语音嵌入与EmoNet面部表征的联合分类框架,以及与HEXI平台伦理规范相适应的隐私保护计算管线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务