遇见数据集

VIP-MINGLE

收藏
arXiv2026-07-15 更新2026-07-17 收录
官方服务:

资源简介:

VIP-MINGLE是由纽约大学创建的多模态对话数据集,旨在研究面对面与视频会议两种环境下群体语言互动的行为差异。该数据集包含约59小时录音,涵盖32个小组的105名参与者,共计7,077个标注片段,数据来源为受控实验任务中采集的原始音视频、心理测量数据及多模态特征。数据集通过严格的被试内设计,使同一组参与者在两种环境下完成相同协作任务,从而支持跨环境的直接行为对比。该资源主要应用于多模态对话分析、人机交互建模及远程通信研究,致力于解决跨环境对话行为差异的量化问题,并为开发适应性强的群体交互模型提供关键数据支持。

VIP-MINGLE is a multimodal dialogue dataset developed by New York University, which aims to investigate the behavioral differences in group linguistic interaction between face-to-face and video conferencing environments. The dataset contains approximately 59 hours of recordings, covering 105 participants from 32 groups, with a total of 7,077 annotated segments. Its data sources include raw audio and video, psychometric data, and multimodal features collected during controlled experimental tasks. The dataset employs a strict within-subjects design, where the same group of participants complete the same collaborative tasks in both environments, thus enabling direct cross-environment behavioral comparisons. This resource is mainly applied to multimodal dialogue analysis, human-computer interaction modeling and remote communication research. It is committed to solving the problem of quantifying the differences in dialogue behaviors across environments, and provides key data support for developing robust group interaction models.

提供机构:
纽约大学
创建时间:
2026-07-15
原始信息汇总

数据集概述

  • 名称: VIP-MINGLE: A Corpus for Videoconference and In-Person Multimodal Interaction in Group Language Engagement
  • 版本: v1(2026年6月12日发布)
  • DOI: 10.5281/zenodo.20670131(代表所有版本)
  • 资源类型: 数据集
  • 发布机构: Zenodo
  • 作者/创作者:
    • Andrew Chang(数据管理者),所属机构:纽约大学
    • David Poeppel(导师),所属机构:纽约大学
  • 许可协议: Creative Commons Attribution Non Commercial No Derivatives 4.0 International
  • 状态: 未完全公开(完整数据集将在论文发表后公开)
  • 说明: 该语料库专注于在群体语言交流活动中,视频会议与面对面两种模式下的多模态交互研究。

文件信息

  • 当前仅包含一个说明文件:README.md(4.9 kB,MD5: 0f6cef93daf8676751a5018a1cc2264e)

统计数据(截至检索时,仅该版本)

  • 总浏览量: 10 次
  • 总下载量: 3 次
  • 总数据量: 14.7 kB

相关标识

  • 版本DOI: 10.5281/zenodo.20670132(v1 版本特有)
  • 索引: 收录于 OpenAIRE
  • 引用格式示例(APA): Chang, A. & Poeppel, D. (2026). VIP-MINGLE: A Corpus for Videoconference and In-Person Multimodal Interaction in Group Language Engagement [Dataset]. Zenodo. https://doi.org/10.5281/zenodo.20670132
搜集汇总
数据集介绍
VIP-MINGLE 数据集图片
构建方式
VIP-MINGLE数据集采用受试者内设计,招募105名参与者组成32个小组,每个小组在面对面和视频会议两种场景下完成相同协作任务(如改编自《家庭问答》的游戏)。面对面会议中,参与者围坐于共享会议桌,使用个人笔记本电脑与领夹麦克风,并辅以360°摄像头记录空间信息;视频会议中,参与者分别置于独立隔音房间,通过Zoom平台录制。数据集包含约59小时录音,涵盖原始音频/视频、心理测量数据、多模态处理特征(如说话人分段时间戳、转录文本、面部表情及动作单元强度)以及7,077个人工标注片段,所有数据经时间对齐与标准化处理。
特点
该数据集的核心特点在于其受试者内设计,允许直接比较相同参与者在两种场景下的行为差异,为量化通信媒介导致的领域偏移提供独特基准。数据集整合了多模态特征,包括语音时序(如话轮间隔与时长)、语言复杂度(如句法依存距离)、面部表情(通过OpenFace与DeepFace提取的3D头部姿态、视线方向及情绪概率)以及人工标注(如享受度、流畅性及中断事件)。分析揭示视频会议中话语更短、句法更简单、暂停更长,而面对面互动则表现出更丰富的表情和更高享受度,凸显跨场景行为本质差异而非简单缩放。
使用方法
研究人员可直接利用原始录音与视频进行自定义特征提取,或使用预处理特征(如说话人分段的音频、转录文本与面部表情时序)进行下游分析。数据集适用于开发跨场景对话模型,例如训练域自适应算法或量化行为偏移。推荐结合心理测量数据进行个体差异调节,并利用7,077个10秒片段的人工标注(5点李克特量表与多标签事件标注)评估模型预测的享受度与流畅性。所有数据及脚本可通过Zenodo(DOI: 10.5281/zenodo.20670131)获取,支持PyTorch、OpenFace等工具进行复现与扩展。
背景与挑战
背景概述
VIP-MINGLE数据集由纽约大学Andrew Chang、David Poeppel、Dustin Freeman等研究人员于2026年创建,旨在弥合面对面交流与远程视频会议两种场景下多模态对话研究的鸿沟。该数据集包含32组共105名参与者的59小时录音录像,采用受试者内设计,使得同一组参与者在两种环境下完成相同的协作任务。核心研究问题在于量化通信媒介对群体对话行为的影响差异,并为此类跨场景建模提供根基性资源。其影响力体现在为多模态交互、社会认知及人机通信工程领域提供了首个可直接进行配对对比的高质量语料库,推动了从仅关注单一场景向理解混合沟通生态的范式转变。
当前挑战
该数据集的核心挑战在于破解跨通信场景的领域迁移难题。过往模型多依赖高保真面对面语料(如AMI、ICSI语料库),但其假设在视频会议中常失效——后者并非面对面信号的简单降质,而是呈现质的重构,如更长的话轮间隙、更简化的句式结构以及截然不同的面部表情模式。构建过程中,研究者需应对交叉串扰干扰、设备差异及参与者间距离等物理约束,还需协调两种场景下录音与特征提取流程的同步对齐。此外,任务形式的普遍性限制使得模型泛化至非游戏类自由对话时面临潜在偏差,而时序标注的信赖度与跨模态特征融合的鲁棒性亦是悬而未决的难题。
常用场景
经典使用场景
在群体交互与多模态行为分析的交叉领域中,VIP-MINGLE数据集以其独具匠心的被试内设计脱颖而出,为研究者提供了跨越面对面与视频会议两种交流模态的平行语料。该数据集适用于经典的跨场景群体对话建模任务,研究者可借此深入探究不同通信媒介如何重塑言语节奏、面部表情、句法复杂度以及交互中的打断与间隙等人际动态。通过将同一组参与者在相同协作任务下的行为数据进行严格配对比较,VIP-MINGLE为量化领域迁移效应提供了独一无二的实验平台,已成为检验和开发稳健型多模态群体交互模型的基石性资源。
实际应用
在现实应用层面,VIP-MINGLE数据集对智能通信系统的优化与人机交互设计具有直接推进行。基于其揭示的行为差异,可助力开发能够自适应检测并补偿视频会议中仪式化行为缺失的算法,从而缓解‘Zoom疲劳’现象,提升远程协作中的参与感与愉悦度。此外,该语料库还服务于教育科技与远程医疗场景,支持构建能够实时评估小组讨论质量、识别互动瓶颈的智能辅导系统。在工业界,其所提供的多模态特征与人工标注可为视频会议平台的情绪感知、智能摘要生成及非言语反馈机制的设计注入新动力,推动混合办公模式下的人机协作迈向更深层的语义理解。
衍生相关工作
VIP-MINGLE的问世已催生了一系列前沿研究方向。在方法学上,研究者借鉴其被试内设计范式,构建了能同时泛化至面对面与远程场景的对抗性域适应模型,显著提升了跨场景对话状态追踪与情感识别的鲁棒性。基于该数据集的时空对齐多模态特征,衍生出若干利用图神经网络建模群体交互拓扑结构的经典工作,实现了对群体参与度和领导力涌现的高精度预测。同时,该语料库中丰富的人工标注信息(如愉悦度、流畅度及打断事件)推动了对比学习框架在非言语行为表示学习中的应用,使模型能够在低资源标注条件下仍能捕捉到细微的交互动态,为后续研究树立了跨场景群体交互分析的新标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务