MCoRec
收藏资源简介:
MCoRec数据集由德国卡尔斯鲁厄理工学院、英国Meta AI、美国卡内基梅隆大学联合创建,旨在解决鸡尾酒会场景下的多模态语境感知识别问题。数据集包含多达八名参与者同时进行四场对话的音频和视频记录,涉及日常生活的广泛话题,如个人生活、爱好、学校、工作、娱乐、新闻和假设情境。数据收集于10个不同的室内环境中,捕捉了多样的声学和视觉条件。数据集包括150个记录会话,分为训练、开发和评估三个集合,用于评估系统的语音转录和说话者聚类能力。
The MCoRec dataset was jointly created by Karlsruhe Institute of Technology (Germany), Meta AI (UK), and Carnegie Mellon University (USA), aiming to address the problem of multimodal contextual awareness recognition in cocktail party scenarios. It contains audio and video recordings of up to eight participants engaging in four simultaneous conversations, covering a wide range of daily topics including personal life, hobbies, school, work, entertainment, news, and hypothetical situations. The data was collected across 10 distinct indoor environments, capturing diverse acoustic and visual conditions. The dataset comprises 150 recorded sessions, which are split into training, development, and evaluation sets for assessing systems' speech transcription and speaker clustering capabilities.
MCoRec数据集概述
数据集基本信息
- 数据集名称:MCoRec(Multi-Modal Context-aware Recognition)
- 所属挑战:CHiME-9 Task 1
- 数据来源:https://huggingface.co/datasets/MCoRecChallenge/MCoRec
任务目标
- 转录任务:识别并转录每个说话者的语音内容
- 聚类任务:识别属于同一对话的说话者
- 联合任务:同时完成语音转录和对话聚类
数据特征
- 多模态数据:包含360°视频和音频录制
- 并发对话:最多4个同时进行的对话,最多8个活跃说话者
- 高重叠率:语音重叠率最高可达100%
- 真实对话:非脚本化的日常话题对话
- 单一视角:从中心视角捕捉所有参与者
数据集结构
data-bin/ ├── dev/ │ ├── session_132/ │ │ ├── central_video.mp4 │ │ ├── labels/ │ │ │ ├── speaker_to_cluster.json │ │ │ ├── spk_0.vtt │ │ │ └── ... │ │ ├── metadata.json │ │ └── speakers/ │ │ ├── spk_0/ │ │ ├── spk_1/ │ │ └── ... │ └── ... ├── train/ └── eval/
文件格式说明
- speaker_to_cluster.json:说话者到对话簇的映射关系
- spk_*.vtt:WebVTT格式的说话者时间戳转录文件
- central_video.mp4:360°中心视角视频
- metadata.json:会话元数据
预处理文件
- track_xx_asd.json:主动说话者检测分数
- track_xx_lip.av.mp4:唇部区域裁剪视频
评估指标
- 说话者词错误率:单个说话者的转录准确率
- 对话聚类F1分数:说话者分组的成对F1分数
- 联合ASR-聚类错误率:转录和聚类性能的加权组合指标
数据获取
- 访问方式:需在Hugging Face申请访问权限
- 下载方式:使用Hugging Face Token通过wget命令下载
- 开发集文件:dev_without_central_videos.zip
训练数据规模
- 训练片段:89.3k个训练片段
- 验证片段:3.98k个验证片段
- 存储需求:完整数据集约需1.46 TB存储空间




