MSU-Bench
收藏资源简介:
MSU-Bench是一个用于评估多说话者会话理解的综合基准,具有以说话者为中心的设计。它汇集了与会话理解相关的说话者问题,并将这些问题组织成四个难度递增的层次,共包含25个任务和超过1,200个开放式问答。这个分层框架覆盖了四个渐进层级:单说话者静态属性理解、单说话者动态属性理解、多说话者背景理解和多说话者交互理解。
MSU-Bench is a comprehensive benchmark for evaluating multi-speaker conversational understanding, featuring a speaker-centric design. It compiles speaker-related questions relevant to conversational understanding, organizes these questions into four hierarchies of increasing difficulty, and encompasses a total of 25 tasks and over 1,200 open-ended Q&A pairs. This hierarchical framework covers four progressive levels: single-speaker static attribute understanding, single-speaker dynamic attribute understanding, multi-speaker background understanding, and multi-speaker interactive understanding.
MSU-Bench 数据集概述
数据集简介
MSU-Bench 是一个专注于多说话人对话理解的综合性基准测试,采用以说话人为中心的设计。该数据集包含超过1,200个开放式问答,涵盖25个任务,分为四个难度递增的层级。
层级结构
- 单说话人静态属性理解
- 单说话人动态属性理解
- 多说话人背景理解
- 多说话人交互理解
数据概览
- 会话时长:60-120秒
- 试验数量:1232
- 说话人数量:每会话2-4人
- 语言:中文(CN)和英文(EN)
- 标注内容:
- 说话人分离
- 性别、年龄组、口音
- 情绪、语音流、音质
- 数据格式:
- 音频(.wav)
- 元数据(.json)
- 文本转录(.txt)
数据来源
| 名称 | 语言 | 领域 | 描述 | 时长 | 开源 |
|---|---|---|---|---|---|
| MDT-AD015 | EN | 电话对话 | 双人对话,含背景噪声 | 304.80分钟 | ✅ |
| CHiME-6 | EN | 远场多人对话 | 家庭晚餐场景 | 433.21分钟 | ✅ |
| R3VQA-Audio | EN | 复杂影视场景 | 含背景音乐和事件噪声 | 2470.66分钟 | ✅ |
| MDT-AA007 | CN | 近场多人对话 | 播客对话 | 378×6分钟 | ✅ |
| AliMeeting | CN | 远场会议 | 会议场景 | 252分钟 | ✅ |
| CN-Film | CN | 影视场景 | 含背景音乐和事件噪声 | 1135分钟 | ✅ |
数据集组成
MSU-Bench/ │ ├── audio/ # 原始音频文件 ├── transcripts/ # 文本转录 ├── metadata/ # 说话人属性、情绪标签等 └── examples/ # 示例对话
使用方式
-
克隆仓库 bash git clone https://github.com/ASLP-lab/MSU-Bench.git cd MSU-Bench
-
安装依赖 bash pip install -r requirements.txt
引用
bibtex @dataset{msu-bench2025, title={MSU-Bench: Towards Understanding the Conversational Multi-Speaker Scenarios}, author={Shuai Wang, Zhaokai Sun, Zhennan Lin, Chenyou Wang, Zhou Pan, Lei Xie}, year={2025}, url={https://github.com/ASLP-lab/MSU-Bench} }




