MMSU
收藏资源简介:
MMSU(大规模多任务口语语言理解和推理基准)是一个综合性基准,用于评估多模态模型中的细粒度口语语言理解和推理能力。它通过47个子任务系统地捕捉日常语音中真实世界语言现象的变化,包括语音学、韵律学、修辞学、句法学、语义学和副语言学,涵盖感知和高级推理能力。该基准包含5000个精心策划的音频-问题-答案对,源自多样化的真实录音。
MMSU (Massive Multitask Spoken Language Understanding and Reasoning Benchmark) is a comprehensive benchmark designed to evaluate fine-grained spoken language understanding and reasoning capabilities in multimodal models. It systematically captures the variations of real-world linguistic phenomena in daily speech across 47 subtasks, covering phonetics, prosody, rhetoric, syntax, semantics, and paralinguistics, and encompasses both perceptual and advanced reasoning abilities. This benchmark contains 5,000 carefully curated audio-question-answer pairs derived from diverse real-world recordings.
MMSU 数据集概述
数据集基本信息
- 数据集名称:MMSU (Massive Multi-task Spoken Language Understanding and Reasoning Benchmark)
- 发布状态:已被 ICLR 2026 接收。
- 数据来源:基于多样化的真实录音构建。
- 数据规模:包含 5,000 个精心策划的音频-问题-答案对。
- 获取地址:https://huggingface.co/datasets/ddwang2000/MMSU
数据集核心目标
MMSU 是一个用于评估多模态模型细粒度口语理解和推理能力的综合性基准。它通过涵盖语音学、韵律学、修辞学、句法学、语义学和副语言学等 47 个子任务,系统地捕捉了日常语音中真实世界语言现象的多样性,横跨感知和高层次推理能力。
任务分类体系
MMSU 采用三级分类法组织任务和评估维度:
- 第一级:区分感知能力与推理能力。
- 第二级:
- 感知与推理能力均被划分为语言学和副语言学。
- 语言学关注语言结构、意义和使用。
- 副语言学捕捉影响解释的声学特征,如情感、音高和音量。
- 第三级:
- 语言学进一步分为语义学(意义和上下文理解)和音系学(声音模式,如音调和韵律)。
- 副语言学分为说话者特质(反映固有的声音特征)和说话风格(捕捉可变的表达元素)。
评估内容与排行榜
- 评估领域:在语义学、音系学和副语言学领域,对多模态模型的感知与推理维度进行评估。
- 排行榜:提供了包括 Gemini-1.5-Pro、Qwen2.5-Omni-7B、Kimi-Audio 在内的多个模型的详细性能对比(平均分及各子领域得分)。
- 提交与更新:排行榜将持续更新,欢迎提交结果至联系邮箱:dingdongwang@link.cuhk.edu.hk。
使用与评估流程
-
模型推理:使用提供的脚本在 MMSU 基准上进行推理,数据集会自动从 Hugging Face 加载。用户需修改
mmsu_inference.py以集成自己的模型。 bash python mmsu_inference.py --output_jsonl model_pred.jsonl -
基准评估:使用评估脚本对推理结果进行评估。 bash python mmsu_evaluation.py model_pred.jsonl
相关资源
- 论文地址:https://arxiv.org/pdf/2506.04779
- 音频演示页面:https://ddw.github.io/mmsu_homepage/
引用格式
@article{wang2025mmsu, title={MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark}, author={Dingdong Wang and Jincenzi Wu and Junan Li and Dongchao Yang and Xueyuan Chen and Tianhua Zhang and Helen Meng}, journal={arXiv preprint arXiv:2506.04779}, year={2025}, }




