MMAU-Pro
收藏资源简介:
MMAU-Pro 是一个全面且精心策划的基准测试,用于评估人工智能系统中的音频智能。该数据集包含 5,305 个专家标注的实例,每个实例都与人类专家生成的问答对配对,涵盖了语音、声音和音乐。MMAU-Pro 在 49 个独特的技能和多个复杂维度上评估听觉智能,包括长音频理解和空间音频推理。所有问题都经过精心设计,需要深思熟虑的多跳推理,包括多项选择和开放式回答格式。音频数据直接来源于自然界的记录,而不是来自具有已知分布的现有数据集。
MMAU-Pro is a comprehensive and meticulously curated benchmark for evaluating audio intelligence in artificial intelligence systems. This dataset includes 5,305 expert-annotated instances, each paired with question-answer pairs generated by human experts, covering speech, general sounds, and music. MMAU-Pro evaluates auditory intelligence across 49 distinct skills and multiple complex dimensions, including long-form audio understanding and spatial audio reasoning. All questions are meticulously designed to require deliberate multi-hop reasoning, and support both multiple-choice and open-ended answer formats. The audio data is directly sourced from natural recordings, rather than existing datasets with known distributions.
MMAU-Pro 数据集概述
数据集简介
MMAU-Pro 是一个用于全面评估音频通用智能的综合基准测试,涵盖语音、非语音声音和音乐及其组合的音频理解能力。
核心特点
- 技能覆盖:包含49种独特技能,覆盖语音、声音、音乐及其混合领域
- 复杂维度评估:包括长音频理解、空间音频推理、多音频理解等
- 数据规模:5,305个实例,每个实例包含一个或多个音频及人工专家生成的问题-答案对
- 音频来源:直接从"野外"获取音频数据,而非来自已知分布的现有数据集
评估内容
- 语音:ASR加推理(语义、共指、意图)
- 声音:非语音事件;因果和物理推理
- 音乐:乐器、节奏、理论描述符
- 空间:双耳线索、相对位置、运动
- 多音频:混合归因、流分离
- 语音聊天:人物角色、韵律、多轮问答
- 指令跟随:受限多步任务
数据统计
- 总问答对:5,305
- 领域:语音、声音、音乐及其组合
- 多选题:包含
- 开放式问题:包含
- 平均音频长度:未明确秒数
- 长片段(3-8分钟):包含
- 超长片段(8-10分钟):包含
- 空间问答:包含
- 多音频问答:包含
- 语音STEM:包含
- 指令跟随:包含
问题分布
- 语音问题
- 声音问题
- 音乐问题
- 声音-语音问题
- 音乐-语音问题
- 声音-音乐问题
- 声音-音乐-语音问题
模型性能
在评估的22个领先开源和专有多模态AI模型中,最佳性能为:
- Gemini-2.5 Flash:59.20%准确率
- Gemini-2.0 Flash:55.70%准确率
- GPT4o-Audio:52.50%准确率
相关资源
- 论文PDF:https://sonalkum.github.io/mmau-pro
- 代码仓库:https://sonalkum.github.io/mmau-pro
- 数据集页面:https://sonalkum.github.io/mmau-pro
- 联系方式:sonalkum@umd.edu

- 1MMAU-Pro: A Challenging and Comprehensive Benchmark for Holistic Evaluation of Audio General IntelligenceUniversity of Maryland, College Park, USA, Brno University of Technology, Czech Republic, Universidad Autónoma de Madrid, Telefónica, Tsinghua University, KAIST, Daejeon, Phonexia, Middlebury College, USA, Tufts University, Universidad de Buenos Aires, Indian Institute of Technology, Bombay, Microsoft, Carnegie Mellon University, USA, Universiti Sains Malaysia, Johns Hopkins University, USA, Athens University of Economics and Business, University of Texas, Austin, USA, Shanghai Artificial Intelligence Laboratory · 2025年



