MMAE (Massive Multitask Audio Editing benchmark)
收藏资源简介:
MMAE是由上海交通大学、腾讯混元团队等机构联合创建的大规模多任务音频编辑基准数据集,旨在为基于指令的通用音频编辑系统提供首个综合性评估平台。该数据集包含2000个高保真音频样本,覆盖声音、语音、音乐及其混合等7种模态,并配备了17,741条精细化的评估准则。数据集通过人机协作精心构建,整合了启发式音频收集、多阶段精炼与严格质量控制流程,确保了数据的多样性与高质量。其核心应用在于系统评估音频编辑模型在复杂指令理解、上下文一致性保持及高保真生成等方面的能力,以推动智能音频创作领域的技术突破与标准化评估。
MMAE is a large-scale multi-task audio editing benchmark dataset jointly developed by institutions including Shanghai Jiao Tong University and Tencent Hunyuan Team, among others. It aims to provide the first comprehensive evaluation platform for instruction-based general-purpose audio editing systems. This dataset includes 2,000 high-fidelity audio samples, covering 7 modalities such as sound, speech, music and their mixtures, and is equipped with 17,741 refined evaluation criteria. Meticulously constructed through human-machine collaboration, it integrates heuristic audio collection, multi-stage refinement and rigorous quality control workflows to guarantee the diversity and high quality of the data. Its core application is to systematically evaluate the capabilities of audio editing models in areas such as complex instruction understanding, context consistency preservation and high-fidelity generation, so as to advance technological breakthroughs and standardized evaluation in the field of intelligent audio creation.
MMAE:大规模多任务音频编辑基准
概述
MMAE 是一个大规模多任务音频编辑基准,专为评估通用指令式音频编辑系统而设计。其特点包括:
- 多模态覆盖:涵盖 7 种不同的音频模态,包括音效、语音、音乐及其混合。
- 任务复杂性分级:建立了一个包含 6 个任务复杂度级别的全面分类体系,涵盖从基本修改到多跳推理和多轮编辑。
- 多层级粒度:包含 2 个粒度级别。
- 多种操作类型:包含 8 种不同的操作类型。
- 高质量样本:通过人机协作精心策划,包含 2,000 个高保真样本。
- 创新性评估框架:采用基于标准(rubric-based)的评估框架,将自由形式的任务分解为 17,741 个可验证的标准,实现对指令遵循和上下文一致性的精确、多维评估。
数据构建流程
MMAE 通过一个系统的五阶段流程构建,以确保基准的多样性和高质量:
- 头脑风暴(Brainstorming)
- 分类体系与范式构建(Taxonomy & Paradigm Construction)
- 以指令为中心的数据收集(Instruction-Centric Data Collection)
- 标准注释(Rubrics Annotation)
- 质量检查(Quality Inspection)
评估方法
MMAE 使用 Qwen3-Omni 作为评判模型,依据基于标准(rubric-based)的准则来评估音频编辑输出。
评估步骤:
- 部署 Qwen3-Omni:克隆官方仓库并设置环境,然后启动 vLLM 服务实例。
- 准备预测结果:在 MMAE 基准测试输入数据(元数据)上运行音频编辑模型,并将生成的音频路径填入预测文件的
assistant轮次中。 - 运行评估脚本:使用
eval/score.py脚本,通过指定预测文件路径、Qwen3-Omni 端点 URL 等参数进行评估。
评估输出文件(位于 --output_dir 目录下):
results.jsonl:每个标准的详细结果。per_sample.json:每个样本的聚合得分(指令遵循率、一致性率、精确匹配率)。taxonomy.json:按模态、复杂度、交叉维度和操作类型分组的得分。





