MMAE: A Massive Multitask Audio Editing Benchmark
收藏资源简介:
我们介绍了MMAE,一个大规模多任务音频编辑基准,作为首个为通用指令型音频编辑设计的全面评估测试平台。MMAE涵盖广泛的实际场景,包括7种不同的音频模态(如声音、语音、音乐及其混合),建立了跨越6个任务复杂度级别(从基本修改到多跳推理和多轮编辑)、2个粒度级别和8种操作类型的全面分类体系。通过人机协作精心策划,MMAE包含2,000个高保真样本,并配有一个开创性的基于规则的评估框架。通过将自由形式任务分解为17,741个可验证标准,这一稳健的基于规则的范式能够对指令遵循和上下文一致性进行精确的多维评估。我们期望MMAE能作为智能创作社区未来进展的催化剂,提供清晰的诊断路线图,并为下一代音频编辑系统建立标准化、持久的评估范式。
We introduce MMAE, a large-scale multi-task audio editing benchmark, as the first comprehensive evaluation testbed designed for general instruction-based audio editing. MMAE covers a wide range of real-world scenarios, including 7 distinct audio modalities (e.g., sound effects, speech, music, and their mixtures), and establishes a comprehensive taxonomy that spans 6 levels of task complexity (ranging from basic modifications to multi-hop reasoning and multi-turn editing), 2 granularity levels, and 8 types of editing operations. Curated through human-machine collaboration, MMAE contains 2,000 high-fidelity samples and is equipped with a groundbreaking rule-based evaluation framework. By decomposing free-form tasks into 17,741 verifiable criteria, this robust rule-based paradigm enables precise multi-dimensional evaluation of instruction following and context consistency. We anticipate that MMAE will serve as a catalyst for future advancements in the intelligent creation community, providing a clear diagnostic roadmap and establishing a standardized and enduring evaluation paradigm for next-generation audio editing systems.
MMAE 数据集概述
MMAE(Massive Multitask Audio Editing Benchmark) 是一个大规模多任务音频编辑基准数据集,专为通用指令驱动的音频编辑系统设计,提供全面的评估测试平台。
数据集核心特征
- 覆盖 7 种音频模态:包括声音、语音、音乐及其混合类型,广泛涵盖真实世界场景。
- 分层任务复杂度:建立 6 级任务复杂度分类体系,涵盖基础修改到多步推理及多轮编辑。
- 2 级编辑粒度:提供不同精细程度的编辑任务。
- 8 种操作类型:涵盖多种音频编辑操作。
- 2000 个高质量样本:通过人机协作方式精心筛选与构建。
- 17,741 条可验证评估标准:基于独创的 Rubric 评估框架,将自由形式任务分解为可量化标准,实现指令遵循与上下文一致性的多维精准评估。
数据构建流程
数据集通过系统化的五阶段流水线构建:
- 头脑风暴:确定任务方向与覆盖范围。
- 分类体系与范式构建:建立任务复杂度、粒度与操作类型的分类结构。
- 以指令为中心的数据收集:围绕指令生成与音频数据配对。
- Rubric 标注:为每条指令标注可验证的评估标准。
- 质量检查:确保数据的高保真度与一致性。
评估方法
- 评估模型:使用 Qwen3-Omni 作为评判模型,基于 Rubric 标准评估音频编辑输出。
- 评估步骤:
- 部署 Qwen3-Omni 服务(参考
launch_qwen3_omni.sh脚本,启动两个实例,分别运行在端口 8001 和 8002)。 - 准备模型预测结果:将 MMAE 元数据(
MMAE-meta.json)中的messages添加assistant轮次,指向模型输出的音频路径。 - 运行评估脚本
python -m eval.score,传入预测文件、服务地址等参数。
- 部署 Qwen3-Omni 服务(参考
评估输出文件
results.jsonl:每条 Rubric 的详细评估结果,包含 3 次评判响应、每次尝试的选择、得分及模型原始输出。per_sample.json:每个样本的聚合得分,包括指令遵循、上下文一致性及精确匹配。taxonomy.json:按模态、难度类型、跨维度及操作类型分组的得分。
数据获取与资源
- 音频数据下载:HuggingFace 数据集页面
- 元数据文件:
MMAE-meta.json(位于代码仓库中) - 代码仓库:GitHub - ddlBoJack/MMAE





