MMAE
收藏资源简介:
MMAE(大规模多任务音频编辑基准)是首个为通用指令式音频编辑设计的综合性评估测试平台。该基准覆盖广泛的现实场景,涵盖7种不同的音频模态,包括声音、语音、音乐及其混合。MMAE建立了全面的分类体系,包含6个任务复杂度级别(从基础修改到多跳推理和多轮编辑)、2个粒度级别和8种不同的操作类型。通过人机协作精心构建,MMAE包含2000个高保真样本,并配备了开创性的基于量规的评估框架。该框架将自由形式任务分解为17741个可验证标准,实现了对指令遵循和上下文一致性的精确、多维评估。MMAE旨在为智能创作社区的未来发展提供催化剂,为下一代音频编辑系统提供清晰的诊断路线图和标准化、持久的评估范式。
MMAE (Massive Multitask Audio Editing Benchmark) is the first comprehensive evaluation benchmark platform designed for general-purpose instructional audio editing. This benchmark covers a wide range of real-world scenarios and encompasses seven distinct audio modalities: ambient sound, speech, music, and their mixtures. MMAE establishes a comprehensive classification system, including six task complexity levels (ranging from basic modifications to multi-hop reasoning and multi-turn editing), two granularity levels, and eight distinct operation types. Carefully constructed via human-machine collaboration, MMAE contains 2,000 high-fidelity samples and is equipped with a groundbreaking gauge-based evaluation framework. This framework decomposes free-form tasks into 17,741 verifiable criteria, enabling precise, multi-dimensional assessment of instruction adherence and contextual consistency. MMAE aims to serve as a catalyst for the future development of the intelligent creation community, providing a clear diagnostic roadmap and a standardized, enduring evaluation paradigm for next-generation audio editing systems.
数据集概述:MMAE(大规模多任务音频编辑基准)
- 全称:Massive Multitask Audio Editing (MMAE) Benchmark
- 目的:作为首个专为通用指令驱动的音频编辑设计的综合性评估测试平台,旨在推动智能音频创作领域的发展。
- 核心特点:
- 多模态:涵盖7种音频模态,包括纯声音、语音、音乐及其混合。
- 多层级任务:建立了包含6级任务复杂度的全面分类体系,涵盖从基础修改到多跳推理与多轮编辑。
- 细粒度与多操作:包含2个细粒度级别和8种不同的操作类型。
- 高质量样本:通过人机协作精心构建,包含2,000个高保真样本。
- 首创评估框架:采用基于评估准则(Rubric)的评估框架,将自由形式的任务分解为17,741个可验证标准,实现精确、多维度的评估。
数据集规模与构成
| 维度 | 详情 |
|---|---|
| 总样本数 | 2,000个高保真音频样本 |
| 音频模态 | 声音、语音、音乐及其混合(共7种) |
| 任务复杂度 | 6个级别(从基础修改到多跳推理与多轮编辑) |
| 操作类型 | 8种不同操作 |
| 评估准则 | 17,741个可验证的评估标准 |
| 细粒度级别 | 2个级别 |
数据集构建流程
MMAE采用系统化的五阶段流程构建,以确保多样性和高质量:
- 头脑风暴
- 分类体系与范式构建
- 指令驱动的数据收集
- 评估准则(Rubrics)标注
- 质量审查
评估方法与使用
-
评估模型:使用 Qwen3-Omni 作为裁判模型,基于预设的评估准则对音频编辑输出进行打分。
-
使用步骤:
- 部署 Qwen3-Omni: 克隆官方仓库并启动vLLM服务实例(脚本参考
eval/launch_qwen3_omni.sh)。 - 准备预测结果: 在原始元数据文件(
MMAE-meta.json)基础上,将您的模型产生的输出音频路径添加到messages的assistant轮次中,生成预测结果JSON文件。 - 运行评估脚本: bash python -m eval.score --predictions path/to/your_predictions.json --base_urls "http://localhost:8001/v1,http://localhost:8002/v1" --audio_root path/to/audio_root --output_dir outputs/your_model --concurrency 8
- 部署 Qwen3-Omni: 克隆官方仓库并启动vLLM服务实例(脚本参考
-
评估输出文件(输出到
--output_dir指定目录):results.jsonl: 每个评估准则的详细结果。per_sample.json: 每个样本的聚合分数(指令遵循度、上下文一致性和精确匹配)。taxonomy.json: 按模态、难度、跨维度及操作类型分组的分数。
关键资源链接
- 论文 (arXiv): 待发布
- 演示视频: https://youtu.be/6At5nTWhlXI
- 代码仓库 (GitHub): https://github.com/ddlBoJack/MMAE
- 音频数据下载 (HuggingFace): https://huggingface.co/datasets/BoJack/MMAE





