遇见数据集

MMAE

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

MMAE(大规模多任务音频编辑基准)是首个为通用指令式音频编辑设计的综合性评估测试平台。该基准覆盖广泛的现实场景,涵盖7种不同的音频模态,包括声音、语音、音乐及其混合。MMAE建立了全面的分类体系,包含6个任务复杂度级别(从基础修改到多跳推理和多轮编辑)、2个粒度级别和8种不同的操作类型。通过人机协作精心构建,MMAE包含2000个高保真样本,并配备了开创性的基于量规的评估框架。该框架将自由形式任务分解为17741个可验证标准,实现了对指令遵循和上下文一致性的精确、多维评估。MMAE旨在为智能创作社区的未来发展提供催化剂,为下一代音频编辑系统提供清晰的诊断路线图和标准化、持久的评估范式。

MMAE (Massive Multitask Audio Editing Benchmark) is the first comprehensive evaluation benchmark platform designed for general-purpose instructional audio editing. This benchmark covers a wide range of real-world scenarios and encompasses seven distinct audio modalities: ambient sound, speech, music, and their mixtures. MMAE establishes a comprehensive classification system, including six task complexity levels (ranging from basic modifications to multi-hop reasoning and multi-turn editing), two granularity levels, and eight distinct operation types. Carefully constructed via human-machine collaboration, MMAE contains 2,000 high-fidelity samples and is equipped with a groundbreaking gauge-based evaluation framework. This framework decomposes free-form tasks into 17,741 verifiable criteria, enabling precise, multi-dimensional assessment of instruction adherence and contextual consistency. MMAE aims to serve as a catalyst for the future development of the intelligent creation community, providing a clear diagnostic roadmap and a standardized, enduring evaluation paradigm for next-generation audio editing systems.

创建时间:
2026-05-29
原始信息汇总

数据集概述:MMAE(大规模多任务音频编辑基准)

  • 全称:Massive Multitask Audio Editing (MMAE) Benchmark
  • 目的:作为首个专为通用指令驱动的音频编辑设计的综合性评估测试平台,旨在推动智能音频创作领域的发展。
  • 核心特点
    • 多模态:涵盖7种音频模态,包括纯声音、语音、音乐及其混合。
    • 多层级任务:建立了包含6级任务复杂度的全面分类体系,涵盖从基础修改到多跳推理与多轮编辑。
    • 细粒度与多操作:包含2个细粒度级别和8种不同的操作类型。
    • 高质量样本:通过人机协作精心构建,包含2,000个高保真样本。
    • 首创评估框架:采用基于评估准则(Rubric)的评估框架,将自由形式的任务分解为17,741个可验证标准,实现精确、多维度的评估。

数据集规模与构成

维度 详情
总样本数 2,000个高保真音频样本
音频模态 声音、语音、音乐及其混合(共7种)
任务复杂度 6个级别(从基础修改到多跳推理与多轮编辑)
操作类型 8种不同操作
评估准则 17,741个可验证的评估标准
细粒度级别 2个级别

数据集构建流程

MMAE采用系统化的五阶段流程构建,以确保多样性和高质量:

  1. 头脑风暴
  2. 分类体系与范式构建
  3. 指令驱动的数据收集
  4. 评估准则(Rubrics)标注
  5. 质量审查

评估方法与使用

  • 评估模型:使用 Qwen3-Omni 作为裁判模型,基于预设的评估准则对音频编辑输出进行打分。

  • 使用步骤

    1. 部署 Qwen3-Omni: 克隆官方仓库并启动vLLM服务实例(脚本参考 eval/launch_qwen3_omni.sh)。
    2. 准备预测结果: 在原始元数据文件(MMAE-meta.json)基础上,将您的模型产生的输出音频路径添加到 messagesassistant 轮次中,生成预测结果JSON文件。
    3. 运行评估脚本: bash python -m eval.score --predictions path/to/your_predictions.json --base_urls "http://localhost:8001/v1,http://localhost:8002/v1" --audio_root path/to/audio_root --output_dir outputs/your_model --concurrency 8
  • 评估输出文件(输出到 --output_dir 指定目录):

    • results.jsonl: 每个评估准则的详细结果。
    • per_sample.json: 每个样本的聚合分数(指令遵循度、上下文一致性和精确匹配)。
    • taxonomy.json: 按模态、难度、跨维度及操作类型分组的分数。

关键资源链接

搜集汇总
数据集介绍
MMAE 数据集图片
构建方式
MMAE的构建采用了一套系统性五阶段流水线,旨在确保基准的多样性与高质量。该流程始于头脑风暴阶段,以广泛收集创意与场景;随后构建分类法与范式,确立涵盖7种音频模态(包括声音、语音、音乐及其混合)的多维评估架构。在指令中心化的数据收集阶段,通过人机协作精心筛选与生成样本,最终得到2000个高保真音频数据。此后,针对每个样本进行细致的评分标准标注,将自由形式任务分解为17741个可验证的评估准则。最后,经过严格的质量审查环节,确保每一份样本均符合预设的精确性与一致性标准,从而构建出一个全面且严谨的音频编辑评测基准。
特点
MMAE作为首个面向通用指令音频编辑的综合评估平台,具备显著的多任务特性。其核心特点在于构建了一个细致的分类体系,涵盖从基础修改到多跳推理与多轮编辑的6级任务复杂度、2级操作粒度以及8种不同操作类型,能够模拟真实世界中多样化的编辑需求。尤为独特的是,该基准引入了基于评分标准的评估框架,通过多维度的自动验证,精准衡量模型在指令遵循与上下文一致性两方面的表现。此外,MMAE融合了多种音频模态的混合样本,使其在评估音频编辑系统的泛化能力与鲁棒性方面具有无可比拟的优势。
使用方法
使用MMAE进行评测需遵循一套标准化的流程。首先,用户需部署Qwen3-Omni作为裁判模型,通过提供的脚本启动两个vLLM服务实例,分别监听不同端口。其次,用户需在自己的音频编辑模型上运行MMAE的输入样本,并将输出结果以ChatML格式整理为预测JSON文件,其中需包含音频路径信息。最后,调用评测脚本score模块,指定预测文件、裁判模型端点URL、音频根目录等参数,执行并发评估。脚本将自动基于17741条评分标准对每个编辑结果进行打分,并输出详细结果文件,包括每条样本的指令遵循分数、一致性分数以及按模态、难度等分类的聚合统计,从而实现对模型性能的全面诊断。
背景与挑战
背景概述
MMAE(Massive Multitask Audio Editing Benchmark)是一个大规模多任务音频编辑基准,由研究人员通过人机协作精心构建,旨在为通用指令驱动的音频编辑提供首个全面的评估平台。该基准创建于近年来音频生成与编辑技术快速发展的背景下,核心研究机构或团队致力于推动智能音频创作领域的前沿发展。MMAE覆盖了声、语音、音乐及其混合等7种音频模态,并构建了包含6级任务复杂度、2级粒度及8种操作类型的精细分类体系,显著拓展了音频编辑评估的广度与深度。其包含2000个高质量样本和基于17141条可验证标准的评价框架,为多维度、精准的指令遵循与上下文一致性评估奠定了基础,有望成为下一代音频编辑系统的标准化评估范式,对智能创作社区的未来发展具有重要催化作用。
当前挑战
MMAE所解决的领域核心挑战在于音频编辑任务缺乏统一、多模态的评估基准,现有方法难以适应真实世界中复杂多变的编辑需求,包括声音、语音、音乐及其混合场景下的多跳推理与多轮编辑。构建过程中面临的主要挑战涵盖数据多样性与质量的平衡,需通过系统化五阶段流程(从头脑风暴到质量审查)确保样本的丰富性和可靠性;同时,自由形式编辑任务的评估需分解为大量可验证标准,设计基于规则的评分框架以替代主观判断,这对构建精准、多维度的自动化评估体系提出了技术性难题。此外,音频编辑系统需同时处理跨模态的指令理解与上下文一致性,构建过程中还需应对不同操作类型和难度级别的样本平衡与标注一致性挑战。
常用场景
经典使用场景
MMAE作为首个面向通用指令驱动音频编辑的大规模多任务基准,其经典使用场景聚焦于对音频编辑系统进行全方位、多维度的能力诊断。该基准精心覆盖了声音、语音、音乐及其混合形态等七种音频模态,并依据任务复杂度构建了从基础修改到多跳推理、多轮编辑的六级难度层级,同时融合了两种编辑粒度与八种操作类型。研究人员可通过MMAE提供的2000个高质量样本及其配套的评判标准评估框架,系统性地测试模型在指令遵循、上下文一致性及精细操作上的表现,为音频编辑模型的性能刻画提供了标准化的测试平台。
实际应用
在实际应用层面,MMAE所定义的多样化编辑任务直接映射了智能音频创作的现实需求。该基准涵盖的场景,如从混合音频中分离特定声源、对语音进行语调或内容修改、调整音乐的风格与节奏,以及跨模态的多轮编辑操作,均与数字内容生产、辅助创作工具及人机协作等应用紧密相关。基于MMAE的评估体系,音频编辑系统可被有效验证其在影视后期制作、播客编辑、音乐创作辅助、智能语音助手及无障碍设备中的实用性与鲁棒性,从而加速技术从研究到产品的转化进程。
衍生相关工作
MMAE的提出催生了一系列衍生研究工作,主要体现在方法创新与评估体系拓展两个方向。在方法层面,研究人员开始探索如何利用该基准的多任务特性来训练通用音频编辑模型,例如借鉴其在多模态、多粒度编辑上的分类体系,构建能够同时处理语音增强、音乐分离与声音替换的统一架构。在评估层面,MMAE的评判标准框架启发了后续在生成式音频质量评估中的新范式,研究者尝试将其可分解的评分逻辑应用于其他音频生成任务,并推动开发更为自动化的评估流程。此外,该基准也促进了指令数据合成、人机协同标注策略等方面的技术探索,为构建大规模、高质量的音频编辑数据集提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务