mispeech/MECAT-Caption
收藏官方服务:
资源简介:
MECAT(多专家链音频任务)是一个基于大规模数据构建的全面基准,用于评估机器对音频内容的理解,包括两个核心任务:音频字幕和音频问答。
MECAT (Multi-Expert Chain for Audio Tasks) is a comprehensive benchmark constructed on large-scale data to evaluate machine understanding of audio content through two core tasks: Audio Captioning and Audio Question Answering.
提供机构:
mispeech搜集汇总
数据集介绍

背景与挑战
背景概述
MECAT-Caption是一个用于音频理解任务的多模态基准数据集,专注于音频字幕生成和音频问答两个核心任务,旨在评估机器对音频内容的细粒度理解。该数据集通过集成专家模型和Chain-of-Thought大语言模型的流程生成,提供多角度、细粒度的字幕和开放集问答对,覆盖语音、音乐和一般声音等多种场景,并包含约20K个音频字幕对和约100K个问答对,总规模为40,091行数据。
以上内容由遇见数据集搜集并总结生成



