AVQA
收藏arXiv2025-09-30 收录
数据链接:
官方服务:
资源简介:
该数据集汇总了来自AVQA和MusicAVQA数据集的问答对,并通过指令调整模板进行了增强。该数据集支持对模型在回答需要多模态推理的复杂问题方面的评估工作,其任务旨在应对涵盖音频和视觉模态的问题解答。
This dataset aggregates question-answer pairs from the AVQA and MusicAVQA datasets, and enhances them using instruction tuning templates. This dataset supports the evaluation of models' performance on complex questions that require multimodal reasoning, with its targeted task focused on question answering covering both audio and visual modalities.
搜集汇总
数据集介绍

背景与挑战
背景概述
AVQA是一个音频-视觉问答数据集,专注于视频中多模态理解,旨在通过结合音频和视觉信息回答真实生活场景中的问题。该数据集基于VGG-Sound视频库,包含手动注释的QA对,问题类型多样,并提供了原始视频、注释文件及提取的特征文件,以支持音频-视觉关系推理研究。
以上内容由遇见数据集搜集并总结生成



