开放类型视频问答模型性能对比数据集
收藏国家基础学科公共科学数据中心2026-06-03 收录
官方服务:
资源简介:
本数据集主要面向视频问答(Video Question Answering, Video QA)任务中开放类型(Open-ended)的模型性能评估与对比分析需求构建。数据基于AGQA与ANetQA两大国际标准视频问答基准,通过统一的评测协议对课题组提出的视频理解方法LLaVA-NeXT-Video-AoTD与现有基线方法LLaVA-NeXT-Video进行系统性评估,形成标准化性能对比结果。数据集来源于上述公开数据集的验证集,通过官方评估脚本,针对开放式生成答案计算准确率(Accuracy),并对模型的长时序理解能力进行汇总统计。数据内容主要包括数据集名称、评测任务类型(开放生成)、基准模型LLaVA-NeXT-Video性能、本方法LLaVA-NeXT-Video-AoTD性能以及相对性能提升幅度等关键指标信息。数据集规模较小(146KB级别),以Excel文件形式组织,属于模型评测结果型数据资源,不包含原始视频及标注数据。该数据集可用于支撑细粒度视频内容理解与生成式问答模型的性能验证、项目指标考核及算法对比分析,特别用于验证“在视频问答的基准上,回答准确率相比现有开源模型提升超过5%”的项目考核指标,对推动开放域视频问答与具身智能研究具有重要参考价值。
提供机构:
上海交通大学


