遇见数据集

多选类型视频问答模型性能对比数据集

收藏
官方服务:

资源简介:

本数据集主要面向视频问答(Video Question Answering, Video QA)任务中多选类型(Multi-choice)的模型性能评估与对比分析需求构建。数据基于STAR、NExT-QA、Perception-test、Videomme、Mvbench等国际标准视频问答基准,通过统一的评测协议对课题组提出的视频理解方法LLaVA-NeXT-Video-AoTD与现有基线方法LLaVA-NeXT-Video进行系统性评估,形成标准化的性能对比结果。数据集来源于上述公开权威数据集的验证集或测试集,通过官方评估脚本,在给定候选答案集合的条件下计算分类准确率(Accuracy)指标,并对模型的整体判别能力进行汇总统计。数据内容主要包括数据集名称、评测任务类型(多选)、基准模型LLaVA-NeXT-Video性能、本方法LLaVA-NeXT-Video-AoTD性能以及相对性能提升幅度等关键指标信息。数据集规模较小(998KB级别),以Excel文件形式组织,属于模型评测结果型数据资源,不包含原始视频及问题数据。该数据集可用于支撑复杂视频推理模型的性能验证、项目指标考核及算法横向对比分析,特别用于验证“在视频问答的基准上,回答准确率相比现有开源模型提升超过5%”的项目考核指标,对推动多模态大模型在视频理解与决策任务中的研究具有重要参考价值。

提供机构:
上海交通大学
二维码
社区交流群
二维码
科研交流群
商业服务