Salesforce/ST-Evidence-Instruct
收藏资源简介:
ST-Evidence-Instruct数据集是一个基于时空证据的视频问答数据集,用于训练。数据集包含两部分:gen_mask和gen_qa/vicas。gen_mask部分包含约20k样本,源自CLEVRER视频,具有6fps的视频帧、空间掩码、时间证据注释和问答对。gen_qa/vicas部分包含141k样本,源自ViCaS视频,具有多选题、时间片段注释、空间掩码引用和答案候选。数据集结构清晰,提供了详细的文件结构和数据格式示例。该数据集仅用于研究目的,支持学术论文《Evidence-Backed Video Question Answering》。
The ST-Evidence-Instruct dataset is a spatio-temporal evidence-based video question answering dataset designed for model training. It consists of two subsets: gen_mask and gen_qa/vicas. The gen_mask subset includes approximately 20k samples sourced from CLEVRER videos, with each sample containing 6fps video frames, spatial masks, temporal evidence annotations, and question-answer pairs. The gen_qa/vicas subset contains 141k samples derived from ViCaS videos, featuring multiple-choice questions, temporal segment annotations, spatial mask references, and answer candidates. The dataset has a well-defined structure, with detailed file structure descriptions and data format examples provided. This dataset is for research purposes only and supports the academic paper "Evidence-Backed Video Question Answering".




