ST-Evidence-Instruct
收藏资源简介:
ST-Evidence-Instruct是由Salesforce和布朗大学联合创建的大规模指令微调数据集,旨在支持证据驱动的视频问答任务。该数据集包含16万个三元组样本,每个样本整合了视频问答对、时间证据段和密集的时空分割掩码,数据来源于现有语义视频问答数据集和已标注的掩码视频。数据集通过自动化的可扩展流水线构建,将高层语义推理与细粒度视觉定位对齐。该数据集主要应用于视频理解领域,旨在解决视频大语言模型在回答问题时缺乏可验证视觉证据的问题,推动模型实现可解释的、基于证据的视频推理。
ST-Evidence-Instruct is a large-scale instruction-tuning dataset jointly developed by Salesforce and Brown University, designed to support evidence-driven video question answering tasks. This dataset contains 160,000 triple samples, each integrating a video question-answer pair, temporal evidence segments, and dense spatial-temporal segmentation masks. The data is sourced from existing semantic video question answering datasets and annotated masked videos. The dataset is constructed via an automated and scalable pipeline that aligns high-level semantic reasoning with fine-grained visual grounding. Primarily applied in the field of video understanding, this dataset aims to address the problem that video large language models (LLMs) lack verifiable visual evidence when answering questions, and promote models to achieve explainable, evidence-based video reasoning.
数据集概述
该数据集是 EVQA (Evidence-Backed Video Question Answering) 项目的核心资源,旨在解决视频问答中缺乏可验证视觉证据的问题。该工作已被 ECCV 2026 接收。数据集要求模型在输出语义答案的同时,提供精确的时空证据,包括时间片段和密集的、被追踪的对象分割掩码。
核心基准与数据集
项目提供了两个关键的数据集组件:
-
ST-Evidence 基准 (Benchmark)
- 名称: ST-Evidence-Bench
- 类型: 第一个经过人工验证的、用于判别式和生成式像素级视频问答基准的数据集。
- 访问地址: https://huggingface.co/datasets/Salesforce/ST-Evidence-Bench
- 任务: 支持两种评估任务:
- 生成式 ST-Evidence 任务 (主任务): 模型需同时生成答案、空间证据(目标分割掩码)和时间证据(时间片段)。
- 多项选择 ST-Evidence 任务: 模型从多个候选项中选择正确答案及对应的证据。
-
ST-Evidence-Instruct 数据集
- 名称: ST-Evidence-Instruct
- 规模: 约 160k 样本。
- 大小: 约 46GB。
- 用途: 用于微调模型的指令数据集。它通过一个自动化生成流水线构建,旨在弥合高级推理与细粒度视觉定位之间的差距。
- 访问地址: https://huggingface.co/datasets/Salesforce/ST-Evidence-Instruct
- 数据格式示例: 数据以 CSV 文件(包含问题、答案、候选答案、掩码证据路径、时间证据等)和 JSON 格式的掩码注释文件存储。
已发布模型
项目同时开源了基于该数据集的微调模型,用于建立可解释、有证据支持的视频理解的基线:
- ST-Evidence-3B: https://huggingface.co/Salesforce/ST-Evidence-3B
- ST-Evidence-7B: https://huggingface.co/Salesforce/ST-Evidence-7B
项目结构
项目代码和基准评估脚本按以下目录结构组织:
train/: 包含训练代码、数据集和数据处理逻辑。核心模型为UniPixel,并集成了SAM2。benchmark/: 包含用于在基准数据集上进行评估的脚本。st_evidence_gen/: 用于生成式任务的评估脚本,包括对 UniPixel、GPT、Gemini、InternVL、Qwen2.5-VL 等模型的评估。st_evidence_mcq/: 用于多项选择任务的评估脚本,支持对 UniPixel、GPT、Gemini 等模型的评估。
评估指标
- 问答准确率 (QA Accuracy): 答案正确的百分比。
- 时间 IoU/IoP (Temporal IoU/IoP): 衡量时间证据定位的准确度,包括 mIoU、TIoU@0.3、TIoU@0.5 等。
- 掩码质量 (Mask Quality - 可选): 衡量空间证据分割的精度,包括 J 分数(区域 IoU)、F 分数(轮廓准确性)和 J&F 分数。
- 多项选择准确率 (MCQ Accuracy): 在多项选择任务中,分别评估答案、时间证据和空间证据选择的准确率。
许可协议
- 许可: CC-BY-NC 4.0
- 用途限制: 仅用于研究目的。
引用信息
该数据集及其相关工作基于以下论文,引用格式如下:
bibtex @inproceedings{wang2026evidence, title={Evidence-Backed Video Question Answering}, author={Wang, Shijie and Zhou, Honglu and Wang, Ziyang and Xu, Ran and Xiong, Caiming and Savarese, Silvio and Sun, Chen and Niebles, Juan Carlos}, booktitle={European Conference on Computer Vision (ECCV)}, year={2026} }




