遇见数据集

ST-Evidence-Instruct

收藏
arXiv2026-07-14 更新2026-07-15 收录
官方服务:

资源简介:

ST-Evidence-Instruct是由Salesforce和布朗大学联合创建的大规模指令微调数据集,旨在支持证据驱动的视频问答任务。该数据集包含16万个三元组样本,每个样本整合了视频问答对、时间证据段和密集的时空分割掩码,数据来源于现有语义视频问答数据集和已标注的掩码视频。数据集通过自动化的可扩展流水线构建,将高层语义推理与细粒度视觉定位对齐。该数据集主要应用于视频理解领域,旨在解决视频大语言模型在回答问题时缺乏可验证视觉证据的问题,推动模型实现可解释的、基于证据的视频推理。

ST-Evidence-Instruct is a large-scale instruction-tuning dataset jointly developed by Salesforce and Brown University, designed to support evidence-driven video question answering tasks. This dataset contains 160,000 triple samples, each integrating a video question-answer pair, temporal evidence segments, and dense spatial-temporal segmentation masks. The data is sourced from existing semantic video question answering datasets and annotated masked videos. The dataset is constructed via an automated and scalable pipeline that aligns high-level semantic reasoning with fine-grained visual grounding. Primarily applied in the field of video understanding, this dataset aims to address the problem that video large language models (LLMs) lack verifiable visual evidence when answering questions, and promote models to achieve explainable, evidence-based video reasoning.

创建时间:
2026-07-14
原始信息汇总

数据集概述

该数据集是 EVQA (Evidence-Backed Video Question Answering) 项目的核心资源,旨在解决视频问答中缺乏可验证视觉证据的问题。该工作已被 ECCV 2026 接收。数据集要求模型在输出语义答案的同时,提供精确的时空证据,包括时间片段和密集的、被追踪的对象分割掩码。

核心基准与数据集

项目提供了两个关键的数据集组件:

  1. ST-Evidence 基准 (Benchmark)

    • 名称: ST-Evidence-Bench
    • 类型: 第一个经过人工验证的、用于判别式和生成式像素级视频问答基准的数据集。
    • 访问地址: https://huggingface.co/datasets/Salesforce/ST-Evidence-Bench
    • 任务: 支持两种评估任务:
      • 生成式 ST-Evidence 任务 (主任务): 模型需同时生成答案、空间证据(目标分割掩码)和时间证据(时间片段)。
      • 多项选择 ST-Evidence 任务: 模型从多个候选项中选择正确答案及对应的证据。
  2. ST-Evidence-Instruct 数据集

    • 名称: ST-Evidence-Instruct
    • 规模: 约 160k 样本。
    • 大小: 约 46GB。
    • 用途: 用于微调模型的指令数据集。它通过一个自动化生成流水线构建,旨在弥合高级推理与细粒度视觉定位之间的差距。
    • 访问地址: https://huggingface.co/datasets/Salesforce/ST-Evidence-Instruct
    • 数据格式示例: 数据以 CSV 文件(包含问题、答案、候选答案、掩码证据路径、时间证据等)和 JSON 格式的掩码注释文件存储。

已发布模型

项目同时开源了基于该数据集的微调模型,用于建立可解释、有证据支持的视频理解的基线:

  • ST-Evidence-3B: https://huggingface.co/Salesforce/ST-Evidence-3B
  • ST-Evidence-7B: https://huggingface.co/Salesforce/ST-Evidence-7B

项目结构

项目代码和基准评估脚本按以下目录结构组织:

  • train/: 包含训练代码、数据集和数据处理逻辑。核心模型为 UniPixel,并集成了 SAM2
  • benchmark/: 包含用于在基准数据集上进行评估的脚本。
    • st_evidence_gen/: 用于生成式任务的评估脚本,包括对 UniPixel、GPT、Gemini、InternVL、Qwen2.5-VL 等模型的评估。
    • st_evidence_mcq/: 用于多项选择任务的评估脚本,支持对 UniPixel、GPT、Gemini 等模型的评估。

评估指标

  • 问答准确率 (QA Accuracy): 答案正确的百分比。
  • 时间 IoU/IoP (Temporal IoU/IoP): 衡量时间证据定位的准确度,包括 mIoU、TIoU@0.3、TIoU@0.5 等。
  • 掩码质量 (Mask Quality - 可选): 衡量空间证据分割的精度,包括 J 分数(区域 IoU)、F 分数(轮廓准确性)和 J&F 分数。
  • 多项选择准确率 (MCQ Accuracy): 在多项选择任务中,分别评估答案、时间证据和空间证据选择的准确率。

许可协议

  • 许可: CC-BY-NC 4.0
  • 用途限制: 仅用于研究目的。

引用信息

该数据集及其相关工作基于以下论文,引用格式如下:

bibtex @inproceedings{wang2026evidence, title={Evidence-Backed Video Question Answering}, author={Wang, Shijie and Zhou, Honglu and Wang, Ziyang and Xu, Ran and Xiong, Caiming and Savarese, Silvio and Sun, Chen and Niebles, Juan Carlos}, booktitle={European Conference on Computer Vision (ECCV)}, year={2026} }

搜集汇总
数据集介绍
ST-Evidence-Instruct 数据集图片
构建方式
ST-Evidence-Instruct的构建基于双向自动化数据生成管线,旨在弥合高层语义推理与细粒度时空定位之间的鸿沟。对于已具备密集标注掩码的视频数据集(如ViCaS),采用“生成-验证”范式,利用多模态大语言模型(如Qwen3-VL和Gemini)独立生成问题-答案对,并指派置信度分数及证据对象描述,随后通过文本验证与格式过滤筛选出高质量样本。对于仅含问答对、缺乏视觉标注的语义数据集,设计三级分解策略:首先由视觉语言模型识别关键证据对象及其出现时间戳,并验证基于这些对象生成的答案是否与真实标签一致;其次提取对应帧并生成边界框,经面积、长宽比等过滤机制剔除异常预测;最后利用SAM-3以验证后的边界框为线索,在视频全卷中传播密集的时空分割掩码。通过上述两条路径,最终汇聚形成包含16万组(视频、问题、答案、时间片段、空间掩码)三元组的大规模指令微调数据集。
特点
该数据集的核心特色在于首次将证据驱动的视频问答任务推向像素级密集时空定位的全新高度。与现有仅依赖文本推理或稀疏边界框的方案不同,ST-Evidence-Instruct要求模型联合输出语义答案、关键时间区间以及经跟踪的稠密分割掩码链,从而提供可验证的视觉“证据链”。其证据对象不仅限于答案所指实体,更涵盖逻辑推理过程中不可或缺的因果线索,有效规避语言先验偏差。数据规模达16万组三元组,覆盖因果推理、状态变化、物体交互等复杂动态场景,且通过人工验证与多阶段质量过滤确保标注精度。此外,数据源横跨多个主流视频理解基准(如STAR、CLEVRER、ViCaS等),兼具语义丰富性与时空定位的精细度,为训练兼具推理能力与视觉可解释性的模型奠定了坚实基础。
使用方法
ST-Evidence-Instruct专为证据回溯式视频问答(E-VQA)任务设计,可直接用于对大语言模型进行指令微调,以强化其联合作答与时空证据定位的能力。用户可基于该数据集结合LoRA等高效微调方法,训练模型以最小化答案预测、时间区间生成与掩码解码的联合损失。在评估阶段,模型需针对视频与问题输出完整三元组:语义答案、时间区间及证据对象的像素级掩码,分别采用准确率、时间交并比(tIoU)和J&F指标进行量化评价。为适配不同架构,数据集提供了生成式和多项选择式两种评测变体:前者要求模型自主合成证据,后者则以选项判别方式评估定位能力。数据与代码已在GitHub开源,便于研究者复现基线结果并拓展新的方法与应用。
背景与挑战
背景概述
随着视频大语言模型在问答任务中展现卓越性能,其作为黑盒系统仅输出文本答案的局限性日益凸显,缺乏可验证的视觉依据引发了对可解释性与可靠性的深切忧虑。针对这一困境,Salesforce研究院与布朗大学的研究团队于2025年共同提出了证据支撑型视频问答任务,旨在弥合高层语义推理与细粒度视觉感知之间的鸿沟。该团队创建了首个经人工验证的基准数据集ST-Evidence,涵盖生成式与判别式两种评估范式,为视频理解领域提供了全新的评估标准。这一开创性工作深刻揭示了当前模型在推理准确性与真实视觉感知之间存在显著脱节,从而催生了大规模指令微调数据集ST-Evidence-Instruct的构建,推动了可解释、可验证的视频理解研究迈向新高度。
当前挑战
该数据集所解决的领域核心问题在于,现有视频问答模型普遍依赖语言先验或幻觉生成答案,无法提供像素级的时空证据支撑其推理过程,尤其在应对严重遮挡、非刚性形变及连续状态变化等复杂动态场景时,基于稀疏边界框的传统方法力有不逮。在数据集构建过程中,研究者面临三重棘手的挑战:其一,密集时空掩码的人工标注成本极为高昂,需设计高效的自动化管道来合成大规模训练数据;其二,需确保生成的时空证据真正具有因果推理价值而非仅关注视觉显著性区域;其三,当前通用视频大语言模型与接地视频大语言模型均难以胜任联合推理与精准像素级定位的双重任务,单纯扩大模型规模无法弥合这一能力鸿沟。
常用场景
经典使用场景
ST-Evidence-Instruct数据集的核心用途在于训练和评估具备可验证视觉证据支撑的视频大语言模型(Video LLMs),使其在回答视频问题的同时,必须输出精确的时空证据——即相关的时间片段和密集的、可追踪的对象分割掩码。这一经典使用场景突破了传统视频问答仅提供文本答案的黑箱局限,将高层次语义推理与细粒度像素级定位紧密结合,为视频理解领域建立了一种全新的、可解释的联合推理范式。
实际应用
在实际应用中,ST-Evidence-Instruct赋能Video LLMs在自动驾驶场景中通过定位关键障碍物时空区域来验证决策合理性,在医疗过程分析中精准追踪手术器械与人体组织的交互轨迹,以及在机器人协作系统中提供可追溯的视觉证据链以保障人机交互安全。这些高可靠性需求场景要求模型不仅给出正确答案,还必须提供肉眼可验证的像素级证据,从而在工业质检、安防监控和智能教育等领域实现透明、负责任的自动化决策。
衍生相关工作
该数据集直接衍生了一系列开创性工作,包括基于强化学习的推理增强模型Video-R1和VideoChat-R1、聚焦时间证据蒸馏的VITED、以及集成像素级分割的Sa2VA和UniPixel等架构。这些工作围绕ST-Evidence-Instruct提出的联合推理范式,从不同技术路线探索了如何将时空证据生成与问答任务深度耦合,推动了可解释视频理解领域从稀疏框标注向密集追踪掩码的范式转变,并催生了更多关于证据质量验证、因果推理可视化和多模态可信性评估的研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务