遇见数据集

wovenbytoyota-vai/CaST-Bench

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

CaST-Bench是一个用于视频问答的基准测试数据集,专注于评估视觉语言模型在基于细粒度时空证据的因果链推理能力。该数据集提供人类验证的问答对,要求模型在给定视频和因果问题的情况下,不仅选择正确答案,还需识别并时空定位支撑答案的证据链,包括因果触发器和其下游效应。数据集包含MP4视频片段和JSONL格式的测试文件,每个条目包括视频文件名、问题、问题类型、场景类别、六个答案选项、正确答案以及时空证据链。问题类型涵盖因果解释、反事实推理、预测性预期和推断描述四大类,数据构建通过多阶段人机协作流程完成,并遵循严格的质量控制。数据集发布版本为v1,未来计划发布v2和在线排行榜。

--- 展示名称: "CaST-Bench:面向视频问答的因果链锚定时空推理基准测试" 语言: - 英语 许可协议: cc-by-4.0 任务类别: - 视频-文本到文本 - 视觉问答 样本规模: - 样本数少于1000 标注生成者: - 专家标注 配置项: - 配置名称: 默认 数据文件: - 拆分集: 测试集 文件路径: castbench_hf.jsonl --- # CaST-Bench:面向视频问答的因果链锚定时空推理基准测试 这是**CaST-Bench**数据集的官方仓库,对应论文*"[CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering](https://arxiv.org/abs/2605.23216v1)"*。 CaST-Bench是首个在**锚定细粒度时空证据的因果链推理**任务上评估视觉语言模型(Vision-Language Models, VLMs)的基准测试。给定一段视频与一个因果问题,模型不仅需要选出正确答案,还需识别并时空定位支撑该答案的视觉证据链——涵盖因果触发事件及其下游效应。 本次发布提供了经过人工核验的精选问答对集合,用于快速且可靠地评估视觉语言模型的因果视频理解能力。 --- ## 最新动态 - **[2026-05-28] 版本1发布** — 我们正式公开发布**CaST-Bench v1**,即完整基准测试的精选子集。本次部分发布旨在作为参考版本,用于快速可靠地评估视觉语言模型。 - **[即将上线] 版本2发布** — 我们计划发布包含更多问答对的**CaST-Bench v2**。 - **[即将上线] 在线排行榜** — 我们将推出在线排行榜,用于追踪并对比模型在v1和v2版本上的性能表现。 --- ## 数据集结构 . ├── castbench_hf.jsonl # 测试集(人工核验的问答对) └── videos/ # 源自SAV的MP4视频片段 ### 数据字段 `castbench_hf.jsonl`中的每一行都是一个JSON对象,包含以下顶级字段: | 字段名 | 数据类型 | 描述 | |---|---|---| | `video` | 字符串 | MP4文件名(例如 `"sav_000267.mp4"`) | | `question` | 字符串 | 关于该视频的自然语言因果问题 | | `question_type` | 字符串 | 问题子类别名称(详见下文分类体系) | | `scene_category` | 字符串 | 描述场景的简短自由文本标签 | | `options` | 对象 | 六个答案选项,键为 `"A"` 至 `"F"` | | `answer` | 字符串 | 正确答案的键(取值为 `"A"`–`"F"` 之一) | | `evidence` | 字符串 | JSON编码的时空证据对象数组 | #### 证据对象字段 `evidence`字段为JSON编码的列表,每个元素包含以下字段: | 字段名 | 数据类型 | 描述 | |---|---|---| | `evidence_start_time` | 字符串 | 片段开始时间,格式为 `"mm:ss"` | | `evidence_end_time` | 字符串 | 片段结束时间,格式为 `"mm:ss"` | | `evidence_instance_id` | 字符串 | 追踪的实例标识符(例如 `"person_FnH"`、`"car_lEu"`) | | `evidence_rationale` | 字符串 | 描述该证据因果贡献的自然语言文本 | | `SAV_instance_id` | 字符串 | 指向源SAV追踪文件的引用 | | `bboxes_in_range` | 对象 | 每秒对应的边界框;键为以字符串形式表示的整数秒,值为 `"[x_min, y_min, x_max, y_max]"` 格式的字符串 | #### 答案选项结构 每个问答项均包含六个答案选项,用于探测不同的失效模式: | 选项序号 | 类型 | |---|---| | 第1/6项 | 正确答案 | | 第2/6项 | 近似失误答案(结构一致,仅修改一个关键属性) | | 第3/6项 | 文本型干扰项(不观看视频也可能选对的似是而非选项) | | 第4/6项 | 近似失误文本型干扰项 | | 第5/6项 | 视频型干扰项(基于视频中存在的因果无关实例生成) | | 第6/6项 | 近似失误视频型干扰项 | 答案选项的键 `"A"`–`"F"` 会针对每个问答项随机打乱,因此正确答案并非始终对应固定字母。 --- ## 问题类型分类体系 CaST-Bench将问题分为四大顶级类别,覆盖因果推理的全场景: | 顶级类别 | 子类别 | |---|---| | **1. 因果解释** | 为何类问题(因果原因) | | | 如何类问题(作用机制) | | **2. 反事实推理** | 物理反事实 | | | 社会反事实 | | **3. 预测性预判** | 物理预测 | | | 行为预测 | | **4. 推理性描述** | 身份/角色推理 | | | 人际关系推理 | | | 目标/意图推理(非即时性) | | | 情绪/动机推理 | | | 技能/专业能力推理 | | | 所有权/归属推理 | | | 风险/安全评估 | | | 成功/失败推理 | | | 环境条件推理 | | | 其他上下文推理 | --- ## 数据拆分集 | 拆分集 | 文件 | 描述 | |---|---|---| | 测试集 | `castbench_hf.jsonl` | 用于快速评估的人工核验问答对 | 本次发布包含完整CaST-Bench基准测试中经过严格质量管控的子集。每个问答对均由专业标注人员人工审核,并通过了多阶段自动化过滤流程(详见下文数据集构建部分)。 --- ## 数据集构建 CaST-Bench通过**多阶段人机协作流水线**构建: 1. **视频筛选** — 视频源自[Segment Anything Video (SAV)](https://ai.meta.com/datasets/segment-anything-video/)数据集,该数据集提供密集标注的实例分割追踪结果。由视觉语言模型自动筛选出包含多名参与不同活动的人物、画面稳定且画质优异的视频。 2. **时空实例描述** — 针对每个追踪实例,通过三步流水线生成带时间戳的动作日志:(i) 将实例裁剪为独立片段,(ii) 使用高亮帧生成静态描述,(iii) 针对裁剪片段生成动态描述。随后由7名母语为英语的专业标注人员使用定制化网页标注工具,审阅并重写所有AI生成的描述,最终得到超过10000条高质量实例描述。 3. **问答与因果链生成** — 视觉语言模型“因果思考代理”以实例描述、视频和问题分类体系为输入,按照规定的JSON schema生成包含因果证据链的结构化问答对。 4. **多项选择干扰项生成** — 生成文本型和视频型干扰项,以及所有三类基础选项的近似失误变体,并验证其语义排他性。 5. **多阶段过滤** — (i) 纯文本大语言模型(Large Language Model, LLM)过滤器:移除无需观看视频即可回答的问题。(ii) 视频掩码过滤器:将所有因果链边界框涂黑;丢弃在掩码视频上仍可回答的条目。(iii) 专业标注人员进行最终质量审核并修订问答对与证据。 --- ## 引用 bibtex @inproceedings{zhang2026castbench, title = {CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering}, author = {Zhang, Mingfang and Pan, Jingjing and Kumar, Ashutosh and Saini, Rajat and Erdogan, Mustafa and Yang, Hsuan-Kung and Kang, Caixin and Huang, Yifei and Sato, Yoichi and Kong, Quan}, booktitle = {Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)}, year = {2026} } --- ## 许可协议 本基准测试的标注内容采用[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)协议发布。附带的视频片段源自SAV数据集,需遵守[SAV的原始许可条款](https://ai.meta.com/datasets/segment-anything-video/)。

提供机构:
wovenbytoyota-vai
搜集汇总
数据集介绍
wovenbytoyota-vai/CaST-Bench 数据集图片
构建方式
CaST-Bench数据集通过多阶段人机协同管道构建。首先,从SAV数据集中筛选出多人参与不同活动的稳定高质量视频片段。随后,为每个被跟踪的实例生成时空描述:通过实例裁剪、静态与动态描述生成,并由七名英语母语专家审查改写,最终获得超过一万条高质量描述。在此基础上,一个视觉语言模型“因果思维代理”依据实例描述、视频及问题分类法生成结构化的问答对与因果证据链,并配合文本与视频干扰项生成及邻近错误变体。最后,经过文本大语言模型过滤、视频掩码过滤及人工审核的多阶段质量控制,确保数据集的严谨性与可靠性。
使用方法
CaST-Bench专为快速可靠的视觉语言模型评估而设计。用户可从HuggingFace下载castbench_hf.jsonl测试集文件及对应视频片段。使用过程中,模型需根据视频与因果问题选择正确答案,并同时定位支撑答案的因果证据链时空位置,包括触发事件与后续影响的视觉证据。评估结果可提交至官方排行榜(HuggingFace Spaces)以与其他模型进行性能比较。数据集的CC BY 4.0许可协议允许学术与商业应用,而视频片段需遵守SAV原始许可条款。
背景与挑战
背景概述
CaST-Bench是由多位研究人员于2026年在CVPR会议上提出的基准数据集,旨在评估视觉-语言模型在因果链式时空推理任务上的能力。该数据集由来自多个机构的学者共同开发,核心研究问题聚焦于模型能否在视频问答中不仅选出正确答案,还能准确时空定位构成因果链条的视觉证据。通过对视频中因果关系触发事件及其下游效应的精细标注,CaST-Bench填补了现有视频理解基准在细粒度因果推理评估方面的空白,为衡量和推动视觉-语言模型在高阶认知任务上的进展提供了关键测试平台。
当前挑战
CaST-Bench所解决的领域挑战在于,现有视频问答基准大多关注表面视觉特征或简单时序关系,缺乏对因果链式推理的评估,模型难以理解事件之间的深层因果联系。构建过程中面临的挑战包括:从大规模视频数据中筛选出包含清晰多元人际活动的片段,生成数万条高质量时空实例描述并经过专业人工审核,设计六种精细干扰选项以探测模型的不同失败模式,以及通过多阶段过滤(如文本仅推理和掩码验证)确保问题无法凭常识或局部视觉线索解答,从而确保基准的评估效度。
常用场景
经典使用场景
CaST-Bench作为首个专注于因果链支撑的时空推理基准,其经典使用场景集中于评估视觉-语言模型在视频问答任务中的深层因果理解能力。在给定视频与因果问题时,模型不仅需从众多选项中甄别正确答案,更必须定位并解释支撑答案的因果链——涵盖触发事件与其下游效应的精细时空证据。这一设计突破性地衡量了模型能否超越表面视觉模式匹配,真正把握事件间的因果逻辑脉络。
解决学术问题
该数据集系统性地解决了现有视频问答基准难以评估因果链推理能力的核心短板。通过引入因果解释、反事实推理、预测性预期和推断性描述四类问题,以及精心设计的近误选项与基于视频的干扰项,CaST-Bench有效区分了模型是否真正依赖因果证据作答。其多阶段人工-AI协同构建流程,包括视频掩码过滤和人工验证,确保了数据质量,为深入探究视频理解中的因果推理机制提供了可靠实验平台。
实际应用
在实际应用中,CaST-Bench评估的能力对智能视频监控、自动驾驶场景理解、人机交互系统等关键领域具有深远意义。例如,监控系统需推断某一行为的原因(如人物为何奔跑)及其后续影响;自动驾驶车辆需预测其他交通参与者的意图并做出因果性判断。该基准为开发能够进行可靠因果推理的视觉系统提供了标准化的测试手段,推动相关技术从单纯模式识别向更深层次的事件理解演进。
数据集最近研究
最新研究方向
当前,视频理解领域正从粗粒度的场景识别迈向对因果链条与时空细粒度证据的深度推理。CaST-Bench作为首个聚焦于因果链时空定位的视频问答基准,巧妙融合了因果触发事件与下游效应的双重证据,将模型评估从单纯的答案正确性拓展至可解释的因果证据链输出。该数据集精心设计了六类选项以剖析不同失效模式,并涵盖因果解释、反事实推理、预测性预判、推断性描述四大类目,全面挑战模型在物理、社会、行为等多维度的因果关系建模能力。其发布正值多模态大模型亟需细粒度因果理解评估的风口,不仅为视频问答设立了新标杆,更有力推动着可解释视频推理系统的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务