遇见数据集

CAST-CVR

收藏
github2026-06-02 更新2026-06-05 收录
官方服务:

资源简介:

CAST-CVR是一个用于评估上下文感知视频检索中状态和身份一致性的基准数据集。它要求模型根据短视觉历史、文本指令和包含状态、身份及简单负样本的候选池,检索正确的下一个视频片段。数据集基于YouCook2、COIN和CrossTask三个现有教学视频数据集构建,仅发布注释文件,不包含原始视频。

CAST-CVR is a benchmark dataset for evaluating state and identity consistency in context-aware video retrieval. It requires models to retrieve the correct subsequent video clip based on short visual histories, textual instructions and a candidate pool containing states, identities and simple negative samples. The dataset is constructed from three existing instructional video datasets: YouCook2, COIN and CrossTask, and only the annotation files are released without including the original videos.

创建时间:
2026-06-02
原始信息汇总

数据集概述

CAST-CVR(ICML 2026)是一个为一致性视频检索(Consistent Video Retrieval, CVR)任务设计的基准数据集和评估框架。

核心任务

给定以下三项输入,模型需从候选池中检索出正确的下一段视频片段:

  1. 同一视频的短视觉历史(context_history)。
  2. 描述下一步的文本指令(query_text)。
  3. 包含9个候选(1对9)的候选池(candidates),其中包含状态负样本身份负样本简单负样本

该基准旨在分离普通文本-视频匹配任务与两个一致性要求:

  • 状态一致性:检索到的片段必须是正确的程序性下一步,而非同一视频中的其他步骤。
  • 身份一致性:检索到的片段必须保持相同的演员/场景/对象身份,而不仅仅是匹配其他视频中出现的文字指令。

数据集构成

CAST-CVR基于三个现有的教学视频数据集构建,本仓库仅发布标注文件,不包含原始视频。

来源数据集 分割 样本数 候选数
YouCook2 训练集 8,998 9
YouCook2 验证集 2,765 10
COIN 训练集 13,185 10
COIN 测试集 4,107 10
CrossTask 训练集 8,657 10
CrossTask 测试集 2,222 10

原始数据来源:

JSON 数据结构

每个样本包含以下字段:

  • query_text:查询文本指令。
  • query_id:样本的唯一标识符。
  • video_id:来源视频的标识符。
  • context_history:一个列表,包含历史视频片段(video_path, caption, id, lag)。
  • candidates:一个包含10个候选列表,每个候选包含 video_path, id, type, caption

候选的 type 包括:

  • ground_truth:正确的下一个片段。
  • state_negative:同一视频中错误的程序性状态。
  • identity_negative:来自不同视频/身份的语义相关指令。
  • easy_negative:随机的低混淆干扰项。

评估指标

对于每个样本候选列表上的分数向量,报告以下指标:

  • Acc(Recall@1):top-1准确率。
  • MnR:真实候选的平均1-indexed排名。
  • State:真实候选分数高于所有状态负样本的样本百分比。
  • Ident:真实候选分数高于所有身份负样本的样本百分比。

基线结果(CLIP ViT-B/32,无上下文)

数据集 分割 样本数 Acc MnR State Ident
YouCook2 验证集 2,765 25.03 3.61 50.42 35.77
COIN 测试集 4,107 14.07 3.90 40.44 25.59
CrossTask 测试集 2,222 16.83 4.15 45.72 25.34
搜集汇总
数据集介绍
CAST-CVR 数据集图片
构建方式
CAST-CVR是面向视频理解领域中的一致性问题而构建的基准数据集,旨在评估模型在检索过程中是否能够同时维持状态一致性与身份一致性。该数据集以三个现有教学视频数据集——YouCook2、COIN与CrossTask——为基础,通过系统性重组其视频片段与注释信息,生成面向一致性视频检索任务的标注样本。每个样本包含一个查询文本、一段来自同一视频的短时序视觉上下文,以及一个包含10个候选视频片段的池子,其中正例为正确的下一个步骤,负例则涵盖状态负例(同一视频中错误的步骤)、身份负例(语义相关但来自不同视频的片段)以及简单负例。这一结构使得CAST-CVR能够严格测试模型在视频时序推理与跨视频区分上的能力。
特点
CAST-CVR的核心特点在于其精心设计的候选池结构,旨在分离文本-视频匹配任务中的两种一致性维度。状态一致性要求模型能够区分同一视频中不同步骤的时序关系,而身份一致性则考验模型能否在语义相似但来源不同的视频之间保持对象、场景与主体的辨识力。此外,数据集涵盖三个教学视频领域,共计超过三万条标注样本,覆盖训练与验证/测试划分,支持可重复的基准评测。候选片段类型被明确标注为ground truth、state negative、identity negative与easy negative,配合Acc、MnR、State和Ident四项指标,可对模型的检索表现与两种一致性能力进行细粒度分析与对比。
使用方法
使用CAST-CVR时,用户需先从各原始数据集的官方网站获取视频文件,并将视频片段按说明预处理至本地目录。随后,可通过本仓库提供的验证与统计脚本检查数据完整性,或利用评测脚本对模型输出的预测分数进行评估。预测结果需以JSON或JSONL格式提交,每个样本对应一个分数向量,顺序与候选池一致。仓库还附带了可选的零样本CLIP基线脚本,支持无上下文检索或融合视觉连续性的简单策略,方便研究者快速建立参考结果。评测脚本会输出包括Acc、MnR、State与Ident在内的多项指标,以全面衡量模型在一致性视频检索任务上的表现。
背景与挑战
背景概述
视频检索领域长期致力于弥合自然语言指令与视觉内容之间的语义鸿沟,然而现有基准多聚焦于粗粒度的文本-视频匹配,忽略了视频序列中状态演替与身份一致性的精细约束。在此背景下,由加州大学圣克鲁兹分校研究团队主导,联合多位学者于2025年提出了CAST-CVR基准(发表于ICML 2026),旨在推动**一致性视频检索(CVR)**这一新兴任务的发展。该基准基于YouCook2、COIN和CrossTask三大经典教学视频数据集,精心构建了包含时序上下文、指令查询及三重负样本候选池的评测体系,系统性地评估模型在状态一致性与身份一致性两方面的能力。CAST-CVR的发布填补了视频检索在细粒度时序推理方面的空白,为多模态学习研究提供了极具挑战性的标准化测试平台,迅速成为该领域的重要参考基准。
当前挑战
CAST-CVR基准所面临的挑战首先源于其核心研究问题的复杂性:传统视频检索仅要求语义匹配,而CVR任务要求模型同时满足状态一致性(正确识别视频中的下一个程序性步骤)与身份一致性(确保检索片段与历史片段共享同一角色、场景或物体),这远超现行多模态模型的推理能力。从基准构建角度来看,挑战同样显著:创建者需从原始数据集中提取具有明确时序依赖的片段对,并精心设计四类候选样本(真值、状态负例、身份负例、易负例),以排除简单语义匹配的干扰。此外,为了确保评测的公平性与可复现性,基准仅发布标注文件而不包含原始视频,使用者需自行获取并处理视频数据,这在一定程度上增加了实验设置的复杂性。这些挑战共同塑造了CAST-CVR作为评测模型时序理解与身份保持能力的标杆地位。
常用场景
经典使用场景
在视频理解与检索领域,CAST-CVR数据集被广泛用于评估模型在复杂视觉状态转换下的检索能力。其经典使用场景是要求模型基于同一视频中的短时序视觉历史片段和一条描述下一步骤的文本指令,从包含真实正例、状态负例、身份负例及易混淆负例的候选池中,精准定位正确的下一个视频片段。这一设计使得研究者能够在细粒度层面测试模型是否同时满足状态一致性与身份一致性,而非仅仅停留在粗粒度的文本-视频匹配上。
解决学术问题
CAST-CVR数据集着力于解决传统视频检索任务中忽视的跨步骤语义连贯性与视觉同一性保持这两大核心学术难题。其所定义的状态一致性要求模型能够区分同一视频内不同步骤间的细微差异,而身份一致性则强调模型需捕捉场景、人物或对象在视频间的延续性,避免因单纯匹配指令文本而导致错误。这一框架有效弥补了现有基准在评估视频检索鲁棒性方面的不足,为推进时序推理与视觉语义对齐研究提供了关键的评测平台。
衍生相关工作
依托CAST-CVR数据集,衍生出了一系列推动视频理解边界的重要工作。其中,CLIP基线方法被广泛用作零样本检索的参考锚点,而上下文融合基线则探索了视觉连续性与文本匹配的简单结合策略。此外,该基准催生了针对状态负例与身份负例的专项优化方法,研究者围绕度量学习、对比学习及多模态时序建模等方向提出创新框架,显著提升了视频检索在步骤区分与跨场景泛化上的性能,形成了丰富的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务