FeVOS
收藏数据链接:
官方服务:
资源简介:
FeVOS是一个前瞻性表达视频对象分割数据集,包含968个视频片段、14,525个前瞻性表达和2,904个思维链标注,用于支持预测性推理任务,旨在评估需要预决策时空推理的场景。
FeVOS is a forward-looking referring expression video object segmentation dataset. It comprises 968 video clips, 14,525 forward-looking referring expressions, and 2,904 chain-of-thought annotations. This dataset supports predictive reasoning tasks and aims to evaluate scenarios requiring pre-decision spatio-temporal reasoning.
创建时间:
2026-06-23
原始信息汇总
数据集概述
FeVOS (Foresight Expression Video Object Segmentation) 是一个面向前瞻性表达能力视频目标分割任务的数据集,由复旦大学团队构建,发表于 ECCV 2026。
任务定义
该数据集提出“前瞻性表达能力视频目标分割”任务,要求模型在观察到视频帧中,根据描述未来事件或动作的前瞻性表述,预测并分割出相关对象的掩码。例如在自我中心视频中,回答“接下来会使用什么工具?”这类问题,需要模型进行时空推理。
数据集规模
- 视频片段数量:968 个
- 前瞻性表达数量:14,525 条
- 思维链(Chain-of-Thought)注释:2,904 条,提供显式且可解释的推理步骤
数据来源与内容
- 面向需要预判性时空推理的场景,支持对未来事件、动作或工具等对象的预测。
- 包含自中心视角等场景,要求模型从观察到的时间线索中推理并输出观察帧中目标对象的掩码。
数据集获取
- 数据集完整基准可在 Hugging Face 平台获取:https://huggingface.co/datasets/lannn2333/FeVOS
- 对应的基础模型 FeVOS-R1 可在 Hugging Face 获取:https://huggingface.co/lannn2333/FeVOS-R1
基线模型
- FeVOS-R1:基于多模态大语言模型(MLLM)构建,采用两阶段训练流程(监督微调 + 强化学习),是该数据集的基线模型,在 FeVOS 数据集上达到最优性能,并展现了良好的泛化能力。
发布计划
- ✅ 数据集和模型已在 Hugging Face 发布
- ❌ 完整训练配置和代码待发布
搜集汇总
数据集介绍

构建方式
FeVOS数据集的构建源于对现有指代视频对象分割任务局限性的深刻洞察。现有方法多聚焦于描述已观测帧中对象的事件、动作或外观,缺乏对未来事件进行预判性时空推理的能力。为弥补这一空白,研究者设计了前瞻性表达视频对象分割任务,并精心构建了FeVOS数据集。该数据集包含968个视频片段,共标注了14,525条前瞻性表达,并额外提供了2,904条思维链注释,旨在为模型提供明确且可解释的推理步骤。数据集的构建注重场景的多样性与推理的复杂性,尤其侧重于第一人称视角下的工具使用等需要预判未来动作的典型场景,从而确保数据能够有效驱动模型学习面向未来的时空推理能力。
使用方法
使用FeVOS数据集进行研究和模型开发,首先需从Hugging Face平台获取完整的数据集资源,并将其存放于项目根目录下的`data/`文件夹中。对于快速评估,研究人员可直接下载预训练的FeVOS-R1模型权重至`models/`目录,并通过运行`bash scripts/reproduce_eval.sh`脚本一键复现在FeVOS基准上的性能表现。若需自行训练模型,可参照即将发布的完整训练配置和代码,利用数据集提供的监督微调和强化学习两阶段流程进行定制化开发。数据集以标准化格式组织,支持与Sa2VA、VLM-R1等现有框架的无缝集成,便于研究人员快速上手并开展前瞻性视频对象分割的探索性工作。
背景与挑战
背景概述
在视频理解领域,现有指代视频目标分割任务主要聚焦于对已观测帧中物体的事件、动作或外观进行描述与分割,却缺乏对尚未发生事件的预判性时空推理能力评估,这严重制约了模型在复杂动态场景中的前瞻性应用。为填补这一空白,复旦大学研究团队于2026年提出前瞻性表达视频目标分割任务,旨在通过推理未来视频片段中的事件,在已观测帧中为目标物体生成遮罩作为视觉答案。该团队构建了FeVOS数据集,包含968个视频片段、14,525条前瞻性表达及2,904条思维链注释,为模型提供可解释的推理步骤。FeVOS的推出不仅定义了视频感知中预测推理的新基准,还通过所提模型FeVOS-R1在多个基准上展现出卓越性能,激发了该领域的广泛研究热潮。
当前挑战
FeVOS的核心挑战在于解决视频理解中缺乏前瞻性时空推理能力的瓶颈。传统指代视频目标分割仅能处理已发生事件的描述,而FeVOS要求模型从已观测帧中挖掘线索,预测即将使用的工具或物体,这对模型在时空上下文理解、因果推理及动作预判能力上提出了极高要求。此外,构建过程中亦面临诸多困难:前瞻性表达具有高度抽象性与歧义性,需要精心设计表述以覆盖多样化预测场景;同时,为确保推理步骤的可解释性,需手工标注大量思维链数据,而视频时序的连续性与复杂交互又加剧了标注一致性挑战。数据集的规模与多样性平衡也是难题,需在有限视频片段中充分涵盖不同预测类型,以支撑模型泛化能力。
常用场景
经典使用场景
在视频理解与推理领域,FeVOS数据集被广泛应用于前瞻性表达视频目标分割(Foresight Expression Video Object Segmentation)任务。该任务要求模型根据当前观测帧中的时空线索,理解并回答关于未来视频片段中即将发生的事件或对象变化的自然语言查询,例如在第一人称视角视频中回答“接下来会使用什么工具?”,并精准分割出该工具在当前帧中的像素级掩码。FeVOS通过提供968个视频片段、14,525条前瞻性表达及2,904条思维链标注,为模型训练提供了富含因果推理与时空预测的监督信号,推动了从被动描述到主动预测的视频感知范式转变。
解决学术问题
FeVOS数据集针对性地解决了现有视频目标分割任务(如常规指代视频分割)在时空前瞻性推理能力上的根本性缺失。传统工作局限于对已发生事件、动作或外观的描述,无法应对需基于当前信息预判未来事件并产出视觉答案的挑战。FeVOS引入“前瞻表达”概念,构建了首个评估模型在观测帧内定位未来对象能力的基准,填补了视觉预决策推理的学术空白。其附带的高质量思维链标注为可解释的推理步骤提供了监督,推动了细粒度时空因果推理的研究,并对视频感知、事件预测和智能决策等方向产生了深远的方法论影响。
实际应用
在实际应用层面,FeVOS数据集赋能了一系列需要前瞻性视觉推理的场景。在自动驾驶中,系统可依据当前路况与指令,提前分割出即将交互的目标(如下一个要避让的行人或即将使用的转向灯),从而增强决策的预见性。在智能机器人领域,FeVOS可让机器人根据操作者的自然语言指令,实时预测并定位下一步将要抓取的工具或零件,提升人机协作效率。此外,在视频监控与安防系统中,该数据集有助于模型从过往片段中提前识别可疑行为或即将出现的危险物体,为主动预警与干预提供视觉依据。
数据集最近研究
最新研究方向
FeVOS数据集开创了“前瞻性表达视频物体分割”(Foresight Expression Video Object Segmentation)这一全新任务范式,突破了传统视频物体分割仅依赖已观测帧内事件、动作或外观的局限,首次要求模型基于视频中的时空线索推理未来事件,并生成当前帧中相关物体的分割掩码作为视觉答案。该工作通过引入包含968个视频片段、14,525条前瞻性表达及2,904条链式推理标注的FeVOS数据集,并训练出基于多模态大语言模型的FeVOS-R1模型,在实现最先进性能的同时展现出对现有基准的强泛化能力。这一研究方向紧密关联具身智能与第一人称视觉理解等前沿热点,为机器人决策、人机交互等场景下的预判性视觉感知提供了关键数据和模型基础,推动了视频理解从“描述过去”向“预测未来”的跨越。
以上内容由遇见数据集搜集并总结生成



