遇见数据集

StateBench

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

StateBench是一个用于评估视频续写中世界状态推理能力的基准数据集,源自论文《Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation》。该数据集包含200个跨片段续写任务,分为三个难度级别:past_visible(85个任务,目标对象在先前帧中可见,测试时间记忆)、occluded_process(65个任务,状态变化发生在对象被遮挡时,测试过程推理)、complex_transition(50个任务,多个状态转换或冲突线索,测试组合推理)。每个任务包含元数据字段:id、difficulty、target_object、shots、expected_state、checklist和reference_frames。该数据集旨在评估视频生成模型在续写过程中对物体状态变化的理解与预测能力。

StateBench is a benchmark dataset for evaluating world-state reasoning capabilities in video continuation, derived from the paper Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation. It contains 200 cross-segment continuation tasks across three difficulty levels: past_visible (85 tasks, where the target object is visible in previous frames, testing temporal memory), occluded_process (65 tasks, where state changes occur when the object is occluded, testing process reasoning), and complex_transition (50 tasks, involving multiple state transitions or conflicting cues, testing compositional reasoning). Each task includes metadata fields: id, difficulty, target_object, shots, expected_state, checklist, and reference_frames. The dataset aims to evaluate video generation models ability to understand and predict object state changes during continuation.

创建时间:
2026-09-02
原始信息汇总

StateBench 数据集详情

数据集简介

StateBench是一个用于视频延续中的世界状态推理(World-State Reasoning in Video Continuation)的基准测试数据集,源自论文《Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation》(论文链接:https://huggingface.co/papers/2609.03673)。

许可证

  • Apache-2.0

任务类别

  • 文本到视频(text-to-video)

数据集规模与难度分级

该基准包含200个跨片段延续任务,按难度分为三个等级:

难度级别 数量 描述
past_visible(过去可见) 85 目标物体在先前的帧中可见——测试时间记忆能力
occluded_process(遮挡过程) 65 状态变化发生在物体被遮挡期间——测试过程推理能力
complex_transition(复杂转换) 50 多个状态转换或冲突线索——测试组合推理能力

数据字段

每个任务包含以下元数据:

  • id:任务标识
  • difficulty:难度等级
  • target_object:目标物体
  • shots:镜头/片段信息
  • expected_state:预期状态
  • checklist:检查清单
  • reference_frames:参考帧

相关资源

  • 代码仓库:https://github.com/AMAP-ML/StateAgent
搜集汇总
数据集介绍
StateBench 数据集图片
构建方式
视频生成领域对世界状态推理能力的评估长期缺乏系统性基准,StateBench的构建正是为填补这一空白。该数据集围绕跨片段视频延续任务,精心设计了200个测试样例,依据认知难度划分为三个层级:past_visible层级包含85个任务,目标物体在先前帧中可见,用以考察时序记忆能力;occluded_process层级涵盖65个任务,状态变化发生于物体被遮挡期间,旨在检验过程推理能力;complex_transition层级则设置50个任务,涉及多重状态转换或冲突线索,用于评估组合推理能力。每个任务均配备丰富的元数据,包括唯一标识符、难度标签、目标物体、镜头信息、预期状态、检查清单以及参考帧,为模型评估提供结构化依据。
特点
StateBench的核心特点在于其层级化的难度设计与多维度的元数据标注。数据集通过past_visible、occluded_process和complex_transition三个难度级别,系统性地覆盖了从简单时序记忆到复杂组合推理的认知梯度,能够精细刻画视频生成模型在世界状态推理上的能力边界。每个任务附带的元数据如target_object、shots、expected_state和checklist等,不仅明确了任务目标与预期结果,还为自动化评估提供了可操作的检查标准。参考帧的引入进一步增强了任务的可复现性与评估的客观性,使得该基准兼具诊断性与可扩展性。
使用方法
使用StateBench时,研究者可依据任务元数据中的difficulty字段筛选特定难度的测试样例,针对模型在时序记忆、过程推理或组合推理方面的表现进行专项评估。每个任务的checklist和expected_state提供了明确的评判标准,可结合参考帧对模型生成的延续视频进行逐项核验。通过对比模型在不同难度层级上的通过率,能够量化其世界状态推理能力的强弱。该基准适用于视频生成模型的系统性评测,也可作为训练过程中的验证集,引导模型学习跨片段的连贯状态追踪。
背景与挑战
背景概述
视频生成技术日臻成熟,然而其是否具备跨片段追踪世界状态的能力,始终未获系统审视。2025年,高德机器学习团队发布StateBench,作为视频续写中世界状态推理的首个基准,旨在回答视频生成器能否在片段更迭间保持对物体状态的连贯认知。该基准构建了200项跨片段续写任务,依认知难度分为可见过去、遮挡过程与复杂转换三级,分别考察时序记忆、过程推理与组合推理。StateBench的提出填补了视频生成评测在动态世界建模维度的空白,为衡量生成模型的物理常识与因果连贯性提供了量化标尺,亦推动了世界模型研究从静态感知向动态推理的范式迁移。
当前挑战
该基准所应对的核心领域问题,在于视频生成模型普遍缺乏跨时间片段的状态追踪能力,难以在遮挡、多物体交互或状态突变后维持世界表征的一致性。构建过程中,研究者面临多重挑战:其一,设计兼具代表性与区分度的跨片段任务,需确保状态变化可被客观验证且不依赖主观判断;其二,标注遮挡过程中的状态演变,要求精细的时序逻辑与因果推理,人工标注成本高昂且易引入噪声;其三,复杂转换任务涉及多重状态叠加与冲突线索,如何平衡难度梯度以有效区分模型能力,仍需持续探索。此外,参考帧与检查表的构建亦须兼顾多样性与公平性,避免数据偏差导致评测失真。
常用场景
经典使用场景
在视频生成与理解领域,时序一致性与世界状态追踪始终是衡量模型智能水平的关键标尺。StateBench作为面向视频续写任务的世界状态推理基准,其经典使用场景在于评估生成模型能否在跨片段续写中准确追踪目标物体的状态演变。该基准精心构建了两百项跨片段续写任务,涵盖过去可见、遮挡过程以及复杂转换三个难度层级,分别检验模型的时间记忆能力、过程推理能力与组合推理能力,从而为视频生成模型的动态世界建模水平提供系统化、细粒度的诊断工具。
解决学术问题
该数据集直面学术研究中长期存在的核心难题,即视频生成模型是否真正具备跨片段的世界状态追踪能力。过往研究多聚焦于单一片段内的视觉逼真度,难以揭示模型对物体状态连续性的理解深度。StateBench通过设计遮挡过程与复杂转换等任务,有效区分了模型是基于表面统计相关性进行生成,还是真正维护了内在的世界状态表征,为因果推理、物理常识与时空记忆等前沿议题提供了可复现的评测范式,推动了视频生成研究从感知逼真向认知一致的范式跃迁。
衍生相关工作
围绕StateBench,研究者提出了配套的StateAgent方法,旨在增强视频生成模型的世界状态推理能力,形成了基准与方法的协同创新。该基准亦激发了后续关于跨片段一致性建模、状态感知视频扩散模型以及时序记忆增强架构的系列探索。相关经典工作涵盖从评测协议设计到推理机制改进的完整链条,为视频生成领域的世界建模研究奠定了重要的方法论基础,并持续推动着该方向向更深层次的认知智能迈进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务