遇见数据集

CRONOS-benchmark

收藏
Hugging Face2026-05-26 更新2026-05-27 收录
官方服务:

资源简介:

CRONOS-Benchmark是一个受控的合成基准数据集,旨在评估视频世界模型中的反事实物理一致性。该数据集通过测试生成式视频模型是否能在不同场景、物体和视角下正确模拟三种基本物理事件类型——物体坠落、物体碰撞和物体遮挡,来提供标准化评估。数据集包含675个在受控仿真环境中渲染的序列,每个序列捕获一种物理事件类型,前景物体被放置在逼真的室内或室外场景中。每个序列均提供90帧的真实多模态标注,包括RGB彩色渲染帧、深度图和物体分割掩码。此外,每个序列还包含一个5帧的条件剪辑视频和一个`metadata.json`文件,其中包含序列标识符和描述预期物理事件的自然语言提示。数据按事件类型、场景(公寓、房屋、花园、池子、厨房)、物体(瓶子、罐子、网球、玩具卡车、足球)、外观(三种变体)和视角(近、前、侧、顶;遮挡事件仅侧视)进行组织。该数据集专门用于评估以图像或视频为条件的视频生成模型在物理事件生成任务上的性能。所有内容均为合成生成,不包含个人或敏感信息。

CRONOS-Benchmark is a controlled synthetic benchmark dataset designed to evaluate counterfactual physical consistency in video world models. It provides standardized evaluation by testing whether generative video models can correctly simulate three basic physical event types—object falling, object collision, and object occlusion—across different scenes, objects, and viewpoints. The dataset contains 675 sequences rendered in a controlled simulation environment, each capturing one physical event type, with foreground objects placed in realistic indoor or outdoor scenes. Each sequence provides 90 frames of ground-truth multimodal annotations, including RGB color-rendered frames, depth maps, and object segmentation masks. Additionally, each sequence includes a 5-frame conditioning clip video and a `metadata.json` file containing a sequence identifier and a natural language prompt describing the expected physical event. The data is organized by event type, scene (apartment, house, garden, pool, kitchen), object (bottle, can, tennis ball, toy truck, soccer ball), appearance (three variants), and viewpoint (close, front, side, top; occlusion events are side-view only). This dataset is specifically designed to evaluate the performance of image- or video-conditioned video generation models on physical event generation tasks. All content is synthetically generated and contains no personal or sensitive information.

创建时间:
2026-05-19
原始信息汇总

CRONOS-Benchmark 数据集概述

基本信息

  • 许可证: Apache 2.0
  • 任务类别: video-to-video, image-to-video
  • 数据集大小: 10GB ~ 100GB
  • 数据集规模: 675 个序列,共 182,250 帧 JPEG 图像,1,350 个 MP4 文件,未压缩大小约 18.8 GB

数据集描述

CRONOS-Benchmark 是一个受控的、合成生成的基准数据集,用于评估视频世界模型中的反事实物理一致性。它测试生成式视频模型能否正确模拟三种基本物理事件类型:物体下落 (fall)物体碰撞 (collision)物体遮挡 (occlusion),场景、物体和视角多样化。

每个序列提供真实标注的 RGB 帧、深度图和分割掩码,以及一个 5 帧的条件剪辑和 metadata.json 文件,支持对接受图像或视频条件输入的任何视频生成模型进行标准化评估。

数据集结构

分类体系

维度 取值
事件类型 fall, collision, occlusion
场景 apartment, house, garden, pool, kitchen
物体 Bottle, Can, TennisBall, ToyTruck, SoccerBall
外观变体 appearance_0, appearance_1, appearance_2
视角 close, front, side, top (fall/collision);side (仅 occlusion)

序列数量

事件类型 序列数
fall 300
collision 300
occlusion 75
总计 675

目录结构

dataset/ └── {event}/ # fall | collision | occlusion └── {scene}/ # apartment | house | garden | pool | kitchen └── {object}/ # Bottle | Can | TennisBall | ToyTruck | SoccerBall └── {appearance}/ # appearance_0 | appearance_1 | appearance_2 └── {viewpoint}/ # close | front | side | top ├── rgb/ # 90 × frame_XXXX.jpg (1920×1080, 彩色) ├── depth/ # 90 × frame_XXXX.jpg (1920×1080, 深度) ├── mask/ # 90 × frame_XXXX.jpg (1920×1080, 二值掩码) ├── movies/ │ ├── complete.mp4 # 完整 90 帧序列 │ └── conditioning_5.mp4 # 前 5 帧 (条件输入) └── metadata.json # 序列元数据和文本提示

数据模态

模态 格式 分辨率 描述
RGB JPEG 1920 × 1080 场景彩色渲染
Depth JPEG 1920 × 1080 每帧深度图
Mask JPEG 1920 × 1080 每个物体的分割掩码
complete.mp4 MP4 1920 × 1080 完整真实标注序列(90 帧)
conditioning_5.mp4 MP4 1920 × 1080 前 5 帧,用作模型条件输入
metadata.json JSON 序列标识符(事件、场景、物体、外观、视角)和描述预期物理事件的自然语言提示

使用场景

  • 直接用途: 评估视频生成/世界模型对物理事件生成的能力。给定第一帧或条件剪辑,模型需要生成序列的剩余帧。
  • 超出范围的使用: 真实世界场景理解(数据完全为合成数据)。

数据集创建

  • 数据来源: 所有序列使用 UnrealEngine5 合成渲染,3D 资产购自 Unreal Engine 资产商店 (FAB)。
  • 个人信息: 不包含任何个人信息或敏感信息,所有内容均为合成生成。

偏差、风险与局限性

  • 合成域差距: 在真实视频上训练或微调的模型可能因其真实能力与合成场景外观之间的差距而表现不佳。
  • 有限的场景和物体集: 组合设计限制了每种视觉因素的变体数量,仅包含五个场景、五个物体和四个视角。
搜集汇总
数据集介绍
CRONOS-benchmark 数据集图片
构建方式
CRONOS-benchmark 是一个专为评估视频世界模型中反事实物理一致性而设计的受控合成基准数据集。该数据集通过 UnrealEngine5 渲染引擎生成,所有三维资产均购自虚幻引擎资产商店,确保了视觉保真度与可控性。数据集涵盖物体下落、碰撞与遮挡三种基本物理事件类型,每种事件均在五种室内外场景(如公寓、花园、泳池等)中,结合五种前景物体与四种摄像机视角进行组合生成,最终构成 675 个序列。每个序列包含 90 帧高分辨率(1920×1080)RGB 图像、深度图与分割掩码,并提供完整的 90 帧视频与仅含前 5 帧的条件输入视频,以及包含自然语言提示与序列元数据的 JSON 文件,为标准化评估提供多模态真值标注。
特点
该数据集的核心特点在于其精细的轴级分类体系与丰富的模态覆盖。数据按照事件类型、场景、物体、外观变化与视角五个维度进行系统组织,形成清晰的层次化目录结构,便于研究者针对特定物理事件或视觉因素进行细粒度分析。每个序列均提供 RGB、深度与分割掩码三种模态的真值数据,其中深度图与掩码为验证模型对物体空间关系与遮挡推理的能力提供了客观依据。此外,数据集包含 5 帧条件视频作为输入,完美适配图像到视频与视频到视频生成模型的评估需求,而自然语言提示则进一步支持对生成内容语义一致性的检验。
使用方法
CRONOS-benchmark 的使用方法直观且标准化。用户可将任一序列的前 5 帧条件视频或首帧作为输入,要求视频生成模型或世界模型预测后续 85 帧的完整序列。模型输出的帧序列可与真值 RGB、深度及掩码进行像素级对比,从而量化其物理事件模拟的准确性。数据集通过简单的目录结构(事件/场景/物体/外观/视角)进行访问,配合每个序列内的 metadata.json 文件,用户可轻松提取所需条件与标签。代码库与项目页面提供了详细的加载脚本与评估流程,研究者可快速集成并开展针对反事实物理一致性的标准化评测。
背景与挑战
背景概述
CRONOS-Benchmark是一个由León Begiristain、Olaf Dünkel和Adam Kortylewski等研究人员于2026年构建的综合性合成基准数据集,旨在评估视频生成模型在反事实物理一致性方面的能力。该数据集通过模拟物体坠落、碰撞与遮挡三种基础物理事件,结合五种场景、五种物体及多种视角,为视频世界模型提供了严格的测试平台。其核心研究问题在于探究当前生成式视频模型能否准确模拟物理因果关系,从而推动模型从简单视觉合成向具备物理常识的智能体演进,对视频生成、因果推理及物理模拟等领域具有重要影响力。
当前挑战
CRONOS-Benchmark所解决的领域问题在于,现有视频生成模型常缺乏对物理规律的基本理解,难以在生成过程中保持反事实物理一致性,例如物体落下轨迹、碰撞后的运动或遮挡关系的正确表现。数据集构建过程中面临的主要挑战包括:在合成环境中精确模拟真实物理行为,需确保场景、物体与视角的多样性组合以避免过拟合,同时提供多模态标注如深度图与分割掩码以支持标准化评估;此外,合成数据与真实世界之间的域差异限制了模型泛化能力,且数据量有限,仅包含675个序列,难以覆盖全部物理交互的复杂性。
常用场景
经典使用场景
CRONOS-benchmark 数据集专为评估视频生成模型在反事实物理一致性方面的表现而设计,其经典使用场景聚焦于检验模型对物体下落、碰撞与遮蔽三种基本物理事件的模拟能力。研究者将数据集提供的五帧条件片段作为输入,要求模型生成后续帧序列,并通过对比生成结果与地面真值(RGB、深度图与分割掩码)之间的偏差,量化模型对物理法则的遵循程度。这一范式能够系统性地揭示当前视频世界模型在因果推理与时空连贯性上的薄弱环节,为理解模型是否真正习得了物理世界的运作规律提供了标准化测试平台。
衍生相关工作
CRONOS-benchmark 的发布催生了多个围绕视频物理一致性的评测与改进研究。其配套论文提出的反事实评估框架已被后续工作用作衡量视频生成模型(如 Sora、VideoLDM 等)物理忠实度的基准。受该数据集启发,研究者开始探索将物理约束嵌入扩散模型和自回归视频架构的新方法,例如通过引入可微物理引擎作为损失项或设计因果注意力机制来强化帧间逻辑关联。此外,该数据集的多模态标注(RGB-深度-掩码)也促进了视觉推理任务中跨模态物理先验蒸馏技术的开发,推动了视频模型从表象生成向深层物理理解演化的学术生态建设。
数据集最近研究
最新研究方向
CRONOS-Benchmark数据集聚焦于视频世界模型的反事实物理一致性评估,通过合成渲染的675个序列覆盖物体坠落、碰撞和遮挡三类基本物理事件,结合多视角、多场景与多物体外观的细粒度控制,为生成式视频模型在物理因果推理能力上的标准化评测提供了关键基准。该数据集的设计回应了当前视频生成领域对模型是否真正理解物理规律而非仅学习表面模式的深层追问,尤其与近期关于世界模型可解释性、物理常识嵌入以及生成内容可靠性等热点议题紧密关联。通过提供多模态地面真值(RGB、深度、掩码)与条件输入范式,它推动了从单纯视觉质量评估到物理逻辑一致性验证的研究转向,对构建更稳健、可解释的下一代视频智能系统具有重要方法论意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务