CRONOS
收藏资源简介:
CRONOS是由弗赖堡大学等机构创建的干预式基准数据集,旨在评估视频模型的反事实物理一致性。该数据集包含675个高保真视频,通过虚幻引擎环境生成,涵盖了碰撞、坠落和遮挡三种物理事件,并系统干预了场景、视角、物体外观和类别四个维度。其创建过程基于可控的物理模拟,独立操纵视觉因素以保持底层事件类型不变。该数据集主要应用于视频生成模型的评估与诊断,旨在解决模型在视觉输入受控变化下是否保持物理预测一致性的核心问题,推动构建具有稳健因果表征的世界模型。
CRONOS is an interventional benchmark dataset developed by the University of Freiburg and other institutions, designed to evaluate the counterfactual physical consistency of video models. This dataset contains 675 high-fidelity videos generated using the Unreal Engine environment, covering three types of physical events: collision, falling, and occlusion. It systematically intervenes along four dimensions: scene, viewpoint, object appearance, and object category. Its construction is based on controlled physical simulations, where visual factors are independently manipulated while the underlying event type remains unchanged. This dataset is primarily used for the evaluation and diagnosis of video generation models, aiming to address the core question of whether models maintain physical prediction consistency under controlled visual input changes, and promote the construction of world models with robust causal representations.
数据集概述:CRONOS
CRONOS 是一个用于评估视频模型反事实物理一致性的干预式基准测试。其核心目标是衡量模型在视觉输入受控变化(如场景、视角、物体外观和类别)下,物理事件预测的合理性。
基准测试设计
- 核心思想:将视频模型评估视为可控的反事实实验。每个物理事件通过一次仅干预一个场景因素(保持其他因素不变)的方式,渲染成多个反事实观测样本。
- 物理事件:涵盖三种基础刚体相互作用:坠落(物体从边缘跌落)、碰撞(物体相互撞击)、遮挡(物体被遮挡后复现)。
- 系统性视觉干预:对每个物理事件,单独干预以下四个因素:
- 相机视角:改变渲染视角,检验模型是否将场景几何与运动分离。
- 物体外观:改变主体物体的视觉属性(如颜色),不改变物理参数。
- 场景:替换整个场景(背景、光照、布局),检验模型是否能根据新环境调整事件动态。
- 物体类别:替换主体物体,同时改变视觉属性和物理参数(质量、摩擦力)。
评估指标
CRONOS 使用多个互补的逐视频指标来衡量生成质量,并经过人工评分验证:
- 背景稳定性:环境随时间的变化程度。
- 外观稳定性:物体外观随时间的一致性。
- 3D形状稳定性:物体几何形状在视频中的一致性。
- 运动相似性:与参考渲染视频的运动一致性。
- 物理合理性:使用 VLM(Qwen3-VL-32B)针对特定物理问题进行判断。
- 成功率:基于人工校准阈值的二元通过/失败聚合指标。
主要发现
- 所有评估的视频模型在生成基本刚体物理短片段上均表现失败。最强的模型(Cosmos2.5-2B V2V)也仅实现 22% 的成功率,部分模型低于 5%。
- 没有模型实现反事实一致性:每一项干预(包括表面外观变化,尤其是视角、物体类型和场景干预)下,生成质量都会发生大幅变化。
- 视频条件化不仅有助于运动预测:V2V 模式不仅在运动保真度上优于 I2V,在背景和物体稳定性方面也表现更好,表明额外的条件帧有助于在推理时形成更稳定的内部表征。
- 仅凭模型规模提升是不够的:将 Cosmos 参数从 2B 扩展到 14B,并未带来任何物理事件生成性能的提升。
基准结果
以下为所有视频的平均性能。表格展示主要成功率指标;各分项指标(背景稳定性、运动相似性、外观稳定性、3D形状、物理合理性)的分数为 0-1 尺度。
| 排名 | 模型 | 模式 | 成功率 |
|---|---|---|---|
| 1 | Cosmos2.5-2B | V2V | 0.22 |
| 2 | Wan2.2-14B | I2V | 0.20 |
| 3 | Cosmos2.5-14B | V2V | 0.14 |
| 4 | Cosmos2.5-2B | I2V | 0.12 |
| 5 | Cosmos2.5-14B | I2V | 0.08 |
| 6 | MAGI-1-4.5B | I2V | 0.02 |
| 6 | CogVideoX1.5-5B | I2V | 0.02 |
| 8 | MAGI-1-4.5B | V2V | 0.01 |
数据集的局限性
- 合成到真实的域差距:使用 Unreal Engine 渲染虽然实现了必要的控制,但引入了域差距。
- 单参考展开:多数指标与一个渲染参考进行比较,而条件化允许多种合理的未来。已通过多种子评估和与参考无关的稳定性指标进行缓解。
- 评估模型的范围:仅限于可重复设置的开源模型,未包含封闭的商业系统。
BibTeX 引用
bibtex @misc{begiristain2026cronos, title = {{CRONOS}: Benchmarking Counterfactual Physical Consistency in Video Models}, author = {Begiristain, Le{o}n and D{"u}nkel, Olaf and Kortylewski, Adam}, year = {2026}, eprint = {XXXX.XXXXX}, archivePrefix = {arXiv}, primaryClass = {cs.CV} }





