Craft
收藏arXiv2025-09-30 收录
数据链接:
官方服务:
资源简介:
该数据集是一个用于在离散动作空间中测试任务分解的格子世界环境。在这个环境中,智能体配备了任务和草图。为了支持部分观察,环境被适配以提供一个以自我为中心的窗口。该数据集的主要任务是研究离散动作空间中的任务分解。
This dataset is a grid-world environment designed for testing task decomposition in discrete action spaces. In this environment, the AI Agent is equipped with both the task and its sketch. To support partial observation, the environment is adapted to provide an egocentric window. The main task of this dataset is to study task decomposition in discrete action spaces.
搜集汇总
数据集介绍
构建方式
CRAFT数据集的构建依托于Box2D物理模拟引擎,在20种不同的虚拟场景布局中生成10秒时长的2D视频片段,空间分辨率为256×256像素。每个场景包含静态元素(如斜坡、平台、篮子)与动态物体(具有形状、大小、颜色等属性),通过随机初始化属性值确保场景多样性。为支持因果推理,系统不仅记录原始视频,还为每个动态物体生成移除该物体后的变体视频,用于构建反事实问题。基于这些模拟,提取碰撞、触碰、进入篮子等事件类型,并以有向因果图的形式表征事件间的因果关系,为自动问答生成提供结构化基础。
特点
CRAFT数据集的核心特色在于其深度融合了认知语言学中的力动力学理论,首次在视频问答任务中引入基于‘原因’、‘使能’和‘阻止’三类因果动词的复杂因果推理问题。除传统的描述性与反事实问题外,因果问题要求模型理解场景中作用者与受作用者之间的意图与力的交互模式。数据集包含约5.8万个视频-问题对,覆盖48种问题类型,且通过同义词替换与句式改写确保语言多样性。为减少数据集偏差,生成过程强制不同任务与模拟组合的答案分布尽可能均匀,并采用微小扰动验证机制剔除答案不稳定的样本,从而提升对模型推理能力的真实考验。
使用方法
CRAFT数据集适用于评估与训练视频问答及物理推理模型。使用时,模型需处理256×256像素的2D模拟视频片段与对应的自然语言问题,输出正确答案(如布尔值、颜色、形状或计数)。数据集提供了易与难两种划分设置:易设置中训练、验证与测试集共享场景布局;难设置中测试集使用训练中未见的布局,以检验泛化能力。研究者可结合提供的功能化程序与因果图作为辅助监督信号,或采用端到端的多模态架构(如结合视觉与文本特征的MAC、TVQA等模型)进行训练。评估标准以准确率为主,尤其关注模型在不同问题类型(描述性、反事实、因果)上的表现差异。
背景与挑战
背景概述
因果推理是人类认知的核心能力,涉及对物理对象及其相互作用的预测与理解。然而,尽管近年来人工智能在自然语言与图像理解领域取得了显著进展,现有模型在复杂因果场景下的物理推理能力仍远逊于人类。为弥合这一鸿沟,由土耳其哈斯特帕大学与科奇大学的研究人员于2021年联合提出了CRAFT(Causal Reasoning About Forces and inTeractions)基准数据集。该数据集受认知语言学中的力动态理论启发,聚焦于物体间“致使”、“促成”与“阻止”等因果关系的语义理解,包含从20种虚拟环境中生成的约5.8万组视频-问答对,旨在系统评估模型在动态场景中推理物理力与物体交互的能力。CRAFT的发布为视觉问答与因果推理研究提供了兼具理论深度与挑战性的新标杆。
当前挑战
CRAFT数据集所面临的挑战主要体现在两个层面。首先,在领域问题层面,现有模型难以准确理解复杂因果场景中物体间的动态交互与意图,尤其无法区分“致使”、“促成”与“阻止”等细微的因果关系,导致在因果类问题上表现不佳,与人类76.6%的准确率相比存在显著差距。其次,在数据集构建过程中,挑战在于生成具有高度视觉多样性与均匀答案分布的视频样本,以消除模型利用数据偏见的捷径学习;同时,需要通过随机扰动验证答案的稳定性,并设计反事实问题以测试模型的想象与推理能力,这些步骤对生成脚本与物理模拟器的精确性提出了极高要求。
常用场景
经典使用场景
在视觉与语言交汇的因果推理研究领域中,CRAFT数据集作为一个精心设计的视频问答基准,被广泛用于评估模型对物理世界中物体间力与交互的因果理解能力。其经典使用场景聚焦于让模型观看包含多物体动态交互的2D模拟视频,并回答涉及描述性、反事实以及基于力动态理论的因果问题,例如判断一个物体是否“导致”、“促使”或“阻止”了另一物体的运动或事件发生。这一场景不仅要求模型具备基础的视觉感知与语言理解,更需进行深层次的时序与因果关系推理,从而成为检验人工智能系统物理常识与因果思维能力的试金石。
衍生相关工作
CRAFT数据集的提出催生了一系列旨在提升机器因果推理能力的经典工作。其研究思路直接延续并深化了如CLEVRER等视频推理数据集的工作,但特别强调了基于力动态理论的因果动词分类。受CRAFT挑战的启发,研究者们探索了神经符号推理模型,这些模型通过将视觉感知与符号化的因果图相结合,尝试更准确地回答因果问题。此外,针对CRAFT中模型泛化能力弱的问题,后续工作发展了面向对象的场景表示学习方法,如改进的G-SWM,旨在从视频中分解出独立物体并建模其交互。这些衍生工作不仅提升了在CRAFT基准上的性能,更将因果推理与物理理解这一研究方向推向了新的高度,促进了从感知智能向认知智能的跨越。
数据集最近研究
最新研究方向
在因果推理与物理交互理解的交叉领域,CRAFT数据集正引领着视频问答系统向更深层次的认知建模迈进。该基准测试基于认知语言学中的力动态理论,创新性地引入了“原因”、“促成”与“阻止”三类因果动词的语义区分,要求模型不仅捕捉物体间的时空碰撞与运动轨迹,更需理解作用力背后的意图与结果。前沿研究聚焦于如何将神经符号推理与对象中心表征相结合,以弥合当前视觉模型在未见场景泛化上的显著不足——实验表明,即便最先进的基线模型在CRAFT的困难设置下仍与人类表现存在超过29%的鸿沟。这一挑战推动了可微分物理模拟器与因果图嵌入的融合探索,为构建具备类人常识推理能力的智能体提供了关键评估平台与迭代方向。
相关研究论文
- 1CRAFT: A Benchmark for Causal Reasoning About Forces and inTeractions哈塞特佩大学计算机工程系, 科克大学计算机工程系 · 2022年
以上内容由遇见数据集搜集并总结生成



