遇见数据集

CRAFT

收藏
arXiv2022-03-01 更新2024-06-21 收录
官方服务:

资源简介:

CRAFT是一个视频问答数据集,旨在测试模型对物理力和物体交互的因果推理能力。该数据集包含58,000个视频和问题对,源自20个不同虚拟环境的10,000个视频,涉及多种运动中的物体相互作用和场景交互。CRAFT引入了新的因果问题类别,要求理解物体间通过因果概念如原因、使能和阻止的交互。数据集设计复杂,适合人工模型,但简单适合人类,旨在解决当前模型在因果推理方面的挑战。

CRAFT is a video question answering dataset developed to evaluate models' causal reasoning capabilities regarding physical forces and object interactions. This dataset contains 58,000 video-question pairs derived from 10,000 videos across 20 distinct virtual environments, covering diverse interactions between moving objects and scene dynamics. CRAFT introduces novel causal question categories that require understanding of object interactions mediated by causal concepts such as causation, enabling, and prevention. The dataset is designed to be challenging for artificial models yet accessible to humans, aiming to address the current challenges in causal reasoning faced by existing AI models.

创建时间:
2020-12-08
搜集汇总
数据集介绍
构建方式
在认知科学中,因果推理是人类理解物理世界的关键能力。为探究机器在该领域的表现,CRAFT数据集应运而生。其构建基于Box2D物理模拟器,生成了20种不同虚拟场景下的10秒视频片段,空间分辨率为256×256像素。每个场景包含静态元素与动态物体,动态物体具有形状、大小和颜色等属性,并在重力与相互作用下持续运动。通过提取碰撞、接触、进入篮子等事件,构建有向无环因果图,以形式化表示模拟中的动态交互。基于此,利用功能程序模板自动生成问题,并引入同义词与句式变体以丰富语言多样性。最终,数据集包含约5.7万个视频-问题对,按60:20:20比例划分为训练、验证与测试集。
使用方法
CRAFT数据集主要用于评估视频问答模型在物理因果推理方面的能力。使用时,模型需接收视频片段与自然语言问题,输出对应的答案。问题涵盖布尔型、计数型、颜色与形状识别等多种类型。研究者可基于提供的功能程序生成正确答案,或利用因果图与物体状态信息辅助模型训练。为全面评估,建议在简单与困难两种设置下分别测试,以衡量模型对未见场景的泛化能力。基线实验表明,当前最先进的视觉推理模型在CRAFT上表现远逊于人类,尤其在困难设置中差距显著,凸显了该数据集作为未来研究基准的重要价值。
背景与挑战
背景概述
CRAFT(Causal Reasoning About Forces and inTeractions)是一个于2021年由土耳其哈斯特帕大学与科奇大学联合团队提出的视频问答基准数据集,旨在评估人工智能系统在物理因果关系推理方面的能力。该数据集基于认知语言学中的力动力学理论,通过生成包含复杂物体交互的2D合成视频,引导模型理解‘导致’、‘促成’与‘阻止’等因果语义范畴。CRAFT包含约5.8万对视频与问题样本,覆盖20种虚拟场景,致力于弥合人类直觉物理理解与当前视觉推理模型之间的显著鸿沟,为因果视觉问答研究提供了全新的挑战性平台。
当前挑战
CRAFT所解决的领域问题在于,现有视觉问答模型在面对需要深层因果理解的任务时表现乏力,尤其在区分‘导致’、‘促成’与‘阻止’等精细因果语义上存在根本性困难,且难以对反事实情境进行有效推理。构建过程中的挑战则体现在:需在20种不同场景布局中生成多样化的物理交互视频,确保因果图的准确提取;同时设计问题模板以实现均匀的答案分布,避免模型利用数据集偏差走捷径;此外,还需通过随机扰动验证答案的鲁棒性,剔除人类直觉上反直觉的样本,从而保证基准的可靠性与挑战性。
常用场景
经典使用场景
在视觉与语言交叉的智能推理领域中,CRAFT数据集以其对物理因果关系深度探究的独特性而备受瞩目。该数据集精心构建了约5.8万个视频-问题对,源自20种不同虚拟环境中生成的1万个视频片段,每个片段均展现物体间复杂的动态交互。其经典使用场景集中于视频问答任务,要求模型不仅理解视觉场景中的物体属性与运动轨迹,更需基于力动态理论,对‘致使’、‘促成’与‘阻止’等因果语义范畴进行精准判别,从而检验模型在动态物理世界中的因果推理能力。
解决学术问题
CRAFT数据集直面当前人工智能系统在物理因果推理上的核心短板,系统性地解决了现有视觉问答基准中缺乏复杂因果关系建模的问题。它突破了传统数据集仅关注描述性或简单反事实问题的局限,引入基于认知语言学力动态理论的因果问题类别,迫使模型在理解物体意图与交互结果之间建立深层语义映射。这一设计揭示了尽管人类能轻松应对的因果推理任务,最先进的神经模型仍表现欠佳,从而明确了学术研究在物理常识获取与因果语言理解上的关键瓶颈与前进方向。
实际应用
在实际应用层面,CRAFT数据集所驱动的因果推理能力具有广泛的转化价值。在智能机器人领域,该数据集可赋能机器在动态环境中理解物体间的因果作用(如推动、阻挡、引导),从而提升自主操作与任务规划的安全性与效率。在自动驾驶系统中,基于CRAFT训练的模型能更精准地预测交通参与者间的因果互动,例如判断某车辆是否‘致使’另一车辆变道。此外,在虚拟现实与游戏开发中,该数据集助力构建更符合物理直觉的交互逻辑,为用户提供身临其境的沉浸体验。
数据集最近研究
最新研究方向
在人工智能领域,物理因果推理一直是极具挑战性的前沿方向,而CRAFT数据集的问世为该领域注入了新的活力。该基准聚焦于视频问答中的因果推理能力,特别是基于力动态理论(Force Dynamics Theory)所定义的“原因”、“使能”与“阻止”等复杂因果关系。CRAFT通过合成2D物理场景,生成包含58K视频-问题对的大规模数据集,要求模型不仅理解物体的动态交互,还需进行反事实推理。当前研究表明,尽管人类在该任务上表现优异,但包括最先进的视觉推理模型在内的多种基线方法仍难以有效应对其挑战,尤其在泛化至未见场景时性能显著下降。这一差距凸显了现有模型在深层因果理解与物理常识推理方面的不足,也指明了未来研究应聚焦于神经符号方法与物体中心表征的融合,以弥合人工智能与人类认知之间的鸿沟。
相关研究论文
  • 1
    CRAFT: A Benchmark for Causal Reasoning About Forces and inTeractions哈塞特佩大学计算机工程系, 科克大学计算机工程系 · 2022年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务