遇见数据集

NewtPhys

收藏
arXiv2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

NewtPhys是由法国国家信息与自动化研究所等机构联合创建的4D物理标注数据集,旨在评估基础模型对牛顿力学的底层理解能力。该数据集包含730K帧高保真渲染视频,涵盖53个真实场景和109个日常物体,通过结合3D高斯泼溅技术与牛顿力学模拟,生成了包含碰撞、重力、材料属性等11种像素级物理标注的密集注释。数据集创建过程通过将真实场景的3D高斯表示转化为可模拟粒子,并扩展Simplicits模拟器以支持多物体交互和软体动力学,最终自动生成141K个视觉问答对。该数据集主要应用于计算机视觉与人工智能领域,用于系统评估视觉语言模型和视觉基础模型的物理推理能力,解决现有基准测试在视觉真实性与物理标注密度之间的权衡问题,推动下一代物理感知模型的发展。

NewtPhys is a 4D physically annotated dataset co-developed by institutions including the French National Institute for Digital Science and Technology (INRIA), designed to evaluate the fundamental understanding of Newtonian mechanics by foundation models. This dataset comprises 730K high-fidelity rendered video frames, covering 53 real-world scenarios and 109 daily objects. By integrating 3D Gaussian Splatting technology and Newtonian mechanics simulation, it generates dense annotations with 11 pixel-level physical attributes including collision, gravity, and material properties. During the dataset construction pipeline, 3D Gaussian representations of real scenes are converted into simulatable particles, and the Simplicits simulator is extended to support multi-object interaction and soft body dynamics, ultimately automatically generating 141K visual question-answer pairs. Primarily utilized in the fields of computer vision and artificial intelligence, this dataset enables systematic assessment of the physical reasoning capabilities of vision-language models and visual foundation models. It addresses the trade-off between visual realism and physical annotation density in existing benchmark tests, and facilitates the advancement of next-generation physics-aware models.

创建时间:
2026-06-03
原始信息汇总

数据集概述

  • 数据集名称: NewtPhys
  • 核心主题: 评估基础模型对牛顿物理学的理解能力
  • 数据规模: 包含 11,000 个序列,总计 730,000 帧,以 25 FPS 渲染
  • 场景与物体: 使用了 53 个真实场景和 109 个物体,共 333 个物体实例(含物理属性变化)
  • 标注类型: 提供 6 种密集的逐像素物理标注:
    • 碰撞
    • 重力
    • 材料分割
    • 实例分割
    • 场景流
    • 变形梯度
  • 数据构建: 结合真实世界 DL3DV 场景与 Google Scanned Objects,通过 3D 高斯泼溅表示,并使用基于 Simplicits 的自定义牛顿求解器模拟交互

基准测试

  • 视觉问答 (VQA): 包含 141,000 个 VQA 对(84,000 个多帧样本,57,000 个单帧样本),涵盖六大研究轴:材料理解、力学、空间推理、视点、时间推理和永久性
  • 评估模型: 跨 54 个视觉语言模型和 10 个视觉基础模型进行系统评估
  • 主要发现:
    • 模型在低层牛顿物理推理方面表现薄弱,尤其在力学和材料属性估计上
    • 常见的多模态常识基准与纽特物理学准确性仅存在弱相关性,表明现有常识评估不足以衡量牛顿物理学理解
    • 在视觉基础模型的物理探测中,自监督模型整体表现最佳,MiDaS 是最强的全监督基线,DINO 在重力预测上表现突出

论文信息

  • 论文标题: NewtPhys: Do Foundation Models Understand Newtonian Physics?
  • 作者: Sebastian Cavada, Soumava Paul, Tuan-Hung Vu, Andrei Bursuc, Raoul de Charette
  • 发表年份: 2026
  • 会议/期刊: arXiv
  • 论文地址: https://arxiv.org/abs/2606.03986

额外资源

  • 数据集主页: https://astra-vision.github.io/NewtPhys

  • BibTeX 引用:

    @inproceedings{cavada2026newtphys, title = {{NewtPhys}: Do Foundation Models Understand Newtonian Physics?}, author = {Sebastian Cavada and Soumava Paul and Tuan-Hung Vu and Andrei Bursuc and Raoul de Charette}, year = 2026, booktitle = {arXiv}, url = {https://arxiv.org/abs/2606.03986} }

搜集汇总
数据集介绍
NewtPhys 数据集图片
构建方式
NewtPhys 的构建旨在弥合现实场景视觉复杂性与精确牛顿物理标注之间的鸿沟。其核心流程首先利用从 DL3DV 和 Google Scanned Objects 数据集中选取的真实场景与日常物体,将它们分别转化为稠密的 3D 高斯溅射(3DGS)表达,并在统一的公制坐标系下进行几何对齐与尺度标定。随后,研究团队对基于 Simplicits 的无网格物理模拟器进行了大幅扩展,以处理包含 10⁶ 至 10⁸ 颗粒子的大规模场景,并支持多物体交互与软体动力学。在此模拟器中,3DGS 的粒子中心被视作可模拟的质点,通过动态分配的变形控制点和在交互区域附近采样的配置点进行高效计算,从而在每一时间步长内解析并记录包括碰撞、重力、形变及应力在内的全方位牛顿力学量。最终,模拟结果经由标准的 3DGS 光栅化器渲染为 4D 视频序列,并同步生成 11 种像素级对齐的真值图,覆盖物理场、运动学、语义和几何信息。
特点
NewtPhys 数据集的核心特点在于其提供了前所未有、密集且精细的像素级物理标注,这是以往任何数据集都无法比拟的。它涵盖了包括 3D 力向量、形变场、材料属性图、场景流、碰撞事件以及实例分割在内的 11 种逐帧像素级标注,这些标注均以公制单位记录,确保了物理量的精确性。该数据集由 11,000 个序列、总计 730,000 帧构成,平均每个序列包含约 15 次不同的碰撞事件,场景和物体的多样性极高,涵盖了从刚性到高度形变的软体物体,以及从静止到运动的多种摄像机轨迹。此外,NewtPhys 还配套生成了一个包含 141,000 对问答(VQA)的物理推理基准,跨越材料理解、力学、空间推理、视点、时间推理和物体持久性六大维度,为系统评估视觉语言模型和视觉基础模型的低阶牛顿力学理解能力提供了标准化的测试床。
使用方法
NewtPhys 数据集提供了两种互补的使用方式,以服务于不同层面的物理理解研究。首先,对于视觉语言模型和视觉基础模型的评估,研究者可以利用其配套的 141K 个视觉问答对,对模型在材料理解、力学等六大维度的物理推理能力进行量化测试。这些问答对已预设了干扰项,并提供了单帧和多帧两种输入模式。其次,为了深入探究模型内部的物理表征,NewtPhys 开放了 730K 帧的像素级物理真值图,使得研究者能够构建“物理探针”任务。通过为预训练的视觉基础模型(如 DINOv2、CLIP)附加轻量级的物理解码器,并利用这些真值图进行监督训练,可以评估模型编码器内部是否以及如何蕴含了对碰撞、重力、场景流等物理信号的感知能力。此外,数据集还提供了 NewtPhys-15K 子集,供计算资源有限的团队进行快速原型验证。
背景与挑战
背景概述
NewtPhys是一个由法国国家信息与自动化研究所(Inria)和Valeo.ai等机构的研究人员于2025年提出的四维物理标注数据集,专注于研究视觉语言模型(VLM)和视觉基础模型(VFM)对牛顿力学低层次物理规律的理解能力。该数据集通过将真实世界场景的三维高斯泼溅表示与基于物理的仿真相结合,生成了包含丰富逐像素标注(如三维力、变形场、材质图、场景流等)的高保真视频序列。NewtPhys的核心研究问题在于揭示当前基础模型是否真正理解了力、碰撞、形变等低层次牛顿物理量,抑或仅依赖视觉相关性进行推理。该数据集填补了以往物理推理基准在视觉真实感和物理标注密度之间的鸿沟,并对54个开源和2个闭源VLM模型进行了大规模系统性评估,深刻影响了物理视觉理解领域的研究方向。
当前挑战
NewtPhys所面对的领域挑战主要体现在两大方面:首先,现有模型在基础物理学理解上表现欠佳,尽管在常识推理任务上尚可,但在估算密度、杨氏模量等颗粒状牛顿属性上力不从心——对物理量(如材料理解与力学)的性能提升极其缓慢,说明模型并未真正掌握因果物理机制;其次,当前常用的常识基准与低层次物理理解之间的相关性极弱(皮尔逊系数低至0.36~0.39),导致难以衡量物理推理的进步。在构建过程中,研究人员面临的核心挑战包括:将非结构化的三维高斯泼溅转化为可仿真的粒子系统的技术难题、对大规模场景(含百万至亿级粒子)进行稳定且可记录逐点力的无网格仿真的工程挑战,以及精确估算无标注商品物理属性(如质量误差约14.58%)的度量校准困难。
常用场景
经典使用场景
在计算机视觉与认知科学交汇的领域中,NewtPhys数据集最为经典的应用场景是对视觉基础模型和视觉-语言模型的牛顿力学理解能力进行系统性评估。通过构建具备丰富物理标注的真实场景4D数据,该数据集使得研究者能够精确衡量模型在材料属性辨识、力学交互分析、空间关系推理以及时间动态感知等多维度的表现,从而填补了以往仅依赖合成数据或粗糙代理标签进行评估的空白。
实际应用
在实际应用层面,NewtPhys所推动的物理感知视觉理解对于具身智能领域,尤其是机器人的环境交互与自主操作具有重要意义。该数据集提供的精细物理标注可作为训练或测试机器人视觉系统在物体质量、刚度、碰撞感知等方面的基础,有助于开发能够在真实世界中安全、高效地执行搬运、堆叠等任务的智能体,从而拉近视觉模型与现实物理世界之间的鸿沟。
衍生相关工作
基于NewtPhys所构建的评估框架与丰富标注,已催生了若干重要的衍生研究方向。一方面,研究者在其基础之上提出了Physics Probing任务,通过为冻结的视觉编码器附加轻量级物理解码器,探索模型表征中是否内蕴可访问的牛顿力学信号。另一方面,该数据集推动了反事实物理推理、专家-新手提示策略以及物理信息引导的视觉问答等创新性工作的深入发展,为下一代理性物理感知模型的设计提供了坚实的数据基础与评测平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务