遇见数据集

PhysInOneP02/PhysInOneP02

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

PhysInOne(视觉物理学习与推理一体化套件)包含153,810个动态3D场景和200万个带注释的视频,覆盖了71种基本物理现象,涵盖力学、光学、流体动力学和磁学四个日常物理领域。每个场景可能包含复杂3D环境中的多物体和多物理交互。数据集提供了丰富的注释,包括RGB视频、深度图、物体掩码、3D轨迹、相机姿态、物体网格、材料属性和文本描述。

PhysInOne contains 153,810 dynamic 3D scenes and 2 million annotated videos, covering 71 basic physical phenomena across four domains of everyday physics: mechanics, optics, fluid dynamics, and magnetism. Each scene may contain multi-object and multi-physics interactions in complex 3D environments. The dataset provides rich annotations including RGB videos, depth maps, object masks, 3D trajectories, camera poses, object meshes, material properties, and textual descriptions.

提供机构:
PhysInOneP02
搜集汇总
数据集介绍
PhysInOneP02/PhysInOneP02 数据集图片
构建方式
PhysInOneP02作为PhysInOne数据集的第二分片,依托于大规模合成数据管线构建而成。该数据集利用Unreal Engine物理引擎结合MPM与SPH等先进仿真技术,系统性地生成涵盖力学、光学、流体动力学与电磁学四大领域的71种基础物理现象的动态三维场景。每一场景均包含多物体与多物理场耦合的复杂交互,并借助自动化标注流程同步产出RGB视频、深度图、物体遮罩、三维运动轨迹、相机位姿、网格模型、材质属性及文本描述等多模态标注信息,从而构建起一个高度结构化、多元化且物理真实的视觉学习资源库。
使用方法
使用PhysInOneP02时,推荐通过主仓库提供的官方下载脚本进行数据获取,该脚本支持基于数据分割、活动复杂度、物理现象类型及样本数量的灵活筛选。开发者可将分片数据直接集成至深度学习框架,利用其提供的多模态标注进行视频生成、未来帧预测、深度估计与图像分割等任务的模型训练与评估。针对进阶应用,研究者可借助三维轨迹与材质信息开展物理推理实验,或利用多视图数据训练具身智能体。数据以标准Hugging Face格式组织,便于快速加载与分批次处理,有效支持从单一任务到多任务联合学习的多样化研究需求。
背景与挑战
背景概述
在计算机视觉与物理推理的交叉领域中,如何使人工智能模型具备对物理世界因果关系的理解能力,一直是极具挑战性的核心问题。现有数据集多聚焦于静态图像或简单运动模式,难以支撑对复杂多物理现象耦合场景的深度建模。由香港理工大学vLAR Group、Syai Singapore及Meta等机构联合创建的PhysInOne数据集,于2025年发表在CVPR 2026,提供了153,810个动态三维场景及200万段带有丰富标注的视频,覆盖力学、光学、流体动力学和磁学四大领域共71种基本物理现象。这一大规模、多模态的合成数据集为视觉物理学习与推理研究奠定了前所未有的基础,显著推动了世界模型与视频生成等前沿方向的发展。
当前挑战
PhysInOne所应对的领域挑战在于,现有视觉数据集普遍缺乏对复杂物理交互的系统刻画,模型难以从视频中推理出物体质量、弹性系数、磁场分布等隐含物理属性,也无法泛化至多物体、多物理场耦合的未见场景。数据集构建过程中同样面临诸多难题:如何在三维引擎中精确模拟71种跨领域物理现象并确保视觉真实性;如何在高清渲染中兼顾2百万段视频、深度图、分割掩码、3D轨迹等多模态标注的一致性与计算成本;以及如何从公开平台合法搜集海量3D资产,在遵守CC BY-NC-SA等许可协议的前提下构建可分发、可复用的数据集,均为实际工程中的巨大挑战。
常用场景
经典使用场景
PhysInOneP02作为物理视觉推理领域的综合性数据集,其最经典的使用场景聚焦于基于物理规律的视频生成与未来帧预测任务。研究者可借助该数据集中包含的力学、光学、流体动力学和磁学四大领域共71种基础物理现象,构建能够理解并模拟真实物理世界动态变化的生成模型。通过输入前几帧的RGB图像或深度图,模型需要预测后续帧中物体的运动轨迹、形变状态及其交互行为,这为发展具有物理常识的视觉推理系统提供了关键的训练与评估基准。
解决学术问题
该数据集系统性地解决了视觉物理研究中长期存在的两大难题:其一是缺乏大规模、多模态且物理现象覆盖广泛的标注数据,其二是现有数据集难以支撑复杂多物体交互场景下的物理属性估计与运动迁移研究。PhysInOneP02通过提供153,810个动态三维场景及200万段带有深度、分割掩码、三维轨迹和多视角标注的视频,使得研究者能够在统一的框架下训练和评估模型对质量、弹性系数、流体粘度等隐含物理属性的推断能力,极大推动了计算机视觉向具有因果推理能力的世界模型演进。
实际应用
在实际应用层面,PhysInOneP02为具身智能体和仿真系统的开发提供了不可忽视的基石。机器人操控任务中,机械臂需要基于视觉输入实时预测物体的物理行为(如抓取后的滑动或翻滚),该数据集提供的物理动态注释可直接用于训练机器人的运动规划与碰撞避免策略。此外,在自动驾驶和虚拟现实领域,数据集中丰富的多视角流体与磁学现象模拟素材,可用于提升数字孪生系统中物理仿真的真实感,为智能体在复杂动态环境中的决策行为提供可靠的视觉先验。
数据集最近研究
最新研究方向
PhysInOneP02作为PhysInOne数据集的分片之一,聚焦于利用大规模合成物理场景推动视觉物理学习与推理的前沿探索。该数据集涵盖力学、光学、流体动力学和磁学四大领域的71种基本物理现象,包含逾15万动态3D场景及200万标注视频,为多模态物理理解任务(如视频生成、未来帧预测、物理属性估计、运动迁移等)提供了丰富且精细的标注资源。其研究正积极结合世界模型、具身智能与仿真技术,旨在破解机器对物理世界因果机制的深度理解难题,为下一代具备物理常识的智能系统奠定关键数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务