PhysInOneP04/PhysInOneP04
收藏官方服务:
资源简介:
PhysInOne数据集包含153,810个动态3D场景和200万个标注视频,涵盖日常物理的四个领域(力学、光学、流体动力学和磁学)中的71种基本物理现象。每个场景可能包含复杂3D环境中的多物体和多物理交互。数据集提供丰富的标注,包括RGB视频、深度图、物体掩码、3D轨迹、相机姿态、物体网格、材料属性和文本描述。
PhysInOne contains 153,810 dynamic 3D scenes and 2 million annotated videos, covering 71 basic physical phenomena across four domains of everyday physics: mechanics, optics, fluid dynamics, and magnetism. Each scene may contain multi-object and multi-physics interactions in complex 3D environments. The dataset provides rich annotations including RGB videos, depth maps, object masks, 3D trajectories, camera poses, object meshes, material properties, and textual descriptions.
提供机构:
PhysInOneP04搜集汇总
数据集介绍

构建方式
PhysInOneP04 作为 PhysInOne 数据集的一个分片,是面向视觉物理学习与推理领域的大规模合成数据集的重要组成部分。该数据集依托 Unreal Engine、MPM 和 SPH 等先进仿真技术,精心构建了涵盖力学、光学、流体动力学和磁学四大领域的 71 种基本物理现象,总计包含 153,810 个动态三维场景与超过 200 万段标注视频。每个场景均融合多物体与多物理交互,通过渲染引擎生成 RGB 视频、深度图、物体掩码、三维轨迹、相机位姿、网格模型、材质属性及文本描述等全方位标注,为复杂物理世界的视觉理解提供了坚实的数据基础。
特点
PhysInOneP04 的特色在于其极致的多模态与多维标注体系。数据不仅提供常规的视觉模态,还整合了深度、分割、轨迹、点云等丰富信号,支持从视频生成、深度估计到物体检测、物理属性预估等多元任务。其物理现象覆盖日常力学、光学、流体与磁学,场景复杂度从单一物体到多体交互层层递进,能够有效检验模型对物理规律的理解与泛化能力。此外,所有数据均采用非商业许可协议,确保了研究用途的合法性与可复现性。
使用方法
使用 PhysInOneP04 时,推荐通过主仓库提供的官方脚本进行下载,支持按数据切分、活动复杂度、物理现象及案例数量进行灵活筛选。该分片可直接通过 Hugging Face 平台访问,但建议仅用于小规模文件检查。数据集兼容文本到视频、图像到视频、视频到视频等多种生成任务,也适用于深度估计、图像分割、物体检测等场景。研究人员可结合公开的代码库与项目页面,快速上手开展物理推理与世界模型的相关研究。
背景与挑战
背景概述
PhysInOneP04 是 PhysInOne 数据集的一个分片,PhysInOne 由 vLAR Group、香港理工大学、Sea AI Singapore 和 Meta 联合创建,发表于 CVPR 2026。该数据集旨在为视觉物理学习与推理提供统一基准,涵盖力学、光学、流体动力学和电磁学四大领域的 71 种基本物理现象,包含 153,810 个动态 3D 场景和 200 万段标注视频。通过提供 RGB 视频、深度图、物体掩膜、3D 轨迹、相机位姿、材质属性及文本描述等丰富注释,PhysInOne 显著推动了物理世界理解、视频生成、未来帧预测、物体属性估计等方向的研究,成为构建世界模型和具身智能体的关键资源。
当前挑战
PhysInOne 致力于攻克视觉物理推理领域的数据稀缺与场景复杂性两大核心挑战。领域问题方面,现有数据集多聚焦于单一物理现象或简单耦合场景,难以支撑多物体、多物理场交互下的学习;该数据集通过系统性覆盖 71 种现象并引入多目标动态环境,填补了这一空白。构建过程中,挑战在于跨平台资产(如 SketchFab、Fab、BlenderKit)的合规整合与渲染管线的统一,需确保不同来源的 3D 模型在许可协议(CC BY-NC、CC BY-SA 等)下可用于非商业研究,同时维持物理仿真的真实性与标注一致性,最终以 12 个分片形式分布式发布以应对海量数据存储与分发难题。
常用场景
经典使用场景
在视觉物理学习与推理领域,PhysInOneP04作为PhysInOne数据集的组成部分,被广泛用于物理世界模型的构建与评估。研究人员利用其提供的153,810个动态三维场景及两百万段标注视频,涵盖力学、光学、流体动力学和磁学四大领域的71种基础物理现象,旨在训练模型理解并预测复杂环境中多物体、多物理交互的动态演变。该数据集特别适合用于文字到视频生成、图像到视频生成以及未来帧预测等任务,其丰富的多模态标注(包括RGB视频、深度图、分割掩码、三维轨迹)为学习物理规律与视觉表征之间的映射关系提供了坚实的数据基础。
实际应用
在实际应用层面,PhysInOneP04衍生出的模型被部署于机器人自主操控与无人系统导航领域,使其能够基于视觉输入预判物体在推、抓、投等操作后的动态轨迹。在影视与游戏产业,基于该数据集训练的物理感知视频生成模型可自动为虚拟场景添加符合真实运动规律的中间帧或特效,显著降低手动调参的成本。此外,该数据集在工业仿真中也有重要落地点,例如通过分析流体与固体交互的视频序列,辅助机械设计优化和制造流程中的物理仿真验证。
衍生相关工作
依托PhysInOneP04数据集的丰富物理现象与多模态标注,学术界已衍生出多项经典工作:在视频生成领域,研究者提出了物理条件扩散模型,利用其深度与轨迹标注实现了情节可控的视频合成;在物体动态预测方面,基于该数据训练的图神经网络能够高精度预测多体碰撞后的速度场;此外,结合光度立体视觉与物理模拟的混合方法,被用于从单目视频中分解出物体的可变形性与材质参数。这些工作不仅验证了数据集在物理推理各子任务上的通用性,也为后续构建可解释的物理世界模型奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成




