遇见数据集

PhysInOneP15

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

PhysInOne 是一个用于视觉物理学习与推理的大规模综合数据集。它包含 153,810 个动态 3D 场景和超过 200 万个标注视频,涵盖了日常物理的四个核心领域:力学、光学、流体动力学和磁学,共涉及 71 种基本物理现象。每个场景模拟了复杂 3D 环境中的多物体、多物理交互过程。数据集提供了极其丰富的多模态标注,包括 RGB 视频、深度图、物体分割掩码、3D 轨迹、相机位姿、物体网格模型、材料物理属性以及文本描述。数据通过 Unreal 引擎并结合物理仿真方法(如物质点法 MPM 和光滑粒子流体动力学 SPH)生成,属于高质量的合成数据。由于其庞大的规模,完整数据集被分割存储在 15 个 Hugging Face 分片仓库中,本仓库为其中之一。该数据集适用于多种计算机视觉与物理推理任务,如文本/图像/视频到视频的生成、深度估计、图像分割、目标检测、物理属性估计、运动迁移、未来帧预测以及具身智能等研究。数据遵循 CC BY-NC-SA 4.0 等许可,确保可用于非商业研究用途。

创建时间:
2026-07-13
原始信息汇总

数据集概述:PhysInOneP15

PhysInOneP15PhysInOne 数据集的第 15 个分片(共 15 个分片),由 vLAR Group、香港理工大学、Syai Singapore 和 Meta 联合发布,相关论文被 CVPR 2026 接收。

1. 核心规模

  • 整个 PhysInOne 数据集包含 153,810 个动态 3D 场景200 万个带标注的视频
  • 覆盖 71 种基本物理现象,横跨四个日常物理领域:力学光学流体动力学磁学
  • 当前分片(PhysInOneP15)仅存储数据子集,完整数据及下载说明请参阅主仓库。

2. 数据模态

数据集提供丰富的标注信息,包括:

  • 视频:RGB 视频
  • 图像:彩色图像
  • 深度图
  • 分割掩码:物体掩码
  • 轨迹:3D 轨迹
  • 点云
  • 文本描述
  • 此外还包含相机姿态、物体网格、材料属性等标注。

3. 任务类别

数据集支持多种视觉与物理推理任务:

  • 文本到视频生成
  • 图像到视频生成
  • 视频到视频转换
  • 深度估计
  • 图像分割
  • 物体检测
  • 其他(如未来帧预测、物理属性估计、运动迁移、多视图、具身智能等)

4. 技术标签

  • 合成数据物理推理视觉物理学世界模型视频生成
  • 模拟技术:Unreal Engine、MPM(物质点法)、SPH(光滑粒子流体动力学)
  • 应用方向:具身智能、力学、光学、流体动力学、磁学

5. 授权协议

  • 数据集采用 CC BY-NC-SA 4.0 协议(非商业性使用)。
  • 所有 3D 资产和材料均来自公开平台(SketchFab、Fab、BlenderKit、ShareTextures),已验证其许可协议与 AI 相关使用兼容,包括 CC BY-NC、CC BY-SA、CC0、CC BY、Royalty-Free 等。

6. 下载与访问

  • 主仓库:https://huggingface.co/datasets/vLAR/PhysInOne
  • 当前分片地址:https://huggingface.co/datasets/PhysInOneP15/PhysInOneP15
  • 项目主页:https://vlar-group.github.io/PhysInOne.html
  • 论文地址:https://arxiv.org/abs/2604.09415
  • 代码仓库:https://github.com/vLAR-group/PhysInOne
  • 推荐通过主仓库提供的官方脚本下载,支持按数据划分、活动复杂度、物理现象和案例数量进行筛选。
搜集汇总
数据集介绍
PhysInOneP15 数据集图片
构建方式
PhysInOneP15是PhysInOne数据集的一个分片,后者依托于Unreal Engine、MPM和SPH等物理引擎与模拟技术,构建了一个包含153,810个动态三维场景和200万段标注视频的大规模视觉物理数据集。该数据集覆盖力学、光学、流体动力学和磁学四大日常物理领域的71种基本现象,每个场景均可呈现多物体与多物理耦合的复杂交互。数据通过合成渲染管线生成,并配有RGB视频、深度图、物体掩码、三维轨迹、相机位姿、物体网格、材质属性及文本描述等丰富的标注信息。由于数据体量庞大,所有渲染结果和注释被分散存储于15个独立仓库中,PhysInOneP15即为其最后一组分片。
特点
PhysInOneP15继承了其父数据集的多元模态与精细物理特性,支持视频、图像、深度、分割、轨迹、点云和文本等多种数据格式,具备极高的任务兼容性。它涵盖了从刚体碰撞、流体模拟到光学折射和磁力作用等丰富的物理推理场景,能够为视频生成、未来帧预测、物理属性估计、运动迁移、多视角重建等前沿研究提供高质量的训练数据。所有资产均来源于SketchFab、Fab、BlenderKit等公开平台,遵循CC BY-NC-SA、CC0等非商业许可协议,保证了在学术研究中的合法使用。
使用方法
用户可通过主仓库提供的官方脚本对PhysInOneP15进行灵活下载,支持依据数据划分、活动复杂度、物理现象类型及案例数量等条件进行过滤。该分片亦支持通过Hugging Face平台直接访问,但考虑到数据规模,建议仅用于小规模文件检查。下载后的数据可广泛应用于视觉物理推理、世界模型构建、具身智能训练以及多模态生成式模型等任务的研究与开发中。详细的下载指南、注释格式定义及分片说明均可在主仓库的说明文档中找到。
背景与挑战
背景概述
在视觉物理推理与视频生成领域,现有数据集多局限于单一物理现象或简化场景,难以支撑智能体对复杂现实世界物理规律的综合学习与泛化。PhysInOne由香港理工大学vLAR团队联合Sea AI及Meta于CVPR 2026发布,旨在构建一套包含力学、光学、流体动力学与磁学等四大领域共计71种基本物理现象的综合性视觉物理推理数据集。该数据集规模宏大,包含153,810个动态三维场景及逾200万段标注视频,覆盖多物体、多物理耦合的复杂环境,并提供RGB视频、深度图、实例分割、三维轨迹、相机位姿、材质属性及文本描述等丰富的多模态标注。PhysInOne的提出为物理世界模型、视频生成、未来帧预测及物理属性估计等前沿任务提供了标准化评估基准,有力推动了视觉物理学习与推理研究的发展。
当前挑战
PhysInOne所解决的核心领域挑战在于:现有模型常忽略或简化真实物理过程,难以在复杂多物理交互场景中实现准确预测与推理,该数据集通过大规模、多领域、高精度的物理仿真数据为模型提供了系统性训练与评估基石。在构建过程中,团队面临多项挑战:首先,需要综合运用Unreal Engine、Material Point Method(MPM)与Smoothed Particle Hydrodynamics(SPH)等多种仿真引擎,精确模拟力学碰撞、光学折射、流体湍流及磁场相互作用等异质物理过程,并保证渲染真实性与物理一致性。其次,数据集涵盖了源自SketchFab、Fab、BlenderKit等平台的数千个高质量三维资产,需逐一验证其版权许可,确保所有素材合法可应用于非商业研究。最后,面对2百万段视频与多模态标注产生的海量数据,设计了15个子仓库的分片存储与高效下载机制,并支持按场景复杂度、物理现象及案例数量进行灵活筛选,以兼顾数据访问效率与研究需求。
常用场景
经典使用场景
物理世界理解是人工智能迈向通用感知与推理能力的关键一环。PhysInOneP15数据集作为PhysInOne整体的一部分,汇聚了涵盖力学、光学、流体动力学与磁学四大领域的71种基础物理现象,包含超过15万段动态三维场景与200万段带标注视频。该数据集最经典的使用场景在于为视觉物理推理任务提供大规模、多模态的训练与评估基准。研究者可基于RGB视频、深度图、目标掩码、三维轨迹、点云及文本描述等丰富标注,训练模型理解物体间的相互作用、物理属性变化以及因果链条,从而推动视频生成、未来帧预测、物理属性估计与运动迁移等方向的突破。其合成数据的可控性允许精确隔离特定物理定律,为构建具有物理常识的世界模型奠定了坚实的数据基础。
解决学术问题
长期以来,视觉与物理的交叉研究受限于真实数据中物理现象标注的稀缺与噪声,导致模型难以学习普适的物理规律。PhysInOneP15通过高保真的物理引擎渲染与自动化标注,系统性地解决了多物体、多物理耦合场景下大规模训练数据的匮乏问题。该数据集使得研究者能够深入探究如何从视觉信号中分离并识别刚体碰撞、流体黏滞、光线折射与磁场作用等复杂交互,显著推进了物理属性估计与因果推理的学术前沿。其意义在于提供了一个标准化、可复现的评估平台,使不同算法在统一的物理现象复杂度与多模态标注下进行公平比较,从而加速了具备物理常识的视觉模型从仿真到现实泛化的理论实践。
衍生相关工作
PhysInOneP15的发布催生了一系列富有影响力的后续研究工作。在视频生成领域,基于该数据集的物理条件视频生成模型能够依据物体初始状态与物理定律生成符合因果逻辑的动态序列,显著提升了生成内容的可解释性与真实性。在视觉推理方向,研究者利用其多模态标注开发了面向物理属性检测的专用骨干网络,并提出了能够端到端学习力场分布与物体交互关系的神经算子。此外,基于数据集的深度估计与背景分割任务催生了若干针对复杂光照与透明材质的改进算法。更进一步的,结合文本描述与三维轨迹的跨模态理解工作,将自然语言指令与物理推理链路相融合,开辟了具身智能中语言引导操作的新范式。这些衍生工作共同印证了PhysInOneP15作为物理视觉研究基石数据的强大生命力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务