遇见数据集

vLAR/PhysInOne

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

PhysInOne是一个大规模合成数据集,用于视觉物理学习和推理,包含153,810个动态3D场景和200万个带注释的视频,涵盖力学、光学、流体动力学和磁学中的71种物理现象。每个场景都具有复杂的多对象和多物理交互,并带有丰富的注释,包括RGB视频、深度图、对象掩码、3D轨迹、相机姿态、对象网格、材料特性和文本描述。该数据集支持物理感知视频生成、未来帧预测、物理属性估计、运动传递、物理推理和世界模型的研究。

PhysInOne is a large-scale synthetic dataset for visual physics learning and reasoning, containing 153,810 dynamic 3D scenes and 2 million annotated videos across 71 physical phenomena in mechanics, optics, fluid dynamics, and magnetism. Each scene features complex multi-object and multi-physics interactions with rich annotations, including RGB videos, depth maps, object masks, 3D trajectories, camera poses, object meshes, material properties, and textual descriptions. The dataset supports research on physics-aware video generation, future frame prediction, physical property estimation, motion transfer, physical reasoning, and world models.

提供机构:
vLAR
搜集汇总
数据集介绍
vLAR/PhysInOne 数据集图片
构建方式
PhysInOne是一个大规模合成视觉物理数据集,依托Unreal Engine、MPM和SPH等先进物理引擎与模拟技术构建,涵盖力学、光学、流体动力学与电磁学四大物理领域。数据生成流程基于精心设计的3D网格与背景资产,通过程序化编排构成153,810个动态三维场景,每个场景均包含多物体、多物理场耦合的复杂交互。所有场景被划分为训练集、验证集和测试集,三个子集使用完全不同的3D模型与背景环境,确保场景与视觉内容无任何重叠,从而构建出严谨的泛化性能评估基准。
特点
该数据集包含71种物理现象,提供了超过200万段带有多模态标注的视频,具备RGB视频、深度图、物体分割掩码、3D轨迹、相机姿态、物体网格、材质属性及文字描述等丰富标注形式。其核心特点在于多模态同步与物理属性精细化标注的有机结合,不仅支持物理场中动态物体的运动轨迹提取,还提供了与场景物理规律一致的结构化信息。数据集按物理现象缩略名与活动复杂度(单重、双重、三重)组织,便于研究者按需选取特定物理组合进行深入分析。
使用方法
使用者可通过官方提供的筛选脚本filter_cases.py,依据数据集划分(train/val/test)、活动类型或具体物理现象缩写进行灵活过滤,并利用--num参数进行随机采样以控制数据规模。筛选生成的JSON文件可配合download.py脚本,从多个HuggingFace分片仓库下载对应场景的压缩包。下载支持保持分片/划分/活动类型的目录结构,便于大规模数据管理与高效加载。对于有访问权限限制的仓库,只需传入HuggingFace token即可完成认证下载。
背景与挑战
背景概述
PhysInOne数据集由香港理工大学vLAR Group联合新加坡科技设计大学与Meta于2025年创建,发表于CVPR 2026,旨在突破物理世界理解中数据稀缺与泛化性不足的瓶颈。该数据集涵盖力学、光学、流体动力学与磁学四大领域,包含71种物理现象、15.3万动态三维场景及200万段带注释视频,是迄今规模最庞大的视觉物理推理综合基准。其核心贡献在于为世界模型、物理感知视频生成、未来帧预测及物理属性估计等前沿任务提供了多模态、高精度的训练与评估平台,显著推动了具身智能与物理推理研究的发展。
当前挑战
PhysInOne所解决的领域挑战在于现有数据集多局限于静态图像或单一物理现象,难以支撑对复杂多物体、多物理交互的动态场景建模与推理,导致模型在理解真实世界物理规律时泛化能力薄弱。此外,构建过程中面临两大挑战:一是如何确保训练、验证与测试集使用完全不同的三维网格与背景,以实现稳健的泛化性评估;二是海量数据(超过200万视频)的渲染、存储与跨仓库分发,需设计高效的过滤与下载机制,如支持按分集、活动复杂度及现象类型筛选,这对数据管理与工程架构提出了极高要求。
常用场景
经典使用场景
在视觉物理学习与推理的学术疆域中,PhysInOne数据集以其宏大的规模和丰富的模态信息,为研究者提供了探索物理世界理解算法不可或缺的基础平台。其最经典的运用方式在于,利用其包含的十五万余个动态三维场景及两百万段标注视频,系统性地训练和评估具备物理感知能力的视频生成模型。通过将力学、光学、流体动力学和磁学等七十一类物理现象融入复杂的多物体交互环境,研究者能够深入探究模型在文本到视频、图像到视频等任务中对物理规律的内化程度,从而推动生成式内容向着更符合现实法则的方向演进。
解决学术问题
PhysInOne数据集的诞生,精准地回应了长久以来制约视觉物理推理研究的核心瓶颈——即真实物理场景数据的稀缺性与标注不完整性问题。传统数据集往往局限于单一物理域或简单场景,难以支撑对模型泛化能力的严苛检验。该数据集通过解耦场景与物理现象,并精心划分训练、验证与测试集以确保视觉内容完全不重叠,为评估模型在未见过的材质与背景下的物理推理泛化能力提供了牢固的基准。此举极大地推动了未来帧预测、物理属性估计及世界模型构建等前沿课题的标准化评测进程。
衍生相关工作
PhysInOne数据集的发布,已催生出一系列具有深远影响力的衍生研究工作。在其构建框架的启发下,研究者开始探索将物理先验知识以显式或隐式的方式嵌入生成对抗网络与扩散模型的架构之中,旨在实现更加可控且稳定的物理运动迁移。同时,该数据集所强调的跨模态对准理念,促使了多项关于视觉-语言-物理联合表征模型的创新,例如利用场景文本描述与轨迹数据协同训练,以增强模型对因果关系的推理能力。此外,其丰富的仿真引擎与多物理场耦合数据,也为构建下一代具有物理直觉的大规模世界模型奠定了坚实的数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务