遇见数据集

BAAI-DataCube/Physics-aware-videos

收藏
Hugging Face2025-12-15 更新2025-12-20 收录
官方服务:

资源简介:

该数据集是一个高质量的真实世界视频数据集,专注于物理现象,旨在从视频中学习和评估物理定律。主要涵盖以下经典物理过程:刚体运动/流体动力学、碰撞和反弹、爆炸和爆裂现象、烟雾、灰尘和粒子散射、重力和惯性(下落、滚动、加速等)。数据集通过视频检索结合多模态大模型自动过滤构建,确保高视觉质量和强物理可学习性。包含大量短时长、高运动强度、摄像机稳定的视频片段,适用于物理感知视频生成、视频世界模型和动力学建模、物理一致性评估和对齐训练等研究方向。

This dataset is a high-quality real-world video dataset focused on physical phenomena, designed for learning and evaluating physical laws from videos. It primarily covers classic physical processes such as rigid-body motion/fluid dynamics, collision and rebound, explosion and burst phenomena, smoke, dust, and particle scattering, gravity and inertia (falling, rolling, acceleration, etc.). The dataset is constructed via video retrieval combined with multimodal large-model–based automatic filtering, ensuring both high visual quality and strong physical learnability. It contains a large number of short-duration, high-motion-intensity, camera-stable video clips, suitable for research directions like physics-aware video generation, video world models and dynamics modeling, physical consistency evaluation, and alignment training.

提供机构:
BAAI-DataCube
搜集汇总
数据集介绍
构建方式
该数据集基于物理现象的真实世界视频构建,旨在服务于物理规律的学习与评估。数据采集依托于Datacube平台,通过预设的物理过程关键词(如球体下落弹跳、木块滚动停止等)进行视频检索,初步获取候选素材。随后,借助多模态大模型驱动的自动化过滤流程,对候选视频进行筛选,剔除不符合物理可学习性标准的样本,仅保留视觉质量高、运动轨迹清晰且相机稳定的片段。最终,所有视频被裁剪为5至20秒的短片段,以确保训练的信息密度与稳定性。
使用方法
用户可通过Git LFS工具克隆数据集仓库,并下载分卷压缩的视频文件。下载完成后,运行提供的merge_videoparts.sh脚本,即可将分卷文件合并为完整的videos.tar压缩包,并自动校验文件完整性。数据集内部按查询关键词分目录组织视频,同时提供dataset.jsonl元数据文件,其中包含视频相对路径及由Qwen-VL-72B生成的简短描述文本,便于研究人员直接用于物理感知的视频生成、世界模型训练或物理一致性评估等下游任务。
背景与挑战
背景概述
在计算机视觉与视频理解领域,物理规律的学习与表征一直是极具挑战性的前沿方向。传统视频数据集多聚焦于场景识别、动作分类或语义分割,鲜有专门针对真实世界物理过程设计的资源,导致模型在理解物体运动、碰撞、流体等基本物理现象时缺乏有效的训练与评估基准。为填补这一空白,北京智源人工智能研究院(BAAI)于2024年发布了Physics-aware Video Dataset,该数据集依托其构建的Datacube平台,通过多模态大模型自动筛选与人工校验相结合的方式,系统性地收集了涵盖刚体运动、流体动力学、碰撞反弹、爆炸破碎、烟雾扩散及重力惯性等经典物理过程的短视频片段。每个片段均经过严格的相机稳定性约束与时长控制(5-20秒),并配有由Qwen-VL-72B生成的简短描述。该数据集的问世为物理感知视频生成、视频世界模型构建以及物理一致性评估等研究提供了高质量的真实世界数据支撑,显著推动了视频理解从语义层面向物理规律层面的深化。
当前挑战
该数据集所解决的领域问题核心在于:当前主流视频生成与理解模型普遍缺乏对物理规律的内在感知能力,难以准确再现或预测物体在真实世界中的运动轨迹、相互作用与形变过程。具体挑战包括:1) 物理过程的高度复杂性——同一视频可能同时包含重力、碰撞、摩擦等多重物理效应,模型需解耦并建模这些耦合现象;2) 数据采集与标注的困难——真实物理视频的获取需在自然场景中捕捉特定过程,且需保证运动轨迹清晰、相机稳定,这对采集条件与筛选算法提出极高要求;3) 物理一致性的量化评估缺失——现有评价指标多关注视觉质量或语义准确性,缺乏对运动物理合理性(如动量守恒、能量耗散)的自动度量手段。在构建过程中,团队面临的挑战包括:从海量Datacube视频库中高效检索出符合物理过程定义的候选片段,并设计多模态大模型自动过滤流水线以剔除动画、合成内容及相机运动干扰,同时确保每个片段具备足够的物理可学习性,即物体运动轨迹连续、可追踪且信息密度适中。
常用场景
经典使用场景
该数据集聚焦于真实世界中刚体运动、流体动力学、碰撞反弹、爆炸与烟雾扩散等经典物理过程,为视频理解与生成提供了高度可控的物理先验。其经典使用场景在于训练物理感知的视频生成模型,例如基于文本或视频输入的条件生成任务,要求模型在生成连续帧时遵守重力、惯性、动量守恒等基本物理定律,从而产出运动轨迹连贯、物理行为合理的视频内容。
解决学术问题
该数据集有效解决了视频模型在物理规律学习上缺乏高质量真实数据支撑的学术困境。传统视频数据多包含相机抖动、场景切换或非物理运动,难以用于训练具有物理常识的世界模型。通过自动化筛选固定机位、高运动强度、短时长的视频片段,该数据集为物理一致性评估、物理对齐训练以及视频世界模型的动力学建模提供了标准化基准,显著推动了视频生成中物理可学习性这一关键问题的研究进展。
实际应用
在实际应用中,该数据集可赋能智能机器人对物理世界的感知与操作能力。例如,机器人可基于视频学习物体跌落、碰撞后的运动轨迹预测,从而在抓取或避障任务中做出更精准的决策。此外,在影视特效与虚拟现实领域,该数据集能够辅助生成符合物理规律的动态场景,如爆炸碎片飞散或液体流动,大幅提升合成内容的真实感与沉浸体验。
数据集最近研究
最新研究方向
基于物理感知视频数据集的物理世界模型构建与视频生成一致性研究。该数据集聚焦于真实世界中刚体运动、流体动力学、碰撞反弹、爆炸破碎及重力惯性等经典物理过程,通过多模态大模型自动筛选与Datacube视频检索相结合的方式,构建了高质量、短时长、高运动强度的视频片段库。当前前沿方向包括利用此类数据集训练具备物理常识的视频生成模型,实现从文本或视频到物理一致视频的生成;同时推动视频世界模型的发展,使模型能够从动态视觉序列中隐式学习并预测物理规律。该数据集在物理一致性评估与对齐训练中具有关键作用,为克服现有视频生成模型在物理合理性上的局限提供了重要基准,尤其对机器人仿真、自动驾驶场景理解及科学可视化等热点领域具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务