遇见数据集

Physical-ICL

收藏
Hugging Face2026-07-18 更新2026-07-19 收录
官方服务:

资源简介:

Physical-ICL 是一个项目级数据集存储库,旨在研究视频生成中的物理情境学习。当前版本包含一个基于 Physics-IQ 构建的初步子集。数据集采用查询-演示对的组织形式:每个样本包含一个查询视频(目标视频)以及多个候选演示视频,这些演示视频根据其与查询视频的物理关系被标注为“良好演示”、“弱相关演示”、“相反演示”或“无关演示”。查询视频通常使用完整的 Physics-IQ 视频,而演示视频则使用 5 秒的 Physics-IQ 测试片段。每个演示视频还对应一个通过事件感知的 3x3 帧采样生成的故事板图像。数据集规模较小(少于 1K 样本),适用于物理推理、世界模型、视频生成和演示学习等研究任务。数据集中提供了丰富的元数据,包括物理场景、事件标签、相似度评分等,便于进行细致的物理情境学习分析。

Physical-ICL is a project-level dataset repository designed to study physical in-context learning in video generation. The current version includes a preliminary subset based on Physics-IQ. The dataset is organized in query-demo pairs: each sample contains a query video (target video) and multiple candidate demo videos, which are labeled as good demo, weakly relevant demo, opposite demo, or irrelevant demo based on their physical relationship to the query video. Query videos typically use full Physics-IQ videos, while demo videos use 5-second Physics-IQ test clips. Each demo video also corresponds to a storyboard image generated through event-aware 3x3 frame sampling. The dataset is relatively small (less than 1K samples) and is suitable for research tasks such as physical reasoning, world models, video generation, and demonstration learning. It provides rich metadata, including physical scenes, event labels, similarity scores, etc., facilitating detailed analysis of physical in-context learning.

创建时间:
2026-07-05
原始信息汇总

数据集名称:Physical-ICL

数据集类型:项目级数据集,用于视频生成中的物理上下文学习(Physical In-Context Learning)研究。

许可证:其他(other)

任务类别:文本到视频(text-to-video)、图像到视频(image-to-video)

语言:英语(en)

数据集规模:少于1000个样本(n<1K)

当前子集:基于 Physics-IQ 构建的初步子集(Physics-IQ preliminary subset),路径为 data/physiq_prelim/

样本格式:每个样本包含一个查询视频(query video)和多个候选演示视频(candidate demonstration videos)。样本存储在 data/physiq_prelim/gt_data/task_xxxx/episode_0001/ 目录下。

文件结构

  • video.mp4:查询目标视频,使用完整的 Physics-IQ 视频。
  • prompt/:包含查询视频的初始帧(init_frame.png)和文本提示(prompt.txt)。
  • demos/:候选演示视频及其对应的 3x3 故事板图像(storyboard image)。演示视频类型包括:
    • good_demo_XX.mp4:合适的正面演示。
    • weak_demo_XX.mp4:弱相关演示。
    • opposite_demo_XX.mp4:物理结果相反的演示。
    • irrelevant_demo_XX.mp4:无关的或不同类别的对照演示。
  • 对应的 .png 文件为从该演示视频提取的 3x3 事件感知故事板图像。

元数据文件

  • data/physiq_prelim/summary.json:机器可读的元数据。
  • data/physiq_prelim/case_summary.csv:人类可读的样本级别摘要。
  • data/physiq_prelim/export_warnings.txt:导出警告。
  • data/physiq_prelim/storyboard_warnings.txt:故事板生成警告。

元数据 Schema(summary.json)

  • 每个查询样本包含字段:case_id(唯一标识符)、task_name(任务文件夹名)、gt_path(查询视频路径)、image(查询初始帧路径)、prompt(查询提示)、query_scenario(Physics-IQ 场景名)、query_macro_group(粗粒度物理类别)、query_event_tag(细粒度事件标签)、demos(候选演示列表)、available_demo_types(可用演示类型)。
  • 每个演示条目包含字段:demo_type(类型:good/weak/opposite/irrelevant)、demo_path(演示视频路径)、demo_image_path(3x3 故事板图像路径)、demo_scenario(Physics-IQ 场景名)、demo_relation(详细关系标签)、physical_similarity(物理相似度标签)、visual_similarity(视觉相似度标签)。

使用示例:加载元数据后,可通过 demo_type 过滤演示,例如筛选 good 类型的演示。对于视频模型使用 demo_path,对于图像模型使用 demo_image_path

备注

  • 查询视频使用完整的 Physics-IQ 视频(可用时)。
  • 演示视频使用 5 秒的 Physics-IQ 测试片段。
  • 演示故事板图像基于事件感知的 3x3 帧采样生成。
  • 当前版本不包含低质量生成的演示。
  • 该数据集用于研究和初步实验。
搜集汇总
数据集介绍
Physical-ICL 数据集图片
构建方式
Physical-ICL数据集以Physics-IQ视频素材为基石,精心构建了面向视频生成中物理上下文学习的初步子集。每个样本围绕一个查询视频展开,并为其配备多组候选示范视频,这些示范视频依据与查询的物理关联程度被细致归类为良好、微弱、相反或不相关四类。在储存结构上,数据以任务和场景为层级组织,查询视频附带初始帧图像与文本提示,而每个示范视频则同时提供完整视频片段与经事件感知采样生成的3x3故事板图像,元数据文件则统一记录所有样本与示范的详尽信息。
使用方法
使用该数据集时,研究人员首先通过加载根目录下的summary.json文件获取全部样本的元数据。每个样本的核心字段包含查询视频路径、初始帧图像、文本提示及示范列表。对于具备视频处理能力的模型,可直接引用demo_path字段加载完整示范视频;而对于仅支持图像输入的模型,则可利用demo_image_path字段使用3x3故事板图像作为替代。示范视频可按其demo_type字段灵活筛选,以适应不同物理关联程度的学习任务,从而支持从简单模仿到反事实推理等多种实验设计。
背景与挑战
背景概述
Physical-ICL是一个面向视频生成中物理情境学习(Physical In-Context Learning)研究的项目级数据集,由相关研究团队于近期构建并发布。该数据集的核心研究问题在于探索预训练视频生成模型是否能够通过少量演示(demonstration)理解并泛化物理世界的因果规律,例如物体运动、碰撞、重力等底层物理机制。作为从Physics-IQ数据集衍生而来的初步子集,Physical-ICL通过系统化组织查询视频与四种类型(良好、弱相关、相反、无关)的演示视频,为评估模型在物理推理上的情境学习能力提供了标准化基准。该数据集的提出弥补了现有视频生成领域缺乏物理感知评估的空白,有望推动世界模型与物理智能的发展,对视频生成、机器人学习和物理仿真等交叉领域具有重要的学术与应用价值。
当前挑战
Physical-ICL所应对的核心领域挑战在于,主流视频生成模型常因缺乏物理世界的内在表征而难以准确模拟物体间的因果关系、物理一致性以及反事实情境(例如相反物理结果)。该数据集构建过程中面临多重困难:首先,从Physics-IQ中筛选并标注与物理事件高度相关的视频片段需兼顾物理相似性与视觉相似性,而标注颗粒度的控制极易引入歧义;其次,生成耦合多种物理规律的情境并设计与之对应的相反或弱相关演示,需依赖领域专家对复杂物理场景的分解;此外,通过事件感知的故事板(storyboard)提取3×3关键帧以保证时空采样一致性的方法,在长视频处理中易出现质量不稳定或信息丢失的问题。这些挑战不仅考验数据构建的严谨性,也对模型从稀疏演示中泛化物理规则的能力提出了更高要求。
常用场景
经典使用场景
Physical-ICL数据集为视频生成领域的物理情境学习研究提供了基础性资源。该数据集的核心应用在于评估和提升视频生成模型对物理世界规律的内化能力,通过提供包含良好、弱相关、相反及无关四种类型的候选示范视频,研究者能够系统性地测试模型能否从示范中理解物理逻辑并将其迁移至新的查询视频生成任务中。典型使用方式是加载查询视频的初始帧与文本提示,并结合不同类别的示范视频,观察模型在物理一致性上的生成表现。这一设计尤其适用于探究上下文学习在物理推理任务中的边界与潜力。
解决学术问题
该数据集旨在解决视频生成中物理规律缺乏约束的核心学术难题。当前主流生成模型虽能产生视觉逼真的内容,却常常违背基本物理常识,例如物体掉落方向错误或碰撞反应失实。Physical-ICL通过构建细粒度的物理情境样本,使得研究者可以量化评估模型对物理因果关系的理解程度。其意义在于将物理意识引入生成模型评价体系,推动领域从视觉匹配走向因果推理。该数据集鼓励学界超越纯粹的像素预测,转而关注世界模型的构建,从而对视频生成的学术范式产生深远影响。
实际应用
在实际应用层面,Physical-ICL为多个需要物理常识的智能系统提供了关键支撑。在机器人操作领域,利用该数据集的示范学习机制,可让机械臂通过观察正反例示范快速掌握物体堆叠或倾倒的物理规则。在虚拟现实与游戏开发中,该数据集有助于生成符合物理定律的动态场景,提升沉浸式体验的真实感。此外,自动驾驶模拟系统可通过学习不同物理情境下的运动演示,增强对异常路况的预测能力。这些应用场景共同指向一个目标:让视频生成技术从视觉幻觉走向物理可信。
数据集最近研究
最新研究方向
Physical-ICL数据集专注于视频生成任务中的物理上下文学习,旨在通过提供带有‘好’、‘弱’、‘相反’或‘无关’标签的示范视频,系统评估模型在物理世界理解中的上下文推理能力。该领域的前沿研究围绕构建可泛化的世界模型展开,强调模型需超越视觉相似性,捕捉物体动态、重力等物理规律。结合近期视频生成模型因缺乏物理常识导致生成内容与真实世界规律相悖的热点事件,Physical-ICL通过细粒度物理相似性标注与示范对比,为训练具备物理直觉的生成模型提供了关键测试基准。其意义在于推动视频生成从外观模仿迈向物理规律感知,为构建更可靠、可解释的通用智能系统奠定基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务