Physical-ICL
收藏资源简介:
Physical-ICL 是一个项目级数据集存储库,旨在研究视频生成中的物理情境学习。当前版本包含一个基于 Physics-IQ 构建的初步子集。数据集采用查询-演示对的组织形式:每个样本包含一个查询视频(目标视频)以及多个候选演示视频,这些演示视频根据其与查询视频的物理关系被标注为“良好演示”、“弱相关演示”、“相反演示”或“无关演示”。查询视频通常使用完整的 Physics-IQ 视频,而演示视频则使用 5 秒的 Physics-IQ 测试片段。每个演示视频还对应一个通过事件感知的 3x3 帧采样生成的故事板图像。数据集规模较小(少于 1K 样本),适用于物理推理、世界模型、视频生成和演示学习等研究任务。数据集中提供了丰富的元数据,包括物理场景、事件标签、相似度评分等,便于进行细致的物理情境学习分析。
Physical-ICL is a project-level dataset repository designed to study physical in-context learning in video generation. The current version includes a preliminary subset based on Physics-IQ. The dataset is organized in query-demo pairs: each sample contains a query video (target video) and multiple candidate demo videos, which are labeled as good demo, weakly relevant demo, opposite demo, or irrelevant demo based on their physical relationship to the query video. Query videos typically use full Physics-IQ videos, while demo videos use 5-second Physics-IQ test clips. Each demo video also corresponds to a storyboard image generated through event-aware 3x3 frame sampling. The dataset is relatively small (less than 1K samples) and is suitable for research tasks such as physical reasoning, world models, video generation, and demonstration learning. It provides rich metadata, including physical scenes, event labels, similarity scores, etc., facilitating detailed analysis of physical in-context learning.
数据集名称:Physical-ICL
数据集类型:项目级数据集,用于视频生成中的物理上下文学习(Physical In-Context Learning)研究。
许可证:其他(other)
任务类别:文本到视频(text-to-video)、图像到视频(image-to-video)
语言:英语(en)
数据集规模:少于1000个样本(n<1K)
当前子集:基于 Physics-IQ 构建的初步子集(Physics-IQ preliminary subset),路径为 data/physiq_prelim/。
样本格式:每个样本包含一个查询视频(query video)和多个候选演示视频(candidate demonstration videos)。样本存储在 data/physiq_prelim/gt_data/task_xxxx/episode_0001/ 目录下。
文件结构:
video.mp4:查询目标视频,使用完整的 Physics-IQ 视频。prompt/:包含查询视频的初始帧(init_frame.png)和文本提示(prompt.txt)。demos/:候选演示视频及其对应的 3x3 故事板图像(storyboard image)。演示视频类型包括:good_demo_XX.mp4:合适的正面演示。weak_demo_XX.mp4:弱相关演示。opposite_demo_XX.mp4:物理结果相反的演示。irrelevant_demo_XX.mp4:无关的或不同类别的对照演示。
- 对应的
.png文件为从该演示视频提取的 3x3 事件感知故事板图像。
元数据文件:
data/physiq_prelim/summary.json:机器可读的元数据。data/physiq_prelim/case_summary.csv:人类可读的样本级别摘要。data/physiq_prelim/export_warnings.txt:导出警告。data/physiq_prelim/storyboard_warnings.txt:故事板生成警告。
元数据 Schema(summary.json):
- 每个查询样本包含字段:
case_id(唯一标识符)、task_name(任务文件夹名)、gt_path(查询视频路径)、image(查询初始帧路径)、prompt(查询提示)、query_scenario(Physics-IQ 场景名)、query_macro_group(粗粒度物理类别)、query_event_tag(细粒度事件标签)、demos(候选演示列表)、available_demo_types(可用演示类型)。 - 每个演示条目包含字段:
demo_type(类型:good/weak/opposite/irrelevant)、demo_path(演示视频路径)、demo_image_path(3x3 故事板图像路径)、demo_scenario(Physics-IQ 场景名)、demo_relation(详细关系标签)、physical_similarity(物理相似度标签)、visual_similarity(视觉相似度标签)。
使用示例:加载元数据后,可通过 demo_type 过滤演示,例如筛选 good 类型的演示。对于视频模型使用 demo_path,对于图像模型使用 demo_image_path。
备注:
- 查询视频使用完整的 Physics-IQ 视频(可用时)。
- 演示视频使用 5 秒的 Physics-IQ 测试片段。
- 演示故事板图像基于事件感知的 3x3 帧采样生成。
- 当前版本不包含低质量生成的演示。
- 该数据集用于研究和初步实验。




