遇见数据集

Apple-PI-GT

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

Orchard 是 Apple-π 基准测试(Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence)的真实数据(ground-truth)数据集。该数据集包含 400 个视频,涵盖 10 个经典力学任务,这些任务包括模拟生成、自行录制以及互联网来源的案例。其中,9 个任务专注于单一物理定律,用于受控诊断,另有一个多定律组合任务用于测试泛化能力。Apple-π 通过五个子赛道评估模型能否读取物理量、制定控制定律并生成符合定律的未来状态:感知文本子赛道(在白色背景上呈现物理量)、感知图形子赛道(在白色背景上分离物理对象)、公式文本子赛道(选择定律并代入数值的公式)、公式图形子赛道(带速度注释的未来状态)、推理图形子赛道(完整动力学视频或时间戳关键帧)。数据集以文件树形式组织,按物理定律(如UniversalGravitation、ConservationOfMomentum、NewtonsFirstLaw、MultiLaw)和具体任务分层存放。每个案例包含 metadata.json、初始状态、瞬时速度、RGB、实例分割、掩码、深度(模拟案例)、速度(模拟案例)和相机参数(模拟案例)等数据模态。每个案例的每个子赛道提供 3 次独立运行的评估样本。该数据集旨在作为评估基准,不应用于训练或调优模型。数据集采用 Creative Commons Attribution 4.0 International License。

Orchard is the ground-truth dataset of the Apple-π benchmark (Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence). The dataset contains 400 videos covering 10 classical mechanics tasks, including simulated, self-recorded, and internet-sourced cases. Among them, 9 tasks focus on a single physical law for controlled diagnosis, and one multi-law combination task tests generalization ability. Apple-π evaluates models through five sub-tracks: perception-text sub-track (presenting physical quantities on a white background), perception-graphic sub-track (separating physical objects on a white background), formula-text sub-track (selecting a law and substituting values into a formula), formula-graphic sub-track (future states with velocity annotations), and reasoning-graphic sub-track (complete dynamics videos or timestamp keyframes). The dataset is organized in a file tree structure, layered by physical laws (e.g., UniversalGravitation, ConservationOfMomentum, NewtonsFirstLaw, MultiLaw) and specific tasks. Each case includes metadata.json, initial state, instantaneous velocity, RGB, instance segmentation, mask, depth (simulated cases), velocity (simulated cases), camera parameters (simulated cases), and other data modalities. Each sub-track provides 3 independent evaluation samples per case. The dataset is intended as an evaluation benchmark and should not be used for training or tuning models. It is licensed under Creative Commons Attribution 4.0 International License.

创建时间:
2026-07-21
原始信息汇总

数据集概述:Orchard (Apple-π 基准真值数据集)

基本信息

  • 数据集ID: yaorunmao/Apple-PI-GT
  • 数据集名称: Orchard: Apple-π Ground-Truth Dataset
  • 数据集格式版本: 1.0
  • 提示词版本: 1.0
  • 许可协议: CC-BY-4.0
  • 语言: 英语
  • 标注类型: 专家生成
  • 数据规模: 少于1K样本
  • 任务类别: 图像到视频 (image-to-video)

数据集简介

Orchard 是 Apple-π 基准测试(用于评估视频中思维推理能力,以实现物理智能)的真值数据集。数据集包含400个视频,覆盖10个经典力学任务,数据来源包括模拟生成、自行录制和互联网采集。其中9个任务针对单一物理定律,用于受控诊断;1个任务涉及多定律组合,用于测试泛化能力。

数据集结构

数据集按物理定律分类组织,目录结构如下:

Apple-PI-GT/ ├── dataset.json └── cases/ ├── UniversalGravitation/ │ ├── FreeFall/ (自由落体) │ ├── ProjectileMotion/ (抛体运动) │ ├── InclinedPlane/ (斜面运动) │ └── CircularMotion/ (圆周运动) ├── ConservationOfMomentum/ │ ├── PerfectlyElasticCollision/ (完全弹性碰撞) │ ├── PerfectlyInelasticCollision/ (完全非弹性碰撞) │ └── InelasticCollision/ (非弹性碰撞) ├── NewtonsFirstLaw/ │ ├── AtRest/ (静止) │ └── UniformLinearMotion/ (匀速直线运动) └── MultiLaw/ └── Composition/ (多定律组合)

每个案例包含以下注释文件:

  • metadata.json:元数据
  • initial_state/:初始状态
  • instantaneous_velocity/:瞬时速度
  • rgb/:RGB图像
  • instance_segmentation/:实例分割
  • mask/:掩码
  • depth/:深度(仅模拟器案例)
  • velocity/:速度(仅模拟器案例)
  • camera_parameters/:相机参数(仅模拟器案例)

评价子任务

Apple-π 通过五个子任务评估模型是否能够读取物理量、制定控制定律并生成符合定律的未来状态:

阶段 子任务 预期输出
感知 文本 白背景上渲染的物理量
感知 图形 白背景上隔离的物理对象
公式表达 文本 选定定律及代入数值的公式
公式表达 图形 带速度注释的未来状态
演绎 图形 完整动态视频或带时间戳的关键帧

使用说明

  • 预期用途: 评估图像和视频生成模型在定律约束的物理推理方面的能力
  • 数据集性质: 该数据集是评估基准不是训练语料库
  • 使用限制: 官方测试案例和真值注释不应被用于训练或调整在 Apple-π 上报告的模型
  • 结果报告: 结果应包含每个所需案例及全部3次独立运行,不允许进行 best-of-N 选择
  • 每次案例评估样本数: 每个案例/子任务包含3次独立 rollout

许可与引用

  • 数据集采用 Creative Commons Attribution 4.0 International License (CC BY 4.0) 发布
  • 用户需遵守各案例记录中明确的来源特定归属或使用要求
  • 相关论文: arXiv:2607.16401, 由南洋理工大学 S-Lab 与香港中文大学合作完成
搜集汇总
数据集介绍
Apple-PI-GT 数据集图片
构建方式
该数据集源自Apple-π基准测试,旨在评估视频生成模型在物理定律推理方面的能力。构建过程中,研究者精心设计了涵盖经典力学中十个核心任务的四百段视频素材,这些素材融合了仿真模拟、真实拍摄与网络采集等多种来源,确保场景的多样性与真实性。每一任务均配备多模态的标注信息,包括初始状态、瞬时速度、RGB图像、实例分割、掩码以及深度和相机参数等,以此构成对物理状态全面而精细的描述。数据集的目录结构遵循了论文中的法律支柱分类逻辑,便于在控制变量的条件下对不同物理学定律进行诊断性评测。
特点
数据集的核心特色在于其对物理定律的精细解构与视觉呈现。九项单一定律任务为研究者提供了高度可控的评测环境,每一项都直接聚焦于某一物理法则,而一项多定律组合任务则检验了模型在复杂情境下的泛化能力。所有视频均配备了精确的物理量标签和逐帧的未来状态标注,不仅支持文本和图形等多种输出格式的评估,还确保了推理过程的可解释性与可验证性。此外,每个案例独立执行三次滚动生成,以统计稳健性对抗随机性,从而提供更为可靠的模型性能评估。
使用方法
作为专门用于评测的基准数据集,Apple-PI-GT不充当训练语料。用户可通过HuggingFace或配套的代码库便捷地获取完整数据集镜像,并利用官方提供的验证工具确保数据完整性。在评估过程中,模型需依据视频输入,完成物理量感知、物理定律拟定及未来状态推导等多个阶段的输出,这些输出既可以是纯文本描述,也可以是带有速度标注的图形或完整视频。评估报告必须涵盖所有规定的案例及三次独立滚动结果,严格禁止使用最佳选择策略,以保证评测的公正性与可重复性,进而为物理智能领域的研究提供坚实的数据基础。
背景与挑战
背景概述
Apple-PI-GT(又称Orchard)是由新加坡南洋理工大学S-Lab与香港中文大学联合研究团队于2026年发布的基准数据集,旨在评估视频生成模型在经典力学定律根基上的物理推理能力。该数据集由Runmao Yao、Kairui Hu等学者创建,Ziwei Liu教授担任通讯作者,其核心研究问题在于判定模型能否从视频中精确解析物理量、归纳支配性定律,并生成符合定律演化的未来状态。数据集包含400段视频,覆盖十大经典力学任务,涵盖模拟、自摄及互联网来源,并通过五个子赛道(感知-文本/图形、公式-文本/图形、演绎-图形)实现分阶段诊断。其发布为物理智能研究提供了标准化的评估框架,对视频生成与物理推理交叉领域产生了深远影响,推动了从表象生成向定律遵循的范式转变。
当前挑战
该数据集面临的挑战多维且深刻。在领域层面,现有视频生成模型常忽略物理定律,难以生成长期一致且符合力学的动态过程,Apple-PI旨在填补这一缺陷,通过细粒度子任务(如物理量读取、定律公式化、未来状态演绎)迫使模型超越视觉表象,进行潜在物理推理。在构建层面,数据采集需融合模拟器渲染、真实实验录制与互联网素材,确保多源异构数据的物理一致性,并精确标注初始状态、瞬时速度、实例分割、深度及相机参数等多层信息,这要求跨模态的专业知识协同。此外,每例提供三次独立滚动的评估样本,以消除随机性,但这也增加了数据规模与计算负担,且基准严禁训练调参,维护了评估的纯净性,却对模型泛化能力提出了严苛要求。
常用场景
经典使用场景
Apple-PI-GT数据集作为Apple-π基准测试的核心真值资源,专为评估视觉生成模型在物理定律推理上的表现而设计。其经典使用场景涵盖感知、公式化与演绎三大阶段,通过文本与图形两种模态,要求模型从输入视频中提取物理量、识别支配定律并生成符合定律的未来状态。数据集包含400个视频,覆盖十个经典力学任务,其中九个单定律任务用于受控诊断,一个多定律组合任务用于测试泛化能力。该基准以严格的三次独立展开为评估单元,确保结果统计可靠性,是衡量模型物理智能的权威标准。
实际应用
在实际应用中,Apple-PI-GT可服务于智能视频生成系统的质量检验与迭代优化,尤其是在需要物理准确的领域,如自动驾驶模拟、机器人操作规划、增强现实内容合成等。通过该基准,开发者能够甄别模型在复杂物理场景下的缺陷,指导训练数据的补充或模型结构的调整。此外,该数据集的评估协议支持跨模型对比,为学术与工业界提供了统一的性能衡量标准,促进物理智能技术从实验室走向真实世界应用,确保生成内容不仅视觉逼真,更遵循物理规律。
衍生相关工作
Apple-PI-GT的发布激发了系列后续研究,包括基于该基准的模型性能提升工作、物理推理能力增强方法以及更广泛的物理智能评估框架拓展。一方面,研究团队利用其诊断性子任务定位模型短板,发展出显式物理量感知模块、定律约束生成解码器等改进技术;另一方面,该基准也催生了关于视频生成模型物理一致性理论分析的探讨,并推动构建更大规模、更多物理定律覆盖的扩展数据集。此外,Apple-π的评估方法论被借鉴至其他具有物理交互的视频理解任务,成为研究物理AI可信度与可靠性的重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务