遇见数据集

Apple-π

收藏
github2026-07-21 更新2026-07-22 收录
数据链接:
官方服务:

资源简介:

Apple-π是一个诊断性基准测试,用于评估视频模型的物理推理能力,包含400个视频,覆盖10个经典经典力学任务,并包含模拟、自记录和互联网来源的案例。基准测试协议分为感知、公式化和演绎三个步骤,每个步骤包含文本和图形子轨道,共五个子轨道。评估套件结合了基于Gemini的主观判断和基于物理定律的客观指标,如SAM3分割/跟踪、MoGe深度估计、基于掩码的图像指标、轨迹重叠和速度误差。

Apple-π is a diagnostic benchmark developed to evaluate the physical reasoning capabilities of video models. It comprises 400 videos covering 10 classic mechanics tasks, with cases sourced from simulations, self-recorded materials, and the Internet. The benchmark protocol is divided into three stages: perception, formulation, and deduction, each of which includes text and graphical sub-tracks, totaling five sub-tracks. The evaluation suite combines Gemini-based subjective judgments and objective metrics grounded in physical laws, including SAM3 segmentation/tracking, MoGe depth estimation, mask-based image metrics, trajectory overlap, and velocity error.

创建时间:
2026-06-27
原始信息汇总

数据集概述

Apple-π(Apple-Pi) 是一个诊断性基准数据集,旨在评估视频模型在物理定律指导下进行推理的能力。该数据集通过生成帧的方式,使模型的推理过程变得可见,以判断模型是否识别了相关物理量、选择了支配性物理定律并随时间遵循该定律。

核心组成

Apple-π 由三个相互关联的部分构成:

  • Orchard(果园):包含 400 个视频,涵盖 10 个经典力学任务。视频来源包括模拟、自录和互联网。任务分类包括9个单定律任务(用于受控诊断)和1个多定律组合任务(用于泛化测试)。
  • 基准协议:一个组织为 感知 → 公式化 → 演绎 的科学推理流程。每个流程包含文本和图形子轨道,共产生5个子轨道。
  • 评估套件:包含基于 Gemini 的主观评判,以及基于物理定律的客观指标,例如 SAM3 分割/跟踪、MoGe 深度估计、基于掩码的图像指标、轨迹重叠和速度误差。

基准子轨道

子轨道 问题 预期输出
感知-文本 读取物理量 最终的白色背景标注图像
感知-图形 定位物理对象 最终的白色背景纯对象图像
公式化-文本 选择支配定律 最终的白色背景三行公式答案
公式化-图形 预测目标时刻的状态 带有速度箭头和标签的目标时刻场景
演绎 生成完整的动力学过程 完整的轨迹视频或带时间戳的关键帧

评估协议

  • 推理协议:模型通过 帧链 输出进行评估。同时,该数据集也提供了图像模型协议,图像模型可以为前四个子轨道生成最终帧,并为演绎子轨道独立生成带时间戳的关键帧。
  • 评估要求:每个案例和子轨道都需要进行 三次独立的运行(rollout)
  • 评估组件:评估过程使用了 Gemini 3.0 Flash 作为评判,并结合了 SAM3MoGe-2 等模型进行客观指标计算。

数据状态与获取

  • 数据发布状态:基准的标注数据(Apple-π GT)尚未公开发布,即将发布。
  • 发布地址:未来将在 Hugging Face 数据集仓库 yaorunmao/Apple-PI-GT 上线。
  • 下载命令:在数据发布后,可使用以下命令下载数据: apple-pi download-data --output data/apple_pi 或使用 Hugging Face 命令: hf download yaorunmao/Apple-PI-GT --repo-type dataset --local-dir data/apple_pi

代码与使用

  • 代码库地址https://github.com/21yrm/Apple-PI
  • 安装方式:通过 git cloneconda 环境管理进行安装。
  • 使用流程:主要包括下载数据、导出推理提示词、运行模型生成三次结果、验证结果以及运行评估。

关键链接

许可证

该数据集和代码库使用 Apache License 2.0 许可。

搜集汇总
数据集介绍
Apple-π 数据集图片
构建方式
Apple-π数据集的构建旨在评估视频模型在物理定律约束下的推理能力,其核心是名为“Orchard”的视频集合,包含400个视频,覆盖10项经典力学任务。这些任务通过模拟、自录及互联网来源生成,分为9个单定律子任务用于受控诊断,以及1个多定律组合任务以检验泛化性。数据集的基准协议设计为“感知→公式化→演绎”的科学推理流程,每个推理阶段下再细分为文本与图形两条子轨道,共形成五个评估子轨道。每个案例均需进行三次独立推理,以保障评估结果的统计可靠性。
使用方法
Apple-π的使用遵循一套完整的命令行流程。用户首先需通过`apple-pi download-data`下载官方真值数据,随后利用`apple-pi export-prompts`导出适用于视频或图像模型的推理提示。模型需针对每个案例和子轨道生成三次独立的结果,并严格遵循预设的文件目录结构存放,例如视频模型的输出保存为MP4文件,图像模型则输出对应帧的PNG文件。完成推理后,使用`apple-pi validate-predictions`验证结果格式,最终通过`apple-pi evaluate`调用官方评估套件,执行Gemini评审、SAM3/MoGe等程序化指标计算及分数融合,以获取全面、可复现的模型性能评估。
背景与挑战
背景概述
Apple-π(Apple-PI)是由南洋理工大学S-Lab与香港中文大学联合团队于2026年7月发布的诊断性基准,核心成员包括Runmao Yao、Kairui Hu及Ziwei Liu等。该数据集直面视频生成模型在物理规律推理上的根本困境——即便模型可生成看似合理的运动,却未必真正理解并遵循物理定律。为此,Apple-π构建了包含400段视频的“果园”(Orchard)数据库,覆盖自由落体、弹性碰撞等10种经典力学任务,并设计“感知→公式化→演绎”的三阶段推理管线。其影响力在于将视频模型评估从视觉相似性的表层比较,推向了基于物理定律的严谨诊断,为迈向具有物理智能的通用视觉系统提供了关键测试平台。
当前挑战
Apple-π所解决的领域核心挑战在于:现有视频模型虽能生成逼真动态,却缺乏对物理量(如速度、动量)的显式感知与物理定律的符号化推理能力,导致模型在需要因果推演的场景中表现脆弱。在构建过程中,团队面临多重困难:首先,需从模拟、自采与互联网来源精心挑选并标注符合单一或复合物理定律的视频,确保任务覆盖的广度与标签的精确性;其次,设计可量化的客观评估指标(如SAM3分割跟踪、轨迹重叠度与速度误差)并融合主观评判,以全面反映模型对物理规律的遵从程度;此外,还需构建统一的推理管线与多轮独立采样的评估协议,消除随机性对结果的影响。
常用场景
经典使用场景
Apple-π数据集的核心应用场景在于评估与诊断视频模型在物理定律推理维度的能力。传统视频生成模型往往仅追求视觉上的运动逼真性,却无法验证模型是否真正识别了关键物理量、选择了支配性物理定律并严格遵循该律进行时序演化。Apple-π通过构建涵盖10种经典力学任务的400段视频,设计感知、公式化、演绎三阶段科学推理流程,要求模型从视频中读取物理量、选定物理定律并生成符合定律的动态帧序列。该基准为衡量视频模型是否具备‘物理智能’提供了首个系统化、可重复的标准化评测协议。
解决学术问题
Apple-π解决了当前视频模型评测中普遍存在的‘视觉假象’问题——即模型生成的运动在外观上合理但实则违背物理定律。学术上,该数据集填补了物理推理任务在视频模型评测中的空白,将评测视角从图像语义对齐扩展至物理定律遵从性。通过引入基于物理定律的客观指标(如速度误差、轨迹重叠率)与Gemini主观评判相结合的双轨评估体系,Apple-π揭示了现有模型在感知、物理定律选择与长时间演化推理阶段的系统性缺陷,为探索具有因果推理能力的物理感知模型指明了关键方向。
实际应用
在实际应用层面,Apple-π所定义的‘感知-公式化-演绎’推理框架可直接服务于机器人操作规划、自动驾驶行为预测与物理仿真验证等领域。例如,机器人系统需从视觉输入中实时推理物体的重力加速度、碰撞响应等物理量以规划抓取动作;自动驾驶需通过观察行人或车辆的物理运动轨迹推断其未来状态。Apple-π提供的标准化评测协议与链式帧生成范式,为上述系统在部署前验证其物理推理可靠性提供了可复用的基准工具,进而降低因物理规律误判导致的安全事故风险。
数据集最近研究
最新研究方向
Apple-π的发布标志着视频生成模型评估从视觉合理性向物理法则对齐的关键跃迁。该基准通过结构化推理管道——感知、公式化、演绎——系统性地考察模型对经典力学定律的遵循程度,其前沿方向聚焦于构建可解释的物理智能。研究热点涵盖多定律组合推理、链式帧输出中定量物理量的追踪与误差度量,以及基于大语言模型的主观评判与客观物理指标(如轨迹重叠率、速度误差)的融合评价体系。这一工作对于推动具身智能体在真实世界场景中的安全部署具有深远意义,为视频模型超越表面模仿、迈向蕴含物理因果的深层认知提供了诊断工具与标准化评价范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务