遇见数据集

ActPhysCause_Challenge_Track0

收藏
github2026-07-16 更新2026-07-28 收录
官方服务:

资源简介:

该数据集专注于Track 0: Future Video Generation,包含50个双手机器人桌面操作任务,用于ActPhysCause挑战。训练集有2,000个任务分组片段,包括第一帧图像、指令、元数据和真实视频;评估集有500个匿名样本,包括第一帧图像、指令和提交元数据。媒体格式为640×480 RGB第一帧图像和H.264视频。数据通过RoboTwin 2.0仿真平台收集和生成,使用aloha-agilex机器人平台。

This dataset focuses on Track 0: Future Video Generation, and includes 50 dual-arm robotic desktop operation tasks for the ActPhysCause Challenge. The training set contains 2,000 task group clips, covering first-frame images, instructions, metadata, and ground-truth videos; the evaluation set consists of 500 anonymous samples, which include first-frame images, instructions, and submission metadata. The media formats are 640×480 RGB first-frame images and H.264 encoded videos. The data was collected and generated via the RoboTwin 2.0 simulation platform, using the aloha-agilex robotic platform.

创建时间:
2026-07-16
原始信息汇总

ActPhysCause Challenge 数据集详情

数据集概览

ActPhysCause Challenge 是一个面向具身智能的 动作条件物理与因果世界建模 竞赛,由 LoViF 2026 @ ECCV Workshop 主办。当前发布的 Track 0: 未来视频生成 是该竞赛唯一被评估和排名的赛道。

核心任务

给定一个首帧观察和一段自然语言任务指令,模型需生成一个展现未来操作过程的视频。输出视频需满足:

  • 目标对齐:遵循指令并达到预期结果
  • 物理合理性:建模可信的交互、运动和物体行为
  • 视觉一致性:保留外观、几何和场景身份
  • 时间连贯性:随时间维持稳定和可信的过程

数据集规模与划分

  • 场景:固定头部摄像头视角下的双臂桌面操作
  • 任务数量:50 个任务
  • 训练集:2,000 个按任务分组的episode,每个包含首帧、指令、元数据和真值视频
  • 评测集:500 个匿名样本,仅提供首帧、指令和提交元数据,评测标注隐藏
  • 媒体格式:640 × 480 RGB 首帧图像和 H.264 编码视频

数据来源

数据集基于 RoboTwin 2.0 仿真平台 (项目网站,MIT 许可证) 重新采样生成,使用 aloha-agilex 机器人体型,覆盖 50 个双臂操作任务。

评测指标

最终 RCS100 分数综合两部分:

  • 无参考质量:衡量生成视频的视觉连贯性和物理可信度
  • 真值保真度:衡量与预期未来的匹配程度

详细评测协议将通过挑战赛官网发布。

提交方式

  • 提交邮箱ActPhysCause_Challenge@x-era.com
  • 提交格式:将 500 个预测视频打包为一个 ZIP 文件,视频文件直接置于压缩包根目录,按 s000.mp4s0499.mp4 顺序命名

奖项设置

名次 奖金
🥇 第1名 USD 1,000
🥈 第2名 USD 700
🥉 第3名 USD 300

组织方

  • X-Era AI
  • 中山大学
  • 悉尼科技大学
  • 香港科技大学(广州)

组织者:Tianshui Chen, Jusheng Zhang, Qinhan Lyu, Tongyu Mo, Ruichong Gao, Zijie Liang, Keze Wang, Wenhao Wang, Sidi Liu

官方链接

搜集汇总
数据集介绍
ActPhysCause_Challenge_Track0 数据集图片
构建方式
ActPhysCause Challenge Track 0 数据集(即 Future Video Generation 赛道)由 X-Era AI 等研究机构联合构建,旨在评估具身智能体对动作物理后果的预见能力。该数据集基于 RoboTwin 2.0 仿真平台(MIT 协议),采用 aloha-agilex 双臂桌面操作设定,通过重采样技术收集并生成。数据集涵盖 50 项操作任务,包含 2,000 段训练样本(含第一帧观测、自然语言指令、元数据及真实视频)和 500 段评估样本(仅提供第一帧与指令,真实标注隐藏),所有视频均为 640×480 分辨率、H.264 编码。
使用方法
参与者需从 Hugging Face 仓库下载 Track 0 数据集,其中训练集用于模型开发,评估集用于提交。输入为每样本的第一帧 RGB 图像与对应自然语言指令,输出为预测的未来操作视频。提交时需将 500 个预测视频打包为单一 ZIP 压缩包,视频文件直接置于根目录下,并按 s000.mp4 至 s0499.mp4 顺序命名。最终通过官方邮箱提交压缩包及团队信息,由挑战赛组织方根据 RCS100 评分进行排名。
背景与挑战
背景概述
ActPhysCause_Challenge_Track0数据集源于LoViF 2026 @ ECCV Workshop举办的ActPhysCause挑战赛,由X-Era AI、中山大学、悉尼科技大学及香港科技大学(广州)的研究团队联合构建,于2026年发布。该数据集聚焦于具身智能中的动作条件物理与因果世界建模,核心研究问题在于:模型能否理解一个动作,预判其物理后果,并生成后续视频。通过提供初始帧观察与自然语言任务指令,要求参与者输出操控过程的未来视频,场景为固定头部视角下的双臂桌面操作。数据集包含50个任务、2000个训练片段与500个评估样本,对具身智能领域的视频预测、物理推理及因果建模研究具有重要推动作用,为评估模型在视觉、物理、时间一致性及目标对齐方面的能力提供了标准化基准。
当前挑战
当前数据集面临多维度挑战。首先,领域问题方面,模型需解决动作驱动的未来视频生成任务,这要求同时满足目标对齐(遵循指令并达成预期结果)、物理合理性(建模物体间可信的交互与运动)、视觉一致性(维持外观、几何与场景身份)以及时间连贯性(确保过程稳定可信),任何短板均会降低生成视频的真实性与实用性。其次,构建过程中,数据集基于RoboTwin 2.0仿真平台通过重采样生成,如何确保50个双臂操作任务的物理多样性、避免数据分布偏差,以及如何在高保真仿真中精确标注动作-因果链,均是技术难点。此外,评估阶段需设计兼顾无参考质量与地面真值一致性的RCS100评分体系,这进一步考验了评测方法的鲁棒性与公平性。
常用场景
经典使用场景
在具身智能与物理世界建模的交汇领域,ActPhysCause_Challenge_Track0数据集被设计用于未来视频生成任务,其核心场景是让模型基于单帧初始观测与自然语言指令,预测并生成随后的机械臂操作过程视频。这一设置模拟了智能体在物理环境中执行任务时所需的因果推理能力,要求生成的视频在视觉上逼真、物理上合理、时序上连贯,并最终达成指令所描述的目标,为评估模型对动作条件化物理世界的理解提供了标准化基准。
解决学术问题
该数据集直击具身智能研究中一个根本性学术难题:如何让模型理解动作指令、预判其物理后果并生成连续的未来状态。它填补了现有视频生成数据集在物理因果推理和动作条件化方面的空白,解决了从静态观测到动态过程推断的挑战,推动了对物理世界建模、因果推理与时序一致性等关键问题的系统研究,为开发具备物理常识的智能体奠定了实验基础。
实际应用
在实际应用中,该数据集所支撑的未来视频生成技术可赋能机器人自主操作、虚拟仿真训练和人机协作等场景。例如,机器人可依据单帧图像和任务指令预测操作步骤,提前规划运动轨迹并规避潜在冲突;在工业装配和家庭服务中,模型能够通过生成视频验证操作可行性,提升任务执行的鲁棒性与安全性,从而加速具身智能系统从仿真环境向真实世界的迁移。
数据集最近研究
最新研究方向
ActPhysCause数据集聚焦于具身智能领域中动作驱动的物理因果世界建模,其最新研究方向以未来视频生成为核心,旨在探索模型能否依据自然语言指令与初始观测,精准预测并生成后续的操控过程。该研究方向与多模态学习、物理模拟及因果推理等前沿热点紧密关联,特别是在双臂桌面操控场景下,要求生成结果不仅具备视觉连贯性与物理合理性,还需严格对齐任务目标。通过引入RCS100评分机制,该数据集推动了参考无关质量与真实标注保真度的联合评估,为具身AI在虚拟环境中的泛化能力提供了基准,对提升机器人在复杂任务中的理解与执行水平具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务