ActPhysCause_Challenge_Track0
收藏资源简介:
该数据集专注于Track 0: Future Video Generation,包含50个双手机器人桌面操作任务,用于ActPhysCause挑战。训练集有2,000个任务分组片段,包括第一帧图像、指令、元数据和真实视频;评估集有500个匿名样本,包括第一帧图像、指令和提交元数据。媒体格式为640×480 RGB第一帧图像和H.264视频。数据通过RoboTwin 2.0仿真平台收集和生成,使用aloha-agilex机器人平台。
This dataset focuses on Track 0: Future Video Generation, and includes 50 dual-arm robotic desktop operation tasks for the ActPhysCause Challenge. The training set contains 2,000 task group clips, covering first-frame images, instructions, metadata, and ground-truth videos; the evaluation set consists of 500 anonymous samples, which include first-frame images, instructions, and submission metadata. The media formats are 640×480 RGB first-frame images and H.264 encoded videos. The data was collected and generated via the RoboTwin 2.0 simulation platform, using the aloha-agilex robotic platform.
ActPhysCause Challenge 数据集详情
数据集概览
ActPhysCause Challenge 是一个面向具身智能的 动作条件物理与因果世界建模 竞赛,由 LoViF 2026 @ ECCV Workshop 主办。当前发布的 Track 0: 未来视频生成 是该竞赛唯一被评估和排名的赛道。
核心任务
给定一个首帧观察和一段自然语言任务指令,模型需生成一个展现未来操作过程的视频。输出视频需满足:
- 目标对齐:遵循指令并达到预期结果
- 物理合理性:建模可信的交互、运动和物体行为
- 视觉一致性:保留外观、几何和场景身份
- 时间连贯性:随时间维持稳定和可信的过程
数据集规模与划分
- 场景:固定头部摄像头视角下的双臂桌面操作
- 任务数量:50 个任务
- 训练集:2,000 个按任务分组的episode,每个包含首帧、指令、元数据和真值视频
- 评测集:500 个匿名样本,仅提供首帧、指令和提交元数据,评测标注隐藏
- 媒体格式:640 × 480 RGB 首帧图像和 H.264 编码视频
数据来源
数据集基于 RoboTwin 2.0 仿真平台 (项目网站,MIT 许可证) 重新采样生成,使用 aloha-agilex 机器人体型,覆盖 50 个双臂操作任务。
评测指标
最终 RCS100 分数综合两部分:
- 无参考质量:衡量生成视频的视觉连贯性和物理可信度
- 真值保真度:衡量与预期未来的匹配程度
详细评测协议将通过挑战赛官网发布。
提交方式
- 提交邮箱:ActPhysCause_Challenge@x-era.com
- 提交格式:将 500 个预测视频打包为一个 ZIP 文件,视频文件直接置于压缩包根目录,按
s000.mp4至s0499.mp4顺序命名
奖项设置
| 名次 | 奖金 |
|---|---|
| 🥇 第1名 | USD 1,000 |
| 🥈 第2名 | USD 700 |
| 🥉 第3名 | USD 300 |
组织方
- X-Era AI
- 中山大学
- 悉尼科技大学
- 香港科技大学(广州)
组织者:Tianshui Chen, Jusheng Zhang, Qinhan Lyu, Tongyu Mo, Ruichong Gao, Zijie Liang, Keze Wang, Wenhao Wang, Sidi Liu
官方链接





