future-sight-pusht
收藏资源简介:
Future Sight PushT 是一个专为研究训练数据规模和组成如何影响世界模型学习与泛化而设计的数据集。该数据集在统一的 PushT 环境中,结合了大规模被动收集的语料库和较小规模的迭代主动探索语料库,提供了一个受控的实验设置,以隔离数据规模与异构数据集的潜在污染对世界模型学习的影响。数据集包含三大组成部分:被动训练集(约121万条轨迹,压缩大小486.249 GB),由四种不同行为策略收集;主动训练集(共17,000条轨迹,压缩大小8.901 GB),包含五种探索方法及其消融变体,每种方法有5次迭代;评估集(400条轨迹,压缩大小0.239 GB),包含四种评估语料。所有观测均为144×144像素的RGB PNG图像,动作空间为六维连续动作,使用单一摄像头视角。轨迹以TFRecord格式存储,并附有JSON格式的语料元数据和CSV格式的逐轨迹元数据。评估记录还额外包含PNG格式的分割掩码。该数据集适用于机器人学中的世界建模任务,特别是研究数据规模和行为多样性对世界模型泛化能力的实验。
Future Sight PushT is a dataset designed for studying how training data scale and composition affect world model learning and generalization. It combines a large-scale passively collected corpus with a smaller-scale iterative active exploration corpus in a unified PushT environment, providing a controlled experimental setup to isolate the effects of data scale and potential contamination from heterogeneous datasets on world model learning. The dataset consists of three main components: a passive training set (approximately 1.21 million trajectories, 486.249 GB compressed) collected by four different behavior policies; an active training set (17,000 trajectories, 8.901 GB compressed) containing five exploration methods and their ablation variants, each with five iterations; and an evaluation set (400 trajectories, 0.239 GB compressed) comprising four evaluation corpora. All observations are 144×144 pixel RGB PNG images, with a six-dimensional continuous action space and a single camera viewpoint. Trajectories are stored in TFRecord format with corpus metadata in JSON and per-trajectory metadata in CSV format. Evaluation recordings additionally include PNG segmentation masks. This dataset is suitable for world modeling tasks in robotics, particularly experiments investigating the impact of data scale and behavioral diversity on world model generalization.
Future Sight PushT 数据集概述
数据集简介
- 名称:Future Sight PushT
- 许可协议:MIT
- 任务类别:robotics(机器人)
- 标签:robotics、world-modeling、pusht、tfrecord、video
Future Sight PushT 是一个用于研究训练数据规模与组成如何影响世界模型学习与泛化的受控环境。它在统一的 PushT 环境中,将大规模被动采集语料与较小的迭代式主动探索语料配对,帮助隔离数据规模与潜在污染的影响。
数据采集预览
被动采集
包含四种采集方式,具有不同的行为分布:Expert PPO、扰动与恢复(perturbation and recovery)、随机游走(random walk)、随机动作(random actions)。
主动探索
由任务特定的探索方法产生较小的语料,包括:AIM、DADS、DIAYN、ICM 和 METRA,展示第 4 次迭代(iteration 4)。
两个视频均展示每个集合第一个分片(shard)中第一条轨迹的观测记录,最多 100 帧。播放速度为 10 帧/秒;短回合会重复播放,帧计数器标记每次重启。该显示速率不代表采集频率。这些片段仅展示单条轨迹,而非整体性能或覆盖范围。
数据集概览
| 类别 | 被动训练 | 主动训练 | 评估 |
|---|---|---|---|
| 回合数(Episodes) | ≈121 万 | 17,000 | 400 |
| 压缩大小 | 486.249 GB | 8.901 GB | 0.239 GB |
主动回合数包含全部五次采集迭代及两个 AIM 消融实验。每个评估集合包含 100 回合。被动回合数为四舍五入值;所有大小均为压缩十进制 GB。
预览的训练语料使用 144×144 RGB PNG 观测、六维连续动作和单一相机视角。轨迹以 TFRecords 存储,附带 JSON 语料元数据和 CSV 逐轨迹元数据。评估记录使用相同的解码 RGB/动作维度,并额外包含 PNG 分割掩码。
采集指南
被动采集
被动集合代表可大规模采集的数据:
| 集合 | 行为 | 回合数 | 压缩大小 |
|---|---|---|---|
| Expert PPO | 任务导向的专家轨迹 | ≈307,000 | 56.976 GB |
| Recovery | 带扰动与恢复的策略推演 | ≈300,000 | 118.956 GB |
| Random walk | 时间相关的随机动作 | ≈300,000 | 156.312 GB |
| Uniform random | 均匀随机动作 | ≈300,000 | 154.005 GB |
主动采集
主动集合代表较小的、任务特定的探索轮次。每种方法有五套语料,即 iter-0 至 iter-4,每次迭代包含八个分片。
| 方法 | 角色 | 五次迭代总回合数 | 压缩大小 |
|---|---|---|---|
| AIM | Action Influence Maximization | 5,000 | 2.667 GB |
| AIM no-MI | AIM 互信息消融 | 5,000 | 2.617 GB |
| AIM no-SN | AIM 谱归一化消融 | 5,000 | 2.631 GB |
| DADS | Dynamics-Aware Discovery of Skills | 500 | 0.260 GB |
| DIAYN | Diversity Is All You Need | 500 | 0.223 GB |
| ICM | Intrinsic Curiosity Module | 500 | 0.244 GB |
| METRA | Metric-aware abstraction | 500 | 0.260 GB |
评估数据
评估数据与训练数据相互独立:
| 语料 | 行为 | 回合数 |
|---|---|---|
| BC | 行为克隆策略推演 | 100 |
| BC failures | 交替的专家与推开控制器片段 | 100 |
| PushAway | 推开控制器推演 | 100 |
| Interaction | 带模拟器分割掩码的人类遥操作 | 100 |
文件与下载
文件结构:
text passive-collection/<ppo|recovery|random-walk|uniform-random>/train/shard_N.tar.zst active-exploration/<method>/iter-N/shard_N.tar.zst evaluation/<bc|bc-failures|pushaway|interaction>/shard_0.tar.zst manifest.json
manifest.json 记录每个归档的路径、字节大小和 SHA-256 校验和。上文大小为压缩十进制 GB;解压需要额外磁盘空间。
先安装 Hugging Face CLI,然后仅下载实验所需的数据。
下载单个归档:
sh hf download smbml/future-sight-pusht evaluation/bc/shard_0.tar.zst --repo-type dataset --local-dir ./future-sight-pusht
下载一个完整的主动探索迭代:
sh hf download smbml/future-sight-pusht --repo-type dataset --include "active-exploration/aim/iter-0/*.tar.zst" --local-dir ./future-sight-pusht
添加 --revision FULL_COMMIT_HASH 可固定可复现的快照。验证大小或校验和时,请下载同一版本的 manifest.json。
解压与读取
在安装 GNU tar 和 zstd 后:
sh mkdir -p ./future-sight-data tar --zstd -xf ./future-sight-pusht/evaluation/bc/shard_0.tar.zst -C ./future-sight-data
这将创建 future-sight-data/pusht_bc_1pct_n100/,包含 TFRecords 和元数据。归档路径用于组织下载;解压后的顶层目录名反映每个归档中存储的语料。
对于分片训练语料,请将每个分片解压到单独的目录,以免分片本地元数据文件相互覆盖。需要从全部八个目录读取 TFRecords 和元数据,才能使用完整的迭代或被动语料。
许可协议
MIT。
引用
如果使用该数据集,请引用:
bibtex @inproceedings{bateman2026training, title = {Training Controllable World Models via Action Influence Maximization}, author = {Bateman, Samuel M. and Yin, Tenny and Zheng, Chongyi and Huang, Lei and Wang, Brian and Eysenbach, Ben and Fern{'a}ndez Fisac, Jaime and Shah, Dhruv}, booktitle = {Conference on Robot Learning (CoRL)}, year = {2026} }
论文链接即将发布。





