遇见数据集

paarbench-data

收藏
Hugging Face2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

PAARBench PushObj Training Data 是一个为机器人世界模型和测试时适应研究提供的可选训练数据集。该数据集包含在PushObj模拟器中生成的轨迹数据,覆盖T、L、Z、+四种形状。数据集分为训练集(7,200个episodes,约864MB)和验证集(800个episodes,约97MB)。每个episode包含一个MP4格式的观察流,以及对应的状态、速度、相对动作、绝对动作和序列长度信息。该数据集供研究人员复现基模型或适配器训练,或开发使用离线轨迹的方法。注意,该数据集未明确声明许可证,使用者应查阅上游资产许可信息。

PAARBench PushObj Training Data is an optional training dataset for robot world model and test-time adaptation research. The dataset contains trajectory data generated in the PushObj simulator, covering four shapes: T, L, Z, and +. The dataset is divided into a training set (7,200 episodes, approximately 864MB) and a validation set (800 episodes, approximately 97MB). Each episode includes an observation stream in MP4 format, along with corresponding state, velocity, relative action, absolute action, and sequence length information. The dataset is provided for researchers to reproduce base model or adapter training, or to develop methods using offline trajectories. Note that the dataset does not explicitly declare a license; users should refer to the upstream asset licensing information.

创建时间:
2026-08-03
原始信息汇总

数据集概述:PAARBench PushObj Training Data

数据集名称:PAARBench PushObj Training Data
数据集标签:机器人学、世界模型、测试时自适应
数据集用途:作为 PAARBench 评估协议的可选训练数据集,用于复现基础模型或适配器训练,或开发使用离线轨迹的方法。


核心内容

1. 数据集定位

  • 非必需训练数据:PAARBench 评估协议本身不需要训练轨迹,其目标片段和归一化元数据在 data/pushobj_eval/ 中独立读取。
  • 适用场景:面向需要复现训练流程或研究离线轨迹使用的研究者。

2. 下载方式

  • 通过脚本 scripts/download_data.py 下载,数据源为 ThomasWalker1/paarbench-data 仓库。
  • 下载后存储于 data/pushobj_multishape/,并通过 DATASET_MANIFEST.json 进行完整性校验。

数据规模与结构

数据划分 轨迹数 文件数 总字节数
train 7,200 7,206 864,106,305 字节(约 824 MB)
val 800 806 97,366,292 字节(约 93 MB)
  • 文件组成:每个划分包含 states.pthvelocities.pthrel_actions.pthabs_actions.pthseq_lengths.pklshapes.pkl,以及每个轨迹对应一个 MP4 观测视频流(存放于 obses/ 目录)。
  • 无冗余数据:根目录下的重复副本及中间分片未包含在发布版本中。

数据生成与环境

  • 生成环境:在 PushObj 模拟器中生成。
  • 物体形状:轨迹覆盖 T、L、Z、+ 四种形状。

使用许可

  • 数据集未声明额外许可,仅保留仓库所有者权利。
  • 使用者在再分发前需查阅数据集仓库卡片及适用的上游资产许可。
搜集汇总
数据集介绍
paarbench-data 数据集图片
构建方式
PAARBench PushObj训练数据集的构建依托于PushObj模拟器,覆盖T、L、Z和+四种形状的物体推挤任务。数据生成遵循不可变基准发布原则,仅包含训练管线所需的非冗余分割。训练集包含7200个回合,验证集包含800个回合,每个回合均配有状态、速度、相对动作、绝对动作、序列长度及形状等结构化数据,并以MP4格式保存观测流。数据集通过脚本下载并经过清单校验,确保数据的完整性与可复现性。
特点
该数据集的核心特点在于其精简与高效。它摒弃了冗余的根级副本和中间分片,仅保留训练与验证所需的必要文件。每个回合的观测以视频形式呈现,为基于视觉的模型提供了丰富的时空信息。数据集的不可变性保障了基准测试的公平性,而多形状的覆盖则增强了模型的泛化能力。此外,数据集的许可声明明确,要求使用者在分发前审查上游资产许可,体现了对知识产权的尊重。
使用方法
使用该数据集时,用户可通过执行脚本自动下载并验证数据。数据集设计初衷并非强制用于训练,而是为复现基础模型或适配器训练,以及开发利用离线轨迹的新方法提供支持。评估协议仅需跟踪目标分割和固定的归一化元数据,无需打开训练数据,这使得数据集在训练与评估之间保持高度独立性。用户可根据研究需求,灵活地将此数据集纳入其工作流程,以推动机器人世界模型与测试时自适应领域的发展。
背景与挑战
背景概述
PAARBench PushObj训练数据集由ThomasWalker1等人创建,旨在支持机器人世界模型与测试时自适应领域的研究。该数据集于近期发布,提供7,200个训练轨迹和800个验证轨迹,涵盖T、L、Z和+四种形状的物体推动任务。其核心研究问题在于,通过离线轨迹数据,使研究者能够复现基础模型或适配器训练,并开发显式利用历史数据的自适应方法。数据集的发布为机器人学习社区提供了标准化的基准,促进了世界模型在物理交互场景中的评估与改进,对推动具身智能的发展具有重要意义。
当前挑战
该数据集面临的挑战包括:领域问题方面,机器人操作任务的高维连续状态空间和动力学复杂性,使得世界模型难以准确预测物体运动;同时,多形状物体推动任务要求模型具备泛化能力,以应对不同几何形状与物理特性的变化,这限制了模型在真实世界中的应用。构建过程中,生成高质量轨迹需依赖精确的模拟器,而模拟与真实之间的域差距可能影响训练效果;此外,数据规模与多样性平衡、轨迹存储效率以及基准的固定标准化元数据,均构成技术难点,要求研究者在数据利用和模型设计上寻求创新。
常用场景
经典使用场景
PAARBench PushObj Training Data 数据集作为机器人操作领域的世界模型测试时适应评估基准PAARBench的补充训练资源,其核心使用场景在于为研究者提供离线轨迹数据以训练或微调基础模型与适配器。该数据集包含源自PushObj模拟器的多形状物体(T、L、Z、+)推动任务的7,200个训练片段及800个验证片段,每个片段均配备状态、速度、动作(相对与绝对)序列及观测视频流,为构建状态转移模型、学习动力学特征或开发基于离线强化学习的适应策略提供了标准化的数据原料。
衍生相关工作
围绕此数据集衍生了一系列相关研究,包括开发新的时间对齐或归一化技术的世界模型训练方法,以及利用离线轨迹增强测试时适应效率的元学习算法。另一方面,该数据集的发布激励了面向多形状物体推动任务的数据高效学习研究,衍生出如少样本适应、对抗性扰动下的鲁棒控制等子课题。同时,其与PAARBench协议的紧密结合催生了统一评测框架的构建,促进了不同模块(感知、预测、控制)在统一数据基准上的协作与整合。
数据集最近研究
最新研究方向
PAARBench数据集在机器人领域引领了世界模型与测试时适应算法的前沿探索,其非冗余训练轨迹的发布为复现基座模型与适配器训练提供了坚实基础。该数据集聚焦于多形状推物任务,涵盖T、L、Z、+四种几何构型,通过完整的运动状态与动作序列,支持离线轨迹学习与自适应策略优化。在当前具身智能与泛化操作研究热潮中,PAARBench成为评估模型环境感知与实时调整能力的关键基准,其验证协议无需训练数据即可评测,凸显了简洁性与可复现性。研究者可借助此数据开发不依赖显式轨迹的推理方法,或深入探索多任务迁移与域适应策略,从而推动机器人系统在复杂动态场景中的鲁棒性与适应性,对实现通用操作智能具有重大意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务