object-sorting-cross-embodiment-rich-modality-sample
收藏资源简介:
该数据集是一个跨本体物体分类的检测样本,包含20个片段(10个Franka Panda和10个WidowXAI机器人),总帧数为39,976帧(约22.21分钟,30 FPS)。每个机器人保持原生LeRobot v2.1状态/动作模式,并分别存储在不同的查看器配置中。数据集包含五个同步RGB视图(前、上、腕、右45°、左45°),每个摄像头均提供度量深度(float32 NPZ,单位米)和实例分割(无损FFV1 MKV,共享41类标签图)。此外,还包含机器人状态/动作向量(Panda 9维,WidowXAI 8维)、末端执行器局部/世界TCP位姿、线速度、笛卡尔状态/动作、夹爪开度/模式/活动标注,以及QA分数(D1-D7)、复合分数、置信度、等级、冻结帧计数和任务结果重建字段。数据集旨在用于检查跨本体操作模式、测试多模态预处理流程、比较不同机器人在同一排序任务上的表现,以及验证加载器、可视化工具和本体适配器。注意:这是合成数据,用于检查与管道验证,并非完整策略训练语料;状态/动作向量为到达的下一帧状态而非控制器命令;物体6DoF位姿未包含;注释由原始记录自动重建,未经人工审查;无明确许可证,不可假设再分发权利。
This dataset is a cross-embodiment object sorting detection sample, consisting of 20 episodes (10 Franka Panda and 10 WidowXAI robots), with a total of 39,976 frames (approximately 22.21 minutes at 30 FPS). Each robot maintains its native LeRobot v2.1 state/action schema and is stored in separate viewer configurations. The dataset includes five synchronized RGB views (front, overhead, wrist, right 45°, left 45°), with each camera providing metric depth (float32 NPZ, in meters) and instance segmentation (lossless FFV1 MKV, with shared 41-class label maps). Additionally, it contains robot state/action vectors (Panda 9D, WidowXAI 8D), end-effector local/world TCP poses, linear velocities, Cartesian states/actions, gripper opening/mode/activity annotations, as well as QA scores (D1-D7), composite scores, confidence, ranking, frozen frame counts, and task result reconstruction fields. The dataset is intended for inspecting cross-embodiment manipulation patterns, testing multimodal preprocessing pipelines, comparing robot performances on the same sorting task, and validating loaders, visualizers, and embodiment adapters. Note: This is synthetic data for pipeline verification purposes, not a full policy training corpus; state/action vectors are next-frame states to be reached, not controller commands; object 6DoF poses are not included; annotations are automatically reconstructed from raw recordings without human review; no explicit license is provided, and redistribution rights cannot be assumed.
Cross-Embodiment Object Sorting — Rich-Modality 20-Episode Inspection Sample
数据集概述
- 数据集地址:https://huggingface.co/datasets/ExylosAi/object-sorting-cross-embodiment-rich-modality-sample
- 语言:en
- 任务类别:robotics
- 规模类别:10K<n<100K
- 总片段数:20(10 个 Franka Panda + 10 个 WidowXAI)
- 总帧数:39,976 帧(约 22.21 分钟,30 FPS)
- 存储库占用:约 65.93 GB
- 许可证:源存储库中未指定
任务描述
- 拾取被指定的物体并将其放入被指定的目标盒(Box A、B 或 C)中。
- 用于在进入更大规模发布前检查跨具身操作模式。
片段清单
| 机器人 | 片段数 | 帧数 | 时长 |
|---|---|---|---|
| Franka Panda | 10 | 24,739 | 约 13.74 分钟 |
| WidowXAI | 10 | 15,237 | 约 8.47 分钟 |
| 总计 | 20 | 39,976 | 约 22.21 分钟 |
配置(Configs)
- panda:数据文件路径 viewer_data/panda/*.parquet,split 为 train
- widowxai:数据文件路径 viewer_data/widowxai/*.parquet,split 为 train
- episodes:数据文件路径 viewer_index/metadata.parquet,split 为 train
- videos:数据文件路径 viewer_videos/train.parquet,split 为 train
模态(Modalities)
- RGB:front_cam、top_cam、wrist_cam、right_cam_45、left_cam_45,共五个同步的 1280×960 H.264 视图,无音频。
- 深度:每个相机均有米制 float32 深度,以 NPZ 打包。
- 分割:每个相机均有实例分割,共享 41 类标签映射,无损 FFV1 MKV。
- 机器人状态/动作:各具身原生的关节与夹爪向量,Panda 为 9 维,WidowXAI 为 8 维,采用独立机器人配置,无跨机器人填充。
- 末端执行器:局部/世界 TCP 位姿、线速度、笛卡尔状态/动作以及实现的下一帧笛卡尔动作。
- 夹爪:开度比例、模式与活动标注。
- QA:D1–D7 分数、综合分数、置信度、等级、冻结帧计数,以及重建的任务结果字段。
加载方式
选择具身显式加载:
python from datasets import load_dataset
repo = "ExylosAi/object-sorting-cross-embodiment-rich-modality-sample"
panda = load_dataset(repo, name="panda", split="train") widowxai = load_dataset(repo, name="widowxai", split="train") episodes = load_dataset(repo, name="episodes", split="train") videos = load_dataset(repo, name="videos", split="train")
机器人帧模式保持独立,不要在未使用显式具身适配器的情况下拼接它们的状态/动作向量。
规范嵌套 Parquet 存储于每个机器人根目录下:
python from huggingface_hub import hf_hub_download import pyarrow.parquet as pq
path = hf_hub_download( "ExylosAi/object-sorting-cross-embodiment-rich-modality-sample", "robots/panda/data/chunk-000/episode_000000.parquet", repo_type="dataset", ) episode = pq.read_table(path) print(episode.schema)
- 使用 episodes 配置获取片段级来源、时长、机器人类型、源 QA 状态和源录制元数据。
- 使用 videos 浏览全部 100 个 RGB 流。
文件布局
text robots/panda/ meta · data · videos · annotations for 10 Panda episodes robots/widowxai/ meta · data · videos · annotations for 10 WidowXAI episodes viewer_data/ separate flattened Panda and WidowXAI frame configs viewer_index/ combined 20-row episode and provenance config viewer_videos/ combined 100-row RGB Video-feature config assets/ synchronized front-camera RGB/depth/segmentation preview sample_manifest.json · annotations.json
来源(Provenance)
- sample_manifest.json 保存源片段 ID、机器人特定本地 ID、源录制与 URDF 之间的映射。
- 媒体文件为不可变源负载的服务器端副本;片段路径仅经过重映射以创建独立的机器人子集。
适用与不适用
适用
- 在进入更大规模发布前检查跨具身操作模式。
- 测试多视图 RGB、深度、分割、机器人状态与末端执行器预处理。
- 比较 Franka Panda 与 WidowXAI 上相同的分拣任务。
- 验证加载器、可视化工具与具身适配器。
不适用
- 需要完整的策略训练语料(20 个片段仅用于检查与流水线验证)。
- 需要跨机器人单一共享状态/动作向量。
- 需要力/力矩、触觉、接触、点云或音频流。
- 需要人工审核的自然语言标注(所含标签为从原始录制自动重建)。
注意事项与局限
- 本数据集为合成数据,用于检查与流水线验证,不是统计上具有代表性的基准。
- Panda 与 WidowXAI 使用不同的原生关节模式。
- 关节空间与笛卡尔动作表示实现的下一帧状态,而非记录的控制器命令。
- 不包含逐帧 6-DoF 物体位姿。
- 指令、目标物体、目标盒、结果、阶段与子任务字段为从原始录制重建。
- 重建的标注未经人工独立审核。
- 源存储库中无独立许可证文件或明确许可条款,请勿假定拥有再分发权利。
标注更正
- 各片段的指令、目标物体、目标盒、结果、阶段标注与质量分数均从原始录制重建。
- 片段对齐使用精确帧数、时间戳、帧索引与末端执行器轨迹进行验证。
- WidowXAI 的 D7 分数使用六个驱动关节以及 URDF 位置/速度限制。
引用
- 如使用本样本,请引用本存储库及其确切提交(commit)。




