遇见数据集

object-sorting-cross-embodiment-rich-modality-sample

收藏
Hugging Face2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

该数据集是一个跨本体物体分类的检测样本,包含20个片段(10个Franka Panda和10个WidowXAI机器人),总帧数为39,976帧(约22.21分钟,30 FPS)。每个机器人保持原生LeRobot v2.1状态/动作模式,并分别存储在不同的查看器配置中。数据集包含五个同步RGB视图(前、上、腕、右45°、左45°),每个摄像头均提供度量深度(float32 NPZ,单位米)和实例分割(无损FFV1 MKV,共享41类标签图)。此外,还包含机器人状态/动作向量(Panda 9维,WidowXAI 8维)、末端执行器局部/世界TCP位姿、线速度、笛卡尔状态/动作、夹爪开度/模式/活动标注,以及QA分数(D1-D7)、复合分数、置信度、等级、冻结帧计数和任务结果重建字段。数据集旨在用于检查跨本体操作模式、测试多模态预处理流程、比较不同机器人在同一排序任务上的表现,以及验证加载器、可视化工具和本体适配器。注意:这是合成数据,用于检查与管道验证,并非完整策略训练语料;状态/动作向量为到达的下一帧状态而非控制器命令;物体6DoF位姿未包含;注释由原始记录自动重建,未经人工审查;无明确许可证,不可假设再分发权利。

This dataset is a cross-embodiment object sorting detection sample, consisting of 20 episodes (10 Franka Panda and 10 WidowXAI robots), with a total of 39,976 frames (approximately 22.21 minutes at 30 FPS). Each robot maintains its native LeRobot v2.1 state/action schema and is stored in separate viewer configurations. The dataset includes five synchronized RGB views (front, overhead, wrist, right 45°, left 45°), with each camera providing metric depth (float32 NPZ, in meters) and instance segmentation (lossless FFV1 MKV, with shared 41-class label maps). Additionally, it contains robot state/action vectors (Panda 9D, WidowXAI 8D), end-effector local/world TCP poses, linear velocities, Cartesian states/actions, gripper opening/mode/activity annotations, as well as QA scores (D1-D7), composite scores, confidence, ranking, frozen frame counts, and task result reconstruction fields. The dataset is intended for inspecting cross-embodiment manipulation patterns, testing multimodal preprocessing pipelines, comparing robot performances on the same sorting task, and validating loaders, visualizers, and embodiment adapters. Note: This is synthetic data for pipeline verification purposes, not a full policy training corpus; state/action vectors are next-frame states to be reached, not controller commands; object 6DoF poses are not included; annotations are automatically reconstructed from raw recordings without human review; no explicit license is provided, and redistribution rights cannot be assumed.

创建时间:
2026-08-31
原始信息汇总

Cross-Embodiment Object Sorting — Rich-Modality 20-Episode Inspection Sample

数据集概述

  • 数据集地址:https://huggingface.co/datasets/ExylosAi/object-sorting-cross-embodiment-rich-modality-sample
  • 语言:en
  • 任务类别:robotics
  • 规模类别:10K<n<100K
  • 总片段数:20(10 个 Franka Panda + 10 个 WidowXAI)
  • 总帧数:39,976 帧(约 22.21 分钟,30 FPS)
  • 存储库占用:约 65.93 GB
  • 许可证:源存储库中未指定

任务描述

  • 拾取被指定的物体并将其放入被指定的目标盒(Box A、B 或 C)中。
  • 用于在进入更大规模发布前检查跨具身操作模式。

片段清单

机器人 片段数 帧数 时长
Franka Panda 10 24,739 约 13.74 分钟
WidowXAI 10 15,237 约 8.47 分钟
总计 20 39,976 约 22.21 分钟

配置(Configs)

  • panda:数据文件路径 viewer_data/panda/*.parquet,split 为 train
  • widowxai:数据文件路径 viewer_data/widowxai/*.parquet,split 为 train
  • episodes:数据文件路径 viewer_index/metadata.parquet,split 为 train
  • videos:数据文件路径 viewer_videos/train.parquet,split 为 train

模态(Modalities)

  • RGB:front_cam、top_cam、wrist_cam、right_cam_45、left_cam_45,共五个同步的 1280×960 H.264 视图,无音频。
  • 深度:每个相机均有米制 float32 深度,以 NPZ 打包。
  • 分割:每个相机均有实例分割,共享 41 类标签映射,无损 FFV1 MKV。
  • 机器人状态/动作:各具身原生的关节与夹爪向量,Panda 为 9 维,WidowXAI 为 8 维,采用独立机器人配置,无跨机器人填充。
  • 末端执行器:局部/世界 TCP 位姿、线速度、笛卡尔状态/动作以及实现的下一帧笛卡尔动作。
  • 夹爪:开度比例、模式与活动标注。
  • QA:D1–D7 分数、综合分数、置信度、等级、冻结帧计数,以及重建的任务结果字段。

加载方式

选择具身显式加载:

python from datasets import load_dataset

repo = "ExylosAi/object-sorting-cross-embodiment-rich-modality-sample"

panda = load_dataset(repo, name="panda", split="train") widowxai = load_dataset(repo, name="widowxai", split="train") episodes = load_dataset(repo, name="episodes", split="train") videos = load_dataset(repo, name="videos", split="train")

机器人帧模式保持独立,不要在未使用显式具身适配器的情况下拼接它们的状态/动作向量。

规范嵌套 Parquet 存储于每个机器人根目录下:

python from huggingface_hub import hf_hub_download import pyarrow.parquet as pq

path = hf_hub_download( "ExylosAi/object-sorting-cross-embodiment-rich-modality-sample", "robots/panda/data/chunk-000/episode_000000.parquet", repo_type="dataset", ) episode = pq.read_table(path) print(episode.schema)

  • 使用 episodes 配置获取片段级来源、时长、机器人类型、源 QA 状态和源录制元数据。
  • 使用 videos 浏览全部 100 个 RGB 流。

文件布局

text robots/panda/ meta · data · videos · annotations for 10 Panda episodes robots/widowxai/ meta · data · videos · annotations for 10 WidowXAI episodes viewer_data/ separate flattened Panda and WidowXAI frame configs viewer_index/ combined 20-row episode and provenance config viewer_videos/ combined 100-row RGB Video-feature config assets/ synchronized front-camera RGB/depth/segmentation preview sample_manifest.json · annotations.json

来源(Provenance)

  • sample_manifest.json 保存源片段 ID、机器人特定本地 ID、源录制与 URDF 之间的映射。
  • 媒体文件为不可变源负载的服务器端副本;片段路径仅经过重映射以创建独立的机器人子集。

适用与不适用

适用

  • 在进入更大规模发布前检查跨具身操作模式。
  • 测试多视图 RGB、深度、分割、机器人状态与末端执行器预处理。
  • 比较 Franka Panda 与 WidowXAI 上相同的分拣任务。
  • 验证加载器、可视化工具与具身适配器。

不适用

  • 需要完整的策略训练语料(20 个片段仅用于检查与流水线验证)。
  • 需要跨机器人单一共享状态/动作向量。
  • 需要力/力矩、触觉、接触、点云或音频流。
  • 需要人工审核的自然语言标注(所含标签为从原始录制自动重建)。

注意事项与局限

  • 本数据集为合成数据,用于检查与流水线验证,不是统计上具有代表性的基准。
  • Panda 与 WidowXAI 使用不同的原生关节模式。
  • 关节空间与笛卡尔动作表示实现的下一帧状态,而非记录的控制器命令。
  • 不包含逐帧 6-DoF 物体位姿。
  • 指令、目标物体、目标盒、结果、阶段与子任务字段为从原始录制重建。
  • 重建的标注未经人工独立审核。
  • 源存储库中无独立许可证文件或明确许可条款,请勿假定拥有再分发权利。

标注更正

  • 各片段的指令、目标物体、目标盒、结果、阶段标注与质量分数均从原始录制重建。
  • 片段对齐使用精确帧数、时间戳、帧索引与末端执行器轨迹进行验证。
  • WidowXAI 的 D7 分数使用六个驱动关节以及 URDF 位置/速度限制。

引用

  • 如使用本样本,请引用本存储库及其确切提交(commit)。
搜集汇总
数据集介绍
object-sorting-cross-embodiment-rich-modality-sample 数据集图片
构建方式
该数据集以跨具身操作研究为背景,从原始录制中抽取20个回合构建而成,包含10个Franka Panda与10个WidowXAI回合。每个机器人的本体状态与动作按各自原生LeRobot v2.1模式分别保留,通过sample_manifest.json维护源回合ID、机器人局部ID、源录制与URDF之间的映射关系。媒体文件为服务器端副本,回合路径仅经重新映射以形成相互独立的机器人子集,深度、分割及回合级指令、目标物体、目标箱、结果等标注则由原始录制自动重建。
特点
数据集聚焦跨具身物体分拣任务,要求拾取指令物体并放入指定目标箱。其突出特点在于丰富的多模态同步信息:五路1280×960 RGB视图,每一路均配有米制float32深度与共享41类实例分割;同时提供机器人关节与夹爪状态动作、末端执行器局部与世界TCP位姿、线速度、笛卡尔状态动作以及夹爪开合语义。Panda与WidowXAI的状态动作维度分别为9维和8维,框架分离而不做跨机器人填充,另含D1至D7质量评分、综合分、置信度、等级和冻结帧计数等QA元数据。
使用方法
使用者可通过Hugging Face datasets库按具身名称显式加载:分别指定panda、widowxai、episodes与videos配置读取训练划分。各机器人框架模式保持独立,若需联合使用状态或动作向量,应引入明确的具身适配器,不应直接拼接。规范嵌套Parquet文件可借助huggingface_hub下载后以pyarrow读取,以查看单回合模式;episodes配置用于获取回合级溯源、时长、机器人类型与源QA状态,videos配置用于浏览全部100路RGB视频流。
背景与挑战
背景概述
机器人操作技能的跨本体泛化是具身智能领域的核心难题。传统数据集多局限于单一机械臂构型,难以支撑跨本体的策略迁移研究。在此背景下,ExylosAi构建了跨本体物体分拣数据集,涵盖Franka Panda与WidowXAI两种异构机械臂,各含10个演示回合,总计39,976帧、约22分钟。该数据集以丰富模态为特色,同步提供五路RGB视图、度量深度、实例分割、机器人状态与动作、末端执行器轨迹及夹爪语义,并附有质量评估元数据。作为面向检查与流程验证的样本,它为跨本体操作研究提供了精细的模态对齐资源,对推动具身智能中多模态感知与动作适配具有参考价值。
当前挑战
该数据集所应对的核心领域问题在于跨本体操作策略的泛化与迁移。具体挑战包括:Franka Panda与WidowXAI采用异构关节构型,状态与动作空间维度互异,无法直接拼接或共享,需要显式的本体适配器;多模态数据虽丰富,但深度、分割、状态与动作在五路视图间的精确时空同步仍构成预处理难点;数据集规模有限,仅20个回合,不足以支撑统计意义上的策略训练或基准评测,仅适用于流程验证;标注信息由原始记录自动重建,未经人工复核,其指令、目标框与质量评分可能存在噪声;此外,源仓库未提供明确许可证,使用与再分发权利存在不确定性。
常用场景
经典使用场景
在机器人学习与具身智能领域,跨本体操作策略的泛化性研究日益依赖于多样化的机器人平台数据。该数据集作为一种紧凑的跨本体检验样本,经典使用场景在于对Franka Panda与WidowXAI两种机械臂执行同一物体分拣任务的多模态数据进行快速审查与管线验证。研究者可利用其五路同步RGB视图、度量深度、实例分割以及机器人状态与动作序列,检验数据加载器、可视化工具与本体适配器的兼容性,从而在投入大规模训练语料前,先行评估跨本体操作模式的对齐质量与预处理流程的鲁棒性。
衍生相关工作
围绕该检验样本,后续研究可能衍生出若干经典工作方向。其一,基于其跨本体模式,学者可构建本体适配器或领域自适应方法,实现Panda与WidowXAI间策略的零样本或少样本迁移。其二,利用其多模态同步数据,可开展多视图融合与深度引导的分割增强研究,提升操作任务中的场景理解能力。其三,其自动重建的指令与结果标注可被用于评估自动标注质量,并激发半监督或自监督的标注修正技术。这些工作将共同丰富跨本体机器人学习的工具生态。
数据集最近研究
最新研究方向
在跨具身机器人操作研究领域,该数据集为异构机器人策略迁移与统一表征学习提供了关键的检验样本。其核心方向聚焦于多模态感知融合与具身适配器设计,即借助五路同步RGB视图、度量深度与实例分割信息,验证不同自由度机器人(Franka Panda与WidowXAI)在物体分拣任务中的状态-动作空间对齐与策略泛化能力。该样本支持在完整训练语料发布前进行管线校验与可视化工具测试,推动了模仿学习中跨具身数据 schema 标准化与模态丰富化的发展趋势,对构建通用型机器人操作基础模型具有先导意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务