physical-ai
收藏资源简介:
该数据集是DecisionFacts Physical AI Dataset的一部分,专注于SO-101机械臂(so_follower)的遥操作数据。数据由训练有素的操作员通过人工遥操作完成,每个episode均记录机械臂的完整本体感觉状态(6自由度:肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部滚动、夹爪)以及两个同步相机视角(正面和俯视)的RGB视频(480×640分辨率,30帧/秒,AV1编码的MP4格式)。数据收集遵循标准化协议:专家遥操作、同步多模态捕获、一致性检查,并保留成功、失败和恢复类型的episode(每个episode带有结果标签)。数据集采用LeRobotDataset v3.0格式组织,每个任务独立目录(如cup_nesting),包含data/(帧级状态/动作的Parquet文件)、videos/(两个相机视角的视频文件)和meta/(模式信息、归一化统计、任务-语言映射、episode索引)。每个任务至少包含30个episode,并引入领域随机化(物体位置、姿态、场景配置变化)以增强泛化能力。该数据集适用于多种机器人学习任务:VLA(视觉-语言-动作)端到端训练、机器人策略的后训练/微调、VLM(视觉语言模型)在物理具身场景中的预训练/后训练,以及世界模型(从多视角视频和动作序列中学习环境动态)的训练。数据集仅用于研究评估,遵循CC BY-NC 4.0许可,商业用途需另行授权。
This dataset is part of the DecisionFacts Physical AI Dataset, focusing on teleoperation data for the SO-101 robotic arm (so_follower). The data is collected by trained operators via human teleoperation. Each episode records the complete proprioceptive state of the robotic arm (6 degrees of freedom: shoulder rotation, shoulder elevation, elbow flexion, wrist flexion, wrist roll, gripper) along with synchronized RGB videos from two camera viewpoints (front and top-down) at 480×640 resolution, 30 fps, encoded in AV1 MP4 format. Data collection follows a standardized protocol: expert teleoperation, synchronized multimodal capture, consistency checks, and includes episodes of success, failure, and recovery types (each episode with a result label). The dataset is organized in LeRobotDataset v3.0 format, with each task in a separate directory (e.g., cup_nesting), containing data/ (Parquet files for frame-level states/actions), videos/ (video files from two camera viewpoints), and meta/ (mode information, normalization statistics, task-language mapping, episode indices). Each task includes at least 30 episodes, and domain randomization is introduced (variations in object positions, poses, scene configurations) to enhance generalization. The dataset is suitable for various robot learning tasks: VLA (Vision-Language-Action) end-to-end training, robot policy post-training/fine-tuning, VLM (Vision-Language Model) pre-training/post-training in physical embodied scenarios, and world model training (learning environment dynamics from multi-view videos and action sequences). The dataset is intended for research evaluation only, under CC BY-NC 4.0 license; commercial use requires separate authorization.
DecisionFacts Physical AI 数据集 — SO-101 机械臂遥操作数据集
数据集概述
该数据集基于 SO-101 机械臂(so_follower)采集的真实世界遥操作数据,旨在支持从模仿学习策略到大规模视觉-语言-动作(VLA)模型及世界模型的训练与评估。每个 episode 均为人类遥操作的任务演示,通过两个摄像头视角与机械臂完整本体感觉状态和运动控制信号同步记录。
数据采集方法
- 专家遥操作:每个 episode 由训练有素的操作员执行,目标明确,非脚本或仿真运动。
- 同步多模态采集:关节状态、动作及双摄像头 RGB 视频以 30 fps 同步捕获。
- 一致性检查:在发布前对 episode 的完整性、时间对齐和任务完成情况进行审查。
- 结构化可复现记录:所有数据采用标准化的 LeRobotDataset v3.0 格式存储,与开放机器人学习生态系统直接兼容。
- 领域随机化:对象姿态、位置及场景条件(如物体放置、方向、工作区配置)在任务间变化,以增强模型泛化能力。
- episode 数量:每个任务目标收集 30 个以上 episode,确保覆盖随机化条件并提供足够演示多样性。
- 人机协同质量控制:演示由培训操作员执行并审查,确保每个 episode 反映连贯且成功的任务执行。
- 结果构成:除成功演示外,数据集中包含部分失败与恢复 episode(部分完成、纠正错误、重试),这些数据对世界模型和鲁棒性训练有价值,并带有结果标签(成功/失败/恢复)可供筛选。
数据结构
数据集遵循 Hugging Face LeRobotDataset v3.0 格式,将多个 episode 打包至较少的大分块文件中,通过关系元数据解析 episode 边界。
physical-ai/ └── SO-101/ └── <task_name>/ # 例如 cup_nesting ├── data/ │ └── chunk-000/ │ └── file-000.parquet # 关节状态、动作、索引——每个文件含多个 episode ├── meta/ │ ├── info.json # 模式、帧率、机器人类型、分块配置 │ ├── stats.json # 各特征的归一化统计信息 │ ├── tasks.parquet # 任务索引 -> 自然语言任务描述 │ └── episodes/ │ └── chunk-000/ │ └── file-000.parquet # 各 episode 长度、任务引用、文件/字节偏移 └── videos/ ├── observation.images.cam_front/ │ └── chunk-000/ │ └── file-000.mp4 # 前置摄像头视角 └── observation.images.cam_top/ └── chunk-000/ └── file-000.mp4 # 俯视摄像头视角
关键结构要点:
data/— Apache Parquet 分片,包含帧级observation.state、action(均为 6 自由度:shoulder_pan、shoulder_lift、elbow_flex、wrist_flex、wrist_roll、gripper),以及timestamp、frame_index、episode_index和task_index。videos/— 每个 episode 有两个同步摄像头流:observation.images.cam_front— 工作区正面视角observation.images.cam_top— 工作区俯视视角- 均为 AV1 编码 MP4,分辨率 480×640,30 fps,无音频。
meta/— 自描述元数据:模式/配置(info.json)、归一化统计(stats.json)、任务-语言映射(tasks.parquet)以及各 episode 索引记录(episodes/)。- episode 非独立存储:多个 episode 拼接在共享的、有大小上限的分块文件中(
chunk-000、chunk-001……),具体位置通过meta/episodes/查找,而非文件名解析。 - 每个任务(如
cup_nesting)在SO-101/下组织为独立的 LeRobotDataset 目录,包含各自的data/、meta/和videos/子目录。
适用人群
该数据集面向物理 AI 模型开发流程中的多个阶段:
- VLA(视觉-语言-动作)训练 — 端到端训练将视觉观察和语言指令直接映射到机器人动作的策略。
- 机器人后训练 — 使用高质量演示数据对预训练机器人策略或基础模型进行微调和适配。
- VLM 预训练/后训练 — 利用配对的视觉、语言(任务描述)和交互数据,增强视觉-语言模型在物理、具身场景中的基础能力。
- 世界模型训练 — 从同步多视角视频和动作/状态序列学习环境和物体动态的预测模型。
主要面向从事模仿学习、机器人基础模型和具身 AI 研究的科研人员与工程师。
许可与访问
本仓库提供的是 DecisionFacts Physical AI 数据集的公开评估样本,在 CC BY-NC 4.0 许可下发布,仅用于研究和评估目的。商业使用、再分发或将数据用于商业部署的模型训练,需要单独许可。访问此仓库需同意相关条款并提供联系信息(仅用于跟进使用情况和许可选择,不向第三方出售或分享)。
完整目录许可说明
本仓库为更大持续增长数据集的样本。完整目录包含更多任务、更大的每任务 episode 数量,并可针对特定操作技能、环境或多样性需求进行定制。提供:
- 试点批次(200–500 个 episode),适用于评估和微调实验
- 生产批次(1,000+ 个 episode),适用于大规模训练和后训练
- 自定义采集,适用于公开目录中尚未涵盖的任务类别或设备平台
若要讨论完整目录访问或自定义采集范围,请联系 info@decisionfacts.io。
引用
如需引用该数据集,请按如下格式:
bibtex @misc{decisionfacts_teleops_dataset, credits = {Prabhu Raghav, Sreeram B Unni, Balamurugan Pandi, Sriram Gopalan}, year = {2026}, howpublished = {url{https://huggingface.co/datasets/DecisionFacts/physical-ai}} }




