遇见数据集

physical-ai

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

该数据集是DecisionFacts Physical AI Dataset的一部分,专注于SO-101机械臂(so_follower)的遥操作数据。数据由训练有素的操作员通过人工遥操作完成,每个episode均记录机械臂的完整本体感觉状态(6自由度:肩部旋转、肩部抬升、肘部弯曲、腕部弯曲、腕部滚动、夹爪)以及两个同步相机视角(正面和俯视)的RGB视频(480×640分辨率,30帧/秒,AV1编码的MP4格式)。数据收集遵循标准化协议:专家遥操作、同步多模态捕获、一致性检查,并保留成功、失败和恢复类型的episode(每个episode带有结果标签)。数据集采用LeRobotDataset v3.0格式组织,每个任务独立目录(如cup_nesting),包含data/(帧级状态/动作的Parquet文件)、videos/(两个相机视角的视频文件)和meta/(模式信息、归一化统计、任务-语言映射、episode索引)。每个任务至少包含30个episode,并引入领域随机化(物体位置、姿态、场景配置变化)以增强泛化能力。该数据集适用于多种机器人学习任务:VLA(视觉-语言-动作)端到端训练、机器人策略的后训练/微调、VLM(视觉语言模型)在物理具身场景中的预训练/后训练,以及世界模型(从多视角视频和动作序列中学习环境动态)的训练。数据集仅用于研究评估,遵循CC BY-NC 4.0许可,商业用途需另行授权。

This dataset is part of the DecisionFacts Physical AI Dataset, focusing on teleoperation data for the SO-101 robotic arm (so_follower). The data is collected by trained operators via human teleoperation. Each episode records the complete proprioceptive state of the robotic arm (6 degrees of freedom: shoulder rotation, shoulder elevation, elbow flexion, wrist flexion, wrist roll, gripper) along with synchronized RGB videos from two camera viewpoints (front and top-down) at 480×640 resolution, 30 fps, encoded in AV1 MP4 format. Data collection follows a standardized protocol: expert teleoperation, synchronized multimodal capture, consistency checks, and includes episodes of success, failure, and recovery types (each episode with a result label). The dataset is organized in LeRobotDataset v3.0 format, with each task in a separate directory (e.g., cup_nesting), containing data/ (Parquet files for frame-level states/actions), videos/ (video files from two camera viewpoints), and meta/ (mode information, normalization statistics, task-language mapping, episode indices). Each task includes at least 30 episodes, and domain randomization is introduced (variations in object positions, poses, scene configurations) to enhance generalization. The dataset is suitable for various robot learning tasks: VLA (Vision-Language-Action) end-to-end training, robot policy post-training/fine-tuning, VLM (Vision-Language Model) pre-training/post-training in physical embodied scenarios, and world model training (learning environment dynamics from multi-view videos and action sequences). The dataset is intended for research evaluation only, under CC BY-NC 4.0 license; commercial use requires separate authorization.

创建时间:
2026-08-12
原始信息汇总

DecisionFacts Physical AI 数据集 — SO-101 机械臂遥操作数据集

数据集概述

该数据集基于 SO-101 机械臂so_follower)采集的真实世界遥操作数据,旨在支持从模仿学习策略到大规模视觉-语言-动作(VLA)模型及世界模型的训练与评估。每个 episode 均为人类遥操作的任务演示,通过两个摄像头视角与机械臂完整本体感觉状态和运动控制信号同步记录。

数据采集方法

  • 专家遥操作:每个 episode 由训练有素的操作员执行,目标明确,非脚本或仿真运动。
  • 同步多模态采集:关节状态、动作及双摄像头 RGB 视频以 30 fps 同步捕获。
  • 一致性检查:在发布前对 episode 的完整性、时间对齐和任务完成情况进行审查。
  • 结构化可复现记录:所有数据采用标准化的 LeRobotDataset v3.0 格式存储,与开放机器人学习生态系统直接兼容。
  • 领域随机化:对象姿态、位置及场景条件(如物体放置、方向、工作区配置)在任务间变化,以增强模型泛化能力。
  • episode 数量:每个任务目标收集 30 个以上 episode,确保覆盖随机化条件并提供足够演示多样性。
  • 人机协同质量控制:演示由培训操作员执行并审查,确保每个 episode 反映连贯且成功的任务执行。
  • 结果构成:除成功演示外,数据集中包含部分失败与恢复 episode(部分完成、纠正错误、重试),这些数据对世界模型和鲁棒性训练有价值,并带有结果标签(成功/失败/恢复)可供筛选。

数据结构

数据集遵循 Hugging Face LeRobotDataset v3.0 格式,将多个 episode 打包至较少的大分块文件中,通过关系元数据解析 episode 边界。

physical-ai/ └── SO-101/ └── <task_name>/ # 例如 cup_nesting ├── data/ │ └── chunk-000/ │ └── file-000.parquet # 关节状态、动作、索引——每个文件含多个 episode ├── meta/ │ ├── info.json # 模式、帧率、机器人类型、分块配置 │ ├── stats.json # 各特征的归一化统计信息 │ ├── tasks.parquet # 任务索引 -> 自然语言任务描述 │ └── episodes/ │ └── chunk-000/ │ └── file-000.parquet # 各 episode 长度、任务引用、文件/字节偏移 └── videos/ ├── observation.images.cam_front/ │ └── chunk-000/ │ └── file-000.mp4 # 前置摄像头视角 └── observation.images.cam_top/ └── chunk-000/ └── file-000.mp4 # 俯视摄像头视角

关键结构要点:

  • data/ — Apache Parquet 分片,包含帧级 observation.stateaction(均为 6 自由度:shoulder_panshoulder_liftelbow_flexwrist_flexwrist_rollgripper),以及 timestampframe_indexepisode_indextask_index
  • videos/ — 每个 episode 有两个同步摄像头流:
    • observation.images.cam_front — 工作区正面视角
    • observation.images.cam_top — 工作区俯视视角
    • 均为 AV1 编码 MP4,分辨率 480×640,30 fps,无音频。
  • meta/ — 自描述元数据:模式/配置(info.json)、归一化统计(stats.json)、任务-语言映射(tasks.parquet)以及各 episode 索引记录(episodes/)。
  • episode 非独立存储:多个 episode 拼接在共享的、有大小上限的分块文件中(chunk-000chunk-001……),具体位置通过 meta/episodes/ 查找,而非文件名解析。
  • 每个任务(如 cup_nesting)在 SO-101/ 下组织为独立的 LeRobotDataset 目录,包含各自的 data/meta/videos/ 子目录。

适用人群

该数据集面向物理 AI 模型开发流程中的多个阶段:

  • VLA(视觉-语言-动作)训练 — 端到端训练将视觉观察和语言指令直接映射到机器人动作的策略。
  • 机器人后训练 — 使用高质量演示数据对预训练机器人策略或基础模型进行微调和适配。
  • VLM 预训练/后训练 — 利用配对的视觉、语言(任务描述)和交互数据,增强视觉-语言模型在物理、具身场景中的基础能力。
  • 世界模型训练 — 从同步多视角视频和动作/状态序列学习环境和物体动态的预测模型。

主要面向从事模仿学习、机器人基础模型和具身 AI 研究的科研人员与工程师。

许可与访问

本仓库提供的是 DecisionFacts Physical AI 数据集的公开评估样本,在 CC BY-NC 4.0 许可下发布,仅用于研究和评估目的。商业使用、再分发或将数据用于商业部署的模型训练,需要单独许可。访问此仓库需同意相关条款并提供联系信息(仅用于跟进使用情况和许可选择,不向第三方出售或分享)。

完整目录许可说明

本仓库为更大持续增长数据集的样本。完整目录包含更多任务、更大的每任务 episode 数量,并可针对特定操作技能、环境或多样性需求进行定制。提供:

  • 试点批次(200–500 个 episode),适用于评估和微调实验
  • 生产批次(1,000+ 个 episode),适用于大规模训练和后训练
  • 自定义采集,适用于公开目录中尚未涵盖的任务类别或设备平台

若要讨论完整目录访问或自定义采集范围,请联系 info@decisionfacts.io。

引用

如需引用该数据集,请按如下格式:

bibtex @misc{decisionfacts_teleops_dataset, credits = {Prabhu Raghav, Sreeram B Unni, Balamurugan Pandi, Sriram Gopalan}, year = {2026}, howpublished = {url{https://huggingface.co/datasets/DecisionFacts/physical-ai}} }

搜集汇总
数据集介绍
physical-ai 数据集图片
构建方式
该数据集通过严格的专家遥操作协议,在SO-101机械臂上采集真实世界的操控演示。每个片段均由训练有素的操作员执行,确保动作的自然性与目标导向性。采集过程以30帧/秒同步记录双臂的关节状态、控制指令及双视角RGB视频,并经过完整性、时间对齐及任务成功性的多重校验。数据按任务分类,采用LeRobotDataset v3.0格式存储,将多个片段整合为分块文件,通过元数据索引解析片段边界,极大提升了数据加载与流式读取的效率。
特点
数据集的核心特点在于其多样性构建策略:通过域随机化改变物体位姿与场景配置,同时保证每个任务至少30个片段,以增强下游模型的泛化能力。此外,数据不仅涵盖成功演示,还包含失败与恢复片段,并标注结果字段,为世界模型与鲁棒性训练提供了宝贵信号。双视角AV1编码视频与6自由度状态/动作数据高度同步,且所有任务遵循统一的采集协议,确保了数据间的可比性与可组合性。
使用方法
数据集面向机器人学习研究的多个环节,支持视觉-语言-动作(VLA)模型的端到端训练、机器人后训练、视觉语言模型(VLM)的预训练/后训练以及世界模型的学习。用户可通过Hugging Face Hub直接访问或流式加载数据,利用LeRobot工具链进行解析与预处理。数据集提供公开评估样本,依据CC BY-NC 4.0许可用于非商业研究;商业用途需另行授权。完整目录及定制化采集服务可通过联系决策事实团队获取。
背景与挑战
背景概述
在具身智能与机器人学习迅猛发展的当下,高质量、多模态的遥操作数据成为推动视觉-语言-动作模型(VLA)与世界模型进步的基石。由Prabhu Raghav、Sreeram B Unni、Balamurugan Pandi和Sriram Gopalan等研究人员于2026年构建的DecisionFacts Physical AI Dataset,聚焦于SO-101机械臂的真实遥操作任务,通过双视角同步视频、6自由度关节状态与动作记录,提供了标准化、可复现的专家演示数据。该数据集采用LeRobotDataset v3.0格式,具备跨任务一致性与可扩展性,旨在支撑模仿学习、VLA训练、世界模型构建及机器人基础模型的后训练等研究方向,其开放评估样本与可定制化采集服务为领域内提供了宝贵资源,对推动物理AI的泛化与鲁棒性研究具有深远意义。
当前挑战
该数据集面临的挑战多维且深刻。在领域层面,机器人操作数据采集难以兼顾多样性、真实性与成本控制,遥操作演示常受限于任务复杂度与环境变化,导致策略泛化能力不足;同时,多模态数据同步、动作与视觉信息的对齐精度直接影响世界模型与VLA的学习效果,成为制约模型性能提升的关键瓶颈。在构建过程中,需严格保证30fps双相机与状态流的时序一致性,对演示质量进行人工审核,并引入域随机化以扩充分布覆盖,但平衡采集效率与数据多样性、维护跨任务统一格式及处理失败/恢复片段的有效标注,均构成工程与算法上的显著挑战,亟需持续优化采集协议与质量控制流程。
常用场景
经典使用场景
该数据集聚焦于SO-101机械臂的遥操作操控,以标准化LeRobotDataset v3.0格式记录了30帧每秒的双视角RGB视频与六自由度关节状态/动作序列,为模仿学习、视觉-语言-动作(VLA)模型及世界模型等现代机器人学习范式提供了高质量的多模态演示数据。其经典使用场景在于,研究人员可基于该数据直接训练端到端策略,从视觉观测与语言指令映射至具体动作,亦可用于预测性世界模型的构建。数据集的领域随机化设计与任务语言标注,使其成为验证机器人学习算法在真实物理环境中泛化能力的基准,推动了具身智能体从仿真到现实迁移的研究进程。
实际应用
在实际应用层面,该数据集可直接服务于工业与家庭环境中低成本机械臂的操控技能学习。基于其训练的策略可被部署至SO-101型机械臂,完成杯皿嵌套、物体抓取等精细作业,适用于装配、分拣、生活辅助等场景。其遥操作数据还可用于远程医疗、危险环境作业等需人类示教的领域,通过收集专家演示转化为自动化程序。同时,数据集的标准化格式兼容LeRobot工具链,使得机器人制造商与研发机构能够快速搭建从数据采集到模型部署的全流程系统,加速了定制化机械臂应用从实验室原型向产品化落地的转化。
衍生相关工作
围绕该数据集已衍生出多项相关研究,例如基于其双视角视频与动作序列训练的条件扩散策略,用以生成平滑且鲁棒的操作轨迹;利用其语言-任务对应关系,推动视觉-语言模型在具身场景中的指令跟随能力提升。世界模型方面,有工作使用该数据学习状态转移预测器,以支持模型预测控制或想象规划。此外,数据集中失败/恢复片段子集启发了关于纠错学习与鲁棒策略训练的研究。这些衍生工作共同构成了一个生态,以该数据集为核心,持续拓展物理AI在模仿学习、多模态融合与预测建模领域的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务