遇见数据集

pico-robotics-basic

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

Pico Robotics Dataset · Annotated Edition 是一个基于 Pico VR 头显和自定义追踪器装备采集的自我中心多模态数据集,在 Advanced 版本的基础上额外提供了粗粒度动作分割注释。数据集包含三个场景:retail-shelf-a(便利店店面前区域,包含饮料货架、零食货架、冷柜、酒类展示等,混合日光和室内照明)、retail-shelf-b(便利店内部过道,包含品牌饮料冷柜、独立零食架、瓶装水托盘等,均匀天花板照明)、gymnasium(室内体育馆,包含大型开放式球场、划线、阶梯座位、顶棚桁架照明、横幅等)。每个场景包含多个序列,数据规模在 10,000 到 100,000 样本之间。每个样本包含以下文件:未畸变的左/右摄像头立体视频、深度图、双声道音频、相机标定文件、视频索引 JSON、点云(对齐到头部姿态)、世界坐标系点云、21 个手部关键点 JSON、MCAP 可视化记录文件,以及新增的 segments.json 动作分割注释文件。注释格式为:每个序列包含若干连续不重叠的片段,每个片段有起始帧/结束帧、起始时间/结束时间、动作标签和自由文本备注。标签集目前示例包括 approach_shelf(走向货架)、scan_shelf(扫视货架)、reach_and_grasp(伸手抓取)、inspect_item(检查物品)、place_back(放回)、walk_transit(行走移动)以及 other(其他)。数据集适用于自我中心动作识别、时间动作分割、行为理解的弱监督预训练、视频-语言对齐、以及基于片段的条件模仿学习等任务。注意:标签平衡性不均匀,边界为近似标注,不适合作为精确基准。数据集采用 CC BY 4.0 许可证,需要手动请求访问。

Pico Robotics Dataset · Annotated Edition is an egocentric multimodal dataset collected using the Pico VR headset and custom tracker equipment, providing coarse-grained action segmentation annotations on top of the Advanced version. The dataset includes three scenes: retail-shelf-a (convenience store front area with beverage shelves, snack shelves, freezers, liquor displays, etc., mixed daylight and indoor lighting), retail-shelf-b (convenience store interior aisle with branded beverage coolers, standalone snack shelves, bottled water trays, etc., uniform ceiling lighting), and gymnasium (indoor gymnasium with large open court, markings, tiered seating, truss lighting, banners, etc.). Each scene contains multiple sequences, with sample sizes ranging from 10,000 to 100,000. Each sample includes the following files: undistorted left/right stereo video, depth map, binaural audio, camera calibration file, video index JSON, point cloud (aligned to head pose), world-coordinate point cloud, 21 hand keypoints JSON, MCAP visualization record file, and the newly added segments.json action segmentation annotation file. Annotation format: each sequence consists of several consecutive non-overlapping segments, each with start frame/end frame, start time/end time, action label, and free-text notes. The current label set includes approach_shelf, scan_shelf, reach_and_grasp, inspect_item, place_back, walk_transit, and other. The dataset is suitable for tasks such as egocentric action recognition, temporal action segmentation, weakly supervised pretraining for behavior understanding, video-language alignment, and segment-based conditional imitation learning. Note: label balance is uneven, boundaries are approximate annotations, and it is not suitable as a precise benchmark. The dataset is licensed under CC BY 4.0 and requires manual access request.

创建时间:
2026-07-23
原始信息汇总

Pico Robotics Dataset · Annotated Edition 数据集总结

数据集简介

该数据集是基于 Pico VR 头显和自定义追踪器采集的以自我为中心的多模态数据,在 Advanced 版本基础上增加了粗粒度动作分割标注。每个序列都被划分为带标签的时间段,可直接用于动作识别、时序分割和行为理解等任务,无需自行标注。数据集为门控数据集,需要手动审核访问请求。

版本对比

版本 内容 访问权限
基础版 无畸变立体视频 + 逐帧深度图 + 双通道音频 + ~1 kHz 6-DoF 头部姿态 + 相机标定 公开
高级版 基础版内容 + 姿态对齐立体点云(.npz)+ 21 关节点手部追踪 + 世界坐标系点云 + MCAP / Foxglove 可视化 需申请访问
标注版(本仓库) 高级版内容 + 粗粒度动作分割(segments.json 手动审核

场景配置

配置名称 环境 描述
retail-shelf-a 便利店店面区域 饮料货架、零食货架、冷柜、酒类展示;玻璃幕墙强日光与混合室内光照
retail-shelf-b 便利店内部过道 品牌饮料冷柜、独立零食架、瓶装水堆垛、瓷砖地面,均匀顶棚照明
gymnasium 室内体育馆 大型开放球场,带标线、阶梯座位、顶棚桁架照明、横幅和活动布置

各场景的序列数、分割数量和时长信息暂未提供(TBD)。

目录结构

retail-shelf-a/sample_0001/ 为例,包含:

  • head_left_camera_undistorted.mp4 / head_right_camera_undistorted.mp4:左右目无畸变视频
  • depth/:深度图
  • audio_dual_channel.wav:双通道音频
  • undistort_camera.json:相机标定
  • video_index.json:视频索引
  • pointcloud/pointcloud_world/:点云数据
  • hand_landmarks.json:手部关键点
  • recording.mcap:MCAP 录制文件
  • segments.json:粗粒度动作分割(本版本新增)

标注格式

segments.json 文件包含序列 ID、场景名称、帧率和分割段列表。每个分割段包含:

  • start_frame / end_frame:包含式帧范围,与 video_index.json 索引对应
  • start_time / end_time:从序列开始的秒数
  • label:动作类别标签
  • notes:标注者自由文本备注(可空)

同一序列内的分段是连续且不重叠的;无合适类别匹配的帧标记为 other。标签集的具体类别及统计信息未提供(TBD),示例标签包括 approach_shelfscan_shelfreach_and_graspinspect_itemplace_backwalk_transitother

标注协议

标注人员、指南链接、边界容忍度、双重标注比例和标注者间一致性等具体信息均为 TBD。标签是有意粗粒度的:边界近似,类别词汇量较小,适合作为弱监督或更精细标注的起点,而非精确基准。

预期用途

  • 以自我为中心的动作识别和时序动作分割
  • 行为理解的弱监督预训练
  • 第一人称活动的视频-语言关联
  • 基于分割条件的模仿学习

适用范围之外

类别分布不均衡,取决于自然采集过程中的实际情况,某些标签的片段数量很少。边界是粗粒度的,未进行逐帧裁决。在此标签集上报告最先进结果而不承认这些限制会产生误导。

许可证与引用

  • 许可证:CC BY 4.0
  • 引用信息已提供 BibTeX 格式,作者为 skycn110,发布于 2026 年,访问地址为 https://huggingface.co/datasets/skycn110/pico-robotics-annotated

联系方式

  • 数据问题与合作:skycn110@gmail.com
  • 访问申请:通过数据集页面提交(手动审核)
  • 问题与讨论:欢迎在仓库中提出
搜集汇总
数据集介绍
pico-robotics-basic 数据集图片
构建方式
该数据集基于Pico VR头显与定制追踪装置,通过第一人称视角采集多模态数据,涵盖零售货架与体育馆等真实场景。在高级版本的基础上,增设了粗粒度动作分割标注,每个序列被划分为带标签的时间片段,形成segments.json文件。构建过程遵循严格的标注协议,所有片段连续且不重叠,未归类帧标记为'other',确保数据可直接用于动作识别与时序分割任务。
特点
数据集的核心特点在于其多模态融合与动作标注的协同性,包含去畸变立体视频、逐帧深度图、双声道音频、六自由度头部姿态及相机标定,辅以点云、手部关键点与MCAP可视化文件。粗粒度动作标注采用小规模类别词汇,边界近似但覆盖完整,适合作为弱监督学习的基准,其自然采集导致的类别不平衡也如实呈现,为行为理解提供真实分布。
使用方法
使用该数据集时,可通过HuggingFace datasets库直接加载特定场景配置,如retail-shelf-a。segments.json文件提供帧级与时间级的动作片段索引,便于裁剪视频片段进行训练。Python脚本可便捷读取标注并配合OpenCV提取对应视频帧。数据集面向第一人称动作识别、时序分割、弱监督预训练及视频-语言对齐等任务设计,并需注意类别不平衡与边界粗糙性,避免过度解读基准性能。
背景与挑战
背景概述
pico-robotics-basic数据集由skycn110团队于2026年创建,旨在提供基于Pico VR头显及自定义追踪器硬件的第一人称视角多模态机器人学习数据。该数据集覆盖零售货架与体育馆等真实场景,包含未畸变立体视频、逐帧深度图、双声道音频及约1kHz的6自由度头部位姿与相机标定信息,为具身智能与机器人学习研究提供了高时间分辨率、多模态对齐的基准资源。其核心研究问题聚焦于利用头戴式设备捕捉自然行为,以支撑动作识别、时序分割及行为理解等领域,对推动第一人称感知与机器人操作学习的交叉研究具有重要影响力。
当前挑战
该数据集面临的挑战体现在领域问题与构建过程两个层面。领域层面,第一人称视频中的动作识别与分割需应对视角变化、手物遮挡及背景杂音,同时多模态数据(视觉、深度、音频、位姿)的时间同步与空间对齐亦构成技术难点。构建层面,高质量标注依赖精细的协议,但粗粒度标签(如approach_shelf)边界模糊,且标注者间一致性难以保证;此外,场景多样性(如零售店光变、体育馆强光)对传感器校准与深度估计精度提出了严苛要求,而数据规模(10K-100K样本)与类别不均衡进一步加剧了模型泛化的挑战。
常用场景
经典使用场景
Pico Robotics Dataset - Annotated Edition 作为一份自我中心的机器人多模态数据资源,其核心应用场景聚焦于细粒度的动作识别与时间序列分割。该数据集利用Pico VR头戴式设备搭配定制追踪装置,同步采集未畸变立体视频、深度图、双通道音频及高频六自由度头部姿态,并在此基础上引入粗粒度的动作分割标注。这种同步多模态数据为评估视觉-听觉-运动信号的协同建模能力提供了理想平台,支撑端到端的行为理解模型训练,尤其在零售货架整理及体育馆内操作等复杂动态环境中,能够有效驱动自我中心视角下的动作分类与时间边界定位研究工作。
解决学术问题
该数据集针对性解决了自我中心视频理解中多模态融合不足与标注稀缺的学术困境。通过提供时间对齐的立体视觉、深度点云、手部关节点及粗粒度动作标签,它缓解了行为理解任务在真实场景中数据获取成本高、标注规范不统一的问题。此数据集鼓励发展弱监督学习算法,利用其粗粒度分割标签对抗自然场景下的类别不均衡现象,从而推动动作识别、时域分割及视频-语言接地等研究方向在具身智能体上的落地验证。其开放式发布亦促进了科研社区对第一人称视角计算模型的构建与基准比较,对推进机器人学习及人机交互认知科学具有积极意义。
衍生相关工作
该数据集的发布已催生多项拓展性研究。其基础版本支持了立体视觉与深度估计的鲁棒性验证工作,而注释版本则推动了时间动作分割网络的弱监督变体发展,如基于对比学习的跨模态特征对齐方法。业界亦借鉴其点云与手部追踪数据的组合,衍生出抓取姿态生成与操作技能学习的基准任务。数据集提供的MCAP可视化与Foxglove集成促进了机器人系统开发中的调试工具研究。相关论文常引用此资源以证明其在自我中心感知、行为预测及语言指令接地等课题上的贡献,形成了一个活跃的学术引文网络,持续推动监督与自监督方法的交叉创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务