pico-robotics-basic
收藏资源简介:
Pico Robotics Dataset · Annotated Edition 是一个基于 Pico VR 头显和自定义追踪器装备采集的自我中心多模态数据集,在 Advanced 版本的基础上额外提供了粗粒度动作分割注释。数据集包含三个场景:retail-shelf-a(便利店店面前区域,包含饮料货架、零食货架、冷柜、酒类展示等,混合日光和室内照明)、retail-shelf-b(便利店内部过道,包含品牌饮料冷柜、独立零食架、瓶装水托盘等,均匀天花板照明)、gymnasium(室内体育馆,包含大型开放式球场、划线、阶梯座位、顶棚桁架照明、横幅等)。每个场景包含多个序列,数据规模在 10,000 到 100,000 样本之间。每个样本包含以下文件:未畸变的左/右摄像头立体视频、深度图、双声道音频、相机标定文件、视频索引 JSON、点云(对齐到头部姿态)、世界坐标系点云、21 个手部关键点 JSON、MCAP 可视化记录文件,以及新增的 segments.json 动作分割注释文件。注释格式为:每个序列包含若干连续不重叠的片段,每个片段有起始帧/结束帧、起始时间/结束时间、动作标签和自由文本备注。标签集目前示例包括 approach_shelf(走向货架)、scan_shelf(扫视货架)、reach_and_grasp(伸手抓取)、inspect_item(检查物品)、place_back(放回)、walk_transit(行走移动)以及 other(其他)。数据集适用于自我中心动作识别、时间动作分割、行为理解的弱监督预训练、视频-语言对齐、以及基于片段的条件模仿学习等任务。注意:标签平衡性不均匀,边界为近似标注,不适合作为精确基准。数据集采用 CC BY 4.0 许可证,需要手动请求访问。
Pico Robotics Dataset · Annotated Edition is an egocentric multimodal dataset collected using the Pico VR headset and custom tracker equipment, providing coarse-grained action segmentation annotations on top of the Advanced version. The dataset includes three scenes: retail-shelf-a (convenience store front area with beverage shelves, snack shelves, freezers, liquor displays, etc., mixed daylight and indoor lighting), retail-shelf-b (convenience store interior aisle with branded beverage coolers, standalone snack shelves, bottled water trays, etc., uniform ceiling lighting), and gymnasium (indoor gymnasium with large open court, markings, tiered seating, truss lighting, banners, etc.). Each scene contains multiple sequences, with sample sizes ranging from 10,000 to 100,000. Each sample includes the following files: undistorted left/right stereo video, depth map, binaural audio, camera calibration file, video index JSON, point cloud (aligned to head pose), world-coordinate point cloud, 21 hand keypoints JSON, MCAP visualization record file, and the newly added segments.json action segmentation annotation file. Annotation format: each sequence consists of several consecutive non-overlapping segments, each with start frame/end frame, start time/end time, action label, and free-text notes. The current label set includes approach_shelf, scan_shelf, reach_and_grasp, inspect_item, place_back, walk_transit, and other. The dataset is suitable for tasks such as egocentric action recognition, temporal action segmentation, weakly supervised pretraining for behavior understanding, video-language alignment, and segment-based conditional imitation learning. Note: label balance is uneven, boundaries are approximate annotations, and it is not suitable as a precise benchmark. The dataset is licensed under CC BY 4.0 and requires manual access request.
Pico Robotics Dataset · Annotated Edition 数据集总结
数据集简介
该数据集是基于 Pico VR 头显和自定义追踪器采集的以自我为中心的多模态数据,在 Advanced 版本基础上增加了粗粒度动作分割标注。每个序列都被划分为带标签的时间段,可直接用于动作识别、时序分割和行为理解等任务,无需自行标注。数据集为门控数据集,需要手动审核访问请求。
版本对比
| 版本 | 内容 | 访问权限 |
|---|---|---|
| 基础版 | 无畸变立体视频 + 逐帧深度图 + 双通道音频 + ~1 kHz 6-DoF 头部姿态 + 相机标定 | 公开 |
| 高级版 | 基础版内容 + 姿态对齐立体点云(.npz)+ 21 关节点手部追踪 + 世界坐标系点云 + MCAP / Foxglove 可视化 |
需申请访问 |
| 标注版(本仓库) | 高级版内容 + 粗粒度动作分割(segments.json) |
手动审核 |
场景配置
| 配置名称 | 环境 | 描述 |
|---|---|---|
retail-shelf-a |
便利店店面区域 | 饮料货架、零食货架、冷柜、酒类展示;玻璃幕墙强日光与混合室内光照 |
retail-shelf-b |
便利店内部过道 | 品牌饮料冷柜、独立零食架、瓶装水堆垛、瓷砖地面,均匀顶棚照明 |
gymnasium |
室内体育馆 | 大型开放球场,带标线、阶梯座位、顶棚桁架照明、横幅和活动布置 |
各场景的序列数、分割数量和时长信息暂未提供(TBD)。
目录结构
以 retail-shelf-a/sample_0001/ 为例,包含:
head_left_camera_undistorted.mp4/head_right_camera_undistorted.mp4:左右目无畸变视频depth/:深度图audio_dual_channel.wav:双通道音频undistort_camera.json:相机标定video_index.json:视频索引pointcloud/和pointcloud_world/:点云数据hand_landmarks.json:手部关键点recording.mcap:MCAP 录制文件segments.json:粗粒度动作分割(本版本新增)
标注格式
segments.json 文件包含序列 ID、场景名称、帧率和分割段列表。每个分割段包含:
start_frame/end_frame:包含式帧范围,与video_index.json索引对应start_time/end_time:从序列开始的秒数label:动作类别标签notes:标注者自由文本备注(可空)
同一序列内的分段是连续且不重叠的;无合适类别匹配的帧标记为 other。标签集的具体类别及统计信息未提供(TBD),示例标签包括 approach_shelf、scan_shelf、reach_and_grasp、inspect_item、place_back、walk_transit 和 other。
标注协议
标注人员、指南链接、边界容忍度、双重标注比例和标注者间一致性等具体信息均为 TBD。标签是有意粗粒度的:边界近似,类别词汇量较小,适合作为弱监督或更精细标注的起点,而非精确基准。
预期用途
- 以自我为中心的动作识别和时序动作分割
- 行为理解的弱监督预训练
- 第一人称活动的视频-语言关联
- 基于分割条件的模仿学习
适用范围之外
类别分布不均衡,取决于自然采集过程中的实际情况,某些标签的片段数量很少。边界是粗粒度的,未进行逐帧裁决。在此标签集上报告最先进结果而不承认这些限制会产生误导。
许可证与引用
- 许可证:CC BY 4.0
- 引用信息已提供 BibTeX 格式,作者为 skycn110,发布于 2026 年,访问地址为 https://huggingface.co/datasets/skycn110/pico-robotics-annotated
联系方式
- 数据问题与合作:skycn110@gmail.com
- 访问申请:通过数据集页面提交(手动审核)
- 问题与讨论:欢迎在仓库中提出




