zeno-app-household
收藏资源简介:
ZenO App Household 数据集包含7个第一人称视角的普通家务工作记录,双手在三维空间中以真实米为单位进行跟踪,采用LeRobot v2.1格式。每个片段包含视频(observation.images.head,1920x1440分辨率)、状态(7个浮点数,表示相机位置和方向)和动作(20个浮点数,表示双手腕位置、方向及手爪开合)。坐标框架遵循ROS REP 103(X向前,Y向左,Z向上,单位米)。数据集共101,205帧(约56.2分钟,30fps)。动作向量包含左右手各10个值:手腕位置(3维)、6D旋转表示(6维)和手爪开合(1维)。手部关键点通过MediaPipe Hands检测,并利用LiDAR深度图和ARKit相机位姿反投影到三维空间。数据集经过四项自动质量检查(回访漂移、骨骼长度、速度、惯性一致性),排除不合格记录。所有记录均获得知情同意,并已去除面部等识别信息。许可证为CC BY-NC 4.0,仅限非商业用途。
The ZenO App Household dataset contains 7 first-person perspective recordings of common household tasks, with both hands tracked in 3D space in real meters, using the LeRobot v2.1 format. Each episode includes video (observation.images.head, 1920x1440 resolution), state (7 floats representing camera position and orientation), and action (20 floats representing wrist positions, orientations, and gripper openings for both hands). The coordinate frame follows ROS REP 103 (X forward, Y left, Z up, units in meters). The dataset has a total of 101,205 frames (approximately 56.2 minutes at 30fps). The action vector contains 10 values per hand: wrist position (3D), 6D rotation representation (6D), and gripper opening (1D). Hand keypoints are detected via MediaPipe Hands and back-projected to 3D using LiDAR depth maps and ARKit camera poses. The dataset undergoes four automatic quality checks (drift, bone length, speed, inertial consistency) to exclude unqualified recordings. All recordings are obtained with informed consent, and identifying information such as faces has been removed. Licensed under CC BY-NC 4.0 for non-commercial use only.
ZenO App Household 数据集详情
基本信息
- 许可证:CC BY-NC 4.0(非商业用途)
- 任务类型:机器人学(robotics)
- 语言:英语
- 数据规模:少于1K条样本
- 标签:LeRobot、第一人称视角、手部姿态、激光雷达、家务活动、操作任务
数据集内容
| 属性 | 详情 |
|---|---|
| 片段数 | 7个第一人称家务工作视频片段 |
| 总帧数 | 101,205帧(30 FPS,约56.2分钟) |
| 视频 | observation.images.head,分辨率1920x1440 |
| 状态 | 7个浮点数(相机位置与朝向) |
| 动作 | 20个浮点数(双手腕部与双夹爪) |
| 坐标系 | ROS REP 103标准(X向前,Y向左,Z向上,单位为米) |
深度测量技术
该数据集使用iPhone的LiDAR传感器进行录制,深度信息通过实际测量而非推断获得:
- 手部关键点由MediaPipe Hands生成,通过LiDAR深度图和ARKit相机姿态进行反向投影,得到房间坐标系中的真实3D位置(以米为单位)
- 轨迹可在不同录制间直接比较,或无需额外标定即可传递给机器人
动作向量说明
每帧20个数值,每只手10个:
- 左手:
l_pos_x/y/z(手腕位置,米)、l_rot6d_0..5(旋转6D表示)、l_gripper(手部开合度,0闭合至1张开) - 右手:
r_pos_x/y/z、r_rot6d_0..5、r_gripper - 旋转使用6D表示(连续形式),而非四元数
action.left_valid和action.right_valid为布尔标志,检测不到的手部保持最后已知姿态,需检查标志而非寻找哨兵值
夹爪通道说明
- 表示手部开合度(拇指到食指距离除以手跨度),经固定阈值映射:0.12视为闭合,0.66视为张开
- 阈值基于25,011次检测的第5和第95百分位数,存储在
meta/info.json中 - 注意:这是开合度而非抓取标签,两者经常不一致,如需接触事件需自行推导和验证
质量保证
所有片段通过4项自动检查:
- 重访漂移检查:相机返回原位置时,场景位置是否一致
- 骨骼长度检查:手指节段长度在帧间是否恒定
- 速度检查:手部和相机移动速度是否在人类可产生范围内
- 惯性一致性检查:手机运动传感器与姿态轨迹是否一致及时间偏移
已有1个录制因未通过检查被排除。检查保守,失败通常表示跟踪滑动而非录制无价值。
快速开始
python from lerobot.common.datasets.lerobot_dataset import LeRobotDataset
ds = LeRobotDataset("zeno-labs/zeno-app-household") sample = ds[0]
sample["observation.state"] # [x, y, z, qx, qy, qz, qw] sample["action"] # 20个浮点数 sample["observation.images.head"] # [C, H, W] uint8
重要限定
- 数据中不含机器人,动作表示人手位置而非关节指令,重定向需自行处理
- 仅包含手部和头部数据,不含身体姿态
- 手部检测率在94%-99%之间,手部离开画面、被遮挡或没入水中时会丢失
- 片段可能重新发布,需要严格可复现性时请固定commit
隐私与许可
- 每段录制由知情同意的付费参与者提供,数据使用条款涵盖研究和商业用途
- 人脸和其他识别特征在录入前已移除
- 许可证为CC BY-NC 4.0(非商业),完整语料或商业条款请联系 support@zen-o.xyz
相关数据集
使用相同采集设备和架构的其他录制:zeno-labs/egostation-iphone-lidar-household-v1,两者不可互相替代。



