遇见数据集

play_human_fruits_v2_train_eef

收藏
Hugging Face2026-08-26 更新2026-08-27 收录
官方服务:

资源简介:

play_human_fruits_v2_train_eef 是一个针对人手末端执行器(EEF)注释的数据集,来源于 aytsaiusc/play_human_fruits_train 数据集。该数据集通过修复手部检测缺陷(包括将检测窗口从裁剪区域改为全帧、将提示词从“a hand”改为“a human hand”、放宽形状过滤条件至 aspect < 2.2),将帧级注释覆盖率从87.6%提升至99.9%,平均每帧手部框宽度从109像素增至135像素,窗口边缘裁剪比例从59.3%降至0.8%。数据集包含299个episode(原始300个中缺失episode 264),共219087帧。每帧提供以下字段:observation.eef.position_right(世界坐标系中的夹持中心,三维)、observation.eef.rotation_matrix_right(世界坐标系中的末端姿态,平滑后,九维)、observation.eef.width_right(夹持开度,一维,但不可靠)、observation.eef.detected_right(手部检测标志,一维)、observation.eef.lift_ok_right(深度提升收敛标志,一维)、observation.eef.kpts21_2d(HaMeR关键点,全帧像素,21×2)、observation.eef.kpts21_3d_world(HaMeR关键点,世界坐标系,21×3)、observation.eef.kpt2d_crop128_*(已过时,建议使用前者)、observation.eef.{position,width}_right_raw(平滑前数据)。下游使用的EEF三元组为[pinch, p + R·w/2, p − R·w/2],全部位于抓取端,不含腕点。注意事项:width_right不可作为可靠的距离度量;kpt2d_crop128_*字段已过时且错误;episode 264缺失;episode 230注释率从100%降至94.4%。该数据集适用于机器人操作任务中的手部姿态估计、抓取点预测等场景。

play_human_fruits_v2_train_eef is a dataset annotated for human hand end-effector (EEF), derived from the aytsaiusc/play_human_fruits_train dataset. By fixing hand detection defects (including changing the detection window from cropped area to full frame, modifying the prompt from a hand to a human hand, and relaxing shape filtering to aspect < 2.2), the frame-level annotation coverage improved from 87.6% to 99.9%, the average hand bounding box width per frame increased from 109 pixels to 135 pixels, and the window edge cropping ratio decreased from 59.3% to 0.8%. The dataset contains 299 episodes (episode 264 missing from the original 300), totaling 219,087 frames. Each frame provides the following fields: observation.eef.position_right (gripper center in world coordinates, 3D), observation.eef.rotation_matrix_right (smooth end-effector pose in world coordinates, 9D), observation.eef.width_right (gripper opening width, 1D, but unreliable), observation.eef.detected_right (hand detection flag, 1D), observation.eef.lift_ok_right (depth lifting convergence flag, 1D), observation.eef.kpts21_2d (HaMeR keypoints in full-frame pixels, 21×2), observation.eef.kpts21_3d_world (HaMeR keypoints in world coordinates, 21×3), observation.eef.kpt2d_crop128_* (deprecated, prefer the former), observation.eef.{position,width}_right_raw (pre-smoothing data). The downstream EEF triple used is [pinch, p + R·w/2, p − R·w/2], all located at the gripper end, without wrist points. Notes: width_right is not a reliable distance metric; kpt2d_crop128_* fields are deprecated and erroneous; episode 264 is missing; episode 230 annotation rate dropped from 100% to 94.4%. This dataset is suitable for tasks such as hand pose estimation and grasp point prediction in robotic manipulation.

创建时间:
2026-08-23
原始信息汇总

数据集概述

play_human_fruits_v2_train_eef 是一个为 aytsaiusc/play_human_fruits_train 提供人类末端执行器(EEF)标注的数据集,覆盖全部 300 个片段中的 299 个(共 219,087 帧)。该数据集于 2026-08-26 重建,修复了此前版本中手部检测的缺陷。

关键改进与修复

  • 旧版问题:手部检测使用了硬编码的工作区窗口(右边界 x=440),导致手部被截断,仅能看到指尖;形状过滤器(aspect < 1.8)进一步丢弃了大量框,造成严重漏检。
  • 修复方法
    1. 检测提示词从 "a hand" 改为 "a human hand",并在全帧上检测,不再使用窗口。
    2. 形状过滤器阈值从 1.8 放宽至 2.2。
  • 验证结果(覆盖全部 300 个片段):
    • 有标注的帧比例:旧版平均 87.6%,新版 99.9%(中位数 100%);最差片段从 50.9% 提升至 94.4%
    • 框被窗口截断的比例:从 59.3% 降至 0.8%
    • 深度提升成功(lift_ok)平均从 87.5% 升至 99.9%

数据内容(每帧字段)

列名 形状 含义
observation.eef.position_right (3,) 捏合中心,世界坐标系(公制,深度提升)
observation.eef.rotation_matrix_right (9,) 末端朝向,世界坐标系(平滑后)
observation.eef.width_right (1,) 夹持开口宽度(见注意事项)
observation.eef.detected_right (1,) 是否检测到手
observation.eef.lift_ok_right (1,) 深度提升是否收敛
observation.eef.kpts21_2d (21,2) HaMeR 关键点,全帧像素坐标
observation.eef.kpts21_3d_world (21,3) HaMeR 关键点,世界坐标系(公制)
observation.eef.kpt2d_crop128_* (2,) 已过期,不可用(见注意事项)
observation.eef.{position,width}_right_raw 平滑前原始值

下游使用的 EEF 三元组为 [pinch, p + R·w/2, p − R·w/2],三个点均位于抓取端,不包含腕部点。

注意事项

  • 片段 264 缺失:源数据集在该片段内部不一致(mp4 有 1222 帧,parquet 只有 567 行),无法对齐,因此跳过该片段。片段索引保持与源一致(0..263, 265..299),meta/ 描述 299 个存在的片段,原始 300 片段元数据保留为 *.orig300
  • width_right 不可靠:它与 HaMeR 拇指尖/食指尖分离度的比例范围过大(0.27–3.69),22% 帧超过 1.0,不能作为公制距离或抓取状态的指示。
  • kpt2d_crop128_* 已过期:该字段使用错误数据集裁剪方式计算,请改用 kpts21_2d 或 3D 列。
  • 片段 230 是唯一变差的片段(100% → 94.4% 标注率),原因未调查。

精度说明

修复主要增加覆盖率而非精度。在两个版本都有标注的帧上,捏合中心与 HSV 水果掩码质心的距离相近(旧版 12.6 px,新版 13.1 px),精度无显著变化;每帧抖动略有降低(0.99 → 0.93 px)。关键点引用的数值(如 6.4 → 5.3 px)不能作为精度提升的证据,因为 EEF 由同一关键点派生,比较存在循环性。

来源信息

构建版本为 AYTSAI_VERSION=fruits_v2_fix,使用 PHANTOM_BBOX_FIX=1(提示词 + 全帧 + PHANTOM_ASPECT_MAX=2.2)重新运行 Pass1。旧版本保留不变,可供对比。

搜集汇总
数据集介绍
play_human_fruits_v2_train_eef 数据集图片
构建方式
该数据集致力于为人类操作视频提供高精度的手部末端执行器(EEF)标注,其构建根植于机器人学习与模仿学习领域对高质量人类演示数据的需求。通过采用Grounding-DINO进行手部检测,并结合HaMeR模型估计手部姿态,生成了涵盖位置、旋转、宽度及关键点在内的多维标注。构建过程中特别注重全帧检测与形状过滤参数的优化,以克服早期版本中因工作区窗口裁剪导致的手部框截断问题,从而确保标注的完整性和准确性。
特点
该数据集在标注覆盖率上表现卓越,全帧标注率均值高达99.9%,即便在最差片段中也达到94.4%,显著优于先前版本的87.6%和50.9%。其标注内容全面,包括手部位置、旋转矩阵、抓取宽度、检测状态、深度提升收敛标志以及21个手部关键点的二维和三维坐标。此外,数据集还提供了原始未平滑数据,便于用户进行自定义处理。值得注意的是,抓取宽度并非可靠度量,且部分二维关键点裁剪数据已过时,需谨慎使用。
使用方法
使用该数据集时,推荐以下游任务所需的末端执行器三元组[pinch, p + R·w/2, p − R·w/2]作为核心特征,三者均位于抓取端,与机器人侧的三元组构建方式一致,便于跨域匹配。手部位置和姿态信息可直接用于策略学习或动作预测,而抓取宽度应避免作为度量距离使用,建议通过拇指和食指关键点确定抓取位置。二维关键点应使用全帧像素坐标或三维世界坐标,避免使用已过时的裁剪数据。数据集包含299个片段(编号0-263, 265-299),片段264因源数据不一致而缺失。
背景与挑战
背景概述
在具身智能与机器人操作研究中,从人类演示视频中提取手部末端执行器(EEF)状态是实现技能迁移与模仿学习的关键前提。play_human_fruits_v2_train_eef数据集由研究者aytsaiusc构建,于2026年8月修复后重新发布,旨在为play_human_fruits_train源数据集提供逐帧的人类手部EEF标注。其核心研究问题在于:如何利用视觉基础模型(Grounding-DINO与HaMeR)从多视角操作视频中稳健地恢复手部位置、朝向与关键点,从而弥合人类演示与机器人执行之间的域差异。该数据集覆盖300个回合、逾21万帧,为灵巧操作与跨域策略学习提供了细粒度标注资源,对推动人-机器人技能迁移研究具有重要支撑意义。
当前挑战
该数据集所应对的领域问题在于从非结构化人类操作视频中精确估计手部EEF,其难度源于手部与手臂的视觉混淆、自上而下视角下的遮挡以及深度提升的不稳定性。构建过程中面临多重挑战:早期版本因硬编码工作区窗口导致手部检测框被截断,59.3%的框不完整,仅87.6%的帧获得标注;提示词与形状过滤阈值的耦合使检测覆盖率进一步恶化;深度提升收敛性不足造成EEF位置偏差。此外,width_right量纲不可靠、kpt2d_crop128_*字段因裁剪归属错误而失效、Episode 264源视频与深度数据不一致等缺陷,均对标注质量与下游可用性构成显著制约。
常用场景
经典使用场景
在机器人学习与具身智能领域,人手操作的精细建模长期依赖高质量的末端执行器标注。play_human_fruits_v2_train_eef数据集恰为这一需求提供了关键支撑:其经典使用场景在于从人类演示视频中提取手部抓取中心、姿态与开合度,构建视觉-动作映射,从而赋能模仿学习与行为克隆。研究者常以此数据集训练策略网络,使机械臂在水果抓取任务中复现人类操作轨迹,尤其在接触前伸与携运阶段实现精准的末端轨迹预测。
衍生相关工作
围绕该数据集,后续工作多聚焦于跨域对齐与多模态融合。典型衍生包括:利用其全帧关键点训练手-物交互预测模型,结合深度提升模块改进三维重建;亦有研究将其与机器人侧末端轨迹配对,开展人-机动作映射与域适应。此外,针对宽度不可靠的警示,部分工作转向双指间距作为抓取判据,推动了更稳健的抓取表征学习。
数据集最近研究
最新研究方向
在机器人模仿学习与灵巧操作领域,手部末端执行器(EEF)的精确标注是连接人类演示与机器人策略的枢纽。该数据集针对既往构建中因工作窗裁剪导致的检测截断与帧级漏标问题,以全帧检测与松弛形状过滤完成系统性重建,将有效标注覆盖率从87.6%提升至99.9%,有力支撑了基于视觉的抓取前伸与携带阶段的稠密行为建模。当前前沿研究正聚焦于利用此类高覆盖率标注探索跨域EEF映射与接触前动力学表征,尤其关注抓取中心与手指关键点的几何一致性,以缓解演示数据中的分布偏移。该重建工作为精细操作技能的可扩展学习提供了更可靠的监督信号,对推动具身智能中的数据高效策略迁移具有积极意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务