遇见数据集

g1-fold-towel

收藏
Hugging Face2026-10-01 更新2026-10-01 收录
官方服务:

资源简介:

该数据集包含来自机器人Charlie的96个注释的“折叠毛巾”演示,记录于2026年9月29日。采用LeRobot v3.0格式,帧率为30 FPS,共185,084帧(约1.714小时)。特征包括:头部480×1280 RGB双目立体图像(左右并排)、左腕和右腕480×640 RGB图像;观测状态包含29个测量的关节位置(按meta/info.json顺序排列)、枢轴(7维)、测量的末端执行器位姿(12维)和夹爪控制(4维);动作包含枢轴(7维)、命令的末端执行器位姿(12维)和夹爪控制(4维)。语言注释包括持久化语言(主任务和子任务时间线,时间相对于episode起始)和事件语言(空列表)。数据分割与同步:每个精确的“fold towel”注释标记一个episode的起始和结束,采用30 Hz的网格采样,缺失值最多保留2秒。视频编码使用AV1。数据遵循BitRobot/HIW-500-LeRobot的特征命名、维度、相机布局和嵌套语言模式。

This dataset contains 96 annotated fold towel demonstrations from robot Charlie, recorded on September 29, 2026. It uses LeRobot v3.0 format at 30 FPS, totaling 185,084 frames (approximately 1.714 hours). Features include: head 480×1280 RGB binocular stereo images (left and right side-by-side), left and right wrist 480×640 RGB images; observation state includes 29 measured joint positions (ordered as per meta/info.json), pivot (7-dim), measured end-effector pose (12-dim), and gripper control (4-dim); actions include pivot (7-dim), commanded end-effector pose (12-dim), and gripper control (4-dim). Language annotations include persistent language (main task and subtask timeline, time relative to episode start) and event language (empty list). Data splitting and synchronization: each fold towel annotation marks the start and end of an episode, using 30 Hz grid sampling, with missing values retained for up to 2 seconds. Video encoding uses AV1. The data follows BitRobot/HIW-500-LeRobots feature naming, dimensions, camera layout, and nested language pattern.

提供机构:
aarontung
创建时间:
2026-10-01
原始信息汇总

G1 Fold Towel 数据集

基本信息

  • 数据集名称:G1 Fold Towel
  • 语言:英语(en)
  • 任务类别:机器人学(robotics)
  • 标签:LeRobot、robotics、unitree-g1、fold-towel
  • 配置:默认配置(config_name: default),数据文件位于 data//.parquet

数据概况

  • 包含 96 条带标注的 "fold towel"(折叠毛巾)演示数据
  • 数据来自机器人 Charlie,录制于 2026-09-29
  • 格式:LeRobot v3.0
  • 帧率:30 FPS
  • 总帧数:185,084 帧,约 1.714 小时

特征字段

  • observation.images.head:480 x 1280 RGB 立体图像,并排保留
  • observation.images.left_wrist、observation.images.right_wrist:480 x 640 RGB
  • observation.state:29 个测量的关节位置,顺序见 meta/info.json
  • observation.state.wbc:pivot(7)、测量的末端执行器姿态(12)、夹爪控制(4)
  • action:pivot(7)、指令末端执行器姿态(12)、夹爪控制(4)
  • language_persistent:主任务与子任务时间线,时间相对于情节开始
  • language_events:空列表,与参考数据集表示一致

说明:测量的和指令的末端执行器姿态都伴随相同的 pivot 与夹爪控制值,遵循参考数据集的 23 维布局。头部图像不拆分,不添加摄像头翻转或红外流。视频使用 AV1 编码。

分段与同步

  • 每个精确的 "fold towel" 标注开始一个情节,由其显式的 "end" 标注闭合
  • 原始 UTC 标注时间和源 ID 保存在 meta/source_segments.json 中
  • 不以下一个主任务边界替代缺失的 "end"
  • 采样采用 30 Hz 网格,起始于标注的开始时间,排除结束时间戳
  • 每个特征使用网格时间点之前或等于该点的最近源样本
  • 最后一帧可能使表示时长超出标注区间不到 1/30 秒
  • 缺失样本最多保持最后可用值 2 秒
  • 在源录制开始时,第一个可用样本可在同一限制内填充前导间隙
  • 若任何所需摄像头或状态主题超过该限制,则整个主任务到结束区间被排除;该录制中的其他区间仍符合条件
  • 107 个输入区间中有 11 个被排除,详见 meta/excluded_segments.json
  • 视频编码等待每一帧
  • 语言时间线在情节的每一帧上重复,与参考一致;保留完整源标注时间线,包括未来子任务
  • 校准文件保存在 calibration/ 目录下

验证与兼容性

  • 所有数值帧检查了有限值、正确维度、连续的情节/帧索引和 30 Hz 时间戳
  • 每个情节的首帧、中间帧和末帧均通过原生 LeRobot v3 读取器读取回,并解码了全部三个摄像头流,详见 meta/validation.json
  • 容器使用 LeRobot 0.4.4
  • 原生读取器需要针对参考数据集的附加 "language" 类型提供特征/张量适配器;转换器为此包含 enable_hiw_language_reader()
  • 数值数据、索引和视频解码使用原始 LeRobot 实现
  • 导出的 Arrow 语言列和特征声明与参考模式匹配

参考与来源

  • 特征名称、维度、摄像头布局和嵌套语言模式遵循 BitRobot/HIW-500-LeRobot
  • 这些是单独转换的源录制,而非复制的参考情节
二维码
社区交流群
二维码
科研交流群
商业服务