遇见数据集

towel_fold_dataset_aug_v1

收藏
github2026-09-02 更新2026-09-03 收录
官方服务:

资源简介:

120个真实双臂演示,包含85,187帧,帧率为30 FPS。

120 real dual-arm demonstrations, totaling 85,187 frames with a frame rate of 30 FPS.

创建时间:
2026-08-25
原始信息汇总

项目概览

这是一个双机械臂衣物折叠(毛巾折叠)模仿学习项目,基于 ACT(Action Chunking Transformer) 架构,在真实的双 AgileX Piper 机械臂上实现柔性物体(毛巾)的双手协同折叠操作。项目实现了从数据采集、模型训练到真实机器人实时控制部署的完整闭环。

核心技术框架

  • 模仿学习与ACT:采用 CVAE + Transformer 策略,预测完整的动作块(action chunks)
  • 双手协同控制:单一模型输出一个 14 维动作向量,同时驱动两条机械臂及两个夹爪
  • LeRobot 数据集:使用 LeRobot 格式进行遥操作数据采集与存储
  • gRPC 异步推理部署:服务器端(CUDA)持有模型,客户端(CPU)以 30 Hz 频率驱动机械臂
  • 实时控制与安全机制:每一步控制命令前均经无依赖的安全层验证,默认空跑模式,实际执行需显式确认

数据集信息

  • 数据规模:120 个真实双机械臂演示数据,共 85,187 帧(30 FPS)
  • 数据存储:LeRobot episodes 格式(parquet + mp4)
  • 数据标识local/towel_fold_dataset_aug_v1
  • 发布地址:https://huggingface.co/datasets/1goldexperience1/towel_fold_dataset_aug_v1
  • 相机配置:三个 RGB 视角(左、中、右),分辨率 640×480,30 fps
  • 训练数据未启用图像增强

模型与训练配置

参数
动作空间维度 14(左臂 6 关节 + 左夹爪 + 右臂 6 关节 + 右夹爪)
状态空间维度 28(两条手臂 × 7 个电机 × 位置+力矩)
ACT chunk 大小 100
训练批次大小 8
训练步数 目标 60,000 步,从零开始训练
模型标识 towel_fold_act_v4_scratch60k
checkpoint 全局步 040000(= last),SHA256: e118230cb7be20e307a64598fced077f50c631651b243deb2cf0db8366a4c28c
Piper SDK 0.6.2

评估结果

系统在一次连续录制中完成 10 次试验并全部成功(10/10 consecutive trials)。

项目
录制方式 一次连续拍摄,无内部剪辑
试验跨度 1.5 - 314.0 秒(约 34 秒/次)
完成/成功次数 10 / 10
人工重置 是(每次试验前操作员重新摆放毛巾)
计时精度 ±0.5 秒
评估用 checkpoint v4 · 040000(= last)
各阶段结果 接近、左右抓取、抬起、折叠、释放——每次试验中全部可见且成功

评估详情见:results/consecutive_10_trials.csvresults/consecutive_10_trials_review.md

系统架构与数据流

遥操作采集 → LeRobot 数据集 → ACT 训练 → checkpoint → gRPC policy_server (CUDA) → robot_client (CPU) → 2 × Piper (CAN) → 30 Hz 观测反馈 → 下一个动作块

安全层在每个控制步骤均执行:起始姿态校验(0.15 rad / 0.02 m)、每指令步长限制(0.10 rad / 0.01 m)、跟踪误差(0.35 rad / 0.03 m)、硬件关节限位、夹爪裁剪至 [0, 0.08] m,且从不发送禁用命令(机械臂保持 ENABLED 以防坠落)。

硬件环境

组件 规格
机械臂 2 × AgileX Piper(6-DoF + 夹爪),左臂接 can1,右臂接 can0
相机 3 × 640×480 @ 30 fps,udev 符号链接 /dev/camera_{left,middle,right}
主机 Ubuntu + NVIDIA A10(24 GB)用于训练与 CUDA 推理
驱动 / CUDA 595.84 / 13.2

模型权重与视频说明

  • Model Weightspretrained_model/(v4 040000 = last),发布地址:https://huggingface.co/1goldexperience1/towel_fold_act_v4_040000
  • 视频资料:仓库仅包含 GIF/封面/链接,原始录像保存在本地
  • 权重与数据集不出现在 Git 仓库中,需通过导出安装指令获取(docs/reproducibility.md

相关项目

同一平台基于此 ACT 基线构建的 SmolVLA(视觉-语言-动作模型)进阶项目:保留本项目的 ACT checkpoint(towel_fold_act_v4_040000)作为安全保障基础(始终拥有夹爪控制权),通过连续权威混合添加 SmolVLA 塑形策略,详见:piper-dual-arm-smolvla-towel-folding

许可与致谢

  • LeRobot / ACTPolicy:Apache 2.0,基于 Tony Z. Zhao 的 ALOHA 工作
  • AgileX Piper SDK:按其自身许可条款
  • 本仓库以 Apache 2.0 许可发布
搜集汇总
数据集介绍
towel_fold_dataset_aug_v1 数据集图片
构建方式
该数据集源自双机械臂软物体操作研究,聚焦于毛巾折叠任务的模仿学习。通过遥操作主臂,采集了120次真实双臂演示,利用LeRobot框架记录,涵盖三个RGB视角(左、中、右),以30帧/秒的速率捕获,共包含85,187帧图像和对应的状态-动作序列。状态维度为28,涵盖双臂各关节位置与力矩;动作维度为14,统一控制双臂及夹爪。数据集存储为parquet与mp4格式的LeRobot episodes,置于本地目录'local/towel_fold_dataset_aug_v1',并发布至Hugging Face供研究复用。
特点
该数据集面向高难度的软体物体操作,具有显著的双臂协同与视觉引导特性。采集自真实的AgileX Piper双臂平台,动作空间紧凑且维度统一,有利于算法直接学习关节级控制策略。数据包含多种扰动和连续操作片段,支持训练具有长时间预测能力的动作分块Transformer(ACT)策略。其亮点在于真实环境下的可复现性,配套严格的评估协议,如一次连续录制完成10次试验的高成功率记录,增强了数据集的可信度。此外,设计兼顾工程规范,提供清晰的数据采集与训练接口,便于研究社区扩展应用。
使用方法
此数据集专用于端到端的模仿学习流程,主要适配基于Transformer的动作分块(ACT)算法。使用前需将LeRobot的'piper_dual'机器人类型注册到环境,并配置相机设备。通过LeRobot的训练脚本加载本地数据集或Hugging Face版本,指定动作分块长度(如100)和批大小等超参数,训练后得到策略checkpoint。部署时,采用gRPC异步架构,策略服务器(CUDA)与机器人客户端(CPU)分离,以30Hz频率实时推理,并集成安全层,确保动作命令在硬件限制内。数据集亦支持离线评估和失败分析,为双臂软体操作研究提供标准化基准。
背景与挑战
背景概述
towel_fold_dataset_aug_v1数据集诞生于双机械臂软体操作研究的前沿,由研究团队于近期创建,旨在攻克用物理双臂进行毛巾折叠这一高度柔顺、非刚性物体的精细操控难题。依托Action Chunking Transformer(ACT)架构与LeRobot框架,该数据集采集了120次真实遥操作演示,包含85,187帧三视角RGB视觉及28维状态与14维动作数据,为训练一个能同时协调双机械臂及夹爪的单一策略模型提供了坚实基础。该数据集支撑了在真实AgileX Piper双臂平台上实现的端到端模仿学习流程,并在连续10次试验中取得全部成功,彰显了其在软体操作领域的标杆作用,为后续视觉-语言-动作模型研究铺平了道路。
当前挑战
该数据集面临的首要挑战源于软体对象的高度非线性和双臂协调的复杂性。毛巾材质形变无规律,姿态变化错综复杂,使传统的刚性物体操作方法失效,要求策略模型从高维视觉和状态输入中精准捕捉动态特征,实现稳健的抓取、提升与折叠动作。构建过程中,数据收集依赖遥操作,需确保演示动作的一致性和覆盖度,同时多相机同步、高保真状态记录及大规模数据存储也构成技术难题。模型训练与实时推理的权衡亦具挑战性,需在30Hz控制频率下保证低延迟,并通过多级安全机制验证每步动作,以防意外发生,确保物理实验的可重复性与安全性。
常用场景
经典使用场景
该数据集聚焦于双臂软体操作这一前沿研究领域,以日常毛巾折叠为具体任务载体,记录了120次真实双臂遥操作演示,包含85,187帧三视角RGB图像及对应的28维状态与14维动作序列,为模仿学习算法提供了高质量的多模态训练样本。其核心使用场景是训练基于Action Chunking Transformer(ACT)的模仿学习策略,使双机械臂能够协同完成可变形物体的精细操作。研究者可利用该数据集的连续帧结构和动作分块设计,验证策略在实时控制下的鲁棒性与泛化能力,同时该数据集也支持对双臂协调、软体物体状态估计等关键科学问题的深入探究。
解决学术问题
该数据集直面软体操作中高维状态空间与双臂协同控制的学术挑战,为模仿学习在非刚性物体操作任务上的应用提供了标准化基准。具体而言,它解决了缺乏真实双臂软体操作公开数据集的问题,使研究者能够系统评估策略在连续试验中的成功率与稳定性,如报告中展示的10/10连续成功记录。此外,该数据集强调了可复现的评估方法论,倡导以无剪辑连续录像作为可信度基准,从而促进了模仿学习研究范式的严谨性。其对动作分块、异步推理及安全机制的设计,也为后续工作探索视觉-语言-动作模型的融合奠定了坚实基础。
衍生相关工作
本研究衍生了若干重要工作,最引人注目的是在相同平台上的SmolVLA后续项目,该项目在ACT安全基座(源自本数据集训练的检查点towel_fold_act_v4_040000)之上,叠加了视觉-语言-动作(VLA)模型连续权限混合,形成了分层控制的新范式。这一系列工作不仅证明了从纯模仿学习到多模态融合框架的演进路径,而且其关于安全层与权威混合机制的设计,为高精度双臂操作中引入语义推理提供了可扩展的范例。同时,研究者也可以基于该数据集的构建方法与评估标准,探索其他软体操作任务(如布料展开、物品包装)的模仿学习,从而扩展其在更广泛机器人操作研究中的影响力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务