遇见数据集

zihiao_real_test

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

本数据集(仓库)包含用于机器人操作任务 '盖子放入容器'(cap_to_tray)的推理代码、模型权重、基座模型及配置文件。模型输入为:桌面头相机 RGB 图像、右腕 D405 相机 RGB 图像、机械臂 TCP 实测位置(毫米)和四元数(wxyz)、六指实测位置(原始计数 0-997),以及可选的触觉垫数据(针对 v10_tactile 变体)。输出为 8 个绝对位姿(4×4 齐次变换矩阵,平移单位毫米)和 8 组六指绝对目标(原始计数)。模型基于 Cosmos3-Edge 基座和 Wan2.2 VAE,提供两个检查点变体:vanilla_rgb_step4000 和 v10_tactile_step4000,每个约 6.3 GB。基座模型(Cosmos3-Edge + Wan2.2 VAE 缓存)约 11.3 GB。训练数据来源于实测流(AgiBot 和 UMI 风格),包含 5902 个训练窗口和 5 条验证 episode。离线评测结果显示,模型在 10 Hz 下预测 8 拍(0.8 秒),误差累积较慢,t8 误差 31.7 mm(vanilla)对比基线 59.5 mm。适用场景:机器人操作中的精确放置任务,特别适合使用扩散策略的滚动时域控制(每 0.8 秒重规划)。

This dataset is for the robotic manipulation task cap_to_tray, containing training data, model weights, inference code, and configuration files. Inputs include a desktop head camera RGB image, a right wrist D405 camera RGB image, the measured TCP position (mm) and quaternion (wxyz), the measured gripper position (raw counts 0-997), and optional tactile pad data (for the v10_tactile variant). Outputs are 8 absolute poses (4×4 homogeneous transformation matrices, translation in mm) and 8 sets of absolute gripper targets (raw counts). The model is based on the Cosmos3-Edge backbone and Wan2.2 VAE, with two checkpoint variants: vanilla_rgb_step4000 and v10_tactile_step4000, each approximately 6.3 GB. The backbone model (Cosmos3-Edge + Wan2.2 VAE cache) is about 11.3 GB. Training data is sourced from real-world streaming (AgiBot and UMI style), containing 5902 training windows and 5 validation episodes. Offline evaluation shows that the model predicts 8 steps (0.8 seconds) at 10 Hz with slow error accumulation: t8 error 31.7 mm (vanilla) vs baseline 59.5 mm. Application scenario: precise placement tasks in robotic manipulation, particularly suitable for receding horizon control using diffusion policy (replanning every 0.8 seconds).

创建时间:
2026-09-05
原始信息汇总

数据集概述

数据集名称:tacWAM wet-lab 策略 — 推理与真机部署

核心任务:将一帧实测机器人状态(10 Hz)转换为八个绝对位姿与八组手指目标,用于机器人操作任务“盖子放入容器”(cap_to_tray)。

目标硬件:xArm6 机械臂 + BrainCo Revo2 右臂右手触觉手套(图鉴 EI-G012),搭配静态桌面头相机与右腕 D405 相机。


模型与检查点

项目 说明
模型总参数量 3.370 B
可用检查点 vanilla_rgb_step4000(6.3 GB)<br>v10_tactile_step4000(6.3 GB)
建议先使用 vanilla_rgb_step4000
任务类型 文本条件(中文任务名“盖子放入容器”),单一任务
训练数据规模 5,902 个训练窗口(10 Hz 模型时钟)

资源需求

项目 实测值
权重显存 7.6 GiB
峰值运行显存 10.2 GiB(≥16 GB 显存可用)
模型加载时间 23–25 秒
首次 act() 预热 1.2–4.0 秒(务必预热)
单卡即可运行 支持 NVIDIA H200(143 GB),PyTorch bf16

运行节奏(重要变更)

  • 执行全部 8 拍(0.8 秒),每 0.8 秒重规划一次,UniPC 采用 10 步
  • 稳态单次推理耗时:0.66–0.76 秒(10 步),低于 0.8 秒预算。
  • 训练建议的“执行前 4 拍、0.4 秒重规划”在实机无法运行(采样耗时 0.39 秒以上,无余量)。
  • UniPC 5 步(0.39–0.49 秒)可作降级选项,但误差略高(t8 误差 51.0 mm vs 10 步的 41.8 mm)。

数据包内容与安装

压缩包 大小 内容
tacwam_wetlab_infer.zip 12.6 GB 推理代码 + 两个 checkpoint bundle + 配置
base_models.zip 11.3 GB Cosmos3-Edge 基座 + Wan2.2 VAE 缓存

解压后目录结构包含:new_infer/(推理代码与检查点)、tacwam/(Python 包)、docs/(触觉手套几何及归一化文件)、base_models/(Cosmos3-Edge 基座 8.6 GB + hf_cache Wan2.2 VAE 2.7 GB)。所有组件均需保留,除 vae/ 子目录(1.4 GB 冗余)可删除。

必设两个路径:基座模型路径(覆盖 run_config.json 中训练机绝对路径)及 HF 缓存路径(HF_HOME),设置后无需外网。


输出格式与控制说明

  • policy.act() 返回 ActionChunk,包含 poses_abs([8, 4, 4] 齐次变换矩阵,平移单位为毫米)、hand_targets([8, 6] 手指目标)。
  • 8 行对应观测时刻后 0.1–0.8 秒(10 Hz),不含观测时刻本身设定点。
  • 绝对位姿基于所传入的实测 TCP 坐标系推导,可直接下发。
  • 四元数采用 wxyz 顺序;位置单位 毫米;手指目标为原始计数,合法范围 0–997,需用 clipped_hand() 夹取后再下发。
  • 任务严禁使用欧拉角与轴角表示姿态(存在万向锁及 ±180° 奇点问题),需使用四元数或矩阵形式。

输入观测字段

字段 形状/单位 说明
rgb_head [H,W,3] uint8 静态桌面头相机,内部缩放至 256×256
rgb_wrist_right [H,W,3] uint8 右腕 D405 图像
tcp_pos [3](毫米) 手臂末端实测位置
tcp_quat_wxyz [4](wxyz) 手臂末端实测量,须单位化
hand_pos [6](0–997 计数) 手指实测位置
timestamp_ns int(纳秒) 时间戳,用于触觉 mRoPE
tactile_maps [30,1,H,W] 已归一化触觉输入(仅触觉变体)
taxel_valid [30,H,W] bool 触觉有效性掩码

离线评测结果

逐 tick 误差(median,毫米,UniPC 10 步)

模型 t1 t2 t3 t4 t5 t6 t7 t8
原地不动(基线) 6.7 14.1 22.2 29.5 36.8 45.1 53.0 59.5
vanilla@4000 6.2 11.8 14.9 19.2 23.4 27.4 30.0 31.7
tactile@4000 5.8 11.6 17.0 22.4 28.9 36.1 39.0 41.8

两个 checkpoint 从第 1 拍起优于“原地不动”基线,t8 时领先 47%(vanilla)。

方向余弦(median)

vanilla@4000:+0.66 → +0.77;tactile@4000:+0.67 → +0.70(均 ≥ 0.5)。

八道验收门

  • 通过 7/8 道:
    • 误差控制、方向一致性、步长范围、无方向震荡、优于原地不动等门均通过。
  • 未通过:hand_in_sensor_range(手指范围门)——模型预测手指计数可超出 0–997(预测范围约 −69.5…351.8),需在执行侧用 clipped_hand() 夹取解决。

关键注意事项

  1. 模型每拍平均位移 9.38 mm(p95 19.62 mm),代码含 60 mm/拍位移上限保护,仅为最低限度护栏,并非安全系统。
  2. 采样过程从高斯噪声起步,同一观测两次调用结果不同,需固定随机种子复现。
  3. 模型是文本条件的,推理时 prompt 必须与训练时逐字一致(中文任务名 + 英文模板),换任务需重新 post-train。
  4. 触觉数据存在左右重映射需求(数据来自“left”文件但需用作右手输入),代码已封装处理,勿重复操作。
  5. 需保证所有观测读数来自同一时刻的实测值(非指令值),相机外参、手套贴装及手指编号须与采集时一致。
  6. 提供的 RobotInterface 接口需实现六个方法(头相机、腕相机、TCP 位姿、手指位置、触觉 pad、下发动作),且全部返回实测值。
搜集汇总
数据集介绍
zihiao_real_test 数据集图片
构建方式
该数据集来源于一项针对真实机器人操作的探索性测试,旨在将单帧实测状态映射为八组绝对位姿与手指目标。数据采集依托xArm6机械臂与BrainCo Revo2触觉手套,在“盖子放入容器”任务下,以10Hz频率同步记录桌面头相机与腕部D405的视觉信息、TCP位姿及六指原始计数。构建过程严格遵循实测流原则,避免采用遥操指令作为标签,并通过对触觉通道的左右重映射与无效掩码处理,确保数据分布的真实性与一致性。
特点
该数据集具有鲜明的多模态融合与细粒度时间分辨率特征。其动作表征采用绝对位姿与相对增量相结合的方式,涵盖旋转矩阵、位置增量及手指绝对目标,且对欧拉角与轴角奇异性进行了规避。数据内在特性昭显于姿态接近万向锁与±180°奇点区域,而手指计数存在越界现象,凸显了执行端夹取操作的必要性。模型基于文本条件架构,中文任务名与英文模板组合驱动推理,展现了跨模态条件生成的精确对齐能力。
使用方法
使用此数据集进行推理与部署时,需遵循特定的滚动时域控制协议:模型一次性预测八拍(0.8秒),随后以8拍为周期基于最新观测重规划,并采用UniPC采样十步以保证实时性。输出必须转换为四元数或齐次矩阵形式,避免欧拉角插值引发的奇异问题。手指目标须经夹取函数限制于0至997的传感器范围内。完整的部署流程涉及实现读取实测状态与下发指令的六个接口函数,并需通过契约自检以确保编解码链路无误。
背景与挑战
背景概述
该数据集源自tacWAM wet-lab策略项目,由研究团队于近期开发,旨在实现机器人对‘盖子放入容器’任务的精确操作。数据集涵盖一帧实测机器人状态到八个绝对位姿及八组手指目标的转换,频率为10Hz,并基于xArm6机械臂与BrainCo Revo2触觉手套构建。其核心研究问题在于通过融合视觉与触觉信息,提升机器人在复杂操作中的实时决策与执行能力。该数据集及其配套模型在任务中展现出优于基线的性能,将末端执行器误差从59.5mm降至31.7mm,为机器人操作学习提供了高效的数据基础。其对相关领域的影响力体现在推动了多模态感知与预测控制策略在真实场景中的部署,为灵巧操作研究树立了新的标杆。
当前挑战
该数据集面临多重挑战。首先,在领域问题层面,机器人操作任务要求模型在高速运动下维持高精度,但模型预测存在误差累积,尤其在长时域中,尽管实验表明误差增长慢于线性,但单步误差仍可能因系统噪声而放大。其次,数据构建过程中遭遇硬件与计算限制,模型推理耗时与执行周期难以严格匹配,需调整重规划策略以适配实际算力。此外,数据采集涉及触觉手套的左右重映射、传感器同步性及手指标定等复杂工程问题,任何错位都会导致分布偏移。最后,模型的输出存在越界风险(如手指计数超出传感器范围),需通过裁剪策略确保安全执行,且其依赖于高精度基座模型,对部署环境有严格约束。
常用场景
经典使用场景
该数据集源于机器人灵巧操作领域的真实世界部署实验,聚焦于‘盖子放入容器’这一精细任务,通过xArm6机械臂与BrainCo Revo2触觉手套的协同,构建了从视觉感知到触觉反馈的多模态观测流。其经典使用场景在于作为视觉-语言-动作(VLA)模型在物理环境中的闭环推理基准,研究者可利用其中10Hz采样的多视角RGB图像、六维力觉信息及机械臂状态序列,训练或评估模型在真实动态场景下的短时程动作预测能力。数据集提供8步动作块(0.8秒)的密集标注,涵盖绝对位姿与手指目标,为模仿学习、行为克隆及基于扩散策略的机器人控制研究提供了高保真度的实测数据范式。
实际应用
在实际应用中,该数据集及其配套推理代码可直接服务于工业机械臂的精细装配、分拣或实验室自动化场景。其设计的行动块推理范式支持每0.8秒重规划一次的控制循环,输出8个绝对位姿与手指目标,可直接转换为机械臂SDK能够执行的指令,适用于高速、非结构化环境下的灵巧操作任务。尤为重要的是,数据集强调实测数据而非指令值,并规避了欧拉角万向锁问题,推荐使用四元数或齐次变换矩阵进行控制,这保证了系统在不同机器人本体上的可移植性。通过提供干运行自检及与真实硬件交互的完整示例,该数据集为开发人员提供了一套从模型部署到实时执行的高效路径,有望加速下一代自主机器人在仓储物流、医疗辅助等领域的落地应用。
衍生相关工作
该数据集及其工程框架直接衍生了一系列关于扩散模型在机器人控制中应用的进阶工作。其一,研究者基于其8步动作块预测机制,探索了不同生成步数(如UniPC 5步与10步)对控制精度和计算效率的影响,推动了轻量化实时推理策略的优化。其二,数据中触觉通道的左右重映射与掩码设计,启发了后续关于缺失传感器模态下多任务学习鲁棒性的研究,例如如何利用单一手套数据模仿完整双手操作。其三,‘原地不动’基线和滚动时域重规划思想的提出,为无模型强化学习与模型预测控制的融合提供了新的比较基准。此外,围绕该数据建立的契约自检(selftest)与错误门禁(ship_gate)理念,也被推广为具身智能模型评估标准化的重要范例,促进了可靠、可复现的机器人学习研究社区的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务