遇见数据集

combined_targets_eval

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

该数据集是使用LeRobot框架创建的机器人数据集,旨在为机器人模仿学习、行为克隆和强化学习提供训练数据。数据集包含57个演示片段(episodes),共28777帧,覆盖5个不同任务。机器人类型为stringman。数据字段包括:11维动作(包含线速度、角速度、腕部速度、手指速度、接触向量和episode结束标志)、9维观测状态(夹爪位置、旋转角度、手指角度、激光测距仪、手指压力、腕部角度和目标力)、两个摄像头视频流(夹爪摄像头:256x448分辨率,顶置摄像头:512x512分辨率,均为30fps,AV1编码),以及时间戳、帧索引、episode索引、任务索引等元数据。数据以Parquet文件和MP4视频文件形式存储,训练集包含所有57个episodes。

This dataset is a robot dataset created using the LeRobot framework, designed to provide training data for robot imitation learning, behavior cloning, and reinforcement learning. It contains 57 demonstration episodes with a total of 28,777 frames, covering 5 different tasks. The robot type is stringman. Data fields include: 11-dimensional action (including linear velocity, angular velocity, wrist velocity, finger velocity, contact vector, and episode end flag), 9-dimensional observation state (gripper position, rotation angle, finger angle, laser rangefinder, finger pressure, wrist angle, and target force), two camera video streams (gripper camera: 256x448 resolution, overhead camera: 512x512 resolution, both at 30fps, AV1 codec), as well as metadata such as timestamps, frame indices, episode indices, and task indices. Data is stored in Parquet files and MP4 video files, with the training set containing all 57 episodes.

创建时间:
2026-08-14
原始信息汇总

数据集概述

数据集名称naavox/combined_targets_eval

数据集简介:该数据集使用 LeRobot 框架创建,主要面向机器人学(robotics)任务,属于机器人操控相关数据。


基本信息

属性 内容
许可证 Apache-2.0
任务类别 机器人学(robotics)
标签 LeRobot
机器人类型 stringman
帧率(fps) 30
代码库版本 v3.0

数据规模

指标 数值
总片段数(total_episodes) 57
总帧数(total_frames) 28,777
总任务数(total_tasks) 5
数据文件大小 100 MB
视频文件大小 200 MB
数据切分 train: 0:57(全部作为训练集)

数据特征(Features)

1. 动作(action

  • 数据类型:float32
  • 维度:11
  • 特征字段
    • vel_xvel_yvel_z:速度分量(x/y/z)
    • room_vel_xroom_vel_y:房间速度分量
    • wrist_speed:手腕速度
    • finger_speed:手指速度
    • contact_vec_xcontact_vec_ycontact_vec_z:接触向量分量
    • episode_end:片段结束标志

2. 观测状态(observation.state

  • 数据类型:float32
  • 维度:9
  • 特征字段
    • gripper_pos_xgripper_pos_ygripper_pos_z:夹爪位置坐标
    • spin:旋转角度
    • finger_angle:手指角度
    • laser_rangefinder:激光测距值
    • finger_pressure:手指压力
    • wrist_angle:手腕角度
    • target_force:目标力

3. 图像观测(observation.images

(a)夹爪相机(gripper_camera

  • 分辨率:256 × 448 × 3(高 × 宽 × 通道)
  • 视频编码:AV1,帧率 30 fps
  • 像素格式:yuv420p
  • 类型:普通彩色视频(非深度图)

(b)顶视相机(overhead_camera

  • 分辨率:512 × 512 × 3(高 × 宽 × 通道)
  • 视频编码:AV1,帧率 30 fps
  • 像素格式:yuv420p
  • 类型:普通彩色视频(非深度图)
  • 编码参数:CRF=30,预设值=12

4. 时间戳(timestamp

  • 数据类型:float32,维度 1

5. 帧索引(frame_index

  • 数据类型:int64,维度 1

6. 片段索引(episode_index

  • 数据类型:int64,维度 1

7. 索引(index

  • 数据类型:int64,维度 1

8. 任务索引(task_index

  • 数据类型:int64,维度 1

数据格式与存储

  • 数据文件路径data/*/*.parquet(按块组织和存储)
  • 视频文件路径videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 块大小:1000

使用说明

  • 该数据集可通过 LeRobot 框架进行加载和使用。
  • 数据集提供可视化工具,可通过 Hugging Face Spaces 上的 LeRobot 数据集可视化工具进行预览。
  • 目前论文信息(Paper)和引用格式(BibTeX)尚未提供(标记为 "More Information Needed")。
搜集汇总
数据集介绍
combined_targets_eval 数据集图片
构建方式
本数据集借助LeRobot框架进行构建,遵循v3.0代码库版本规范。数据采集以30帧每秒的频率进行,涵盖57个回合,共计28777帧。数据以Parquet格式存储于data目录下,视频数据则采用AV1编解码器,以MP4格式存储。特征维度明确,动作空间包含11维连续变量,如速度、接触向量等,观测状态包含9维变量,如夹爪位置、激光测距等。此外,还集成了夹爪相机和俯视相机两路视觉观测,分辨率分别为256×448和512×512,为机器人学习提供了多模态感知信息。
特点
该数据集专为机器人操作任务设计,具有多模态、高维度和精细标注的特点。动作空间和观测状态均以浮点型张量表示,涵盖末端执行器速度、夹爪姿态、力反馈等丰富物理量,支持复杂操控策略的学习。视觉观测包含夹爪视角和全局俯视视角,便于研究视觉-运动协调。数据集按任务索引划分,包含5种不同任务,且每个回合的帧序列完整,时间戳和帧索引信息齐全,为时序建模提供了便利。机器人类型为stringman,增强了特定平台的适用性。
使用方法
使用者可通过Hugging Face平台直接加载数据集,利用LeRobot提供的可视化工具在线浏览数据样本。数据集划分为训练集(0:57),适用于模仿学习、强化学习等机器人策略训练。加载时,可依据data_path和video_path模板读取Parquet文件和视频文件,或使用LeRobot库进行高效解析。研究人员可基于动作和观测特征设计网络架构,利用多视角图像进行感知融合,并结合任务索引实现多任务学习。数据集遵循Apache-2.0许可,允许自由使用和修改,但需遵守相关引用要求。
背景与挑战
背景概述
机器人学习领域长期依赖真实世界交互数据来训练感知与操控策略,而高质量、多模态、带精细标注的数据集始终稀缺。combined_targets_eval数据集依托LeRobot框架构建,于2024年前后发布,主要研究人员或机构尚待补充,其核心研究问题在于为复杂目标导向的机器人操控任务提供可复现的评估基准。该数据集涵盖57个回合、28777帧,包含夹爪与顶置双视角视频、九维状态及十一维动作空间,融合测距、压力与接触向量等传感信息。它为机器人模仿学习与策略泛化研究提供了标准化测试平台,对推动具身智能领域的可重复实验具有积极意义。
当前挑战
该数据集所面对的领域问题在于,如何让机器人在多目标、动态接触的操控场景中实现稳健的泛化与精准的力觉控制。构建过程中,多模态同步采集与标注面临显著困难,包括双视角视频与高频传感器信号的时序对齐、接触事件与目标力标签的精确切分,以及不同任务间动作空间与状态空间的统一表示。此外,数据规模与任务多样性之间的平衡、评估协议的可复现性、以及真实机器人平台与仿真环境间的迁移一致性,均为该数据集亟待应对的挑战。
常用场景
经典使用场景
在机器人学习与具身智能研究领域,combined_targets_eval数据集最为经典的使用场景在于支撑基于视觉-力觉多模态融合的精细操作策略学习与评估。依托LeRobot框架,该数据集采集了包含夹爪相机与俯视相机在内的双视角视觉观测、11维动作指令及9维机器人状态信息,涵盖57个回合、近三万帧、5类任务,能够为模仿学习与离线强化学习算法提供高保真的训练与测试环境,尤其适用于接触密集型操作中力位混合控制策略的验证。
解决学术问题
该数据集直击机器人精细操作研究中长期存在的多模态感知融合与接触力建模难题。通过同步记录激光测距、指尖压力、腕部角度与目标力等状态量,其为研究视觉伺服与力反馈协同控制提供了系统化的数据支撑,有效缓解了真实机器人接触任务中力觉信号稀疏、多传感器时序对齐困难的瓶颈,推动了具身智能策略从纯视觉驱动向视触融合范式的演进。
衍生相关工作
作为LeRobot生态中的评测型数据集,combined_targets_eval衍生了一系列围绕多模态模仿学习与力觉表征学习的研究工作。基于其结构,后续工作相继探索了视触联合编码、时序动作分块及目标力条件策略等方向,相关模型常被用作对比基线,用以评估不同架构在接触密集任务上的性能边界,逐步形成了以力感知为核心的机器人操作研究脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务