遇见数据集

HABIT

收藏
Hugging Face2026-07-01 更新2026-07-01 收录
官方服务:

资源简介:

HABIT(人类意识行为与交互训练数据集)是一个大规模机器人演示数据集,专为人类存在环境设计,旨在训练机器人策略具备人类意识行为。该数据集包含10,563个episodes和164小时的双臂操作数据,覆盖60个任务,基于三种交互角色:Collaborator(人类和机器人共同完成共享任务)、Coworker(人类和机器人在共享空间内执行独立任务但需避免碰撞)和Supervisor(人类通过手势或指令指导机器人)。数据集通过反应性收集协议捕获人类-机器人交互动态,包括五路RGB摄像头流(3个机器人侧、2个人类侧)、细粒度子任务注释(在线记录人类和机器人子任务边界),以及多样化的任务设置。它旨在解决现有数据集中在人类缺席环境中的局限性,促进机器人在家庭、工厂等共享工作空间中的安全和社会兼容性。

HABIT (Human Awareness, Behavior, and Interaction Training Dataset) is a large-scale robotic demonstration dataset purpose-built for human-inhabited environments, aimed at training robotic policies with human-aware behaviors. This dataset contains 10,563 episodes and 164 hours of dual-arm manipulation data, covering 60 distinct tasks, and is based on three interaction roles: Collaborator, where humans and robots jointly complete shared tasks; Coworker, where humans and robots perform independent tasks in a shared space while avoiding collisions; and Supervisor, where humans guide robots through gestures or commands. The dataset captures human-robot interaction dynamics via a reactive data collection protocol, including five-channel RGB camera streams (3 installed on the robot, 2 on the human operator), fine-grained subtask annotations that record the boundaries of human and robot subtasks in real time, as well as diverse task configurations. It is designed to address the limitations of existing datasets focused on human-absent environments, and to promote the safety and social compatibility of robots in shared workspaces such as homes and factories.

提供机构:
configint
创建时间:
2026-06-30
原始信息汇总

数据集概述

HABIT (Human-Aware Behavior and Interaction Training) 是一个大规模、专为人机共存环境设计的机器人示教数据集,旨在训练机器人策略具备人机协同意识。

核心特性

  • 每一段示教片段(episode)中都包含一位与机器人共处同一工作空间的人类合作伙伴。
  • 覆盖三种人机交互角色:Collaborator(协作者)、Coworker(同事)Supervisor(监督者)
  • 任务以图结构表示,明确编码了跨智能体的依赖关系。
  • 提供子任务级别的注释,标注了人与机器人在示教过程中的动作分界。
  • 拥有5路RGB摄像头流:3路机器人侧 + 2路人类侧。
  • 使用双臂 Franka Research 3 (FR3) 机器人平台。
  • 数据格式遵循 LeRobot v2.0 标准。

数据集规模统计

指标 数值
任务数量 60
片段数量 10,563
帧数 5.91 M
总时长 164.19 小时
交互角色 3(Collaborator / Coworker / Supervisor)
每段片段摄像头数 5(3机器人侧 + 2人类侧)
机器人平台 双臂 Franka Research 3
格式 LeRobot v2.0
  • 片段时长(按任务):均值 59.9 秒,中位数 56.4 秒,范围 30.3 – 101.4 秒。
  • 独特子任务:157 个机器人子任务,182 个人类子任务,308 个独特的人-机器人子任务对。

各角色统计分解

角色 任务数 片段数 时长(小时) 每段机器人子任务数 每段人类子任务数
Collaborator 20 3,198 49.98 3.86 4.70
Coworker 20 3,969 57.33 3.12 4.25
Supervisor 20 3,396 56.88 4.15 3.98

三种交互角色说明

  1. Collaborator(协作者):人与机器人通过直接的物理交互(如传递物体、共同端水桶)共同完成一个共享目标。机器人必须在空间和时间上与人类协调。
  2. Coworker(同事):人与机器人共享一个目标和空间,但没有直接物理接触,各自独立处理自己负责的任务部分。机器人必须避免与人类发生碰撞以确保安全。
  3. Supervisor(监督者):人类通过明确的线索(如手势、行为指令)指挥机器人,机器人需要仅凭视觉输入感知人类意图。

硬件设置

  • 机器人:双臂 Franka Research 3,配备 Robotiq 2F-85 夹爪。
  • 工作区:一个位于人与机器人之间的前桌(直接共享工作区),以及一个人侧专用的侧桌
  • 摄像头(5路RGB)
    • 1 x robot-center(机器人中央):向前倾斜,捕捉人与共享工作区。
    • 2 x wrist-mounted(腕装):每只手臂各一个。
    • 1 x human head-mounted (egocentric)(人类头戴式):捕捉人类第一人称视角,有助于接地手势目标。
    • 1 x exocentric(外部视角):观察整个交互空间,提供全局视图。
  • 遥操作:使用 Meta Quest 3 控制器,基于 DROID 代码库。动作表示以关节空间、笛卡尔空间和夹爪状态形式记录。

数据采集协议

每个片段由两名操作员分别扮演不同角色录制:一名机器人操作员(遥操作双臂FR3),一名人类操作员(执行人类侧活动)。两人各自使用脚踏板在线标记子任务边界。

协议遵循三个原则:

  1. 反应式交互:每一方只有在直接观察到对方后才行动,禁止任何排练、眼神或语言提示。
  2. 目标行为诱导:通过让机器人主动让行、变化人类操作员动作速度、以及变化人类手势前的等待时间,使特定的人机协同行为体现在数据中。
  3. 多样化的:在每项任务中变化衣服颜色和物体交互顺序;整个数据集涵盖多位不同体型的人类操作员。

数据获取与加载

bash

克隆完整数据集

git lfs install git clone https://huggingface.co/datasets/configint/HABIT

使用 datasets 库加载

from datasets import load_dataset

加载小样本(sample)配置

ds = load_dataset("configint/HABIT", "sample")

加载完整数据集

ds = load_dataset("configint/HABIT", "full")

配置

配置 描述 大小
sample 覆盖所有60个任务的小子集(每任务1个片段),约1 GB,用于快速探索 ~1 GB
full 完整数据集:10,563个片段,164.19小时,60个任务

数据集结构

遵循 LeRobot v2.0 标准。每个配置(fullsample)拥有独立的文件夹结构:

{full,sample}/ ├── meta/ │ ├── episodes.jsonl # 每段片段的元数据 │ ├── tasks.jsonl # 高级语言指令列表 │ ├── subtasks.jsonl # 机器人低级语言指令列表 │ ├── human_subtasks.jsonl # 人类低级语言指令列表 │ ├── info.json # 模式、帧率、特征、路径模板 │ ├── modality.json # 状态与动作模态信息 │ └── stats.json # 特征归一化统计 ├── data/ │ └── chunk-XXX/ │ └── episode_XXXXXX.parquet # 每个文件存储一个完整片段(状态、动作、时间戳、语言指令) └── videos/ └── chunk-XXX/ └── observation.images.<view>/ └── episode_XXXXXX.mp4 # 每个文件存储一个片段的单摄像头流

特征模式 (Features Schema)

  • 子任务注释:在Parquet文件中,每个时间步都携带人类和机器人当前活动的子任务索引。
    • low_level_task_index:对应机器人的子任务(映射到 meta/subtasks.jsonl)。
    • human_role_subtask_index:对应人类的子任务(映射到 meta/human_subtasks.jsonl)。
  • 摄像头特征键:每个片段包含5路RGB流。
    • observation.images.front_view:机器人中央前向视图。
    • observation.images.left_wrist_view:左臂腕装视图。
    • observation.images.right_wrist_view:右臂腕装视图。
    • observation.images.human_front_view:人类头戴式第一人称视图。
    • observation.images.exo_view:外部全局视图。

任务描述

数据集包含60个任务,分布在三种角色中。每个片段在 meta/episodes.jsonl 中通过 sid(场景ID)字段链接到详细的任务文档,文档位于 task_details/ 目录下。文档内容包括:环境设置、高级指令、子任务序列、以及任务工作流图。

引用

bibtex @article{song2026habit, author = {Jaehwi Song and Suchae Jeong and Byeongguk Jeon and Sungdong Kim and Minjoon Seo and Hyungmok Son and Kimin Lee}, title = {HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation}, journal = {arXiv preprint arXiv:2606.31682}, year = {2026} }

二维码
社区交流群
二维码
科研交流群
商业服务