遇见数据集
官方服务:

资源简介:

HABIT(Human-Aware Behavior and Interaction Training dataset)是一个专为人类在场环境设计的大规模机器人演示数据集,旨在解决现有数据集在人类缺席环境中收集导致策略难以在真实部署环境(如家庭、工厂)中与人类协调的问题。它包含10,563个演示片段,总计164.19小时的双手机器人操作数据,覆盖60个不同任务。任务根据人机交互依赖关系分为三种角色:协作角色(人机共同完成共享目标,涉及直接物理交互)、同事角色(共享目标和空间但独立执行任务,需避免碰撞)和监管角色(人类通过手势等指令指导机器人)。数据收集采用双操作员模式,使用双Franka Research 3机械臂和Robotiq 2F-85夹爪,通过五个RGB摄像头流(三个机器人侧视角和两个人类侧视角)记录,动作数据以关节空间、笛卡尔空间和夹爪状态多种形式记录。数据集提供精细的子任务级标注,实时记录人类和机器人子任务边界,实现时间步精确对齐。采用LeRobot v2.0格式组织,包含元数据(任务指令、子任务指令、统计信息等)、Parquet格式的状态-动作序列文件和MP4格式视频文件,适用于训练视觉-语言-动作模型和世界动作模型,以提升机器人在人机共存环境中的任务成功率和社会兼容性行为。

HABIT (Human-Aware Behavior and Interaction Training dataset) is a large-scale robotic demonstration dataset specifically designed for human-present environments, aiming to address the issue that existing datasets collected in human-absent scenarios make it difficult for robot policies to coordinate with humans in real-world deployment environments such as homes and factories. It contains 10,563 demonstration segments, totaling 164.19 hours of dual-arm robotic manipulation data, covering 60 distinct tasks. Tasks are categorized into three roles based on human-robot interaction dependencies: collaborative role (human and robot jointly complete shared goals involving direct physical interaction), coworker role (share goals and space but perform tasks independently, requiring collision avoidance), and supervisory role (humans instruct robots via gestures and other commands). The data was collected in a dual-operator setup, using dual Franka Research 3 robotic arms and Robotiq 2F-85 grippers. Data was recorded via five RGB camera streams (three robot-side viewpoints and two human-side viewpoints), and motion data was captured in multiple forms including joint space, Cartesian space, and gripper status. The dataset provides fine-grained subtask-level annotations, which record the boundaries of human and robot subtasks in real time and enable precise time-step alignment. Organized in the LeRobot v2.0 format, the dataset includes metadata (task instructions, subtask instructions, statistical information, etc.), Parquet-formatted state-action sequence files and MP4-format video files. It is suitable for training vision-language-action models and world action models to improve the task success rate and socially compliant behaviors of robots in human-robot coexistence environments.

创建时间:
2026-06-30
原始信息汇总

HABIT 数据集概述

HABIT(Human-Aware Behavior and Interaction Training Dataset)是一个面向人类在场环境的机器人操作演示数据集,旨在训练机器人策略学习人类感知行为。

  • 许可协议: CC-BY-4.0
  • 任务类别: 机器人学
  • 语言: 英语
  • 关键词: 机器人操作数据集、人机交互、视觉-语言-动作模型
  • 规模: 10,000 < N < 100,000 个样本

核心特点

  • 人类在场演示: 每个数据片段都包含一位在场的人类搭档,在响应式收集协议下采集。
  • 三种交互角色: 合作者 (Collaborator)、同事 (Coworker)、监督者 (Supervisor),三种角色的片段数量相当。
  • 任务工作流: 采用图结构任务表示,明确捕获跨智能体的依赖关系。
  • 子任务级别标注: 在演示过程中实时记录机器人和人类的子任务边界。
  • 五路RGB摄像流: 3个机器人侧视角 + 2个人类侧视角,全面捕捉人机交互。
  • 双臂操作: 使用两台Franka Research 3 (FR3) 机械臂。

数据集统计

  • 任务数量: 60
  • 数据片段数: 10,563
  • 总帧数: 591万
  • 总时长: 164.19 小时
  • 交互角色: 3种(合作者/同事/监督者)
  • 每个片段摄像头数量: 5个
  • 机器人平台: 双臂 Franka Research 3
  • 数据格式: LeRobot v2.0

片段时长(按任务统计): 均值 59.9 秒,中位数 56.4 秒,范围 30.3 – 101.4 秒。

独特子任务: 157个机器人子任务,182个人类子任务,308个独特的人-机器人子任务对。

按角色细分统计

角色 任务数 片段数 时长(小时) 机器人子任务/片段 人类子任务/片段
合作者 20 3,198 49.98 3.86 4.70
同事 20 3,969 57.33 3.12 4.25
监督者 20 3,396 56.88 4.15 3.98

三种交互角色详解

  • 合作者: 人和机器通过直接物理交互(如递物、共提水桶)共同完成一个共享目标。机器人必须在空间和时间上与人类协调。
  • 同事: 人和机器共享一个目标和空间,但无直接物理接触。每个智能体独立处理自己的任务部分。机器人必须避免与人类碰撞以确保安全。
  • 监督者: 人类通过明确线索(如手势或行为指令)指挥机器人,机器人必须仅从视觉输入感知人类的意图。

硬件设置

  • 机器人: 双臂 Franka Research 3,配备 Robotiq 2F-85 夹爪。
  • 工作空间: 一个前桌(人类与机器人之间,直接共享工作空间)和一个侧桌(人类一侧,用于人类活动)。
  • 摄像头(5个RGB):
    • 1个机器人中心摄像头:向前倾斜,捕获人类和共享工作空间。
    • 2个腕部摄像头:每臂一个。
    • 1个人类头戴式摄像头(第一人称视角)。
    • 1个外部摄像头:观察整个工作空间。
  • 遥操作: 使用 Meta Quest 3 控制器,基于 DROID 代码库。动作表示以关节空间、笛卡尔空间和夹爪状态形式记录。

数据收集协议

  • 每个片段由两位操作员记录:机器人操作员(遥控双臂 FR3)和人类操作员(执行人类侧活动)。
  • 每位操作员通过脚踩踏板在线标记子任务边界。
  • 协议三原则:
    1. 响应式交互: 每位操作员仅在直接观察搭档后行动,禁止排练、眼神信号或口头指令等场外协调。
    2. 目标行为引导: 通过特定设计引导数据中出现如让行时间适应手势理解等人类感知行为。
    3. 多样性: 在片段间变化服装颜色和物体交互顺序,并涉及多位不同体型的人类操作员。

任务详情

数据集包含60个任务,涵盖三种角色。完整的任务列表(高级指令)位于 meta/tasks.jsonl 中。每个片段在 meta/episodes.jsonl 中通过 sid(场景ID)字段链接到详细的 task_details/ 目录下的文档,涵盖环境设置、高级指令、低级指令和工作流图。

数据集结构

数据遵循 LeRobot v2.0 格式。 fullsample 两个配置独立组织。目录结构包括 meta/(元数据)、data/(Parquet文件存储完整片段的状态、动作、时间戳和语言指令)、videos/(MP4视频文件)。

子任务标注: 每个步骤(step)的 Parquet 文件中都携带当前活动的子任务索引:

  • low_level_task_index: 机器人子任务索引。
  • human_role_subtask_index: 人类子任务索引。

摄像头特征键:

用途
observation.images.front_view 机器人 正前方中心视图;捕获人类和共享工作区域
observation.images.left_wrist_view 机器人 左臂腕部摄像头
observation.images.right_wrist_view 机器人 右臂腕部摄像头
observation.images.human_front_view 人类 头戴式,人类第一人称视角
observation.images.exo_view 外部 全视角外部摄像头

引用

bibtex @article{song2026habit, author = {Jaehwi Song and Suchae Jeong and Byeongguk Jeon and Sungdong Kim and Minjoon Seo and Hyungmok Son and Kimin Lee}, title = {HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation}, journal = {arXiv preprint arXiv:2606.31682}, year = {2026} }

搜集汇总
数据集介绍
HABIT 数据集图片
构建方式
HABIT 数据集通过精心设计的双操作员协议构建,每段示范均由一名机器人和一名人类操作员协同完成。机器人操作员使用 Meta Quest 3 控制器遥操作双臂 Franka Research 3 机器人,而人类操作员则在场内执行相应活动。构建遵循三大原则:反应式交互,要求双方仅基于可观察的视觉线索行动,杜绝排练或言语沟通;目标行为诱发,通过设计协作、共工与监督三种角色,针对性引出避让、时间适配与手势理解等人类意识行为;多样化设置,通过变换衣物颜色、物体交互顺序及操作员体型来增强数据泛化性。最终数据集包含 10,563 段示范,覆盖 60 项任务,总时长 164 小时。
特点
HABIT 数据集最显著的特点是所有示范均在人机共存的场景下采集,这是其区别于其他机器人数据集的关键。它引入三种交互角色:协作模式中人与机器人通过物理接触共同完成任务;共工模式中双方在同一空间独立操作但需避免碰撞;监督模式中人类通过手势或指令引导机器人。数据包含五个 RGB 摄像头视角(三个机器人侧与两个人类侧)、双臂操作记录以及精细的子任务级别标注——通过脚踏板实时标记每一步中人类与机器人的子任务索引,从而提供跨主体时空对齐。这种结构化的任务图表示和丰富的标注信息,为训练具备社交认知的机器人策略提供了独特资源。
使用方法
HABIT 数据集以 LeRobot v2.0 格式存储,可通过 Hugging Face Datasets 库便捷加载。用户可选择“sample”配置(含每任务一段示范,约 1 GB)进行快速探索,或使用“full”配置获取完整数据集。数据文件包括元数据 JSONL 文件、以 Parquet 格式存储的完整示范序列(含状态、动作、时间戳及语言指令),以及每段示范每视角的 MP4 视频文件。推荐用于微调视觉-语言-动作模型,如论文中使用的 π0.5 和 GR00T N1.6,可选取机器人侧三个摄像头视角(正面、左右腕)作为视觉输入。数据集还支持联合空间、笛卡尔空间或夹爪状态等多种动作空间训练,适应不同模型需求。
背景与挑战
背景概述
在机器人操作领域,数据驱动方法近年已成为训练策略的主流范式,尤其是视觉-语言-动作模型(VLA)的崛起,极大地推动了机器人对场景、本体与任务的泛化能力。然而,现有的机器人数据集通常采集于无人类在场的封闭环境中,机器人作为场景中的唯一代理,其学到的策略难以适用于人与机器人共存的真实世界,如家庭、工厂等共享空间。HABIT数据集于2026年由韩国科学技术院(KAIST)等机构的研究人员提出,旨在填补这一关键空白。该数据集包含10,563个示范片段、164小时双手操作数据,覆盖60个任务,依据人机交互角色划分为协作、共工与监督三类。通过精心设计的采集协议,HABIT致力于使机器人策略习得诸如避让、手势跟随等人类社会性行为,对提升机器人社会环境兼容性具有深远影响。
当前挑战
HABIT数据集致力于解决的核心领域挑战在于,现有机器的操作策略在人类在场的动态环境中往往失效,因缺乏对人类动作的实时解读与协调能力,如递物、避碰、依手势执行指令等。传统数据集因无人类在场而无法演示这些行为,导致策略在部署时面临安全与效率的双重缺陷。在构建过程中,研究团队面临若干关键难题:设计反应式交互协议,确保每一示范动作皆基于人类可见的线索而非隐藏通信;通过变化人类操作者的速度、服装及物体交互顺序激发多样化行为,同时保证数据质量与一致性;跨角色任务还需精准标注人机双方的子任务边界,其时间戳必须在线采集,这对采集流程的实时同步提出了极高要求。此外,数据量庞大(5.91百万帧)且包含五个RGB视频流,存储与组织亦带来工程挑战。
常用场景
经典使用场景
HABIT数据集的核心经典用途在于为机器人操控策略提供富含社会交互情境的训练数据。区别于传统仅在空场环境中采集的数据集,HABIT的每一段演示都包含一位共同在场的人类伙伴,机器人需在协作员、同事与监督者三种迥异的角色关系中执行任务。研究者可借助该数据集微调视觉-语言-动作模型,例如π0.5与GR00T N1.6,使其在面对共居人类时展现出先发避让、手势跟随与时空同步这类原本难以通过人工规则编码的社交智能行为。因此,HABIT是验证与提升机器人社会感知能力的理想基准平台。
解决学术问题
该数据集精准回应了当前机器人学习领域中一个棘手的学术问题:如何在数据驱动的框架下,使机器人学会并非源自环境物理约束、而是根植于人类社交规范的行为模式。传统数据集因缺乏共居人类而无法涵盖诸如递给、避让或等待这些依赖于两主体间实时互动的稀疏但关键的信号。HABIT通过精心设计的反应式采集协议和角色分类学,系统性地捕获了这些缺失的交互动态,使研究者能够量化分析模型是否内化了社会语境,从而将机器人行为学习的研究从单纯的‘任务完成’推进到‘社会兼容性’评估的层次。
衍生相关工作
HABIT的发布已催生了一系列颇具影响力的衍生工作。其倡导的‘共居人类演示’采集范式,直接启发了后续研究者重新设计数据收集协议,将人类主动参与作为训练数据质量的关键维度。基于HABIT提出的协作员、同事与监督者角色划分,学术界出现了专门研究特定角色行为涌现机制的基准测试与评估指标。此外,HABIT中公开的细粒度子任务时序标注与双主体工作流图谱,为开发能够进行模式化推理与意图预测的分层决策模型提供了宝贵的结构化数据根基,不少后续工作以此作为比较基线或迁移学习的预训练数据源,推动了人机交互中社会符号学习的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务