Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation
收藏官方服务:
资源简介:
Hoi!是一个多模态数据集,专注于力基、跨视角的关节操作,通过多个同步传感器(如Project Aria眼镜、手持UMI GoPro夹爪、力/扭矩夹爪、iPhone RGB-D和Leica激光扫描)在真实环境中捕获人-物体交互数据,所有数据都注册到一个共享的世界坐标系中。
Hoi! is a multimodal dataset focused on force-based and cross-view articulated manipulation. It captures human-object interaction data in real-world environments via multiple synchronized sensors, including Project Aria glasses, handheld UMI GoPro grippers, force/torque grippers, iPhone RGB-D sensors, and Leica laser scanners. All data are registered to a shared world coordinate system.
创建时间:
2026-07-01
原始信息汇总
Hoi! 数据集概述
这是一个为力触觉、跨视角铰接操作而设计的多模态数据集,记录的是真实环境中的人与物体交互行为。
核心特征
- 传感器配置:使用多种同步传感器进行录制,包括:
- Project Aria 眼镜
- 手持式 UMI GoPro 夹具
- 力/力矩传感器夹具
- iPhone RGB-D 相机
- Leica 激光扫描仪
- 坐标系统:所有传感器数据均被配准到同一个共享的世界坐标系中。
数据集内容
- 交互类型:记录了人在真实环境中的物体操作交互。
- 数据模态:包含视觉(RGB、深度)、力/力矩、触觉、IMU(惯性测量单元)以及运动学等多种数据流。
工具与管线
项目提供了一套完整的工具链,用于数据录制和处理:
-
数据录制 (
data_recording/)- 运行于 Jetson 平台上的夹具捕获系统。
- 可录制 ZED 相机、力/力矩传感器、触觉传感器和电机数据。
-
数据处理 (
data_processing/)- 将原始录制的数据转换为可用于发布的最终数据集,处理流程包括:
- 提取:从各原始设备(Aria、GoPro、夹具等)中提取数据流。
- 时间对齐:将所有设备的流时间同步。
- 空间配准:将所有数据流注册到 Leica 激光扫描仪定义的世界坐标系中。
- 交互分割:将连续的录制数据分割成单个交互窗口。
- 打包:将处理后的位置打包为发布格式。
- 将原始录制的数据转换为可用于发布的最终数据集,处理流程包括:
-
标定 (
calibration/)- 提供基于开源工具(Kalibr、allan_variance_ros)的相机/IMU 标定文件。
论文与引用
该数据集随 CVPR 2026 论文一同发布。如需引用,请使用提供的 BibTeX 条目。
访问与使用
- 项目网站:timengelbracht.github.io/Hoi-Dataset-Website
- 论文:arXiv:2512.04884
- 代码:所有处理代码均封装在 Docker 容器中运行,通过
data_processing/和data_recording/目录下的 README 文件指导使用。
搜集汇总
数据集介绍

构建方式
在日常生活与工业环境中,人类与物体间的精细交互(如抓取、旋转或按压)是机器人具身智能研究的关键课题。Hoi!数据集的构建从多视角、多模态的同步采集出发,依托Project Aria眼镜、手持UMI GoPro、力/力矩夹爪、iPhone RGB-D相机及Leica激光扫描仪等多元化传感设备,在真实场景中捕获人-物交互数据。所有传感器数据经由时间对齐算法与空间注册流程,统一映射至共享世界坐标系,最终拆分为独立的交互片段并打包形成标准化数据集,为力觉与视觉融合的跨视角操控研究提供了扎实的底层支撑。
使用方法
使用Hoi!数据集时,研究者首先通过Docker容器部署数据处理管道,利用hoi.data_tools.extraction_pipeline模块执行从原始流提取、时间对齐到空间注册的完整流程,并通过package_dataset_release脚本将处理后的地点打包为标准发布格式。对于自有数据采集,可基于Jetson平台运行recording_gripper组件,配置力传感器与相机参数后实时记录交互数据。整套工具链以模块化设计为主,支持按需扩展采集硬件或调整处理流程,便于在机器人学习、姿态估计与触觉感知等下游任务中灵活调用。
背景与挑战
背景概述
Hoi!数据集诞生于2026年,由瑞士苏黎世联邦理工学院、德国慕尼黑工业大学、弗莱堡大学及波恩大学等顶尖机构联合创建,核心研究人员包括Tim Engelbracht、René Zurbrügg及Abhinav Valada等。该数据集旨在攻克具身智能领域中力觉引导的铰接物体操纵这一前沿难题,通过多模态传感融合策略,在真实环境中同步采集Project Aria眼镜、手持夹爪、力/力矩传感器、iPhone RGB-D及激光扫描仪等多源数据,并将所有模态精确配准至统一世界坐标系。其问世为跨视角、力量感应的机器人精细操作研究提供了稀缺的高质量基准,显著推动了人机交互与自主操纵领域的发展。
当前挑战
该数据集面临的核心挑战在于解决力觉信息与视觉模态在铰接物体操纵中的深度融合问题,当前领域内缺乏同时涵盖跨视角观测、力触觉反馈及真实环境动态性的标准化基准,导致模型泛化能力受限。构建过程中,多传感器的时间同步与空间配准构成重大技术壁垒,需应对Aria眼镜的稀疏视图、手持GoPro的连续运动轨迹以及激光扫描的静态参考框架间的异构对齐难题。此外,力/力矩数据的噪声抑制、记录硬件在嵌入式系统上的实时计算约束,以及跨地点采集时的环境变量控制,均对数据集的完备性与可靠性提出了严苛要求。
常用场景
经典使用场景
在机器人灵巧操作与人机协作研究领域,数据驱动的学习范式亟需多模态、力觉锚定的交互数据以突破现有瓶颈。Hoi!数据集通过同步采集Project Aria眼镜的第一人称视角、UMI GoPro抓取器的第三人称视角、力/力矩传感器数据、iPhone RGB-D深度信息以及Leica激光扫描的高精度空间基准,构建了跨越真实环境的细粒度人-物交互记录。其经典应用场景聚焦于铰接物体操作任务的跨视角学习与力觉融合建模,研究者可利用时空对齐后的多模态流,训练机器人理解抓取过程中施加力的动态分布与物体关节状态的演变规律,从而实现对开瓶、开柜门等日常操作的自适应模仿与泛化。
解决学术问题
该数据集系统性地解决了人-物交互领域长期面临的三大核心学术难题:多传感器异构数据的高精度时空同步、铰接物体操作中力觉信息的定量化锚定,以及跨视角观测下交互动作的语义一致性建模。通过引入Leica激光扫描构建的统一世界坐标系,Hoi!首次在真实环境中实现了第一人称与第三人称视角的刚性对齐,消除了因视角差异导致的动作理解歧义。数据集提供的力/力矩标注使研究者能够定量分析操作过程中的接触力学特性,为构建物理可感知的机器人操作策略提供了稀缺的监督信号。这一工作推动了从视觉主导的行为克隆向多模态、物理鲁棒的技能转移范式进化,其公开的完整处理管线亦为后续研究设立了可复现的基准。
实际应用
Hoi!数据集在工业装配、家庭服务及辅助医疗等实际场景中具有显著应用价值。在工业领域,机器人利用该数据集学习到的铰接物体操作技能可直接迁移至零件组装、工具使用等工序,通过融合力觉反馈实时调整抓取策略以应对公差变化。在家庭服务场景中,服务机器人可基于数据中的跨视角演示,自主完成门柜开合、容器旋拧等日常任务,其力觉锚定的特性有效规避了纯视觉方案在光照或遮挡条件下的决策失效风险。此外,数据集采集的精细交互轨迹为假肢控制与远程操作提供了仿生参考,力触觉时间序列可用于训练肌电信号解码模型,从而提升义肢与人体运动意图的匹配精度。
数据集最近研究
最新研究方向
在机器人与计算机视觉交叉领域,面向具身智能的精细操作研究正从单一视觉模态向多模态融合演进,其中力触觉感知与环境几何结构的联合建模成为突破灵巧操作瓶颈的关键。Hoi!数据集通过同步采集人体与物体交互过程中的Aria眼镜第一人称视角、UMI GoPro手持视角、力/力矩传感器、触觉传感器、iPhone RGB-D及Leica激光扫描等多源数据,并实现跨设备时空对齐,为研究跨视角、力觉接地的人-物交互提供了前所未有的高保真基础。该数据集直接回应了当前具身智能在真实环境中的泛化难题,尤其服务于铰接物体操作、动态交互推理及物理属性学习等前沿方向。其在CVPR 2026的发表标志着力觉信息与视觉-几何信息深度融合研究进入系统化阶段,有望推动机器人从实验室结构化场景向家庭、工业等非结构化环境迁移,对家庭服务机器人及智能制造等领域具有深远的范式革新意义。
以上内容由遇见数据集搜集并总结生成



