Gaze4HRI
收藏资源简介:
Gaze4HRI是由中东技术大学机器人中心构建的大规模视线估计基准数据集,包含52名受试者在人机交互场景下的3,258个视频(约620,933帧)。数据通过机器人腕部摄像头与动作捕捉系统同步采集,涵盖多种光照条件、头部-视线冲突及动态目标等关键变量。该数据集专为评估零样本视线估计方法的鲁棒性而设计,通过模拟共享注视和相互注视任务,填补了现有基准在动态人机交互环境中的空白,为机器人感知、AR/VR等领域的算法开发提供重要支撑。
Gaze4HRI is a large-scale gaze estimation benchmark dataset constructed by the Robotics Center of Middle East Technical University. It contains 3,258 videos (approximately 620,933 frames) from 52 subjects in human-robot interaction scenarios. The data was synchronously collected using a robot wrist camera and a motion capture system, covering key variables such as various lighting conditions, head-gaze conflicts, and dynamic targets. This dataset is specifically designed to evaluate the robustness of zero-shot gaze estimation methods. By simulating shared gaze and mutual gaze tasks, it fills the gap in existing benchmarks for dynamic human-robot interaction environments, providing important support for algorithm development in fields such as robotic perception, AR/VR, and other related areas.
数据集概述:Gaze4HRI
Gaze4HRI 是一个大规模、面向人机交互(HRI)场景的3D视线估计数据集,旨在零样本评估现有视线估计神经网络在HRI条件下的表现。该数据集由土耳其中东科技大学(METU)计算机工程系与ROMER团队的研究人员创建,相关论文发表于FG 2026。
核心规模
- 受试者:52人
- 视频数量:3,258个
- 总帧数:620,933帧
- 总时长:约5.7小时
数据集聚焦
采集设置与硬件
- RGB相机:Intel RealSense D435i,安装在UR5机械臂腕部(模拟机器人感知视角),采集分辨率为1920×1080,帧率为30 FPS。
- 动作捕捉:OptiTrack系统,采样率为100 Hz,用于精确的头部/眼部几何标定。
- 三维视线真值:基于校准后的瞳孔中点位置与已知注视目标位置计算,以相机坐标系下的视线向量形式提供。
- 评估方式:计算预测视线向量与真值视线向量之间的角度误差。
主要数据内容
| 数据文件(每个记录文件夹内) | 说明 |
|---|---|
rgb_video.mp4 |
同步的RGB视频 |
rgb_timestamps.npy |
帧时间戳 |
eye_positions.npy, target_positions.npy |
三维视线真值(视线向量由瞳孔中点指向目标) |
head_poses.npy, camera_poses.npy, camera_intrinsics.npy |
头部姿态、相机姿态与内参 |
ur5_joint_states.npy, ur5_base_pose.npy, table_pose.npy |
机器人状态与桌面几何 |
blink_annotations_by_*.npy |
眨眼标注(用于视线评估时遮挡或用于眨眼检测实验) |
任务覆盖
- 以物体为中心的注视:受试者注视共享桌面上的目标点。
- 相互注视:受试者追踪移动的机器人相机,模拟人与机器人的眼神交流。
实验模块
数据集围绕四种代表HRI典型挑战的实验设计:
- 照明变化(Exp. 1):在四种光照强度(
lighting_10,lighting_25,lighting_50,lighting_100)下测试模型鲁棒性。 - 相机视角变化(Exp. 2):机器人相机沿弧线围绕受试者移动,注视目标保持在桌面固定位置(
circular_movement)。 - 头部-视线冲突(Exp. 3):头部朝向固定,视线方向与之产生不同程度冲突(
head_pose_left,head_pose_middle,head_pose_right)。 - 移动目标/相互注视(Exp. 4):受试者追踪移动的机器人相机,模拟动态目标下的相互注视(
line_movement_slow,line_movement_fast)。
零样本基准测试结果
主要发现
- 最佳模型:基于ETH-X-Gaze训练的PureGaze在大多数HRI条件下表现最稳定。
- 训练数据影响:基于ETH-X-Gaze训练的模型在照明变化、视角变化和头部-视线冲突等条件下表现尤为鲁棒。
- 开放性失败案例:所有模型在处理陡峭向下凝视时表现不佳,这对桌面HRI场景至关重要。
各实验平均角度误差(°,越低越好)
| 模型 | 照明 (Exp.1) | 相机视角 (Exp.2) | 头部-视线冲突 (Exp.3) | 相互注视 (Exp.4.2) |
|---|---|---|---|---|
| PureGaze (E) | 11.4 | 11.1 | 7.3 | 5.3 |
| GazeTR (E) | 11.7 | 14.4 | 8.7 | 10.4 |
| PureGaze (G) | 16.1 | 18.5 | 11.4 | 9.5 |
| GazeTR (G) | 15.3 | 17.8 | 12.9 | 7.4 |
| L2CS-Net (G) | 18.8 | 18.1 | 16.6 | 15.4 |
| MCGaze (G) | 15.2 | 15.6 | 20.2 | 23.3 |
| GaT (G) | 16.7 | 16.1 | 12.1 | 16.4 |
(注:表中 (E) 表示基于ETH-X-Gaze训练,(G) 表示基于Gaze360训练。)
关键实验详情
- 照明 (Exp. 1):PureGaze (E) 与 GazeTR (E) 在所有光照水平下表现稳定,而Gaze360训练的方法对光照更敏感。各模型在不同光照强度下的平均误差及变异系数(CV%)在数据集页面中有详细表格。
- 相机视角 (Exp. 2):PureGaze (E) 在相机移动场景中表现最强,与固定相机设置相比误差增幅很小。
- 头部-视线冲突 (Exp. 3):PureGaze (E) 误差最低;Gaze360训练的方法(尤其是MCGaze)随着冲突增加误差显著增大。
- 以物体为中心的注视 (Exp. 4.1):当注视目标靠近受试者(即视线更陡峭向下)时,所有模型误差增加。距受试者最远的目标行最容易,最近的行最难。PureGaze (E) 在多数目标点上表现最佳。
- 相互注视 (Exp. 4.2):PureGaze (E) 在动态目标下最准确;PureGaze与GazeTR架构对俯仰-偏航偏心模式的鲁棒性优于其他模型。
引用
@inproceedings{sezer2026gaze4hri, title={Gaze4HRI: Zero-shot Benchmarking Gaze Estimation Neural-Networks for Human-Robot Interaction}, author={Sezer, Berk and Küçük, Ali Görkem and Şahin, Erol and Kalkan, Sinan}, booktitle={2026 International Conference on Automatic Face and Gesture Recognition (FG)}, year={2026}, doi={10.5281/zenodo.19710372} }




