HandVQA
收藏资源简介:
HandVQA是由蔚山科学技术院等机构联合开发的大规模诊断性基准数据集,专注于评估视觉语言模型对手部细粒度空间关系的理解能力。该数据集基于FreiHAND、InterHand2.6M和FPHA等高质量3D手部数据集构建,包含160万个控制性多选题,涵盖手部关节角度、距离和三维相对位置等空间关系。通过自动化流程将3D关节坐标转化为结构化自然语言问题,数据集支持机器人手术、AR/VR交互等需要精确手部姿态理解的场景,其零样本迁移能力在手势识别任务中实现了10.33%的准确率提升。
HandVQA is a large-scale diagnostic benchmark dataset co-developed by institutions including Ulsan National Institute of Science and Technology (UNIST) and other organizations, focusing on evaluating the capability of visual language models to understand fine-grained spatial relationships of hands. Built on high-quality 3D hand datasets such as FreiHAND, InterHand2.6M and FPHA, this dataset contains 1.6 million controlled multiple-choice questions covering spatial relationships including hand joint angles, distances and 3D relative positions. By converting 3D joint coordinates into structured natural language questions via an automated pipeline, the dataset supports scenarios requiring precise hand pose understanding such as robotic surgery, AR/VR interaction and other related application fields. Its zero-shot transfer capability achieves a 10.33% accuracy improvement in gesture recognition tasks.
HandVQA 数据集概述
数据集基本信息
- 数据集名称:HandVQA
- 发布会议:CVPR 2026
- 论文标题:HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
- 论文地址:https://arxiv.org/abs/2603.26362
- 核心目标:诊断并提升视觉语言模型(VLMs)对精细手部三维几何的空间推理能力。
数据集构建与规模
- 数据来源:基于高质量的三维手部数据集构建,包括 FreiHAND、InterHand2.6M 和 FPHA。
- 问题规模:包含超过 160 万(1.6M+)个受控的多项选择题。
- 问题生成:问题由三维关节坐标确定性地生成,并渲染为自然语言的多项选择选项,确保明确的几何基础。
评估任务与类型
HandVQA 评估五种类型的手部空间理解任务:
- 角度:评估手指弯曲角度,分为四类(完全向内弯曲、向内弯曲、轻微向内弯曲、伸直)。
- 距离:评估关节间距离,分为三类(接近、分开、广泛分开)。
- 相对位置 X:评估左右关系(左侧、右侧)。
- 相对位置 Y:评估上下关系(上方、下方)。
- 相对位置 Z:评估前后关系(前方、后方)。
关键特性与贡献
- 诊断针对性:针对姿势幻觉问题,探测关节级别的空间错误。
- 关注部分-整体关系:专注于单个对象(手)内部的部分-整体空间关系,而非对象间关系。
- 三维坐标基础:所有问题均基于真实的三维坐标,测试欧几里得概念。
- 结构化几何理解:评估标准 VQA 基准中 largely missing 的诊断轴。
- 大规模覆盖:涵盖 100+ 关节组合和 5 种空间推理类型。
主要发现
- 精细关节理解具有挑战性:即使是强大的视觉语言模型也难以理解细微的手指弯曲和关节姿势。
- 距离推理存在系统性偏差:基础模型经常默认选择视觉上看似合理的“接近”预测。
- 方向性空间推理提升显著:左右、上下、前后等关系通过明确的 3D 基础训练得到显著改善。
- 支持零样本迁移:从 HandVQA 学习到的空间知识可以零样本迁移到下游任务,提升手势识别(+10.33%)和手-物体交互识别(+2.63%)的性能。
- 改善置信度校准:微调后的模型在获得更高准确率的同时,表现出更可靠的置信度估计。
基准测试模型
评估了最先进的视觉语言模型,包括 LLaVA、DeepSeek、Qwen-VL 等,涵盖基础版本和 LoRA 微调设置。

- 1HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models蔚山科学技术院; 阿伯丁大学; 伦敦大学学院; Fogsphere (Redev.AI Ltd) · 2026年



