遇见数据集

tonyliao-meta/WearVQA

收藏
Hugging Face2025-10-23 更新2025-10-25 收录
官方服务:

资源简介:

WearVQA是一个专为评估多模态AI助手在穿戴设备(如智能眼镜)上的视觉问题回答(VQA)能力而设计的基准。与之前关注高质量第三方视角图像的基准不同,WearVQA反映了第一视角交互的独特挑战,其中视觉输入可能被遮挡、光照不足、未放大或模糊,问题基于现实世界中的穿戴设备使用场景。

WearVQA is the first benchmark specifically designed to evaluate the Visual Question Answering (VQA) capabilities of multi-modal AI assistants on wearable devices like smart glasses. Unlike prior benchmarks that focus on high-quality, third-person imagery, WearVQA reflects the unique challenges of egocentric interaction—where visual inputs may be occluded, poorly lit, unzoomed, or blurry, and questions are grounded in realistic wearable use cases.

提供机构:
tonyliao-meta
搜集汇总
数据集介绍
tonyliao-meta/WearVQA 数据集图片
构建方式
WearVQA数据集专为评估可穿戴设备(如智能眼镜)上多模态AI助手的视觉问答能力而设计。与以往依赖高质量第三人称视角图像的数据集不同,WearVQA从真实世界的第一人称交互场景出发,构建了2520个图像-问题-答案三元组。数据涵盖7个多样化的图像领域(包括文本中心和通用场景)以及10种认知任务类型(从基础识别到复杂推理),并系统引入了6种可穿戴设备特有的图像质量问题,如遮挡、光线不足、模糊等。所有问题均设计为仅凭视觉输入和常识即可回答,并搭配了标注准确率达96%的LLM作为评判的评估框架。
特点
该数据集的核心特点在于其高度贴近真实可穿戴设备使用场景的生态效度。它首次系统性地反映了第一人称视觉交互中的独特挑战,包括图像质量退化、视角不稳定以及任务导向的认知需求。数据集结构清晰,每个样本包含图像、问题、答案、图像领域、任务类型及质量缺陷标签,便于进行细粒度的鲁棒性分析。通过涵盖从文本识别到空间推理的多样化任务,WearVQA为衡量多模态大语言模型在非理想视觉条件下的综合表现提供了严谨的基准。
使用方法
使用WearVQA数据集时,研究者可直接加载HuggingFace上的数据,每个样本包含RGB图像、自然语言问题及其标准答案。该数据集主要支持视觉问答任务,特别适合评估模型对可穿戴设备特有图像质量问题的鲁棒性。用户可依据'domain'、'task_type'和'quality_issue'字段进行子集划分,以针对性测试模型在不同认知任务或退化条件下的性能。官方还提供了基于LLM评判的自动评估流程,便于高效复现和比较结果,并设有公开排行榜供社区提交模型表现。
背景与挑战
背景概述
在可穿戴设备与多模态人工智能深度融合的浪潮中,视觉问答(VQA)技术正从实验室走向真实世界,然而现有基准如VQA v2.0等大多基于高质量、第三人称视角的图像,难以反映智能眼镜等设备在自我中心(egocentric)交互场景下的独特挑战。由Meta Reality Labs的Eun Chang、Zhuangqun Huang、Yiwei Liao等研究人员于2025年在NeurIPS数据集与基准轨道上发布的WearVQA数据集,正是为填补这一空白而生。该数据集包含2,520个图像-问题-答案三元组,覆盖7种图像域(包括文本密集场景)与10种认知任务类型,旨在评估多模态AI助手在遮挡、光线不足、模糊等常见穿戴式图像质量问题下的推理能力。WearVQA的推出标志着VQA研究从理想化设定向真实穿戴场景的关键跨越,为开发更鲁棒的自我中心视觉助手提供了标准化测试平台。
当前挑战
WearVQA所应对的核心挑战首先在于领域问题的复杂性:传统VQA基准忽视的自我中心视觉输入常伴随运动模糊、光照不均、部分遮挡及未缩放等六类典型质量缺陷,这些问题严重干扰模型对场景的准确理解,尤其对文本识别与细粒度推理构成严峻考验。其次,在数据集构建层面,团队面临如何设计真实且可回答问题的挑战——所有问题需仅依赖图像与常识,避免先验知识偏差,同时确保10种认知任务类型(从基础识别到复杂逻辑推理)的均衡分布。此外,为评估模型在低质量图像上的表现,需人工标注并系统引入各类质量退化,这对标注一致性与数据规模间的平衡提出了极高要求,最终通过LLM-as-a-judge框架实现了96%的标注准确率,但如何进一步扩展数据规模与场景多样性仍是未来挑战。
常用场景
经典使用场景
WearVQA作为首个专为可穿戴设备设计的视觉问答基准,其最经典的使用场景在于评估多模态AI助手在智能眼镜等第一人称视角设备上的视觉理解与问答能力。该数据集包含2520个图像-问题-答案三元组,覆盖从文本密集型场景到通用场景的7种图像领域,并设计了10种认知任务类型,从基础识别到复杂推理,全面模拟用户在真实世界中的交互需求。通过引入6种可穿戴设备特有的图像质量问题(如遮挡、光照不足、模糊等),WearVQA为研究者提供了一个极具挑战性的测试平台,用以衡量模型在非理想视觉条件下的鲁棒性。这一场景尤其适用于对比不同规模的多模态大语言模型在自我中心视觉推理上的表现。
解决学术问题
在学术研究层面,WearVQA解决了传统VQA基准与可穿戴设备实际应用之间的鸿沟问题。先前的工作多依赖于高质量的第三人称图像,忽视了自我中心视角下视觉输入的不确定性,而WearVQA系统性地填补了这一空白。该数据集促进了针对可穿戴设备特有图像质量退化问题的鲁棒性研究,推动了模型在遮挡、运动模糊、低光照等挑战下的视觉推理能力提升。此外,其配套的LLM-as-a-judge评估框架以96%的标注准确率为基准测试提供了可靠保障,使得研究者能够更精确地比较不同模型在真实场景中的认知表现。这一贡献对于理解多模态AI在移动、交互和辅助环境中的局限性具有深远意义。
衍生相关工作
WearVQA的发布催生了一系列相关研究工作。首先,它激励了针对自我中心视觉的多模态大语言模型微调策略研究,例如如何利用其标注数据提升模型在遮挡和光照变化下的泛化能力。其次,该数据集推动了可穿戴设备专用图像质量增强与视觉推理联合优化框架的发展,研究者开始探索将去噪、去模糊模块与VQA模型端到端集成。此外,WearVQA的评估框架被借鉴用于构建其他自我中心视觉任务(如目标检测、动作识别)的鲁棒性基准。该工作还引发了关于可穿戴AI助手伦理与隐私的讨论,促使学界关注如何在真实场景中平衡模型性能与用户数据保护。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务