遇见数据集

VIABench

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

VIABench是一个全面的以自我为中心视角的视频基准数据集,旨在评估多模态大语言模型在现实世界视觉障碍辅助场景中的性能。数据集收集自盲人录制或分享的真实视频,包含761个视频,总时长46.9小时,并提供了14,526个手动精心标注的样本。它围绕三个核心任务构建:主动提醒(要求模型理解实时视频流,预测对导航关键的事件,并在事件发生前提供及时的语言提醒)、视觉问答(要求模型回答用户提出的关于视频中环境或物体的问题)以及视觉引导交互(评估模型在用户与环境之间完成有意图的交互时,进行上下文感知推理和指导的能力)。这些任务覆盖了视觉障碍辅助中的关键需求,适用于视频到文本生成、场景理解、实时决策支持等研究方向。数据集采用MIT许可协议,主要任务类别为视频-文本到文本。

VIABench is a comprehensive egocentric video benchmark dataset designed to evaluate the performance of multimodal large language models in real-world visual impairment assistance scenarios. The dataset is collected from real videos recorded or shared by blind individuals, containing 761 videos with a total duration of 46.9 hours, and provides 14,526 manually and meticulously annotated samples. It is built around three core tasks: proactive reminding (requiring the model to understand real-time video streams, predict events critical to navigation, and provide timely verbal reminders before events occur), visual question answering (requiring the model to answer user-posed questions about the environment or objects in the video), and visual-guided interaction (evaluating the models ability to perform context-aware reasoning and guidance when users complete intentional interactions with the environment). These tasks cover key needs in visual impairment assistance and are applicable to research directions such as video-to-text generation, scene understanding, and real-time decision support. The dataset is released under the MIT license, with the primary task category being video-text-to-text.

创建时间:
2026-07-14
原始信息汇总

VIABench 数据集概述

基本信息

  • 许可证:MIT
  • 任务类别:视频-文本到文本
  • 所属机构:MCG-NJU

数据集简介

VIABench 是一个面向视觉障碍辅助场景的全面第一人称视频基准数据集,用于评估多模态大语言模型在实际环境中的表现。数据来源于盲人拍摄或分享的视频。

数据集规模

  • 视频数量:761 个
  • 总时长:46.9 小时
  • 标注数量:14,526 条人工精心策划的标注

核心任务

数据集围绕以下三个核心任务构建:

  1. 主动提醒(Proactive Reminder)

    • 评估模型是否能够理解持续的视频流,预测导航中的关键事件,并在事件发生前及时提供口头提醒。
  2. 视觉问答(Visual Question Answering, VQA)

    • 评估模型是否能够回答用户提出的关于视频环境或物体的问题。
  3. 视觉引导交互(Vision-Guided Interaction)

    • 评估模型是否能够进行上下文感知的推理和指导,帮助用户完成与环境的意图性交互。

相关资源

  • 论文:https://arxiv.org/abs/2607.14660
  • 代码仓库:https://github.com/MCG-NJU/VIABench
搜集汇总
数据集介绍
VIABench 数据集图片
构建方式
VIABench是一个面向视觉障碍辅助场景的全面视频基准数据集,由来自南京大学等机构的研究团队构建。该数据集基于视障人士拍摄或分享的第一人称视角视频,经过精心筛选与标注,共包含761段视频,累计时长达46.9小时。每段视频均围绕三大核心任务进行人工标注,总计产生14,526条精细化的注释信息,确保了数据在真实场景中的代表性与实用性。
特点
VIABench的数据集特点主要体现在其独特的收集来源与任务设计上。所有视频均由视障人士在真实生活环境中录制,充分反映了辅助视觉技术所面临的现实挑战。任务涵盖了主动提醒、视觉问答和视觉引导交互三个关键方向,能够全面评估多模态大语言模型在预测导航风险、回答环境问题以及指导用户与环境交互等方面的能力。
使用方法
该数据集适合于研究和评估多模态大语言模型在视觉障碍辅助任务中的表现。使用者可直接从HuggingFace平台下载视频与对应标注文件,按照提供的任务划分进行模型训练或测试。建议研究人员参照论文中的评估协议,将模型在主动提醒、视觉问答和视觉引导交互三项任务上的输出结果与人工标注进行对比,以量化模型在真实辅助场景中的性能。
背景与挑战
背景概述
VIABench是由南京大学媒体计算课题组(MCG-NJU)于2025年创建的一个面向视觉障碍辅助场景的全面第一视角视频基准数据集。该数据集旨在评估多模态大语言模型在真实世界视觉障碍辅助任务中的能力,涵盖了从视障人士录制或分享的第一人称视频中收集的761段视频、总计46.9小时的素材,并包含14526条精心策划的标注。VIABench围绕三个核心任务构建:主动提醒、视觉问答和视觉引导交互,为研究如何利用多模态模型辅助视障人士感知环境、规避危险和完成交互提供了标准化的评测平台,对推动智能辅助技术发展具有重要影响力。
当前挑战
VIABench所解决的领域核心挑战在于:现有视频理解基准多聚焦于通用场景,缺乏针对视障人士特殊需求设计的评测体系,而视障辅助要求模型能够理解第一人称视频流中的环境动态、预测安全隐患并主动提供预警,这对多模态模型的时序感知、场景推理和上下文理解能力提出了更高要求。构建过程中,数据采集面临视频来源多样、拍摄质量参差不齐以及视障人士视角的特殊性等挑战,标注人员需在缺乏视觉经验的条件下准确识别关键事件和交互意图,同时确保14,526条标注在三个任务间的一致性和覆盖度,这些对数据集的质量控制和任务设计构成了显著困难。
常用场景
经典使用场景
VIABench作为首个专为视障辅助场景设计的全景式第一人称视频基准,在评测多模态大语言模型对实时视频流的理解能力方面展现出独特价值。该数据集涵盖761段来自视障人士真实录制或分享的第一人称视频,累计46.9小时时长,并包含14,526条经人工精细标注的样本。其核心任务之一——主动提醒功能,要求模型能够精准预判导航过程中的关键事件,并在事件发生前生成及时的语音提示,这为探究模型的时间推理与前瞻性能力提供了理想测试平台。视觉问答任务则聚焦于模型对环境中物体与空间的属性理解,而视觉引导交互任务进一步考验模型在复杂动态场景中实现用户与环境间有意识交互的上下文感知推理能力。
解决学术问题
该数据集系统性地填补了现有视频理解基准在视障辅助领域的空白,解决了三个关键学术难题:如何验证大模型在真实低视力场景中的时空推理能力、如何评测模型对非结构化动态视频的实时预警能力、以及如何量化模型在辅助人机交互中的上下文感知与引导水平。VIABench通过对第一人称视角下日常出行、环境感知等实际困境的深度建模,揭示了现有多模态大语言模型在应对视障人士特有需求时存在的感知滞后与语义理解偏差。其意义在于推动多模态模型从实验室可控场景向真实无障碍环境的迁移,为构建真正服务于弱势群体的智能辅助系统奠定了评测基础,同时促使研究者重新审视模型在长视频理解与前瞻性决策中的局限性。
衍生相关工作
VIABench的发布催生了一系列相关研究,包括针对第一人称视频中时间敏感事件预测的时序感知模型改进、融合多模态线索的视障辅助问答系统设计,以及基于人类注意力机制的视频摘要方法探索。研究者们受该数据集启发,进一步开发了面向低视力场景的鲁棒特征提取器,并提出了联合优化预警准确性与时效性的损失函数。这些衍生活动不仅丰富了视频理解在辅助技术领域的理论框架,还推动了从通用多模态模型向特定人群需求导向的精细化适配研究,促进了人机交互与计算机视觉交叉领域的创新突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务