MCG-NJU/VIABench
收藏官方服务:
资源简介:
VIABench是一个综合性的以自我为中心的视频基准,用于评估多模态大语言模型在现实世界视觉障碍辅助场景中的表现。该数据集收集自盲人录制或分享的视频,包含761个视频、46.9小时的镜头,以及三个核心任务(主动提醒、视觉问答和视觉引导交互)的14,526个手动策划的标注。
VIABench is a comprehensive egocentric video benchmark for evaluating multimodal large language models in real-world visual impairment assistance scenarios. Collected from videos recorded or shared by blind individuals, VIABench contains 761 videos, 46.9 hours of footage, and 14,526 manually curated annotations across three core tasks (Proactive Reminder, Visual Question Answering, and Vision-Guided Interaction).
提供机构:
MCG-NJU搜集汇总
数据集介绍

构建方式
VIABench数据集专为评估多模态大语言模型在视障辅助场景中的表现而构建,其视频素材全部由盲人个体录制或分享,确保了数据来源的真实性与场景的贴近性。数据集包含761段第一人称视角视频,总时长46.9小时,并经过人工精细标注,涵盖14,526条标注信息。围绕三个核心任务——主动提醒、视觉问答与视觉引导交互——进行系统性组织,旨在全面衡量模型在实时视频流理解、环境问答及上下文感知引导等方面的能力。
特点
VIABench数据集的核心特色在于其高度的生态效度与任务全面性。所有视频均源自盲人真实生活场景,而非模拟或脚本拍摄,这使得评估结果更能反映模型在实际辅助中的表现。数据集设计了三项互有侧重的任务:主动提醒考验模型对导航关键事件的预判能力;视觉问答检验模型对用户问题的应答能力;视觉引导交互则评估模型在用户与环境互动中的推理与引导水平。三者共同构建起一个立体化的性能评估框架。
使用方法
使用VIABench时,研究者可依据论文中定义的评估协议,将多模态大语言模型应用于其视频数据与对应标注,分别在三项任务上进行测试。数据集已公布于HuggingFace平台,并附带开源代码库,便于直接下载与复现。使用者需注意,由于视频为第一人称视角且内容涉及视障人群的日常生活,处理时需尊重数据隐私与伦理规范。建议结合官方基准与评价指标进行模型性能的标准化比较。
背景与挑战
背景概述
视觉障碍辅助是人工智能领域亟待突破的重要方向,旨在通过多模态感知技术提升视障人士的独立生活能力。VIABench数据集由南京大学媒体计算组(MCG-NJU)于2025年创建,收录了来自视障个体录制或分享的761段自我中心视角视频,总时长46.9小时,包含14,526条精细标注。该数据集聚焦于三个核心任务:主动提醒、视觉问答和视觉引导交互,旨在评估多模态大语言模型在真实视觉障碍辅助场景中的表现。VIABench的出现填补了该领域缺乏真实、全面评估基准的空白,推动了面向视障辅助的具身智能研究发展。
当前挑战
VIABench所解决的领域核心挑战在于,当前多模态模型在应对视障人士真实需求时,往往缺乏对自我中心视频中动态环境与关键事件的深度理解。具体挑战包括:1)主动提醒任务要求模型具备前瞻性推理能力,能够从持续视频流中预判导航危险并及时生成语音预警;2)视觉问答需应对视障用户提出的非典型、上下文依赖的查询,处理模糊或低质量视频输入;3)视觉引导交互考验模型在复杂空间语境中提供精准操作指引的能力。在构建过程中,挑战源于收集真实视障群体视频的伦理许可、标注质量把控及长视频时序依赖的细粒度注释,确保数据真实反映辅助场景的复杂性。
常用场景
经典使用场景
VIABench作为一个多模态大语言模型评测基准,其经典使用场景聚焦于视障辅助技术的前沿验证。该数据集以视障者第一人称视角拍摄的761段视频为核心,涵盖46.9小时真实生活素材,通过14,526条精心标注的样本,系统性评估模型在主动提醒、视觉问答和视觉引导交互三大任务上的表现。研究者可借此基准测试模型对连续视频流的理解能力、环境风险预判准确性以及人机协作的上下文推理水平,从而推动更安全、更可靠的智能辅助系统迭代。
实际应用
在实际应用中,VIABench直接服务于视障辅助设备的智能升级。基于该数据集训练的模型可嵌入智能眼镜或手机应用,实时识别交通信号、楼梯边缘等环境障碍,并通过语音提前发出警示。同时,模型能够解答用户关于周边物体的疑问,例如描述前方食物的颜色或识别橱窗内的商品标签。在复杂场景下,系统还能指导用户完成取物、开门等交互动作,精准理解手部朝向与目标物位置关系,显著提升视障人士日常出行的独立性和安全性。
衍生相关工作
VIABench的发布催生了一系列视障辅助领域的创新研究。核心衍生工作包括基于该基准的主动提醒算法优化,探索如何利用时空注意力机制提前预测跌倒风险;以及面向渐进式视觉问答的多模态推理模型,通过视频片段动态聚焦关键物体。此外,研究者围绕视觉引导交互任务发展了结合触觉反馈的动作规划网络,实现了用户意图与环境约束的协同建模。这些工作共同推动了可穿戴计算与包容性AI的交叉融合,为下一代智能助盲系统的落地提供了方法论基石。
以上内容由遇见数据集搜集并总结生成



