遇见数据集

ise-ice-lab/PSI_VQA

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

PSI-VQA是一个视频问答基准数据集,基于PSI 2.0数据集构建,涵盖行人过马路场景的驾驶员视角行车记录仪视频。该数据集是AI City Challenge 2026 Track 3(驾驶员情境感知)的OOD测试集2。数据集包含四个互补任务:二值过马路问答(BCQ)、开放式问答(Open QA)、多项选择问答(MCQ)和时间定位(Temporal Localization),所有任务均统一遵循tao-vl-reason-v1.0模式(NVIDIA TAR Benchmark格式)。每个数据项将一个短视频片段与一个问题配对,模型需要返回结构化答案。训练集总共有1147个样本,测试集有328个样本。数据集用于评估模型在交通场景中的视觉推理和情境感知能力,仅限于学术和非商业研究使用。

PSI-VQA is a video question-answering benchmark built on the PSI 2.0 dataset, covering egocentric dashcam footage of pedestrian crossing scenarios. It serves as the OOD Test Set 2 for AI City Challenge 2026, Track 3: Driver Situation Awareness. The dataset spans four complementary tasks: Binary Crossing QA (BCQ), Open QA, Multiple Choice QA (MCQ), and Temporal Localization, all unified under the tao-vl-reason-v1.0 schema (NVIDIA TAR Benchmark format). Each item pairs a short video clip with a question, requiring the model to return a structured answer. The training set contains 1147 samples, and the test set has 328 samples. It is designed for evaluating visual reasoning and situational awareness in traffic contexts, restricted to academic and non-commercial research use.

提供机构:
ise-ice-lab
搜集汇总
数据集介绍
ise-ice-lab/PSI_VQA 数据集图片
构建方式
PSI_VQA数据集构建于PSI 2.0基础之上,精选涵盖行人横穿场景的自动驾驶行车记录仪视频片段。数据集围绕行人过街意图这一核心议题,设计了四项互补的视觉问答任务:二值过街问答、开放式问答、多项选择问答以及时间定位。每一项任务均遵循统一的tao-vl-reason-v1.0架构进行标注与组织,其中二值问答任务聚焦于标注者达成明确共识的行人过街意图,开放式与多项选择任务则针对意图模糊场景,通过多元视角捕捉行人的行为线索,时间定位任务则要求模型识别对驾驶员决策产生最大影响的时间区间。所有视频片段按任务类型归类存储,形成清晰的分层目录结构。
特点
该数据集兼具精细的领域针对性与多模态理解挑战性。其显著特点在于对行人过街意图的层次化建模:从明确的二分判断,到开放式的视觉线索列举,再到选项封闭的多项选择,以及精确到亚秒级的时间定位。这一设计不仅覆盖了从简单到复杂的认知推理难度,更通过标注者之间的分歧点巧妙引入了对意图模糊场景的深度探究。数据集完全采用自然语言作为问答与输出的媒介,使模型需同时具备视觉理解、文本生成与时间推理的综合能力,尤其适用于评估自动驾驶场景下对弱势交通参与者行为的细粒度感知与判断。
使用方法
数据集以标准的JSON格式提供训练与测试注释文件,配合指定目录下的视频资源。用户可通过设置media_root路径将视频关联至注释项中的video_id。模型需针对不同任务类型生成指定格式的预测结果,而后整合为包含item_index与prediction两字段的CSV文件提交至AI City Challenge评估服务器。二值问答任务期望输出确切的“Yes”或“No”,开放式问答需返回无序列表形式的视觉线索,多项选择问答要求输出选项字母及完整文本,时间定位则需以JSON字符串形式提供起止时间戳。所有任务可混合排列于单一提交文件中,由统一的评估体系进行自动评分。
背景与挑战
背景概述
PSI_VQA数据集诞生于智能驾驶安全评估领域的前沿探索中,由北卡罗来纳州立大学智能认知工效学实验室于2025年联合多所机构构建,旨在解决行车场景下对行人意图理解这一核心研究问题。该数据集以PSI 2.0为基础,融合了第一视角行车记录仪视频与视觉问答任务,开创性地将行人穿越意图的二元判断、开放性推理、多选理解及时间定位整合于统一基准。作为AI City Challenge 2026第三赛道的官方测试集,PSI_VQA推动了从简单感知到情境理解的范式跃迁,成为评估自动驾驶系统情境意识能力的重要标杆,对提升人机共驾安全具有深远意义。
当前挑战
PSI_VQA所面对的领域挑战在于突破传统视觉问答仅关注静态物体识别的局限,转向对动态行人意图这一高度不确定且依赖于时空上下文的驾驶安全核心问题——尤其在意图模糊时,标注者之间常出现显著分歧,考验模型对细微行为线索(如眼神接触、步态偏移)的精准捕捉与推理能力。构建过程中,研究团队面临双重挑战:既要保证视频片段的质量与代表性,从海量行车数据中筛选出清晰意图与模糊意图两种截然不同的场景,又要设计多维问答模板以覆盖从简单到复杂的认知层次,同时维护与NVIDIA TAR基准一致的统一标注模式,确保跨任务可比较性及评估公平性。
常用场景
经典使用场景
PSI_VQA数据集以行车记录仪拍摄的视角为核心,构建了一个面向行人过街意图理解的视频问答基准。研究者利用该数据集可设计并评估多模态模型在真实交通场景中的行为推断能力,涵盖二分类过街意图判定、开放式视觉线索归因、多项选择意图理解以及时间定位四项子任务。这些任务共同推动了模型从感知到推理的全面能力发展,尤其适用于自动驾驶感知系统和先进驾驶辅助系统的性能验证。
实际应用
在实际应用中,PSI_VQA可被用于训练和测试面向驾驶员的智能预警系统,帮助车辆实时判断行人是否即将横穿道路。例如,接入该数据集的模型可在真实驾驶环境中,通过分析行人的肢体动作、目光接触和道路位置等视觉线索,输出意图判断与关键时间段,从而触发主动刹车或人机交互提醒。此外,其结构化问答格式也为智能座舱内的动态场景理解与语音交互系统提供了宝贵的验证数据。
衍生相关工作
基于PSI_VQA衍生出的相关工作包括AI City Challenge 2026第三赛道中针对驾驶员情境感知的竞赛任务,推动了大规模视频推理模型在交通场景下的性能比拼。该数据集依托NVIDIA TAR Benchmark的统一格式,促进了tao-vl-reason系列评估协议的发展,并为行人意图理解、视频时间定位与多模态问答等方向提供了公开评测基准。研究者在此基础上设计了各类跨模态融合架构与自注意力推理模块,开拓了具身智能在交通交互领域的应用边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务