遇见数据集

PaSBench-Video

收藏
arXiv2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

PaSBench-Video是由香港中文大学·深圳与清华大学联合创建的前瞻性视频安全预警评测基准,旨在评估多模态大语言模型在连续视频流中进行实时风险识别与预警的能力。该数据集包含740个视频样本,涵盖驾驶、医疗保健、日常生活及工业生产四大领域,每个风险视频均标注了帧级风险起始点与事故发生点,以支持时序精准度评估。数据通过融合公开真实视频与合成渲染技术构建,并经过严格的模型与人工双重筛选流程,确保风险的可预测性与视觉可辨识性。该数据集主要应用于主动安全监控系统研发,旨在解决现有模型在动态场景中因依赖表面线索而导致的误报率高与预警时机不准等核心问题。

PaSBench-Video is a prospective video safety warning evaluation benchmark jointly developed by The Chinese University of Hong Kong, Shenzhen and Tsinghua University, aiming to assess the capabilities of multimodal large language models (LLMs) to conduct real-time risk identification and early warning in continuous video streams. This dataset contains 740 video samples covering four core domains: driving, healthcare, daily life, and industrial production. Each risk video is annotated with frame-level risk start points and accident occurrence points to support temporal precision evaluation. The dataset is constructed by integrating publicly available real-world videos and synthetic rendering technologies, and has undergone strict dual screening processes including model-based validation and manual review, to ensure the predictability and visual recognizability of the included risks. This dataset is primarily utilized for the development of active safety monitoring systems, with the goal of addressing key challenges faced by existing models in dynamic scenarios, such as high false alarm rates and imprecise warning timing caused by over-reliance on superficial cues.

创建时间:
2026-06-02
原始信息汇总

PaSBench-Video 数据集概述

PaSBench-Video 是一个用于主动安全与风险预判的视频基准数据集。每个样本包含一段视频及其对应的帧/时间标注和经过审核的风险响应提示。

数据集结构

  • metadata.csv:Hugging Face VideoFolder 元数据,file_name 列指向视频文件。
  • videos/:481 个精选视频文件,按原始来源数据集分组。
  • annotations/final_annotations.json:经过清洗的公开标注文件,用于生成 metadata.csv
  • annotations/label_schema.json:字段说明与数值分布。
  • annotations/excluded_from_legacy_495.txt:旧版 495 文件包中存在但最终 481 版中排除的视频列表。

数据规模

  • 视频总数:481
  • 总字节数:4,064,785,884
  • 各来源视频数量
    • DADA:105
    • healthbench:33
    • industry:46
    • nexar:96
    • oops:71
    • radsv:17
    • smarthome:113

字段说明

  • sample_id:稳定的 PaSBench 样本标识符。
  • dataset:原始来源数据集/领域。
  • risk_start_time_sec:预判风险开始时间(秒)。
  • accident_time_sec:不良事件或损失开始时间(秒)。
  • risk_reason:经审核的风险原因文本(优先使用修正版,否则使用原始文本)。
  • recommended_user_action:经审核的建议行动文本(优先使用修正版,否则使用原始文本)。
  • file_name:指向视频文件的 VideoFolder 技术键。

注意事项

最终精选集包含 481 条记录。旧版包描述中提及的 495 个视频属于遗留元数据;本次上传遵循最终审核的 481 版标注文件。

许可证与标签

  • 许可证:cc-by-nc-4.0
  • 标签videosafetyrisk-anticipationaccident-anticipation
搜集汇总
数据集介绍
PaSBench-Video 数据集图片
构建方式
在视频安全预警领域,现有基准依赖静态输入,忽略了时序精度且缺乏对安全场景的误报度量。PaSBench-Video的构建从四大领域(驾驶、医疗、日常生活、工业生产)采集候选视频,包括公开的真实数据集和通过文生视频工具合成的医疗与工业场景。每段视频需通过双重过滤:先由两个基础模型依据可预测性、可规避性、非故意性和视觉可定位性四个标准独立筛选,再由人工审核确认保留。通过过滤的视频由标注人员标注风险起始帧、事故帧、风险来源和规避动作,最终形成包含481个风险视频和259个无风险视频的基准。
特点
该数据集的核心特点在于其精细的帧级标注与流式评估协议的结合。每个风险视频标注了风险起始与事故边界,并保留了可干预的时间窗口,使得模型预警的时序精度成为可量化指标。数据集专门设置了无风险子集用于测量假阳性率,弥补了现有基准对误报评估的缺失。评估指标采用渐进严格的金字塔体系,从原始检测到时序校准再到内容准确度,能够精准定位模型在不同环节的失败模式。此外,数据集覆盖四个差异显著的领域,揭示了模型在驾驶等常规与危险场景视觉相似的领域表现尤为薄弱。
使用方法
使用PaSBench-Video时,模型需以因果流式方式处理视频,即仅观测过去与当前帧,并在每个滑动窗口做出预警决策。视频被分割为3秒窗口,步长为0.3秒,模型需输出结构化响应,包含是否预警、风险等级、规避动作及更新后的状态摘要。评估在风险视频上持续至事故时刻,在无风险视频上运行至结束。指标包括Any-Det(检测到风险)、Any-Hit(在风险窗口内预警)、First-Hit(首次预警时序正确)和First-Act(内容准确且时序正确),通过比较这些指标间的差距,可诊断模型在时序定位与风险源识别上的具体不足。
背景与挑战
背景概述
PaSBench-Video由香港中文大学(深圳)与清华大学的研究团队于2026年构建,旨在填补多模态大语言模型在主动安全预警评估领域的关键空白。该数据集聚焦于一个核心研究问题:模型能否在事故发生前的关键时间窗口内,基于连续视频流发出及时且准确的安全警告。相较于依赖静态输入的现有基准,PaSBench-Video率先引入了流式评估协议、时间校准指标以及对安全场景假阳性的系统度量。其涵盖驾驶、医疗、日常生活与工业生产四大领域的740个视频,为评估模型在真实动态环境中的风险推理能力提供了首个标准化测试平台,对推动主动安全预警系统从学术研究向实际部署过渡具有重要指导意义。
当前挑战
该数据集所解决的核心领域挑战在于多模态大语言模型在主动安全视频预警方面的能力缺失——现有模型普遍依赖场景级活动线索进行判断,而非对风险是否正在升级为伤害进行因果推理。实验显示,即便在最严格指标下,所有13个测试模型的表现均未超过20.0%,且召回率与假阳性率之间存在强正相关(Pearson ρ=0.64),表明模型仅通过调整预警阈值来权衡检测与误报,而非真正理解风险。在构建过程中,研究者面临着多方面的挑战:需要从真实与合成数据源中筛选出视觉可预测、可干预且非故意的风险视频,这一过程淘汰了约70%的原始候选;此外,还需对保留视频进行帧级人工标注,包括风险起始帧、事故帧、风险源及规避动作,并在标注质量把控中通过联合审查排除了14个低置信度样本,最终形成了481个风险视频与259个无风险视频的均衡数据集。
常用场景
经典使用场景
在视频安全预警的研究疆域中,PaSBench-Video凭借其帧级别风险起始与事故边界的精细标注,成为评估多模态大语言模型在流式视频环境中主动安全警告能力的黄金基准。该数据集囊括驾驶、医疗、日常生活及工业生产四大领域,涵盖740段视频,其中481段蕴含风险、259段为无风险场景,专为检验模型在因果观测约束下,是否能在风险窗口内发出兼具时间校准与内容正确性的预警而设计。研究者通过流式推理协议,迫使模型仅依赖历史与当前帧进行决策,从而精准衡量其从视觉线索中捕捉正在演化的危险并提前干预的能力。
解决学术问题
PaSBench-Video直面当前安全基准测试中静态输入、忽视时间精度及缺乏误报评估三大核心缺陷。它首创性地引入时间校准与内容归因的层级化指标,从粗检测到精细计时并确认风险源,层层剥离模型失败根源。实验揭示,13种主流MLLM在最严格指标上均未突破20.0%,且召回率与误报率呈强正相关,表明模型仅依赖场景活动线索而非真正的风险推理。这一发现颠覆了传统认知,为学界指明了从活动检测迈向风险预判这一亟待突破的研究方向,并提供了坚实的测试平台。
衍生相关工作
PaSBench-Video的诞生深刻影响了视频理解与安全预警的交叉研究,催生了一系列后续探索。其流式评估协议与时间校准思想直接启发了在线视频理解基准的工作,促使学界开始关注模型在连续观测下的决策动态。同时,该数据集揭示了模型在辨别日常场景与潜在危险上的视觉判别瓶颈,这驱动了面向可解释风险推理、时序轨迹建模及跨域泛化的新型算法设计。此外,针对其发现的高误报率难题,研究者开始探索基于因果推理的风险识别框架,以打破当前模型依赖表面线索的局限,推动真正意义上的风险预判技术进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务