遇见数据集

EgoPolice

收藏
arXiv2026-07-08 更新2026-07-09 收录
官方服务:

资源简介:

EgoPolice是由普林斯顿大学与宾夕法尼亚大学联合创建的、专注于高风险执法场景的基准数据集,旨在填补第一人称视角视频理解在真实世界复杂环境中的研究空白。该数据集包含超过180小时、总计2684段源自美国多地警察部门公开执法记录仪的真实视频,涵盖了从日常对话到枪击事件等多种警民互动场景,并以每秒粒度标注了9类关键行为标签。数据集的构建过程采用了多阶段标注流程与客观行为定义,通过严格的人工审核确保标注质量,并特别设计了针对标注者心理健康的保护机制。该数据集主要应用于评估视频理解模型在剧烈运动、遮挡及低光照等挑战性条件下的鲁棒性,并为开发大规模执法视频自动化分析工具提供基础,以支持高效的警务监督与行为研究。

EgoPolice is a benchmark dataset focused on high-risk law enforcement scenarios, jointly created by Princeton University and the University of Pennsylvania, aiming to fill the research gap in first-person video understanding within real-world complex environments. This dataset contains over 180 hours of real-world video footage totaling 2684 segments, sourced from publicly available body-worn camera recordings from multiple police departments across the United States. It covers a diverse range of police-civilian interaction scenarios, ranging from daily conversations to shooting incidents, and is annotated with 9 categories of key behavioral labels at a per-second granularity. The dataset construction adopts a multi-stage annotation workflow and objective behavioral definitions, ensures annotation quality via strict manual review, and incorporates dedicated protection mechanisms for the mental health of annotators. This dataset is primarily used to evaluate the robustness of video understanding models under challenging conditions such as intense motion, occlusion and low-light environments, and serves as a foundational resource for developing large-scale automated analysis tools for law enforcement videos, supporting efficient police supervision and behavioral research.

创建时间:
2026-07-08
原始信息汇总

数据集名称

EgoPolice

数据集简介

EgoPolice 是一个面向高风险警察随身摄像头视频的自我中心视频理解基准数据集。该数据集包含超过180小时的真实自我中心警察与平民互动视频,源自在多个美国警察部门公开可用的随身摄像头录像。

数据规模

  • 总时长:超过180小时
  • 注释粒度:逐秒标注

任务与支持

  • 支持动作分类的监督学习
  • 支持视频-语言模型的零样本评估

动作类别(共9类)

角色 动作 定义
BWC佩戴者 身体接触 佩戴摄像头的警察触摸平民
BWC佩戴者 医疗处理 佩戴摄像头的警察用手触摸平民,且直接参与治疗
BWC佩戴者 武器出鞘 视频中显示佩戴摄像头的警察持有枪支
BWC佩戴者 奔跑 摄像头剧烈晃动,警察快速前进或后退
其他警察 身体接触 其他警察触摸平民
其他警察 医疗处理 其他警察用手触摸平民,且直接参与治疗
任意警察 戴手铐 任何警察试图或正在使用手铐,手铐清晰可辨
平民 明显受伤 平民有明显伤口或流血
平民 在地面 平民坐、跪或躺在地面上

数据文件格式

videos.txt

  • 包含所有需要下载的视频列表。
  • 格式:video_id, 视频URL, 起始秒, 结束秒
  • 若使用完整视频,起始/结束秒设为-1。

classification.json

  • 提供每个视频片段的逐秒动作标签。
  • 顶级键:
    • labels:将video_id映射到9个二进制向量,每个向量长度为片段时长(秒)。
    • idx_to_class_name:将0–8的类别索引映射到动作名称。
    • training_folds:6折交叉验证划分,包含trainvalid-testood-l (pasadena)ood-t (copa)
    • metadata:文件格式的简要描述。

*mcq_s.json

  • 包含多项选择题(MCQ)基准测试的问题。
  • 每条记录包含问题ID、视频ID、起止时间、问题文本、选项列表和正确答案索引。

数据获取

需要提交申请获取数据集,申请链接:数据集访问申请

引用

bibtex @inproceedings{egopolice, title={EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage}, author={Gonzalez Saez-Diez, Max and Chung, Jihoon and Wolsky, Adam D. and Lanzalotto, Greg and Knox, Dean and Mummolo, Jonathan and Stewart, Brandon M. and Russakovsky, Olga}, booktitle = {European Conference on Computer Vision (ECCV)}, year={2026}, }

搜集汇总
数据集介绍
构建方式
EgoPolice数据集精心采集自美国多个执法机构公开的执法记录仪视频,主要来源包括芝加哥警察局(经民事警察问责办公室发布)、帕萨迪纳警察局等五所警局以及独立新闻网络。研究团队筛选出对警务行为研究至关重要的警察与平民互动行为,采用两阶段流水线进行标注:第一阶段由三名独立标注员标记包含可见互动的视频时间戳,第二阶段则对筛选出的交互片段以每秒为粒度进行九类动作的精细标注。标注定义基于客观可观察标准,避免主观意图推断,并由至少两名标注员对高质量来源视频进行交叉验证,确保标注一致性与可靠性。
特点
该数据集具有三大显著特点。首先,视频包含极端且不规则的相机运动、严重的遮挡与低光照条件,以及密集的人际交互,这些挑战使得常规视频模型难以应对,尤其是'武器出鞘'等高危动作即使在最先进的模型中仍错误频发。其次,数据集中的动作类别(如'平民受伤'、'手铐使用')之间缺乏显著的全局外观区分信号,模型无法依赖场景线索进行捷径学习,必须通过细粒度的时空理解来正确分类。最后,EgoPolice涵盖了从日常对话到枪击急救等完整光谱的警民互动,但真实地偏向于高风险的重大事件,这使其成为评估模型在极端复杂真实场景中鲁棒性的严苛基准。
使用方法
EgoPolice支持两种主要的评估范式:有监督分类与零样本多项选择问答。在分类任务中,研究者可利用标准嵌入模型作为冻结的特征提取器,在其表示之上训练轻量级分类头,并在视频片段长度为1秒、10秒和1分钟三种窗口设置下进行性能评估,数据集提供了六折交叉验证的规范分割。在零样本问答范式中,数据集包含12,000道精心构建的单项选择题,每道题提供一个正确答案与四个干扰项,用于测试视频-语言模型(VLM)在无需微调情况下的语义理解能力。所有模型均在固定提示模板下进行评估,以公正衡量其在高风险执法场景中的视频理解潜力。
背景与挑战
背景概述
EgoPolice数据集由普林斯顿大学与宾夕法尼亚大学的研究团队于2026年联合创建,旨在填补第一人称执法视频理解领域的空白。随着执法记录仪(BWC)的广泛应用,海量警民互动视频亟待智能化分析,然而现有数据集多聚焦于日常场景,忽视了执法情境中快速运动、严重遮挡及罕见高风险事件的特殊性。该数据集从芝加哥、洛杉矶等多个警察局及新闻机构收集了超过180小时的真实执法记录仪视频,标注了9种关键的警民交互行为,如“武器暴露”、“手铐使用”等,为评估和推动视觉模型在高风险第一人称场景中的鲁棒性提供了首个标准化基准,对执法监督、公共安全研究具有深远影响。
当前挑战
EgoPolice数据集面临的挑战涵盖领域问题与构建过程两个层面。首先,它所解决的领域核心挑战在于:执法记录仪视频具有极端的第一人称运动(如追捕时剧烈晃动)、视觉线索单一(大量场景为街道、车辆内部等相似环境)以及高风险动作罕见且易混淆等特性,导致现有视频模型在区分“公民受伤”与“武器暴露”等细微动作时表现不佳,即便是顶尖模型(如Gemini 2.5 Pro)在长视频中的准确率也仅达76.9%。其次,构建过程中遇到的关键挑战包括:数据来源于多个机构且编辑程度不一,需大量预处理;标注涉及血腥、暴力内容,需设计专门的心理健康保护机制;高风险动作的定义需排除主观意图并确保标注一致性,最终通过多阶段流程与客观定义实现了79.4%的标注者间一致性。
常用场景
经典使用场景
在执法记录仪视频分析领域,EgoPolice数据集的核心应用在于评估和提升视频理解模型在复杂、高风险的警民互动场景中的性能。该数据集提供了真实的、以自我为中心的视角,涵盖从日常对话到武器对峙等九种关键行为标签,并以秒级粒度进行精确标注。研究者可以在此基准上对各类视频模型进行标准化测试,尤其关注模型在高强度镜头运动、严重遮挡和罕见高风险事件下的表现,从而推动运动鲁棒性和上下文感知的自我中心感知技术的发展。
衍生相关工作
EgoPolice的发布催生了一系列旨在提升高风险场景视频理解能力的研究工作。一方面,它激发了针对极端运动条件下的视频表征学习新方法,例如发展和改进融合外观与运动信息的模型架构(如VideoMAE V2),以应对执法记录仪特有的剧烈抖动和模糊。另一方面,该数据集推动了面向零样本迁移的视觉-语言模型(VLM)评估基准研究,其多选问答任务设计使得Gemini、GPT-4系列等顶级模型能够被严格测试。此外,它还促进了关于数据标注伦理与安全性(如避免替代性创伤)的研究,其多阶段、高客观性的标注流程为未来构建同类敏感数据集提供了可借鉴的范式。
数据集最近研究
最新研究方向
当前,EgoPolice数据集的核心研究方向聚焦于高压力、真实世界执法场景下的第一人称视频理解,尤其关注在极端运动、低光照、严重遮挡及视觉歧义等挑战性条件下,模型对罕见高危事件(如“武器拔出”)的精准识别能力。该数据集不仅系统评测了从传统分类器到前沿视觉语言模型(如Gemini 2.5 Pro)的性能边界,揭示了现有顶尖模型在自主执法分析中的可靠性不足,更推动了运动鲁棒性表示学习与情境感知理解的发展。其深远意义在于为警察随身摄像头视频的大规模、自动化审计提供了标准化基准,促使研究社区正视并攻关AI在敏感领域中部署时的伦理、安全与偏见问题。
相关研究论文
  • 1
    EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage普林斯顿大学; 宾夕法尼亚大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务