遇见数据集

MovieNet-PS

收藏
arXiv2023-02-28 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

MovieNet-PS是一个大规模的野外人物搜索数据集,由南京航空航天大学等机构创建。该数据集包含160,000张图像,其中训练集有100,000张,涵盖了3,000个身份,具有高度的场景和身份多样性。数据集从大型电影数据集MovieNet中收集和标注,涉及92,043个场景,展示了人物在不同环境下的多样性,如服装、姿态、光照和尺度等。MovieNet-PS旨在解决更广泛和真实的人物搜索任务,通过提供丰富的上下文信息,推动了人物搜索技术的发展。

MovieNet-PS is a large-scale real-world person search dataset created by institutions including Nanjing University of Aeronautics and Astronautics. This dataset contains 160,000 images, among which the training set has 100,000 images, covering 3,000 identities and featuring high diversity in both scenarios and identities. Collected and annotated from the large-scale movie dataset MovieNet, the dataset involves 92,043 scenarios, demonstrating the diversity of persons in various environments such as clothing, poses, lighting and scales. MovieNet-PS aims to address more comprehensive and realistic person search tasks, and promotes the development of person search technologies by providing rich contextual information.

创建时间:
2021-12-05
搜集汇总
数据集介绍
MovieNet-PS 数据集图片
构建方式
MovieNet-PS 数据集基于大规模电影数据集 MovieNet 构建,从 385 部电影中提取了 92,043 个电影镜头,共计 160,816 帧图像。这些帧涵盖了丰富的场景、人物和事件,避免了隐私问题,因为所有面部图像均属于知名演员。数据集包含 274,274 个边界框和 3,087 个身份,其中训练集包含 100,000 帧,测试集包含 60,816 帧。为了适应不同难度级别的实验,训练集根据每个身份的最大实例数(10、30 或 70)划分为三个子集。
特点
MovieNet-PS 是当前规模最大、多样性最丰富的人物搜索数据集。其场景级多样性体现在 92,043 个独特镜头中,覆盖音乐会、街道、乡村等多种现实场景;身份级多样性则表现为同一身份在姿态、服装、光照和尺度上的显著变化,甚至包括同一人物穿着不同服装的情况。每个身份平均拥有约 56 个实例,来自约 23 个不同镜头,远高于现有数据集。此外,该数据集具有隐私不敏感性,无需模糊面部区域。
使用方法
数据集采用标准的人物搜索评估协议,将 2,087 个身份用于训练,1,000 个身份用于测试。测试时支持不同图库大小(2,000 至 10,000 张图像)以调节难度。评估指标包括平均精度均值(mAP)和 top-1 准确率。研究者可直接使用提供的图像、边界框和身份标签进行模型训练与测试,也可利用其丰富的上下文信息(如场景和群体上下文)来提升搜索性能。代码和预训练模型已公开。
背景与挑战
背景概述
在行人搜索领域,现有数据集多源自监控场景,受限于有限的视角、场景和外观多样性,查询目标常局限于姿态相似、衣着不变的行走行人,这严重制约了模型在真实开放环境中的泛化能力。为突破这一瓶颈,南京航空航天大学、上海交通大学和南京邮电大学的研究团队于2022年基于大规模电影数据集MovieNet构建了MovieNet-PS。该数据集包含16万张图像、27.4万个边界框和3000个身份标识,横跨92,043个电影镜头场景,覆盖音乐会、街道、旷野等丰富现实场景。其核心创新在于实现了场景级与身份级双重多样性:同一身份在电影不同情节中呈现显著姿态、光照、尺度和服装变化,极大模拟了真实世界中行人搜索的复杂性,推动了该领域从狭义监控搜索向广义开放场景搜索的范式转变。
当前挑战
MovieNet-PS所解决的领域挑战在于突破传统行人搜索对监控场景的依赖,应对真实世界中查询图像来源多样(如面部、部分身体、不同传感器捕获)、目标姿态与衣着剧烈变化、以及复杂背景干扰等难题。具体而言,现有方法在该数据集上的表现揭示了三大挑战:其一,跨场景泛化能力不足,模型在监控数据上训练后直接迁移至MovieNet-PS时,mAP仅0.7%,远低于反向迁移的41.5%,凸显了场景多样性的巨大鸿沟;其二,身份内差异极大,同一人物在不同电影中穿着迥异、动作多变,导致传统基于外观一致性假设的模型失效;其三,数据构建本身面临巨大挑战,需从385部电影中精准标注92,043个镜头中的3,087个身份,且需处理遮挡、密集人群和光照突变等复杂条件,标注成本与隐私保护要求极高。
常用场景
经典使用场景
MovieNet-PS作为目前规模最大、多样性最丰富的人物搜索数据集,其经典使用场景在于从自然、未经裁剪的图像中同时定位和识别目标人物。该数据集基于电影帧构建,覆盖了92,043个截然不同的场景,囊括音乐会、大厅、街道和旷野等真实世界环境,并包含同一身份在姿势、衣着、光照和尺度上的显著变化。研究者常利用该数据集训练和评估联合行人检测与行人重识别的模型,以应对更具挑战性的通用人物搜索任务。其海量的图像(160K帧)和丰富的身份标注(3,087个身份)为模拟实际复杂场景提供了坚实的数据基础。
解决学术问题
MovieNet-PS解决了现有监控场景数据集(如CUHK-SYSU和PRW)在视图多样性、场景丰富度和身份内变化上的局限性,推动了人物搜索从受限监控环境向通用、开放场景的学术研究转型。该数据集通过引入场景级和身份级的高多样性,揭示了传统方法在面对复杂背景、衣着多变、姿态各异时的性能瓶颈,从而激发了上下文感知学习等新范式的探索。其跨数据集评估实验表明,在MovieNet-PS上训练的模型具有更强的泛化能力,显著推动了人物搜索领域在真实世界应用中的理论发展。
衍生相关工作
MovieNet-PS的发布催生了一系列经典研究工作,其中最具代表性的是全球-局部上下文网络(GLCNet),该网络通过融合全局场景上下文和局部群体上下文,在MovieNet-PS上将mAP相对提升了34%。此外,该数据集还推动了基于序列化端到端架构的SeqNet方法以及规范感知嵌入(NAE)等技术的改进与评估。跨数据集迁移实验进一步激发了研究者对模型泛化能力的关注,促使后续工作探索更加鲁棒的上下文挖掘策略和注意力机制,从而将人物搜索的学术前沿推向更高水平。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务