遇见数据集

creative-graphic-design/PittImageVideoAdsDataset

收藏
Hugging Face2026-06-28 更新2026-07-22 收录
官方服务:

资源简介:

PittImageVideoAdsDataset 是一个图像和视频广告数据集,随论文《Automatic Understanding of Image and Video Advertisements》发布。该论文报告了64,832张图像广告和3,477个YouTube广告视频,并包含人工标注的主题、情感、口号、说服策略、符号参考以及行动/原因问答。这个Hugging Face版本公开了可以从官方发布文件中重建的标注行。该加载器提供两种配置:1) image_ads:标注的图像广告,其中image列是从官方Google Storage图像ZIP文件加载的datasets.Image特征,image_url保存了相应的匹兹堡源URL作为文本;2) video_ads:包含YouTube视频ID和URL,以及原始标注者响应和清理后的多数投票标签,但不下载视频文件。数据集支持广告理解任务,如主题识别、情感识别、说服策略分析、符号检测和行动/原因响应建模。标注文本和问答响应均为英文。数据集中包含一个train分割,因为上游发布是一个标注语料库,未定义训练、验证或测试分区。

PittImageVideoAdsDataset is an image and video advertising dataset released alongside the paper *Automatic Understanding of Image and Video Advertisements*. The paper presents 64,832 image advertisements and 3,477 YouTube advertising videos, with manually annotated topics, sentiments, slogans, persuasion strategies, symbolic references, and action-reason question-answering pairs. This Hugging Face version makes accessible the annotation lines that can be reconstructed from the officially released files. The included dataset loader provides two configuration options: 1) `image_ads`: annotated image advertisements, where the `image` column is a `datasets.Image` feature loaded from the official Google Storage image ZIP archive, and `image_url` stores the corresponding Pittsburgh source URL as plain text; 2) `video_ads`: containing YouTube video IDs and URLs, alongside raw annotator responses and cleaned majority-vote labels, without downloading the actual video files. The dataset supports a range of advertising understanding tasks including topic recognition, sentiment recognition, persuasion strategy analysis, symbolic detection, and action-reason response modeling. All annotation texts and question-answering responses are in English. The dataset includes a single `train` split, as the upstream released resource is an annotated corpus with no predefined training, validation, or test partitions.

搜集汇总
数据集介绍
creative-graphic-design/PittImageVideoAdsDataset 数据集图片
构建方式
PittImageVideoAdsDataset源自匹兹堡大学团队在CVPR 2017上发表的广告理解研究,旨在推动视觉媒体中说服性信息的自动解析。该数据集通过大规模众包标注方式构建,其中图像广告部分从官方标注JSON文件中提取了64,454条有效路径,结合Google Storage中的原始图像ZIP文件进行关联;视频广告则收录了3,477条YouTube视频,并保留原始众包响应与经多数投票清洗后的标签。数据集的图像下载直接嵌入Hugging Face的Image特征,而视频仅提供ID与URL,未实际获取视频文件。这种设计既保证了标注数据的可复现性,又避免了视频版权分发问题。
使用方法
使用该数据集时,可通过Hugging Face的datasets库按配置加载:调用load_dataset并指定name='image_ads'或name='video_ads'以获取对应子集。图像配置自动下载并解码官方ZIP图片,返回PIL Image对象,同时保留原始URL;视频配置则提供YouTube ID与链接,用户需自行处理视频流。标注字段中,图像部分包含自由文本问答、标语、主题类ID及符号边界框;视频部分则提供原始众包响应与清洗后的数值标签。研究者可根据任务需求选择特定字段,例如利用主题与情感标签进行多标签分类,或使用说服策略与符号框进行细粒度视觉推理。
背景与挑战
背景概述
PittImageVideoAdsDataset是由匹兹堡大学Adriana Kovashka教授团队于2017年创建的大规模广告理解数据集,包含64,832幅图像广告和3,477段YouTube视频广告。该数据集的核心研究问题在于超越传统的物体识别范畴,推动对广告中深层语义的理解,包括广告所倡导的行为、观众应采纳该行为的理由、主题、情感倾向以及说服性视觉策略。作为CVPR 2017发表论文《Automatic Understanding of Image and Video Advertisements》的基石,这个数据集通过众包标注的方式提供了包括主题、情感、标语、说服策略、符号引用及行为/理由问答在内的丰富标注信息,为视觉理解与图形设计交叉领域的研究提供了重要基准资源,显著推动了视觉媒体内容分析和计算广告学的发展。
当前挑战
该数据集致力于解决广告理解领域中的多维语义推理挑战,即如何使模型不仅识别广告中的物体,更能理解其说服性意图、情感诉求和文化符号含义。在数据集构建过程中,研究者面临着多重挑战:首先,广告数据本身分布广泛且复杂,需要从互联网大规模收集并确保质量,最终公开的64,454张标注图像低于论文报告的64,832张,反映出数据对齐与完整性维护的难度;其次,众包标注过程中需要处理自由形式的问答、多选题和符号边界框等多种标注类型,不同标注者之间的一致性和偏见控制成为关键问题;再者,视频广告标注涉及YouTube视频的可用性变化风险,且视频特征提取与帧级别标注的整合也增加了技术复杂性。此外,广告可能包含人物、品牌、政治内容等敏感信息,在保证研究价值的同时需要对隐私和偏见问题进行审慎考量。
常用场景
经典使用场景
在计算广告学与多模态内容理解的交叉领域,PittImageVideoAdsDataset被广泛用作衡量模型对广告视觉叙事与说服策略理解能力的基准。该数据集涵盖图像与视频两种形态的广告样本,每一则广告均围绕主题、情感、标语、说服技巧、符号引用以及行动/理由问答进行了多层次标注。研究者通常利用其图像配置进行静态度量学习,通过识别广告中蕴含的情感基调与主题类别来评估模型的跨模态对齐能力。视频配置则拓展了时序维度的理解任务,要求模型从动态画面中提炼连贯的劝说逻辑与情境感知,从而推动多模态推理从静态物体检测向深层意图理解的范式迁移。
解决学术问题
该数据集的核心学术贡献在于将广告理解从浅层的视觉模式识别推向深层语义与意图推理的维度。在此之前,大部分视觉数据集聚焦于物体检测或场景分类,鲜有涉及广告中隐含的劝说性策略与象征性隐喻。PittImageVideoAdsDataset填补了这一空白,使研究者能够系统性地探究如何从视觉与语言联合信号中自动解构广告设计者的意图——例如判别一条广告是激发行动欲望还是渲染品牌价值。它促进了可解释视觉推理模型的发展,并为情感计算、社会信号处理以及动机建模等方向提供了标准化评价的基石,有效缓解了广告语料因版权分散而难以获取的瓶颈。
实际应用
在实际产业中,该数据集驱动的模型被部署于程序化广告投放与创意内容优化平台。通过自动解析广告中的话题分布与情感倾向,系统能够将不同画像的受众与最适合其心理特征的广告进行匹配,从而提升点击转化率与品牌好感度。在内容审核领域,基于该数据集的工具可检测广告是否使用了偏见性或非伦理的说服策略,辅助平台进行合规性审查。此外,营销分析师借助其行动/理由问答标注挖掘消费者深层动机,指导广告文案与视觉元素的迭代,实现从经验驱动到数据驱动的创意决策转型。该数据集还间接支撑了跨文化广告策略的对比研究,助力全球化品牌调适本地化叙事手法。
数据集最近研究
最新研究方向
在计算广告学与视觉理解交叉领域,PittImageVideoAdsDataset正成为解析广告说服机制的关键基准。前沿研究已超越传统目标识别,转向多模态语义推理任务,包括通过深度神经网络联合建模广告视觉风格与语言修辞,自动解码其隐含的购买诱导策略、情感诉求及符号象征。值得注意的是,该数据集与CVPR 2017开创性工作结合,为应对虚假信息传播与内容操控提供了评估框架,近期热点集中于利用对比学习与视觉-语言预训练模型,从海量广告中提取可解释的劝说模式,进而推动媒体素养自动化分析,其深远意义在于为广告伦理审查与用户心理预测建立可量化的技术路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务