遇见数据集

UCF101-AD

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

UCF101-AD是一个大规模的动作否定基准数据集,旨在评估视频多模态大语言模型在存在误导性上下文和运动线索的情况下,能否正确拒绝视频中实际不存在的动作。该数据集从公开的YouTube视频中提取了短视频片段,专门用于研究、教育和非商业目的。根据其声明,该数据集的使用符合美国版权法第107条关于合理使用的规定,因其具有转换性、仅使用有限部分、非商业意图且服务于公共利益,不会替代原始作品。数据集不主张对原始内容的所有权,版权仍归原持有者所有。数据集以“原样”形式提供,不附带任何担保或责任。使用者需遵守隐私和伦理准则,避免用于有害用途,若认为权利受到侵犯可联系发起方提出下架请求。

UCF101-AD is a large-scale action rejection benchmark dataset designed to evaluate whether video multimodal large language models can correctly reject actions that do not actually exist in a video when faced with misleading contextual and motion cues. This dataset extracts short video clips from publicly available YouTube videos, and is exclusively intended for research, educational, and non-commercial purposes. Per its statement, the use of this dataset complies with the fair use provisions of Section 107 of the United States Copyright Act, as it is transformative, uses only a limited portion of the original content, has non-commercial intent, serves the public interest, and does not substitute the original works. The dataset does not claim ownership of the original content, and all copyrights remain with their original holders. The dataset is provided "as-is", without any warranties or liabilities. Users must comply with privacy and ethical guidelines, refrain from using it for harmful purposes, and may contact the initiating party to request removal if they believe their rights have been infringed upon.

创建时间:
2026-06-25
搜集汇总
数据集介绍
UCF101-AD 数据集图片
构建方式
UCF101-AD数据集是基于UCF101原始视频数据精心构建的一个大规模动作-否定基准。该数据集从公开的YouTube视频中提取短片段,通过设计具有误导性的上下文和运动线索,筛选出那些视觉上看似包含特定动作、实则并未发生的视频片段。创建者针对每个动作类别,人工挑选或编辑了场景高度相似但动作缺失的样本,从而构建出用于评估多模态大语言模型对否定情境理解能力的测试集。
特点
该数据集的核心特点在于其专注于检验视频多模态大语言模型在复杂误导条件下拒绝不存在的动作的能力,填补了现有动作识别基准在否定性判别方面的空白。数据集包含超过一万个视频片段,涵盖丰富的动作类别,每个样本都经过精心设计以确保上下文和运动线索具有高度迷惑性,从而对模型的鲁棒性和逻辑推理能力提出严峻挑战。
使用方法
使用UCF101-AD时,研究人员可将视频片段及其对应的否定性标签作为输入,评估视频多模态大语言模型是否能够正确识别并拒绝那些被误导性线索诱导的假动作。数据集的推荐使用场景包括动作理解模型的鲁棒性测试、否定推理能力验证以及多模态对齐研究。用户应遵循CC-BY-NC-SA 4.0许可协议,仅用于研究、教育和非商业目的,并尊重原始视频版权持有者的权利。
背景与挑战
背景概述
随着视频多模态大语言模型的快速发展,如何准确评估模型对视频中动作的理解能力成为研究热点。UCF101-AD数据集由研究团队于2024年创建,基于UCF101动作识别数据集构建,旨在系统性地测试视频MLLMs在误导性语境和运动线索下拒绝识别不存在动作的能力。核心研究问题聚焦于模型对动作缺失场景的鲁棒性,填补了现有基准在动作否定检测方面的空白。该数据集包含从YouTube公开视频中提取的短视频片段,服务于研究与教育目的,对提升视频理解模型的可靠性具有重要影响。
当前挑战
该数据集面临双重挑战。在领域问题层面,现有视频MLLMs往往过度依赖运动或语境线索而忽略动作的实际存在性,导致在误导性场景中产生幻觉,这一缺陷制约了模型在安全监控、自动化审核等高风险领域的应用。在构建过程中,需从原始视频中精确筛选并标注否定性动作样本,避免引入主观偏差;同时需确保片段长度、质量与原始数据一致,并平衡正负样本分布,以构建具有挑战性的评估基准。
常用场景
经典使用场景
UCF101-AD数据集专为视频多模态大语言模型(MLLMs)设计,用于评估模型在误导性上下文和运动线索下拒绝不存动作的能力。其经典使用场景涵盖视频动作识别中的负样本推理测试,特别是在模型需区分真实动作与虚假提示时,该数据集提供了精心标注的正面与负面实例,帮助研究者检验模型对动作缺失的鲁棒性。
解决学术问题
该数据集解决了视频理解中一个关键学术问题:现有MLLMs常因过度拟合动作模式而错误响应误导性线索,缺乏对不存动作的否定能力。UCF101-AD通过引入混合背景干扰和运动伪影,系统性地挑战模型推理边界,从而推动动作识别范式从简单分类向细致逻辑判断演进,显著拓展了视频理解研究的理论深度。
衍生相关工作
此数据集衍生了多项经典工作,包括基于因果推理的动作验证框架、多模态否定逻辑学习模型以及对抗性上下文生成方法。研究团队通过UCF101-AD基准测试,发展了诸如“动作-背景解耦网络”和“隐式否定注意力机制”等创新架构,这些方法进一步被集成到下一代视频理解系统中,推动了领域内对模型鲁棒性的系统性探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务