遇见数据集

IntentQA

收藏
arXiv2026-08-24 更新2026-08-26 收录
官方服务:

资源简介:

IntentQA是一个专为视频意图推理设计的大规模问答数据集,由西安交通大学、北京通用人工智能研究院和北京交通大学联合创建。该数据集包含Causal Why、Causal How、Temporal Previous和Temporal Next四种问题类型,要求模型基于认知上下文(情境、对比、常识)理解人类行为背后的心理意图。数据集通过收集和标注原始视频构建,虽未明确揭示具体规模,但被描述为大规模。其应用旨在推动视频理解从表面事实识别迈向深层意图推理,解决现有模型在理解潜在心理状态方面的根本性不足。

IntentQA is a large-scale question answering dataset specifically designed for video intent reasoning, jointly created by Xi'an Jiaotong University, Beijing Academy of General Artificial Intelligence, and Beijing Jiaotong University. This dataset covers four question types: Causal Why, Causal How, Temporal Previous and Temporal Next, which require models to understand the psychological intentions behind human behaviors based on cognitive contexts (situations, contrasts and common sense). The dataset is constructed by collecting and annotating raw videos. Although its specific scale is not explicitly disclosed, it is described as large-scale. Its application aims to promote the transition of video understanding from superficial fact recognition to deep intent reasoning, and address the fundamental shortcomings of existing models in understanding underlying psychological states.

创建时间:
2026-08-24
原始信息汇总

IntentQA: Context-aware Video Intent Reasoning

数据集简介

IntentQA 是一个面向视频意图推理的视频问答(VideoQA)数据集,由ICCV2023论文《IntentQA: Context-aware Video Intent Reasoning》提出。该数据集专注于意图推理这一特殊类型的推理型VideoQA任务,要求模型不仅理解视频中的视觉事实,还需对潜在变量(如实体间的空间、时间、因果关系以及心理状态等)进行逻辑推理。

数据集内容

数据集包含以下资源,需通过Google Drive下载:

  • Videos:包含所有原始视频,以video_id命名,格式为MP4。
  • region_feat_n:预计算的边界框(bounding box)特征。
  • frame_feat:预计算的帧特征。
  • QA标注文件:包含train.csvval.csvtest.csv三个文件。

标注格式

标注文件的基础列格式与NExT-QA一致,并在此基础上增加了额外列:

  • actionlemmalemma_id:标注当前QA中触发意图(自身或他人)的动作、动作的词元化形式及其在近义词分组后的对应ID。
  • idpos_idneg_id(仅在train.csv中):id为数据行号,pos_idneg_id分别指向训练集中与当前行构成正例和负例的数据行号。

实验结果

论文在多个模型上进行了基准测试,评价指标包括CW(因果推理)、CH(意图推理)、TP&TN(时间/计数推理)和Total(总体准确率)。关键结果如下:

模型 文本表示 Total (%)
EVQA GloVe 27.27
CoMem GloVe 29.52
HGA GloVe 31.54
HME GloVe 33.08
HQGA GloVe 34.21
CoMem BERT 46.77
HGA BERT 44.61
HME BERT 46.16
HQGA BERT 47.66
VGT BERT 51.27
Blind GPT BERT 51.55
Ours w/o GPT BERT 54.50
Ours BERT 57.64
Human - 78.49

环境安装与使用

  • 安装:基于Python 3.8.8创建conda环境,克隆VGT仓库并安装依赖。
  • 推理与评估:运行./shell/intentqa_test.sh 0进行推理,使用python eval_intentqa.py --folder your_work_dir --mode test进行评估。
  • 使用GPT:在测试脚本中添加--GPT_result参数指定GPT结果文件路径。

引用信息

该数据集及代码基于VGT仓库开发,相关引用信息可在原项目页面查看。

搜集汇总
数据集介绍
IntentQA 数据集图片
构建方式
IntentQA数据集的构建以NExT-QA为基础,从中筛选出因果与时间类推理型问题,覆盖Causal Why、Causal How、Temporal Previous和Temporal Next四种类型。通过AllenNLP进行依存句法分析提取关键动作,并借助WordNet获取词元化动词,进而聚类同义词形成动作ID。随后在Amazon Mechanical Turk平台上开展多轮人工标注,设计四项准则以确保动作的物理可见性与语义一致性,并采用至少三名标注者交叉验证的机制保障数据质量。最终主数据集包含4,303个视频和16,297个问答对,按约6:1:1划分为训练、验证与测试集。此外,利用大型语言模型对答案中的动词短语、名词短语及性别相关词进行扰动,生成五个对比子集,以评估模型的鲁棒性。
特点
IntentQA是首个聚焦视频中人类意图推理的大规模VideoQA数据集,其问题设计围绕不可观测的心理状态展开,区别于传统的事实型问答。数据集强调情境上下文、对比上下文和常识上下文三种认知语境的作用,同一动作在不同情境下可映射至不同意图。为克服标准准确率指标的局限性,数据集创新性地引入由大型语言模型生成的五个对比集(涵盖动词、名词和性别扰动),并配套提出“对比性能下降”指标,用以量化模型对细微扰动的敏感度。这一设计不仅测试模型对表面模式的匹配能力,更深入评估其进行因果与意图推理的真实水平,有效缓解了数据集偏差带来的评估虚高问题。
使用方法
IntentQA数据集适用于训练和评估视频意图推理模型。研究者可直接利用其主集进行标准的多选问答训练,以精度作为基础性能指标;同时,通过引入对比集,可运用“对比性能下降”指标系统检验模型的鲁棒性,识别其对语义细微变化的脆弱性。数据集支持端到端的视觉-语言模型开发,例如结合视频特征、文本嵌入及图神经网络构建情境感知模块,并可与大型语言模型集成以实现可解释的常识推理。模型在推理时应综合考虑视频中的情境线索、跨样本的对比信息以及外部常识知识,最终输出带理由的答案选项,从而在提升准确性的同时保障推理过程透明可溯。
背景与挑战
背景概述
IntentQA数据集由西安交通大学、北京通用人工智能研究院等机构的研究人员于2023年首次提出,并在2026年扩展发表于IEEE TPAMI。该数据集聚焦于视频理解中的意图推理任务,旨在弥补现有VideoQA数据集仅关注表面事实而忽视人类行为背后隐藏意图的不足。核心研究问题是如何从视频中推断人物的心理目标和行为意图,从而推动人工智能从视觉识别迈向真正的社会智能。通过提供包含因果和时序等四类问题的16,297个QA对,IntentQA为这一新兴研究方向奠定了坚实基础,其影响力体现在挑战了传统模型仅依赖表面模式匹配的局限,并促进了可解释推理机制的发展。
当前挑战
IntentQA面临的挑战涵盖多个层面。从领域问题角度看,意图推理要求模型具备情境感知、对比学习和常识推理能力,以理解相同动作在不同上下文中可能蕴含的不同意图,并应对传统准确率评价指标因数据集偏差而高估模型能力的问题。从构建过程看,数据标注面临动作语义一致性判断、跨标注者共识保证等困难,需通过多轮人工审核确保质量;同时,生成高质量对比集需借助大型语言模型进行精细的语义扰动,涉及动名词短语的相似度控制、性别术语的替换策略,以及平衡对比难度与自然性的挑战。此外,构建一个既能整合视觉与语言信息又能提供可解释推理路径的框架,也是当前技术中的一大难题。
常用场景
经典使用场景
IntentQA数据集在视频问答领域开辟了新的研究方向,其核心应用场景在于评估和提升模型对视频中人类行为意图的推理能力。该数据集通过构建包含Causal Why、Causal How、Temporal Previous和Temporal Next四类问题的问答对,要求模型不仅理解表面动作,还需推断隐藏的心理状态与目标。这一设计使得研究者能够系统性地测试模型在情境推理、对比学习和常识知识利用方面的表现,推动视频理解从事实识别向深层认知推理的跨越。
衍生相关工作
IntentQA的提出催生了一系列具有影响力的后续研究。X-CaVIR框架的发布,融合了视觉语言查询、对比学习和常识推理,成为该任务的标杆模型。在此基础上,后续工作探索了多种增强路径,如利用更强的视觉编码器、改进的对比学习策略,以及更高效的LLM集成方式。此外,该数据集还激发了关于视频意图推理鲁棒性的研究,推动了对比集生成方法的改进,并带动了可解释AI在视频理解中的应用,形成了丰富的学术衍生谱系。
数据集最近研究
最新研究方向
IntentQA数据集的最新研究方向聚焦于视频中人类意图的深层认知推理,通过引入情境、对比和常识三类认知上下文,推动视频问答从表面事实识别向潜在心理状态推断的跨越。当前前沿趋势包括利用大语言模型构建可解释的推理管道,结合视觉问答置信度与密集字幕生成透明决策路径,并针对数据集偏差构建多维度对比集(如动词、名词、性别扰动)以评估模型的鲁棒性。该数据集在社交智能、人机交互及具身智能领域具有深远意义,为AI系统从模式匹配走向类人因果理解提供了关键基准,同时推动可解释人工智能与视频认知研究的交叉融合。
相关研究论文
  • 1
    IntentQA: Intent Question Answering in Videos by Cognitive Context Reasoning西安交通大学; 北京通用人工智能研究院; 北京交通大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务