遇见数据集

InsightVQA

收藏
arXiv2026-06-01 更新2026-06-03 收录
官方服务:

资源简介:

InsightVQA是由华东师范大学构建的大规模分层视觉问答数据集,旨在推动视觉情感理解与认知推理的研究。该数据集包含从六个公开来源收集并经过严格筛选的138K高质量图像,并标注了总计725K个问答对,内容涵盖感知、理解与认知三个层次。数据构建过程采用了伪标签验证、专家审核及多阶段质量控制流程,通过视觉触发提取和约束引导生成等技术确保标注的准确性与丰富性。该数据集主要应用于多模态大语言模型的情感认知能力评估与训练,致力于解决传统情感识别任务中缺乏可解释性、因果推理及高层认知分析能力的问题。

InsightVQA is a large-scale hierarchical visual question answering (VQA) dataset developed by East China Normal University, which aims to promote research on visual emotion understanding and cognitive reasoning. It includes 138,000 high-quality images collected from six public sources and rigorously filtered, with a total of 725,000 annotated question-answer pairs covering three levels: perception, comprehension, and cognition. The dataset construction process adopts workflows such as pseudo-label verification, expert review, and multi-stage quality control, and ensures the accuracy and richness of annotations via technologies including visual trigger extraction and constraint-guided generation. This dataset is primarily used for the evaluation and training of multimodal large language models' emotional cognition capabilities, and endeavors to address the limitations of traditional emotion recognition tasks, such as the lack of interpretability, causal reasoning, and high-level cognitive analysis abilities.

提供机构:
华东师范大学
创建时间:
2026-06-01
原始信息汇总

数据集名称

InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark

数据集简介

InsightVQA是一个面向高维情感认知的层次化视觉问答数据集,旨在推动模型从情感识别、情感触发理解到认知推理的完整推理能力。

数据规模

  • 图像总数:138,000张(从351,000张公开来源图像中经多阶段筛选得到)。
  • 问答对总数:725,000个。

数据集构成

数据集包含三个层次化的QA任务:

  1. 感知(Perception):情感与效价识别,共276,000个标签与效价QA对。
  2. 理解(Understanding):基于视觉触发提取的视觉、上下文与反事实QA,共330,000个QA对。
  3. 认知(Cognition):意图预测与顺序洞察推理,共119,000个QA对。

数据来源

图像收集自六个公开来源,经严格多阶段过滤后得到138,000张高置信度图像。

评价基准

InsightVQA-Bench:包含30,000个样本的高质量评估基准,用于细粒度评估。

方法(InsightNet)

基于InsightVQA数据集,提出InsightNet,一种统一架构的情绪调优多模态大语言模型(MLLM)基线。采用LoRA微调策略在Qwen2.5-VL-7B上进行层级化感知、理解与认知的训练,并通过指令监督微调(SFT)增强复杂情感场景下的认知深度与泛化能力。

实验结果(部分)

在InsightVQA-Bench上,InsightNet在三个任务中均取得领先性能:

  • 感知任务:ACC 76.25%,F1 90.56%
  • 理解任务:Ranking 82.79%,Top-1 71.21%
  • 认知任务:ACC 69.18%

与开源/闭源MLLM及情感专用模型相比,InsightNet在所有指标上表现最佳(对比模型包括GPT-4o、Gemini-2.5-flash、Claude-3.7-sonnet等)。

搜集汇总
数据集介绍
InsightVQA 数据集图片
构建方式
InsightVQA的构建始于从六个公开图像源收集的351K张原始图像,经过多阶段的严格筛选流程,包括基于伪标签的聚类验证、两个视觉情感分析专家模型(SMKD-VEA与EmotionCLIP)的交叉确认、置信度感知的类别平衡策略以及大规模人工审核,最终保留了138K张具有高置信度的图像。在此基础上,数据集通过三层递进的自动化标注流水线构建:感知层利用多样化模板生成情感类别与效价的问答对;理解层借助视觉触发词提取、空间定位验证及大语言模型驱动的约束生成,产出视觉归因、情境合成与反事实推理三种类型的问答对;认知层则基于理解层的证据输出,通过少样本提示生成响应意图与洞察序列。整个流程融入了规则过滤、自然语言推理一致性检查及视觉重审等迭代质量控制机制,最终形成了包含725K个问答对的大规模分层数据集。
使用方法
InsightVQA可被用于多模态大语言模型的微调训练与细粒度评估。研究人员可将数据集按90%与10%比例划分为训练集与测试集,训练集保持生成式问答格式,测试集则标准化为判别式任务以支持统一评估。该基准包含三个层次化评估任务:情感感知任务通过单选题评测模型对情感类别与效价的识别精度;情感理解任务通过结合三个语义合理的干扰项,评估模型在视觉归因、情境合成与反因果推理上的证握理据能力;情感认知任务则结合标准单选题与情境判断测试范式,度量模型从情感感知到意图形成再到结构化认知规划的桥梁能力。配套的InsightNet基线模型提供了基于LoRA的情感指令微调与层次化偏好优化的实现参考,便于研究者在三维任务体系中进行系统性的模型比较与性能提升。
背景与挑战
背景概述
InsightVQA数据集由华东师范大学的研究团队于2026年提出,旨在突破传统视觉情感理解仅停留于识别层面的局限,构建一个面向高维情感认知推理的层次化视觉问答基准。该数据集从六个公开来源采集35万余张图像,经过严格的多阶段筛选与专家验证,最终保留13.8万张高质量图片,并生成涵盖感知、理解与认知三个层次的72.5万对问答。其核心研究问题在于如何使多模态模型不仅能识别情感状态,更能理解情感产生的视觉诱因并进行响应导向的高阶推理。InsightVQA的提出填补了现有基准在可解释情感推理与认知分析方面的空白,为情感计算与多模态大语言模型的评估提供了系统化平台,在该领域具有重要的推动意义。
当前挑战
InsightVQA所解决的领域问题在于,传统情感理解基准仅聚焦于情感标签预测,缺乏对情感诱因的归因推理与认知层面的分析,导致模型难以解释“为何产生某种情感”以及“如何回应”。该数据集构建过程中面临的挑战包括:需从海量异构图像中筛选高质量样本,并克服通用视觉语言模型在零样本情感预测中存在的严重偏差(如倾向于预测为中性或满足状态);为生成可靠的三层标注,需设计细致的视觉触发词提取、验证与约束引导生成流程,反复进行基于规则、自然语言推理和视觉检查的质量控制;同时需确保八类情感分布的均衡性,并组织人工验证以保证标注的准确性与一致性。
常用场景
经典使用场景
在情感计算与多模态推理的交汇领域,InsightVQA定位为一种层次化视觉问答基准,其最经典的使用场景在于驱动模型从浅层情感分类跃迁至深层认知推理。研究者利用该数据集将图像情感理解分解为三个渐进阶段:感知层识别情感类别与效价,理解层通过视觉触发词定位情感成因,认知层预测响应意图并生成有序的洞察序列。这种由表及里的结构化设计,使InsightVQA成为评估多模态大语言模型是否具备类人心智化能力的标准试金石,尤其擅长考察模型在复杂社会场景中整合视觉线索与情感语义的细粒度推理水平。
解决学术问题
InsightVQA直面现有情感理解基准局限于粗粒度标签预测的核心困境,系统性地解决了三个关键学术难题:其一,弥补了传统数据集缺乏可解释情感因果建模的空白,通过视觉触发词抽取与验证机制,强制模型输出证据驱动的推理过程;其二,突破了情感理解仅停留在感知层面的窠臼,首创性地引入认知层面对响应意图排序与行为洞察链条的评估,推动情感计算从识别向决策推理演进;其三,针对通用多模态大模型存在的情感偏置与零样本认知盲区,提供了覆盖八类情感、包含72.5万问答对的高质量标注资源,为构建具备真实共情能力的类人智能系统奠定了理论与数据基础。
实际应用
在真实应用场景中,InsightVQA所倡导的层次化情感认知范式具有广阔落地前景。在社交辅助机器人领域,该数据集赋能机器人不仅识别用户面部表情,更能理解情感触发源(如环境压力或社交互动),进而规划恰当的安抚或鼓励性行为响应。在情绪感知人机交互系统中,InsightVQA帮助模型实现从被动情绪分类到主动意图推断的跃迁,例如在虚拟心理咨询场景中,系统可根据用户视觉状态生成分步式情感支持策略。在内容智能审核与个性化推荐方面,该数据集使算法能够解析广告或影视片段的情感结构,判别其如何通过场景元素引发特定情绪反应,从而优化内容的情感传达效果。
数据集最近研究
最新研究方向
在当前情感计算与多模态大语言模型交叉融合的前沿浪潮中,InsightVQA开辟了一个全新的研究维度,即从传统的情感分类跃迁至高维情感-认知视觉问答。该数据集的最新研究热点聚焦于构建层次化的“感知-理解-认知”推理框架,其核心在于不仅要求模型识别情绪状态,更需精准定位引发情绪的可视化触发因子,并模拟人类心智理论进行意图预测与序列化洞察推理。围绕这一方向,研究者正着力于如何通过指令微调与层次化偏好优化,使多模态模型在复杂社会场景中具备可解释的因果情感推理能力。此举不仅为细粒度情感基准测试提供了高难度的挑战样本,更为情感智能机器人、辅助社交系统等需要深度共情的人机交互应用铺设了理论基石与评估标尺。
相关研究论文
  • 1
    InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark华东师范大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务