遇见数据集

DAR (Dynamic Affective Reasoning)

收藏
arXiv2026-07-11 更新2026-07-14 收录
数据链接:
官方服务:

资源简介:

DAR是由中国科学技术大学等机构构建的首个大规模、以观众为中心的视频情感推理基准数据集,基于情感事件理论(AET)设计,旨在支持动态情感分析。该数据集包含15,087个视频和36,908个事件对齐的情感片段,标注涵盖27个细粒度情感类别,数据来源于VCE数据集并经过严格预处理。其构建采用三阶段流水线:结合语义与视觉边界的事件对齐分割、增量差分描述生成以及基于AET的流式情感推理链生成,并通过双一致性验证协议确保标注质量。该数据集主要应用于视频情感分析领域,致力于解决传统静态情感分类方法忽略的情感动态演变与因果推理问题,推动机器对连续事件驱动的情感转换进行细粒度定位与解释。

DAR is the first large-scale, viewer-centric video emotion reasoning benchmark dataset developed by the University of Science and Technology of China and other institutions. Designed based on the Affective Event Theory (AET), it aims to support dynamic emotion analysis. This dataset consists of 15,087 videos and 36,908 event-aligned emotion segments, with annotations covering 27 fine-grained emotion categories. The data is sourced from the VCE dataset and has undergone rigorous preprocessing. Its construction adopts a three-stage pipeline: event-aligned segmentation combining semantic and visual boundaries, incremental differential description generation, and streaming emotion reasoning chain generation based on AET, with a dual-consistency verification protocol employed to ensure annotation quality. This dataset is primarily applied in the field of video emotion analysis, aiming to address the issues of emotional dynamic evolution and causal reasoning overlooked by traditional static emotion classification methods, and to advance machines' fine-grained localization and interpretation of continuous event-driven emotion transitions.

创建时间:
2026-07-11
原始信息汇总

数据集概述:DAR (Dynamic Affective Reasoning)

DAR 是一个以观众为中心的动态情感推理视频基准数据集,旨在解决传统视频情感数据集仅对整段视频分配单一静态标签的局限性。该数据集要求模型识别观众情绪何时发生变化、具体是何种细粒度情感,以及是什么视觉事件触发了该情感反应。

  • 数据集规模: 包含 15,087 个视频,36,908 个与事件对齐的情感片段,以及 27 个情感类别。
  • 标注内容: 每个情感片段包含时间跨度、情感标签以及基于视觉的因果推理说明。
  • 数据来源: 原始视频来自 emodiversity 项目,使用者需遵循其许可和使用条款。
  • 数据集访问: 标注文件托管在 Hugging Face Datasets 上。
  • 模型权重:Hugging FaceModelScope 上均可获取。
  • 相关论文: arXiv:2607.10238
  • 所属会议: ECCV 2026

数据构建流程

数据集的构建分为三个阶段:

  1. 事件对齐情感分割: 使用 Gemini-2.5-Pro 提出语义事件边界;通过 PySceneDetect 检测视觉剪切点,并在 0.5 秒窗口内对齐附近边界;最后由 InternVL3.5 验证事件完整性。
  2. 增量差分描述生成: Qwen3-VL 在描述每个片段时,专注于相对于前一个片段的变化,且生成描述时不使用情感标签。
  3. 情感流推理: Qwen3-VL 使用片段描述和 Top-3 候选情感,生成排序后的情感-推理对。随后,Qwen3-Omni 和 InternVL3.5 对视觉接地、因果逻辑、观众中心性、时间一致性和答案一致性进行评判。

模型训练

该数据集对应的模型训练包含两个阶段:

  • 冷启动 SFT (DAR-SFT): 在 Qwen2.5-VL-3B-Instruct 上微调,使其适应结构化的 DAR 输出格式。配置冻结视觉编码器,仅微调大语言模型和适配器,训练 0.5 个 epoch,使用 AdamW 优化器和 1e-5 的学习率。
  • GRPO 训练 (DAR-R1): 从 DAR-SFT 检查点初始化,使用 GRPO 方法优化时间定位、情感预测和推理质量。训练 1 个 epoch,学习率为 2e-6。

评估与推理

使用提供的 test.py 脚本进行推理和评估:

bash python test.py --model-path /path/to/DAR-R1 --test-jsonl /path/to/DAR/test.jsonl --video-root /path/to/DAR/videos --output-jsonl /path/to/outputs/dar_r1_test_predictions.jsonl --batch-size 8

许可信息

  • 该项目以 Apache License 2.0 发布。
  • 原始视频受 emodiversity 及其原始来源的许可和使用条款约束。
  • 上游 Qwen 和 ms-swift 组件遵循其各自的许可协议。
搜集汇总
数据集介绍
DAR (Dynamic Affective Reasoning) 数据集图片
构建方式
DAR数据集的构建根植于情感事件理论,强调观众情感是时间累积与因果驱动的动态过程。原始视频源自VCE数据集,经持续时长过滤与静态帧剔除后,采用由粗到细的事件分割策略:首先利用Gemini-2.5-Pro识别高层语义边界,再通过PySceneDetect检测视觉硬切变,并将语义边界在0.5秒窗口内对齐至视觉切变点,以保证分割的合理性。随后对未对齐片段执行递归验证与合并。在增量差分描述阶段,使用Qwen3-VL结合上一段描述生成当前段落的视觉描述,聚焦内容变化,并由Grounding DINO验证描述中实体与帧画面的对应关系。最后,在情感流推理阶段,结合历史上下文与候选情感标签,生成包含视觉证据、情境评估与情感触发逻辑的推理链。若相邻段情感一致,则合并为单一情感阶段并重写推理。整个流程经双重一致性校验协议进行评估,从视觉锚定、因果逻辑、观众中心性、时间一致性与答案一致性等五个维度进行筛选,低质量样本被退回重写,最终保留高质量标注。
特点
DAR数据集是首个大规模、以观众为中心、面向动态情感推理的基准数据集,包含15,087个视频和36,908个事件对齐的情感片段,覆盖27种细粒度情感类别。其核心特点在于突破传统静态分类范式,将视频情感分析重塑为时间定位、情感分类与因果推理的联合任务。数据集基于情感事件理论,确保每个片段对应一个连贯的刺激单元,而非任意时间窗口,从而捕获由连续事件驱动的实时情感转变。情感转移矩阵揭示了非随机的动态模式,如渴望转向满足、焦虑转向恐惧的典型路径,验证了标注的结构化与因果连贯性。推理文本平均长度达118.8词,远超常规视频描述,提供了丰富的上下文与因果解释,涵盖视觉细节、评价性表达与情感术语。高质量标注经双重验证与人工审核,错误率低于3%,从边界精度、情感标签一致性、视觉锚定与观众中心性上确保了数据的可靠性与细粒度。数据集在视觉场景、情感类别与时间粒度上均展现出高度多样性,满足多层次情感认知任务的需求。
使用方法
DAR数据集支持三个层次化任务:情感分割、细粒度情感分类与情感推理。情感分割要求模型精准定位视频中情感转变的时间边界,评估指标包括片段计数准确率与平均时间交并比。细粒度情感分类则要求模型从27类观众中心情感标签中正确识别每个片段的情感状态,并以时间交并比大于0.5为有效匹配条件。情感推理任务进一步要求生成基于视觉证据的因果解释,评估采用GPT-4o作为裁判,从视觉锚定、因果逻辑、观众中心性、时间一致性与答案一致性五个维度进行0-5分评分。研究者可在DAR数据集上基于Qwen2.5-VL等视觉语言模型进行两阶段训练:冷启动监督微调适应输出格式,随后采用组相对策略优化强化学习,通过结构化约束、片段计数、时间分割、情感准确率与推理质量等多维奖励信号,优化模型的边界定位精度与推理逻辑。评估需同时在测试集上进行自动指标与人工专家评审,以全面验证动态情感推理能力。
背景与挑战
背景概述
在情感计算领域,视频情感分析长期被简化为静态分类任务,将每个视频片段视为独立的情感单元,忽视了情感随时间演进的动态本质与因果逻辑。由中国科学院与合肥工业大学研究团队于2026年提出的DAR数据集,根植于情感事件理论,开创性地将研究视角从角色情感转向观众情感,系统建模连续视觉事件如何驱动观察者情感的实时变迁。该数据集包含15,087段视频与36,908个事件对齐的情感片段,覆盖27种细粒度情感类别,并提供了时空精准的因果推理链。作为首个大规模观众中心动态情感推理基准,DAR催生了情感分割、细粒度分类与因果推理三项联合挑战任务,深刻重塑了该领域的研究范式,推动多模态大语言模型向具备时空认知与因果理解能力的智能情感体演进。
当前挑战
DAR面临的挑战根植于对传统静态范式的三重突破:其一,情感分割要求模型精确定位情绪转变的时序边界,而非依赖整段标签,这迫使模型在连续帧中捕捉微妙的视觉叙事转折点,极大提升了时间位置感知的复杂度;其二,细粒度情感分类突破Ekman六基本情绪框架,引入27类观众中心情感标签,包括共情痛、美学欣赏等复合态,这对模型区分近邻情感的能力构成严峻考验;其三,因果推理要求模型生成视觉证据支撑的逻辑解释,阐明当前情感如何受前序事件累积影响,而非对画面内容的简单复述。数据集构建过程中,研究团队还需克服语义边界与视觉切点对齐困难、增量式描述去冗余以及多维一致性验证等技术难点,以保证标注在时序精准性与因果严谨性上的高质量标准。
常用场景
经典使用场景
DAR数据集最经典的使用场景在于推动视频情感分析从静态分类范式迈向动态情感推理的变革。研究者可基于该数据集对多模态大语言模型进行细粒度的时间边界定位训练,要求模型精准识别视频中情感转变的起始与结束时刻。同时,DAR提供了27类精细情感标签的标注体系,为情感分类任务赋予了超越Ekman基本情感理论的丰富细腻度。此外,该数据集的核心价值体现在因果推理环节,即要求模型在对每个情感片段做出预测时,必须输出基于视觉证据的、符合观众视角的因果解释链条。这一场景深刻还原了人类观看视频时情感随叙事事件动态累积与演化的心理过程,为情感智能系统的认知建模奠定了坚实的基准基础。
解决学术问题
DAR数据集系统性地解决了现有视频情感分析学术研究中的两个核心痛点:时空稀疏性与因果缺失性。传统视频情感基准如DFEW仅提供片段级别的粗粒度标签,无法捕捉情感随时间演变的动态模式,而许多研究仅关注角色面部表情或笼统的效价激活维度,忽视了观众情感由连续刺激事件驱动的心理事实。DAR基于情感事件理论,首次以大规模方式提供了事件对齐的、具有明确因果逻辑的情感推理链条,使研究者能够量化评估模型在情感分割、细粒度分类及因果解释三个层次的表现。这一数据集的问世有力推动了情感计算领域从“识别什么情感”向“何时转变、为何转变”的深层认知范式转型,激发了学界对多模态模型时域感知能力和逻辑一致性约束的理论探索。
衍生相关工作
DAR数据集催生了一系列具有深远影响的经典衍生工作,其中最具代表性的当属DAR-R1框架的提出。该工作首次将强化学习中的组相对策略优化引入动态情感推理领域,通过精心设计的五维奖励函数——涵盖结构约束、片段计数、时域分割、情感准确度与推理质量——显著提升了多模态大语言模型在情感定位与因果解释方面的表现。此外,研究人员基于DAR开发了诸多情感专用的微调方案,比如将AffectGPT、EmotionLlama等模型在该数据集上进行冷启动监督微调,系统验证了大规模情感标注数据对模型结构性适应的促进作用。这些衍生工作共同构建了一个完整的研究脉络,从数据构建、模型训练到评估体系,为情感计算领域树立了动态、细粒度、可解释的发展新标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务