遇见数据集

DAR

收藏
github2026-07-14 更新2026-07-15 收录
数据链接:
官方服务:

资源简介:

DAR是一个以观众为中心的视频情感基准数据集,用于动态情感推理。它要求模型识别观众情感变化的时间点、细粒度情感类型以及视觉事件触发情感反应的原因。数据集包含15,087个视频、36,908个事件对齐的情感片段和27个情感类别,每个片段包括时间跨度、情感标签和视觉因果依据。

DAR is an audience-centric video emotion benchmark dataset for dynamic emotion reasoning. It tasks models with identifying the timestamps of audience emotional shifts, fine-grained emotion categories, and the visual events that trigger corresponding emotional responses. The dataset consists of 15,087 videos, 36,908 event-aligned emotion segments and 27 emotion categories, with each segment containing a time span, emotion label and visual causal justification.

创建时间:
2026-06-23
原始信息汇总

数据集概述

数据集名称:DAR(Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset)

核心任务:面向观看者的动态情感推理。要求模型识别观看者情绪变化的时刻、细粒度情感类别以及引发该情感反应的视觉事件原因。

规模与组成

  • 视频数量:15,087 个
  • 情感片段:36,908 个事件对齐的情感片段
  • 情感类别:27 种
  • 标注内容:每个片段包含时间跨度、情感标签和基于视觉的因果解释(rationale)

数据构建流程(分为三个阶段):

  1. 事件对齐情感分割:使用 Gemini-2.5-Pro 提出语义事件边界,PySceneDetect 检测视觉剪辑点并在 0.5 秒窗口内对齐,InternVL3.5 验证事件完整性。
  2. 增量差异描述:Qwen3-VL 描述每个片段,并聚焦于相对于前一片段的变化,且描述生成过程中不使用情感标签。
  3. 情感流推理:Qwen3-VL 利用片段描述和 Top-3 候选情感,生成排序后的情感-原因对。Qwen3-Omni 和 InternVL3.5 进行视觉关联性、因果逻辑、观看者中心性、时间一致性和答案一致性判断。

数据来源:原始视频来自 hendrycks/emodiversity,需从原始项目下载并遵守其许可条款。

标注数据访问:数据集标注可在 Hugging Face Datasets 获取。

模型权重

训练方法

  • 冷启动 SFT(DAR-SFT):基于 Qwen2.5-VL-3B-Instruct 模型,冻结视觉编码器,训练 LLM 和对齐器,使用 AdamW 优化器,学习率 1e-5,训练 0.5 个 epoch。
  • GRPO 训练(DAR-R1):从 DAR-SFT 检查点初始化,使用 GRPO 优化时间定位、情感预测和推理质量,学习率 2e-6,训练 1 个 epoch。

评估:使用 test.py 脚本进行推理和评估。

许可协议:该项目采用 Apache License 2.0。原始视频受 emodiversity 及其原始来源的许可和使用条款约束。上游 Qwen 和 ms-swift 组件遵循其各自的许可协议。

关联论文arXiv:2607.10238(ECCV 2026)。

搜集汇总
数据集介绍
构建方式
DAR数据集的构建遵循一套精心设计的流水线,旨在捕捉观众情感随视频事件动态演变的复杂性。首先,利用Gemini-2.5-Pro提出语义事件边界,结合PySceneDetect检测镜头切换,并在0.5秒窗口内对齐边界,再由InternVL3.5验证事件的完整性,最终形成事件对齐的情感片段。其次,采用渐进式差异描述策略,由Qwen3-VL描述每个片段时聚焦于与前一片段的变化,且描述生成过程不依赖情感标签,以保持客观性。最后,通过情感流推理阶段,Qwen3-VL结合片段描述与Top-3候选情感,生成排序后的情感-理由对,并由Qwen3-Omni和InternVL3.5对视觉基础、因果逻辑、观众中心性、时间一致性和答案一致性进行联合评判,确保标注的高质量与多维度可靠性。
特点
DAR数据集的核心特色在于其以观众为中心的动态情感推理范式,突破了传统静态情感标签的局限。数据集涵盖15,087个视频,包含36,908个事件对齐的情感片段,并细分为27个情感类别,每个片段均标注了时间跨度、情感标签及视觉因果理由,形成了“何时、何种情感、为何”的三元组结构。其标注过程融合了多模态大模型的协作与多维度质量审核,保证了情感变化与视觉事件之间的紧密因果关联。此外,数据集精心设计了情感类别的层次化与丰富性,旨在推动模型从粗粒度情感分类向细粒度、时序敏感且可解释的情感推理能力进化,为视频情感分析领域设立了新的基准。
使用方法
研究者可通过DAR项目提供的完整训练与评估代码快速上手。数据集的标注文件可在Hugging Face上获取,原始视频则需从emodiversity项目下载并遵守其许可。使用流程包括冷启动指令微调(SFT)与强化学习(GRPO)训练:先基于DAR-SFT对Qwen2.5-VL-3B-Instruct进行结构化输出格式适配,冻结视觉编码器,微调语言模型与对齐层;再以SFT检查点为起点,通过GRPO优化时间定位、情感预测与推理质量。评估阶段使用test.py脚本进行推理与性能评估,支持批量处理。整套流程配置清晰,环境依赖明确,便于复现与扩展。
背景与挑战
背景概述
在视频情感分析领域,传统研究多聚焦于为整段视频赋予单一静态的情感标签,忽略了观众情感随时间推移而动态演化的本质。为弥补这一不足,Zhiyan Zhang等研究者在2026年创建了DAR(Dynamic Affective Reasoning)数据集,由ECCV 2026收录。该数据集以观众视角为核心,旨在推动动态情感推理研究的发展,核心研究问题在于如何精确识别观众情感变化的时刻、细粒度情感类别及其视觉诱因。DAR包含15,087段视频、36,908个事件对齐的情感片段,并覆盖27种情感类别,每个片段均提供时间跨度、情感标签及视觉归因的因果解释。这一基准的提出,为视频理解、情感计算和人机交互等领域的深度探索提供了关键数据支撑,显著促进了模型从静态标注向动态推理的范式转变。
当前挑战
DAR所解决的领域核心挑战在于,传统视频情感标注忽视了情感的动态性与因果关联性,难以捕捉观众在观看过程中因视觉事件引发的实时情感演变。此外,数据集构建过程亦面临多重难题:首先,如何实现事件对齐的情感分割,需借助语义边界检测、视觉剪切检测与事件完整性验证的复杂流水线协同;其次,增量式差分描述要求模型在描述当前片段时聚焦于与前序片段的变化,避免情感标签的干扰,这对视觉语言模型的细粒度理解能力提出极高要求;最后,流式情感推理需综合视觉接地性、因果逻辑、观众中心性、时间一致性等多维度标准进行判别,确保情感-原因对生成的可靠性与鲁棒性。
常用场景
经典使用场景
DAR(动态情感推理基准数据集)的核心使用场景在于推动视频情感分析从静态标签分类迈向精细化、动态化的情感推理任务。传统方法往往仅对整个视频片段赋予单一情感标签,忽视了情感随时间演化的动态属性以及观众个体化的感受差异。该数据集通过提供15,087个视频片段、36,908个事件对齐的情感段落,涵盖27种细粒度情感类别,要求模型精准定位情感发生变化的时间点,识别出具体的情感状态,并阐释引发该情感反应的视觉事件因果逻辑。这一设计使得DAR成为训练和评估多模态大模型在时间结构化情感理解能力的标杆性基准。
实际应用
在实际应用层面,DAR数据集所推动的动态情感推理能力具备广泛而深远的落地潜力。在内容创作与分析领域,该技术可被用于自动识别影视作品中的情感高潮片段,帮助创作者优化叙事节奏,提升观众沉浸感。在智能人机交互系统中,具备动态情感理解能力的模型可以实现更具共情力的虚拟助手和社交机器人,使其能够在对话过程中实时感知用户情绪波动并作出适应性反应。在心理健康监测场景下,通过分析个体对视频内容的情感反应轨迹,可辅助诊断情感障碍或评估治疗效果。此外,在广告营销与用户体验测试中,该技术能够精准捕捉消费者观看广告时情感态度的动态变化,从而指导营销策略的优化与产品设计改进。
衍生相关工作
围绕DAR数据集已衍生出一系列具有代表性的经典工作和研究方法。基准工作提出的DAR-SFT策略通过冻结视觉编码器,仅微调语言模型和连接器,以冷启动方式高效引导Qwen2.5-VL-3B-Instruct学习结构化的动态情感输出格式。进一步地,DAR-R1模型基于前述微调权重,引入基于群体相对策略优化的强化学习范式,在时序定位精度、情感预测准确性以及推理合理性三个维度上实现了系统性提升。此外,数据集构建过程中采用的多阶段流水线——涵盖大语言模型驱动的事件情感分割、增量差异描述生成以及流式情感推理——为后续研究提供了可复现的高效数据标注范式。这些开创性工作共同构筑了动态情感推理研究的技术基石,激发了更多关于情感认知、多模态推理及强化学习对齐等方向的交叉探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务