DAR
收藏资源简介:
DAR是一个以观众为中心的视频情感基准数据集,用于动态情感推理。它要求模型识别观众情感变化的时间点、细粒度情感类型以及视觉事件触发情感反应的原因。数据集包含15,087个视频、36,908个事件对齐的情感片段和27个情感类别,每个片段包括时间跨度、情感标签和视觉因果依据。
DAR is an audience-centric video emotion benchmark dataset for dynamic emotion reasoning. It tasks models with identifying the timestamps of audience emotional shifts, fine-grained emotion categories, and the visual events that trigger corresponding emotional responses. The dataset consists of 15,087 videos, 36,908 event-aligned emotion segments and 27 emotion categories, with each segment containing a time span, emotion label and visual causal justification.
数据集概述
数据集名称:DAR(Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset)
核心任务:面向观看者的动态情感推理。要求模型识别观看者情绪变化的时刻、细粒度情感类别以及引发该情感反应的视觉事件原因。
规模与组成:
- 视频数量:15,087 个
- 情感片段:36,908 个事件对齐的情感片段
- 情感类别:27 种
- 标注内容:每个片段包含时间跨度、情感标签和基于视觉的因果解释(rationale)
数据构建流程(分为三个阶段):
- 事件对齐情感分割:使用 Gemini-2.5-Pro 提出语义事件边界,PySceneDetect 检测视觉剪辑点并在 0.5 秒窗口内对齐,InternVL3.5 验证事件完整性。
- 增量差异描述:Qwen3-VL 描述每个片段,并聚焦于相对于前一片段的变化,且描述生成过程中不使用情感标签。
- 情感流推理:Qwen3-VL 利用片段描述和 Top-3 候选情感,生成排序后的情感-原因对。Qwen3-Omni 和 InternVL3.5 进行视觉关联性、因果逻辑、观看者中心性、时间一致性和答案一致性判断。
数据来源:原始视频来自 hendrycks/emodiversity,需从原始项目下载并遵守其许可条款。
标注数据访问:数据集标注可在 Hugging Face Datasets 获取。
模型权重:
训练方法:
- 冷启动 SFT(DAR-SFT):基于 Qwen2.5-VL-3B-Instruct 模型,冻结视觉编码器,训练 LLM 和对齐器,使用 AdamW 优化器,学习率 1e-5,训练 0.5 个 epoch。
- GRPO 训练(DAR-R1):从 DAR-SFT 检查点初始化,使用 GRPO 优化时间定位、情感预测和推理质量,学习率 2e-6,训练 1 个 epoch。
评估:使用 test.py 脚本进行推理和评估。
许可协议:该项目采用 Apache License 2.0。原始视频受 emodiversity 及其原始来源的许可和使用条款约束。上游 Qwen 和 ms-swift 组件遵循其各自的许可协议。
关联论文:arXiv:2607.10238(ECCV 2026)。




