遇见数据集

HarmVideoBench

收藏
arXiv2026-06-25 更新2026-06-29 收录
数据链接:
官方服务:

资源简介:

HarmVideoBench是一个由多所高校与企业联合构建的多层诊断性基准数据集,旨在评估大型多模态模型对有害视频的深度理解能力。该数据集包含1,379个视频及对应的4,137道多项选择题,数据来源于HateMM等公开资源以及从YouTube和Bilibili平台人工筛选的视频,涵盖多种有害场景与跨语言语境。数据集的构建采用了AI辅助与人工审核相结合的标注流程,通过三个层次(可观察证据、片段内部含义、跨片段推理)系统性地解构有害视频的理解任务。该数据集主要应用于内容安全领域,旨在解决现有基准在评估模型对隐含危害和上下文推理能力方面的不足,推动更透明、全面的自动化内容审核研究。

HarmVideoBench is a multi-layer diagnostic benchmark dataset jointly constructed by multiple universities and enterprises, aiming to evaluate the deep comprehension capabilities of large multimodal models towards harmful videos. This dataset includes 1,379 videos and their corresponding 4,137 multiple-choice questions, with data sourced from public resources such as HateMM and videos manually screened from YouTube and Bilibili platforms, covering various harmful scenarios and cross-lingual contexts. The dataset construction adopts an annotation workflow combining AI assistance and manual review, and systematically deconstructs the comprehension task of harmful videos through three levels: observable evidence, intra-segment meaning, and cross-segment reasoning. This dataset is mainly applied in the field of content security, aiming to address the shortcomings of existing benchmarks in evaluating models' abilities of implicit harm detection and contextual reasoning, and promote more transparent and comprehensive research on automated content moderation.

创建时间:
2026-06-25
原始信息汇总

数据集概述:HarmVideoBench

来源与链接

核心目标

  • 评估大型多模态模型(LVLMs)对有害视频的深度理解能力,解决现有基准存在的两大问题:
    • 忽视有害视频的多层次特征,仅将其简化为二分类任务,无法捕捉隐含或深层上下文危害。
    • 缺乏解释性理由,仅判断模型是否正确标记,无法解释原因,导致评估黑箱化。

数据集构成

  • 视频数量:1379个视频
  • 题目数量:4137个多项选择题
  • 评估维度:三个层次化维度
    1. 可观察证据 (Observable Evidence):基于视频表面信息进行判断。
    2. 片段-内部含义 (Clip-Internal Meaning):理解视频片段内部的深层语义。
    3. 超越片段推理 (Beyond-Clip Reasoning):需结合片段外部上下文进行推理。

评估与基线方法

  • 评估模型:19个主流模型
  • 提出的方法:BCR(基准对齐方法),可预测推理边界并仅在需要时动态检索上下文。
  • 方法效果:将基础模型的宏平均准确率从61.7%提升至84.4%(达到当前最优)。

学科领域

  • 计算机视觉与模式识别 (cs.CV)
  • 计算与语言 (cs.CL)
搜集汇总
数据集介绍
HarmVideoBench 数据集图片
构建方式
HarmVideoBench的构建始于从YouTube、Bilibili等公开平台及现有数据集(如HateMM、MultiHateClip)收集约1,900个候选视频。依据明确的审核政策,筛选出包含暴力、仇恨言论、性剥削、危险行为、虚假信息及欺凌等有害信号的片段,最终保留1,379个视频。注释流程采用AI辅助与人工校验相结合的方式:首先由Qwen-2.5-VL-72B模型为每个视频生成详细描述及覆盖三个推理层级的多选题候选,随后由经过校准的注释员进行独立双盲审核,负责修改、重写或剔除不合适的候选题目。分歧由资深注释员最终裁决,确保每道题目的答案均基于充分证据且类别归属准确。在生成的5,344个候选题目中,最终保留了4,137个高质量的多选题,每个视频对应三个分别评估可观察证据、片段内意义和片段外推理的问题。构建过程强调人工主导,仅37.7%的题目被小幅接受,44.0%需大幅重写,保障了基准的严谨性。
使用方法
HarmVideoBench的使用方法围绕其三级推理框架展开。评估时,每个视频配套三道分别对应可观察证据、片段内意义和片段外推理的问题。模型需以视频帧(经均匀采样)和转录文本作为输入,在统一的多选题界面下作答。评估采用贪婪解码(温度设为0.0),并通过多级准确率进行衡量,包括各层级的分项准确率及宏观平均准确率。为缓解模型在深层推理上的不足,论文同时提供了边界约束推理(BCR)方法作为基线,该方法通过预测问题类型、选择性检索外部上下文以及约束解码步骤来提升性能。数据集还提供了70/10/20的官方划分(训练/开发/测试),方便研究者进行微调或任务适配。所有评估均在代码库(即将发布)中以标准化形式实现,以确保结果的可复现性。
背景与挑战
背景概述
大型视觉语言模型在自动化内容审核领域展现出巨大潜力,然而现有有害视频基准多局限于二元分类,忽略了有害内容的多层次特性,且缺乏对模型决策过程的解释性评估。为突破这一瓶颈,来自中南大学、清华大学、字节跳动等多所顶尖机构的研究团队于2026年联合构建了HarmVideoBench基准数据集。该基准含1379个视频与4137道选择题,从可观测证据、剪辑内部含义及跨剪辑推理三个递进维度评估模型对有害视频的深层理解,并提出了边界约束推理方法,将宏平均准确率从61.7%提升至84.4%,为多媒体内容安全研究提供了突破性诊断资源。
当前挑战
该数据集面临的挑战严峻。领域层面,现有方法将有害视频理解简化为表面分类,无法捕捉依赖文化隐喻、隐晦意图或社会背景的深层危害,尤其在跨剪辑推理中,模型常因缺乏外部知识而误判。构建过程中,数据标注冲击巨大:从约1900个候选视频中,通过AI辅助生成5344个候选题目,却仅保留4137个经人工反复核查的高置信度条目,其中44%的保留项需要进行实质性改写;且标注人员需反复接触暴力、仇恨等敏感内容,对伦理审查与心理健康保障提出了苛刻要求,最终形成了这一高门槛、高质量的专业基准。
常用场景
经典使用场景
HarmVideoBench最经典的用途在于作为大规模多模态模型(LVLMs)对有害视频理解能力的诊断性评测基准。传统基准将有害视频判别简化为二元分类任务,而该数据集则通过嵌套式的三级推理层次——可观察证据、片段内部含义、片段外推理——来全面衡量模型对有害视频的深层理解能力。评估方式采用多选问答形式,每个视频对应三道分别属于三个不同推理层级的问题,从而系统性地揭示模型在识别显性有害线索、理解隐性有害意图,以及结合社会文化背景进行推理等方面的表现差异。
解决学术问题
HarmVideoBench针对性解决了现有有害视频研究领域中两个核心学术问题:其一,克服了传统基准忽略有害视频多层级特征的问题,将测评从粗粒度的二元分类提升为细致的推理分层评估;其二,弥补了现有框架中解释性理据完全缺失的空白,迫使模型不仅要判断视频是否有害,还要论证为何有害,将评估从黑箱式的正确性检验转向可诊断的推理过程解析。该数据集为研究社区提供了透明的诊断工具,揭示了当下模型在视觉感知、语义理解与外部知识整合等环节的瓶颈,推动了有害内容理解领域的理论发展与评估范式的革新。
实际应用
在实际应用中,HarmVideoBench所包含的评测框架能够有效服务于视频分享平台(如YouTube、Bilibili)的自动内容审核系统。通过评估大规模多模态模型在三级推理层次上的表现,该基准可帮助平台甄别出那些仅凭表面线索无法判断的隐性有害内容,例如依托文化隐喻的仇恨言论、具有误导性的信息操纵或鼓励危险模仿的伪装行为。此外,其三级诊断机制为部署者提供了模型在何种推理层次上失效的细粒度洞察,从而辅助优化审核策略,提升平台安全性与用户社区的健康度。
数据集最近研究
最新研究方向
HarmVideoBench的提出标志着有害视频理解研究从二元分类迈向多层次诊断推理的前沿转型。该基准将有害视频评估解构为可观测线索、片段内部语义与跨片段情境推理三个递进层级,揭示了当前多模态大模型在表面感知上已趋成熟,但在深层社会意义理解与外部知识整合上仍存在显著瓶颈。这一范式革新直接回应了内容安全领域对可解释性评估的迫切需求,尤其针对暴力、歧视、误导性信息等热点事件中的隐性危害检测提供了系统化工具。研究还引入边界约束推理方法,通过动态情境检索显著提升了深层推理能力,进一步凸显了在视频内容审核、社交媒体安全治理等关键应用中,模型从“检测”向“理解”跨越的深远意义与学术价值。
相关研究论文
  • 1
    HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models中南大学; 清华大学; 华南师范大学; 字节跳动; 萨拉戈萨大学; CosmosMind; 武汉大学; 加州大学洛杉矶分校; 东南大学; 腾讯; 南开大学; Supermicro Computer Inc; 华中科技大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务