遇见数据集

PKU-Alignment/SafeSora-Eval

收藏
Hugging Face2024-06-20 更新2024-06-15 收录
官方服务:

资源简介:

SafeSora是一个人类偏好数据集,旨在支持文本到视频生成领域的安全对齐研究,以提高大型视觉模型(LVMs)的有益性和无害性。它目前包含三种类型的数据:一个包含57k+文本-视频对的分类数据集(SafeSora-Label),其中包括对其文本提示和文本-视频对的12种伤害标签的多标签分类;一个包含51k+实例的人类偏好数据集(SafeSora),在文本到视频生成任务中包含有益性和无害性方面的比较关系,以及有益性的四个子维度;一个包含600个人工编写提示的评估数据集(SafeSora-Eval),其中300个是安全中性的,另外300个是根据12种伤害类别构建的红队提示。未来,还将开源一些利用这些数据集的基线对齐算法。

SafeSora is a human preference dataset designed to support safety alignment research in the text-to-video generation domain, with the objective of enhancing the helpfulness and harmlessness of large vision models (LVMs). Currently, it encompasses three types of datasets: 1. The classification dataset (SafeSora-Label) with over 57,000 text-video pairs, which enables multi-label classification of 12 harm labels for their corresponding text prompts and text-video pairs; 2. The human preference dataset (SafeSora) comprising over 51,000 instances, which contains comparative preference relationships regarding helpfulness and harmlessness in text-to-video generation tasks, as well as four sub-dimensions of helpfulness; 3. The evaluation dataset (SafeSora-Eval) containing 600 manually written prompts, of which 300 are safety-neutral and the remaining 300 are red team prompts constructed based on the 12 harm categories. In the future, baseline alignment algorithms that utilize these datasets will also be open-sourced.

提供机构:
PKU-Alignment
原始信息汇总

数据集卡片 for SafeSora

概述

SafeSora 是一个人类偏好数据集,旨在支持文本到视频生成领域的安全对齐研究,目的是提高大型视觉模型(LVMs)的有用性和无害性。该数据集目前包含三种类型的数据:

  1. 分类数据集(SafeSora-Label):包含超过 57,000 个文本-视频对,包括 12 种伤害标签的多标签分类。
  2. 人类偏好数据集(SafeSora):包含超过 51,000 个实例,涉及文本到视频生成任务中的有用性和无害性的比较关系,以及四个有用性的子维度。
  3. 评估数据集(SafeSora-Eval):包含 600 个人类编写的提示,其中 300 个是安全中性的,另外 300 个是根据 12 种伤害类别构建的红队提示。

评估数据集

评估数据集包含 600 个人类编写的提示,包括 300 个安全中性提示和 300 个红队提示。这些红队提示是基于 12 种有害类别构建的。这些提示不会出现在训练集中,保留给研究人员用于模型评估的视频生成。

搜集汇总
数据集介绍
构建方式
在文本到视频生成领域,模型的安全对齐研究日益受到关注。SafeSora-Eval评估数据集由北京大学对齐团队精心构建,包含600条人工编写的提示词,其中300条为安全中性提示,另外300条则依据12类危害类别设计为红队测试提示。这些提示词经过严格筛选,确保与训练集无重叠,专用于模型评估场景。
使用方法
研究者可直接利用该数据集进行文本到视频生成模型的安全性能评估。具体而言,可将600条提示词作为输入,驱动目标模型生成对应视频,随后对生成内容进行安全性与帮助性分析。数据集以JSON格式存储,通过HuggingFace平台便捷加载,支持快速集成到现有评估流程中。
背景与挑战
背景概述
随着大规模视觉模型(LVM)与文本到视频生成技术的迅猛发展,确保生成内容的安全性与伦理性已成为学术界与工业界共同关注的焦点。在此背景下,北京大学对齐研究团队于2024年推出了SafeSora-Eval数据集,旨在为文本到视频领域的模型安全对齐研究提供标准化评估基准。该数据集由600条人工撰写的提示词构成,其中300条为安全中性提示,另300条依据12类有害类别构建的对抗性提示,专门用于红队测试。作为SafeSora系列的核心评估组件,该数据集填补了文本到视频生成领域缺乏系统性安全评估资源的空白,为后续对齐算法的开发与模型无害化研究奠定了重要基础,对推动生成式AI的安全可控发展具有深远影响。
当前挑战
SafeSora-Eval数据集所应对的核心挑战在于文本到视频生成模型在安全对齐方面的评估缺失。一方面,现有基准多聚焦于图像或文本模态,难以直接迁移至视频生成任务,且缺乏对有害内容的系统性分类与对抗性测试能力;另一方面,构建过程中面临诸多困难:如何设计覆盖广泛且符合实际威胁场景的12类有害类别标签体系,如何确保300条对抗性提示在语义上逼真且避免与训练集重叠,以及如何保证人工撰写提示的多样性与文化敏感性,均是研发团队必须克服的关键难题。这些挑战的解决直接关系到评估结果的有效性与模型安全对齐研究的可信度。
常用场景
经典使用场景
在文本到视频生成领域,SafeSora-Eval作为一项系统化的评估基准,被广泛用于衡量大型视觉模型(LVM)在安全对齐方面的表现。该数据集精心构建了600条人工撰写的提示词,其中300条为安全中性提示,另300条则依据12类有害类别设计为红队攻击提示,旨在模拟真实世界中可能出现的风险场景。研究者通过让模型基于这些提示生成视频,进而评估其在帮助性与无害性维度上的表现,从而判断模型是否具备抵御恶意输入、避免生成不当内容的能力。这一经典使用场景不仅为安全对齐算法提供了标准化的测试平台,也使得不同模型之间的安全性能对比成为可能。
解决学术问题
SafeSora-Eval的核心学术价值在于它直面了大型视觉模型在文本到视频生成任务中普遍存在的安全隐患问题。随着生成式AI技术的飞速发展,模型可能被用于生成包含暴力、色情、仇恨言论等有害内容的视频,而此前缺乏针对这一领域的高质量评估数据集。该数据集通过系统化分类有害类别并构建针对性提示,解决了如何量化模型安全风险、如何标准化评估安全对齐效果等关键学术难题。其意义在于推动了从定性讨论到定量评估的转变,为安全对齐研究提供了可复现、可比较的实验基础,进而促进更可靠、更负责任的生成模型设计。
实际应用
在实际应用层面,SafeSora-Eval为互联网内容审核、视频平台安全部署以及AI服务提供商提供了重要的参考工具。例如,视频生成平台在推出新模型前,可利用该数据集对模型进行压力测试,识别其在生成不当内容方面的脆弱点,进而调整模型参数或引入额外的安全过滤机制。此外,企业社会责任团队可依据评估结果制定更严格的内容安全策略,降低法律与声誉风险。对于监管机构而言,该数据集可作为衡量生成式AI产品合规性的辅助标准,推动行业形成统一的安全评估规范,从而在技术发展与社会伦理之间取得平衡。
数据集最近研究
最新研究方向
在文本到视频生成领域,安全对齐研究正成为前沿热点,PKU-Alignment团队推出的SafeSora-Eval评估数据集应运而生。该数据集聚焦于大视觉模型(LVM)的实用性与无害性平衡,通过600条人工编写的提示词(包括300条安全中立提示和300条基于12类危害类别的红队提示),为模型安全性评估提供了标准化基准。这一工作紧密关联着AI生成内容治理的紧迫需求,尤其是在Sora等先进视频生成模型引发广泛关注的背景下,SafeSora-Eval填补了视频生成安全对齐评估的空白,为研究人员系统检测模型在敏感场景下的表现提供了关键工具,其多维度危害分类设计也推动了负责任AI发展从文本向多模态领域的延伸。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务