遇见数据集

SafeAtlas-VL

收藏
github2026-09-01 更新2026-09-06 收录
官方服务:

资源简介:

SafeAtlas-VL数据集是一个大规模多模态安全数据集,包含100万训练样本和5000个测试样本,用于训练和评估多模态安全模型,支持二进制安全分类。

The SafeAtlas-VL Dataset is a large-scale multimodal safety dataset containing 1 million training samples and 5,000 test samples. It is designed for training and evaluating multimodal safety models, and supports binary safety classification.

创建时间:
2026-08-26
原始信息汇总

SafeAtlas-VL 数据集概述

基本信息

数据集规模

  • 训练集:100万条训练样本
  • 测试集:5,000条测试样本

数据标注说明

每条数据记录包含以下字段:

  • target_name:目标类别(image 表示可见图像内容;request 表示基于图像的文本请求;response 表示带有图像和请求上下文的助手回复)
  • request:图像相关的用户请求文本
  • response:助手生成的回复文本
  • safety_label:五级安全标签(核心安全类别)

每条记录还附带连续风险评分序数概率以及多个教师模型预测头的结果(教师预测头针对请求和回复目标而定义)。

数据特点

  • 数据集包含多模态(图像、文本请求、文本回复)的安全评估信息
  • 安全标签采用五级细分(超越传统二元安全分类)
  • 提供了序数风险评分和16分类类别头,以及3个教师模拟头
  • 数据集涵盖不安全、冒犯、敏感和可能令人不适的内容,旨在服务于多模态安全研究,如安全审核、序数风险评估、红队测试、评估及安全对齐研究

适用场景与禁止使用声明

  • 用途限定:仅限安全审核、序数风险评估、红队测试、评估和安全对齐研究
  • 禁止用途:不得用于促进有害活动,不得针对个人或受保护群体
  • 使用警示:模型输出依赖上下文与策略设定,需结合实际部署场景评估,不得单独作为高影响决策依据
搜集汇总
数据集介绍
SafeAtlas-VL 数据集图片
构建方式
SafeAtlas-VL数据集的构建旨在突破传统多模态安全评估的二元局限,通过大规模数据和精细标注,覆盖从图像内容到多模态交互的多维安全维度。该数据集基于两阶段训练流程构建,第一阶段进行全参数多模态指令微调,使主干模型能够产生结构化的、目标条件化的安全判断;第二阶段冻结微调后的主干,并训练累积序数头、16路类别头及三个教师模拟头,以捕捉细粒度的风险层级。数据集包含100万个训练样本和5000个测试样本,每份标注均通过适配器归一化为统一记录,涵盖目标名称、请求、响应及安全标签等关键字段,为多模态安全研究提供了丰富而结构化的数据基础。
特点
SafeAtlas-VL数据集的核心特点在于其超越二元分类的安全性评估体系,支持五级风险标签与连续风险评分,实现了对多模态内容风险的序数度量。数据集整合了来自图像、请求及响应三类目标的独立评估视角,并引入教师头预测,增强了模型的上下文理解与判断一致性。该数据集覆盖了广泛的不安全类别与模态组合,在外部基准测试中展现出优异表现,尤其是对多模态请求与响应的平均F1分数达到87%以上,显著提升了模型对复杂安全场景的泛化能力。此外,数据集公开了构建流程与评测接口,便于研究者复现与扩展,推动了多模态安全领域的发展。
使用方法
SafeAtlas-VL数据集及其配套模型的使用流程简洁高效,用户可通过Python API或命令行工具快速加载预训练模型进行推断。使用时需指定模型路径与目标评估对象(图像、请求或响应),并传入相应的图像路径、文本请求或响应内容,模型将返回安全标签、风险评分及序数概率等结构化输出。数据集通过迭代器以流式方式读取训练或测试记录,支持本地仓库或远程Hub,便于大规模数据探索与模型微调。该资源专为安全审核、风险分级、红队测试及安全对齐研究设计,用户应遵循伦理指南,避免将模型输出作为高风险决策的唯一依据,并在部署前进行针对性评估,以确保其在具体场景中的有效性与可靠性。
背景与挑战
背景概述
随着多模态大语言模型的迅猛发展,其交互内容的安全性评估已成为亟待解决的关键议题。传统安全评测体系往往局限于二元分类,难以捕捉复杂情境下微妙的风险梯度。SafeAtlas-VL数据集由Zongrui Wang等学者于2026年构建,依托大规模数据与守卫模型,旨在突破多模态安全评估的二元范式,引入五级细粒度标签与连续风险评分。该数据集包含百万级训练样本与五千测试样本,覆盖图像、文本及多模态交互,推动安全评估向更精准、更细致的维度演进,为多模态内容安全领域提供了规模化、标准化的研究基准,对安全对齐与风险防控研究具有重要支撑作用。
当前挑战
构建SafeAtlas-VL面临多重挑战。领域层面,多模态安全数据固有的敏感性与多样性对标注一致性构成考验,而现有评估基准普遍缺乏对风险细粒度的刻画,难以满足实际部署中对风险排序与精细管控的需求。构建过程中,需从海量异构数据中筛选并组织含不安全内容的样本,要求兼顾数据质量与伦理边界,规避隐私与滥用风险。此外,模型需同时输出五级标签、连续分数及多教师预测头,训练策略复杂,涉及两阶段流程与多任务目标,对计算资源与调优效能提出较高要求。平衡数据规模、标注精度与模型泛化能力,成为该数据集推进过程中的核心挑战。
常用场景
经典使用场景
SafeAtlas-VL数据集作为多模态安全评估的基准资源,其经典使用场景集中于视觉语言模型(VLM)的安全对齐与鲁棒性测试。研究者通过该数据集对模型在图像、用户请求及助手响应三个层面进行细粒度的五级安全标注,以取代传统的二元安全分类。其典型应用包括利用提供的API或命令行工具,针对特定模型执行安全预测,评估多模态交互中潜藏的风险内容,从而为模型的安全性能提供量化度量。
衍生相关工作
基于SafeAtlas-VL,衍生出了一系列关于VLM安全对齐与防御机制的后续研究。例如,利用其数据训练更高效的安全微调算法,或探索对抗性提示攻击的检测与防护。此外,该数据集的多维标注结构亦促进了可解释性安全预警模型的设计,以及跨模态风险传播分析等前沿课题。这些工作共同丰富了多模态安全研究的理论体系,并为构建可信赖AI系统提供了坚实的数据支撑与评估范式。
数据集最近研究
最新研究方向
SafeAtlas-VL数据集聚焦于多模态内容安全评估领域的范式革新,其核心研究方向在于突破传统二元安全分类的局限,通过引入五级细粒度安全标签、连续风险评分及多教师模拟头,构建了面向图像、用户请求与助手响应的三维度序数安全判别机制。结合百万级训练样本与两阶段训练流程,该数据集有力支撑了从基础视觉语言模型到专用安全守卫模型的迁移,推动了多模态安全对齐、红队测试及风险量化评估等前沿课题的发展。其在跨基准测试中的卓越表现,尤其是对文本与视觉融合场景下越狱攻击与隐性风险的识别能力,标志着数据驱动型安全治理从粗粒度判别迈向精细化、可解释性评估的进程,为构建人机共生时代可信赖的多模态智能系统奠定了重要数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务