遇见数据集

SafeAtlas-VL

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

SafeAtlas-VL 是一个大规模、基于图像的多模态安全数据集,专注于图像、用户请求和助手响应的内容审核。该数据集采用五级有序安全标签(从 safe_core 到 unsafe_core)进行标注,并涵盖 15 种危害类别。当前发布的版本包含 1,000,000 条安全标注,覆盖 594,487 张唯一图像,同时提供约 5,000 条标注的测试集。数据集提供两种配置:'images' 配置以每张唯一图像为一行,包含嵌套的标注列表;'annotations' 配置以每条安全标注为一行,便于扁平化处理。字段包括图像标识符、图像数据、标注标识符、审核目标(图像/请求/响应)、用户请求、助手回复、安全标签、危害类别以及教师模型输出等。该数据集适用于多模态安全审核、有序风险评估、红队测试、安全评估以及安全对齐研究。注意:数据集中包含不安全、冒犯性、敏感甚至令人不适的内容,仅供安全研究使用,严禁用于任何有害活动。

SafeAtlas-VL is a large-scale, image-based multimodal safety dataset focused on content moderation of images, user requests, and assistant responses. The dataset is annotated with five-level ordinal safety labels (from safe_core to unsafe_core) and covers 15 harm categories. The current release includes 1,000,000 safety annotations, covering 594,487 unique images, along with a test set of approximately 5,000 annotations. The dataset provides two configurations: the images configuration, where each row corresponds to a unique image with a nested list of annotations, and the annotations configuration, where each row corresponds to a single safety annotation for flat processing. Fields include image identifier, image data, annotation identifier, moderation target (image/request/response), user request, assistant response, safety label, harm category, and teacher model outputs. The dataset is suitable for multimodal safety moderation, ordinal risk assessment, red teaming, safety evaluation, and safety alignment research. Note: The dataset contains unsafe, offensive, sensitive, and potentially disturbing content, intended solely for safety research and prohibited from any harmful use.

创建时间:
2026-08-26
原始信息汇总

SafeAtlas-VL 数据集概述

基本信息

SafeAtlas-VL 是一个大规模图像基础的多模态安全数据集,提供针对图像、用户请求和助手回复的五级有序安全标签(ordinal safety labels)。当前版本包含 1,000,000 条安全标注,覆盖 594,487 张唯一图像,完整数据集将在未来更新中发布。

数据规模

数据划分 唯一图像数 安全标注数
训练集 (train) 594,487 1,000,000
测试集 (test) 4,979 5,000

数据结构

配置方式

  • images 配置(默认):每行对应一张唯一图像,包含嵌套的标注列表。
  • annotations 配置:每行对应一条安全标注,以表格形式呈现,不包含图像列。
  • 两个配置可通过 image_id 字段进行连接。

images 配置字段

字段 类型 描述
image_id string 按划分局部唯一的图像标识符(如 train_img_0000000
image Image 编码后的图像数据
annotations list 该图像对应的安全标注列表

嵌套标注字段

字段 类型 描述
annotation_id string 按划分局部唯一的标注标识符
target string 目标类型,取值为 imagerequestresponse
request nullable string 用于 request/response 目标的用户请求
response nullable string 用于 response 目标的助手回复
safety_label string 五级有序安全标签
category string 15 种危害类别之一,safe_core 时为 none
teacher_head nullable struct 三个教师模型的输出;图像目标时为 null

教师模型输出结构

  • qwen3guard:取值为 SCU
  • guardreasoner_vl:取值为 01
  • llamaguard4:取值为 01

标签体系

有序安全标签(从安全到不安全)

  1. safe_core
  2. safe_leaning_disputed
  3. boundary_uncertain
  4. unsafe_leaning_disputed
  5. unsafe_core

15 种危害类别

dangerous informationdefamationerosion of trust in public informationfalse beliefsfraud or deceptive actionillegal activitiesinfluence operationspersuasion and manipulationprivacyrisky financial practicessecurity threatstoxictrade and complianceunfairviolation of personal property

数据组织与格式

  • 数据以分片(sharded)Parquet 文件形式发布,架构中嵌入了 Hugging Face Image 特征。
  • images 配置包含图像数据和嵌套标注;annotations 配置以表格形式呈现标注。

敏感内容与使用说明

敏感内容警告

该数据集专为安全研究设计,必然包含不安全、冒犯性、敏感且可能令人不适的图像、请求和回复。

预期用途

多模态安全审核、有序风险评估、红队测试、评估及安全对齐研究。数据集不得用于促进有害活动,也不得用于针对个人或受保护群体。

相关资源

  • 代码仓库:https://github.com/zrwang1211/SafeAtlas-VL
  • 模型集合:https://huggingface.co/collections/zrwang1211/safeatlas-guard
搜集汇总
数据集介绍
SafeAtlas-VL 数据集图片
构建方式
SafeAtlas-VL数据集基于大规模图像-文本对构建,采用五级有序安全标签对图像、用户请求及助手响应进行全面审核。其构建过程融合了多模态安全审核领域的先进理念,通过组织专业标注团队,结合自动化教师模型(如Qwen3Guard、GuardReasoner-VL、LlamaGuard4)与人工校验,确保标签的准确性与一致性。数据集以分片Parquet格式存储,包含图像与标注两种配置,前者按唯一图像组织并嵌套多条标注,后者提供扁平化表格视图,两者可通过image_id字段无缝关联,为多模态安全研究提供了结构清晰、扩展性强的数据基础。
特点
该数据集的核心特色在于其庞大的规模与精细的标注体系,包含超过59万张独立图像及100万条安全标注,覆盖15种危害类别,标签从完全安全到严重不安全形成连续谱系,支持细微的风险区分。教师模型的多头输出增强了标注的可解释性,便于模型学习不同审核视角。图像、请求与响应三种目标类型的设计,使得数据集能够全面评估多模态交互中的安全风险,适用于安全审核、红队测试及模型对齐等多元研究场景,其分片存储与流式加载的特性亦提升了数据使用的便捷性与效率。
使用方法
使用者可通过Hugging Face Datasets库轻松加载该数据集,支持流式模式以应对大规模数据。默认的images配置适合需要图像输入的场景,返回每个图像及其嵌套标注列表;annotations配置则提供纯文本的扁平标注,便于快速统计与分析。两种配置均可通过image_id进行连接,以满足不同研究需求。数据集专为多模态安全审核、风险等级评估及安全对齐实验设计,严禁用于任何有害活动或针对特定群体的歧视,确保研究伦理与数据使用的合规性。
背景与挑战
背景概述
SafeAtlas-VL数据集由zrwang1211团队构建,于2025年发布,旨在应对多模态内容安全领域日益严峻的挑战。该数据集创新性地引入五级有序安全标签,覆盖图像、用户请求和助手回应三类目标,共包含594,487张独特图像及100万条细粒度安全标注。其核心研究问题在于如何精确量化多模态内容的风险等级,突破传统二元安全分类的局限。通过整合15种伤害类别和三个教师模型(Qwen3Guard、GuardReasoner-VL、LlamaGuard4)的联合标注,SafeAtlas-VL为多模态安全审核、红队测试及安全对齐研究提供了大规模高质量基准,有望推动该领域的标准化与实证进展。
当前挑战
SafeAtlas-VL所面临的挑战多维且复杂。在领域层面,多模态内容安全审核长期受制于语义模糊性与上下文依赖性,传统二元分类难以捕捉细微风险差异,而五级有序标签的引入对模型细粒度判别能力提出更高要求。在构建层面,数据集需在庞大且多样化的网络图像与文本中确保标注的一致性与准确性,平衡困难样本的分布,并克服多教师模型输出冲突带来的标注噪声。此外,数据规模扩充与质量保障之间的张力,以及内容安全研究固有的敏感性与伦理边界,均为数据集构建与后续应用带来了严峻考验。
常用场景
经典使用场景
SafeAtlas-VL作为大规模图像锚定的多模态安全数据集,其核心应用在于视觉语言模型的安全对齐与细粒度风险分级评估。该数据集精心设计了涵盖图像、用户请求及模型响应三大维度的五级序数安全标注体系,并细分为十五种危害类别,为研究界提供了空前丰富且结构化的安全基准。经典使用场景集中于多模态内容安全审核模型的训练与微调,以及作为红队测试和鲁棒性评估的高质量测试床,有效支撑起从图像内容到交互语境的全面安全性量化分析。
实际应用
在实际应用中,SafeAtlas-VL直接对接内容审核工业界需求,用于构建能够判别图文信息、用户提示及生成回复危害等级的多模态安全过滤器。它可部署于社交平台、搜索引擎、AI助手等场景,实现对色情、暴力、欺诈等违规内容的精准拦截与分级管控。同时,该数据集支持安全策略的动态调优,帮助开发者在开放世界中识别新型攻击模式,从而显著提升线上服务的安全防护能力与合规水平。
衍生相关工作
该数据集的发布催生了一系列具有引领性的衍生工作,其核心是与之配套的SafeAtlas Guard模型系列,该系列通过多教师头(如Qwen3Guard、GuardReasoner-VL、LlamaGuard4)的集成与蒸馏,开创了融合多源安全信号进行序数判级的新范式。此外,数据集的序数标签结构激发了关于安全风险连续性与边界模糊性的理论探索,并推动了跨语言、跨文化安全标准对齐的研究方向。其公开的标注模式也为后续研究提供了可复用的方法论,促使了更广泛的多模态安全基准与评测工具链的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务