遇见数据集

SafeCI-18

收藏
github2026-08-23 更新2026-08-24 收录
数据链接:
官方服务:

资源简介:

SafeCI-18是首个大规模多模态安全基准,系统性地针对关键基础设施(CI)和物理世界操作领域设计。它涵盖了电力系统、轨道交通、现代农业和工业生产四个核心基础设施领域的18个细粒度场景,包含12,011对高质量图文对,通过真实世界采集和扩散驱动合成构建,用于评估多模态大语言模型在物理环境中的安全对齐缺陷。

SafeCI-18 is the first large-scale multimodal safety benchmark, systematically tailored for critical infrastructure (CI) and physical world operation domains. It encompasses 18 fine-grained scenarios across four core critical infrastructure sectors: power systems, rail transit, modern agriculture, and industrial production. Comprising 12,011 high-quality image-text pairs, the dataset is constructed through real-world data collection and diffusion-driven synthesis, and is used to evaluate safety alignment defects of multimodal large language models in physical environments.

创建时间:
2026-08-19
原始信息汇总

SafeCI-18 数据集详情总结

基本信息

SafeCI-18 是首个针对关键基础设施(Critical Infrastructure, CI)和物理世界操作领域,系统化定制的大规模多模态安全基准数据集。该数据集相关论文已被 ICDM 2026 接收(待发表)。数据集可通过 Hugging Face 获取(HuggingFace 链接),采用 Apache-2.0 许可证。

核心目标与覆盖范围

  • 填补空白:传统多模态安全基准主要聚焦于文本中心的在线危害(如非法活动、仇恨言论),SafeCI-18 旨在弥合 AI 安全对齐与物理世界安全之间的关键差距。
  • 覆盖领域:系统地整合了四大关键基础设施行业,包括电力系统、轨道交通、现代农业、工业生产
  • 场景细分:涵盖 18 个细粒度安全场景,并分为三个主要层级。

数据集规模与构建

  • 数据规模:包含 12,011 个高质量的 双源(图像-文本)数据对
  • 数据来源
    • 双源采集:结合真实世界摄影与基于扩散模型的逼真合成图像,覆盖 18 个关键场景。
    • 多模型生成:使用多种多模态大语言模型(MLLMs,如 Gemini、Qwen-VL、GPT)结合领域安全规则,合成隐蔽的技术性问题。
    • 基于大语言模型的质量控制:利用异构大语言模型(如 Gemma、DeepSeek、MiniMax)过滤低质量样本,将高分数据对封装为结构化 JSON 格式。

使用方式

  1. 数据下载:问题文件存放于 data/json 文件夹;图像需从 Hugging Face 下载压缩包(data.zip),解压后置于 data/imgs 目录。
  2. 数据格式:每个场景对应一个 JSON 文件,每项包含场景名称、图像文件名、图像描述及生成的问题。
  3. 模型测试
    • 提供批量测试脚本(如 testLLaVA.pytestInternvl.py),支持通过标准 OpenAI 兼容 API 服务器(如 LM Studio)对本地部署的 MLLM 进行推理。
    • 推理结果按场景保存至 ./data/output_json/ 目录,并在原始提示元数据基础上追加 model_response 字段。
  4. 自动安全评估:运行 deepseek_evaluate.py 脚本,采用"大语言模型作为裁判"(LLM-as-a-Judge)流程评估模型回复,并计算攻击成功率(ASR)。评估结果输出至 data/evaluation_results/
    • 场景审计文件:每个样本的安全判定结果与原始裁判输出。
    • 汇总表格:所有 18 个领域的 安全数量、不安全数量、安全率及 ASR 的聚合统计。

附加信息

  • 定性案例研究:提供了多个对比案例,展示模型在 纯文本(Text-only)图像+文本(Image+Text) 设置下的行为差异,例如描述早期模型在铁路场景下仅退化为中性场景描述,而先进模型可基于视觉组件提供可行的物理攻击步骤。
  • 引用信息:该数据集附带 BibTeX 引用格式(引用键:safeci18_2026),供学术研究引用。
搜集汇总
数据集介绍
SafeCI-18 数据集图片
构建方式
SafeCI-18数据集的构建融合了真实世界采集与扩散模型合成两种图像来源,覆盖电力系统、轨道交通、现代农业及工业生产四大关键基础设施领域,细分为18个具体场景。构建流程为标准化三阶段流水线:首先,通过双源采集获取高保真图像;其次,利用多种多模态大语言模型(如Gemini、Qwen-VL、GPT)结合领域安全规则,生成隐蔽性强的技术性查询;最后,采用异构大语言模型(如Gemma、DeepSeek、MiniMax)进行质量筛选,剔除低质量样本,并将高评分样本封装为结构化JSON格式,最终形成包含12,011对高质量图文样本的数据集。
特点
SafeCI-18作为首个面向关键基础设施与物理世界操作领域的多模态安全基准,填补了现有基准集中于文本在线危害的空白。其显著特点在于双源图像融合策略,兼顾真实性与多样性;18个细粒度场景系统覆盖四大关键基础设施部门,深入物理安全领域;所有查询均经过多模型生成与严格质量控制,确保安全评估的严谨性。此外,数据集提供标准化评估流程,支持批量测试与自动化安全评估(LLM-as-a-Judge),可计算攻击成功率(ASR),为多模态大语言模型在高风险物理环境下的安全部署提供实证基础。
使用方法
使用SafeCI-18时,用户需从Hugging Face下载图像压缩包并解压至data/imgs目录,文本查询位于data/json文件夹下,按场景划分JSON文件。测试阶段,用户可通过OpenAI兼容API服务器(如LM Studio)部署目标多模态模型,运行testLLaVA.py或testInternvl.py脚本进行推理,输出结果保存于data/output_json/。随后,执行deepseek_evaluate.py脚本,采用LLM-as-a-Judge流程自动评估模型响应,计算各场景的安全率与攻击成功率,结果汇总至data/evaluation_results/下的CSV文件。这一流程为研究者提供了从数据加载到安全指标计算的闭环工具,便于复现与扩展评估。
背景与挑战
背景概述
随着多模态大语言模型(MLLMs)在物理世界中的广泛应用,其安全对齐问题日益凸显。传统的多模态安全基准多聚焦于在线文本危害,如非法活动与仇恨言论,而忽略了关键基础设施(CI)等物理世界场景中的潜在风险。为弥合这一鸿沟,由Xingtao Zhu、Chaofan Chen等研究人员于ICDM 2026提出的SafeCI-18基准,首次系统性覆盖电力系统、轨道交通、现代农业及工业生产四大核心CI领域,涵盖18个细粒度场景,包含12,011对通过真实采集与扩散合成构建的高质量图文数据。该基准旨在揭示MLLMs的跨模态对齐缺陷,为高后果物理环境下的模型安全部署提供严格的实证基础,对推动多模态安全评估研究具有重要意义。
当前挑战
SafeCI-18的构建面临多重挑战。首先,领域问题层面,现有安全基准未能充分覆盖物理世界关键基础设施的复杂性,模型需在图像与文本间准确理解并抵御潜在攻击性指令,而跨模态对齐的薄弱环节易被利用,导致安全评估不充分。其次,构建过程中,数据采集需兼顾真实性与多样性,通过真实拍摄与扩散合成结合,确保18个场景的影像逼真度与覆盖度;同时,基于安全规则引导多模型(如Gemini、Qwen-VL)生成隐蔽性技术查询,需平衡问题的有效性与真实性;最后,利用异构LLM(如Gemma、DeepSeek)进行质量筛选,需设计严格标准以剔除低质样本,最终封装为结构化JSON,流程复杂且要求高精度控制。
常用场景
经典使用场景
SafeCI-18作为首个面向关键基础设施场景的大规模多模态安全基准,其经典使用场景聚焦于评估多模态大语言模型(MLLMs)在物理世界高风险环境中的安全对齐能力。研究者可利用其涵盖电力系统、轨道交通、现代农业及工业生产等18个细粒度场景的12,011对图文样本,系统性地检验模型在面对越狱式视觉语义输入时的鲁棒性。通过双源数据构建与LLM辅助质量控制的标准化流程,该基准为跨模态安全评估提供了严谨的实证平台,特别适用于暴露模型在视觉上下文诱导下的对齐缺陷,进而推动安全防护策略的优化。
解决学术问题
该数据集填补了现有安全基准侧重于文本中心在线危害的空白,解决了MLLMs在物理世界关键基础设施场景中缺乏系统性安全评估的学术问题。其核心贡献在于构建了四大核心基础设施领域的细粒度威胁分类体系,并通过真实采集与扩散合成相结合的方式确保了数据的多样性和真实性。这一基准不仅揭示了跨模态对齐缺失导致的安全脆弱性,还为量化模型在不同场景下的攻击成功率(ASR)提供了标准化工具,从而为AI安全研究建立了新的评估维度,深刻影响了后续安全对齐理论与实证研究的发展方向。
衍生相关工作
围绕SafeCI-18衍生了多项经典工作,包括对基线MLLMs(如LLaVA、InternVL等)进行系统性安全压力测试的研究,以及在文本与图像双模态对比下揭示模型行为差异的定性分析。此外,该基准推动了对抗性提示优化与安全微调策略的发展,例如利用LLM-as-a-Judge流水线增强安全评估效率,并催生了针对跨模态越狱攻击的防御机制研究。其在电力、交通等领域的具体案例分析,为后续构建领域专属安全基准和鲁棒性提升方法提供了范式参考,形成了一个持续演进的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务