SafeCI-18
收藏资源简介:
SafeCI-18是首个大规模多模态安全基准,系统性地针对关键基础设施(CI)和物理世界操作领域设计。它涵盖了电力系统、轨道交通、现代农业和工业生产四个核心基础设施领域的18个细粒度场景,包含12,011对高质量图文对,通过真实世界采集和扩散驱动合成构建,用于评估多模态大语言模型在物理环境中的安全对齐缺陷。
SafeCI-18 is the first large-scale multimodal safety benchmark, systematically tailored for critical infrastructure (CI) and physical world operation domains. It encompasses 18 fine-grained scenarios across four core critical infrastructure sectors: power systems, rail transit, modern agriculture, and industrial production. Comprising 12,011 high-quality image-text pairs, the dataset is constructed through real-world data collection and diffusion-driven synthesis, and is used to evaluate safety alignment defects of multimodal large language models in physical environments.
SafeCI-18 数据集详情总结
基本信息
SafeCI-18 是首个针对关键基础设施(Critical Infrastructure, CI)和物理世界操作领域,系统化定制的大规模多模态安全基准数据集。该数据集相关论文已被 ICDM 2026 接收(待发表)。数据集可通过 Hugging Face 获取(HuggingFace 链接),采用 Apache-2.0 许可证。
核心目标与覆盖范围
- 填补空白:传统多模态安全基准主要聚焦于文本中心的在线危害(如非法活动、仇恨言论),SafeCI-18 旨在弥合 AI 安全对齐与物理世界安全之间的关键差距。
- 覆盖领域:系统地整合了四大关键基础设施行业,包括电力系统、轨道交通、现代农业、工业生产。
- 场景细分:涵盖 18 个细粒度安全场景,并分为三个主要层级。
数据集规模与构建
- 数据规模:包含 12,011 个高质量的 双源(图像-文本)数据对。
- 数据来源:
- 双源采集:结合真实世界摄影与基于扩散模型的逼真合成图像,覆盖 18 个关键场景。
- 多模型生成:使用多种多模态大语言模型(MLLMs,如 Gemini、Qwen-VL、GPT)结合领域安全规则,合成隐蔽的技术性问题。
- 基于大语言模型的质量控制:利用异构大语言模型(如 Gemma、DeepSeek、MiniMax)过滤低质量样本,将高分数据对封装为结构化 JSON 格式。
使用方式
- 数据下载:问题文件存放于
data/json文件夹;图像需从 Hugging Face 下载压缩包(data.zip),解压后置于data/imgs目录。 - 数据格式:每个场景对应一个 JSON 文件,每项包含场景名称、图像文件名、图像描述及生成的问题。
- 模型测试:
- 提供批量测试脚本(如
testLLaVA.py、testInternvl.py),支持通过标准 OpenAI 兼容 API 服务器(如 LM Studio)对本地部署的 MLLM 进行推理。 - 推理结果按场景保存至
./data/output_json/目录,并在原始提示元数据基础上追加model_response字段。
- 提供批量测试脚本(如
- 自动安全评估:运行
deepseek_evaluate.py脚本,采用"大语言模型作为裁判"(LLM-as-a-Judge)流程评估模型回复,并计算攻击成功率(ASR)。评估结果输出至data/evaluation_results/:- 场景审计文件:每个样本的安全判定结果与原始裁判输出。
- 汇总表格:所有 18 个领域的 安全数量、不安全数量、安全率及 ASR 的聚合统计。
附加信息
- 定性案例研究:提供了多个对比案例,展示模型在 纯文本(Text-only) 与 图像+文本(Image+Text) 设置下的行为差异,例如描述早期模型在铁路场景下仅退化为中性场景描述,而先进模型可基于视觉组件提供可行的物理攻击步骤。
- 引用信息:该数据集附带 BibTeX 引用格式(引用键:
safeci18_2026),供学术研究引用。




