OVERT
收藏资源简介:
OVERT数据集是一个专门为评估文本到图像模型中的过度拒绝行为而设计的大型基准数据集。它包含4600个看似有害但实际上无害的提示,以及1785个真正有害的提示,旨在评估安全性-实用性权衡。数据集分为九个安全相关类别,旨在严格评估过度拒绝的倾向。该数据集通过自动工作流程构建,以创建合成评估数据,并包括一个补充数据集OVERT-unsafe,用于评估安全性-实用性权衡。该数据集的创建过程包括使用LLMs生成提示、过滤和审计、去重、采样和使用Chameleon进行后处理。OVERT数据集适用于研究如何在不牺牲模型功能的情况下提高文本到图像模型的安全性对齐。
The OVERT Dataset is a large-scale benchmark dataset specifically developed to evaluate over-rejection behavior in text-to-image models. It encompasses 4,600 seemingly harmful but actually harmless prompts and 1,785 truly harmful prompts, with the goal of assessing the safety-usability tradeoff of text-to-image models. The dataset is partitioned into nine safety-related categories to enable rigorous evaluation of the model's over-rejection propensity. Built using an automated workflow to generate synthetic evaluation data, the OVERT Dataset also includes a supplementary dataset called OVERT-unsafe for safety-usability tradeoff assessment. Its development workflow covers prompt generation via LLMs, filtering and auditing, deduplication, sampling, and post-processing using Chameleon. This dataset is well-suited for research on enhancing safety alignment of text-to-image models while preserving their functional capabilities.
OVERT: Over-Refusal Evaluation on Text-to-Image Models
数据集概述
- 名称: OVERT (Over-Refusal Evaluation on Text-to-Image Models)
- 目的: 评估文本到图像(T2I)模型在安全相关类别中的过度拒绝问题。
- 规模: 包含4,600个看似有害但实际无害的提示(OVERT-mini)和1,785个真正有害的提示(OVERT-unsafe)。
- 类别: 覆盖9个安全相关类别,包括隐私(个人)、隐私(公共)、版权侵犯、自残、性内容、非法活动、不道德和不安全行为、歧视和暴力。
数据集构成
- OVERT-mini: 4,600个无害提示,用于评估模型的过度拒绝行为。
- OVERT-unsafe: 1,785个有害提示,用于评估模型的安全性与功能性之间的权衡。
数据集构建流程
- 提示生成: 通过LLMs从WildGuardMix或模板生成提示。
- 过滤与审核: 对生成的提示进行安全过滤和审核。
- 去重与采样: 使用Chameleon进行去重和采样。
- 最终数据集: 用于评估T2I模型的过度拒绝问题。
评估结果
- 模型评估: 包括Imagen-3、DALL-E-3、FLUX1.1-Pro、SD-3.5-Large等模型。
- 评估指标: 拒绝率(在无害提示上的拒绝百分比)和安全响应率(在有害提示上的安全响应百分比)。
- 结果展示: 不同模型在不同类别上表现出不同的拒绝行为(见图3和图4)。
使用方法
-
脚本调用: 使用
main.py进行评估。 bash python main.py --model_name imagen-3.0-generate-002 --category sexual_content --split mini -
参数说明:
--model-name: 支持的模型包括Imagen-3、DALL-E-3、FLUX1.1-Pro、SD-3.5-Large。--category: 9个安全相关类别之一。--split: 可选择mini、full或unsafe数据集。
输出格式
- 结果存储: 存储在
eval_logs/{category}/{model_name}目录下。 - 结果文件:
eval_results_{split}.json,包含每个种子提示的评估结果。 json { "seed_prompt": "示例提示", "category": "类别", "outputs": [ { "prompt": "生成提示", "image_path": [], "error": "错误信息", "refused": 1 } ], "refusal_rate": 100.0 }

- 1OVERT: A Benchmark for Over-Refusal Evaluation on Text-to-Image Models加州大学伯克利分校 · 2025年



