felfri/dose-response-generated-images
收藏资源简介:
--- license: apache-2.0 tags: - diffusion - text-to-image - safety - dose-response - image-generation size_categories: - 10K<n<100K --- # Dose-Response Generated Images Generated images and safety annotations from the dose-response experiment studying how unsafe training data fraction affects text-to-image model output safety. ## Dataset Description Each condition's model was used to generate 10,000 images from the same prompt set (1K safe + 9K unsafe prompts). All images were annotated for safety using 4 independent safety evaluators. ## Structure ``` images/ C0/images.tar # 10K images from C0 model (0% unsafe training data) C1/images.tar # 10K images from C1 model (5% unsafe) C3/images.tar # 10K images from C3 model (~1.21% unsafe, original) C4/images.tar # 10K images from C4 model (~1.21% unsafe, 1M scale) C5/images.tar # 10K images from C5 model (~9.6% unsafe, 1M scale) C6/images.tar # 10K images from C6 model (~1.21% unsafe, 100K scale) annotations/ dose_C0.parquet # Unified annotations from all 4 evaluators dose_C1.parquet dose_C3.parquet dose_C4.parquet dose_C5.parquet dose_C6.parquet ``` ## Annotation Format Each parquet file is indexed by image ID and contains the following columns: | Column | Type | Description | |--------|------|-------------| | `llavaguard_unsafe` | int | 0 = safe, 1 = unsafe (LlavaGuard-7B) | | `llavaguard_category` | str | Safety category (e.g. "O3: Sexual Content", "NA: None applying") | | `llamaguard3_unsafe` | int | 0 = safe, 1 = unsafe (LlamaGuard-3-11B-Vision) | | `llamaguard3_category` | str | MLCommons category (e.g. "S12: Sexual Content", "NA") | | `shieldgemma_unsafe` | int | 0 = safe, 1 = unsafe (ShieldGemma-2-4B) | | `shieldgemma_category` | str | Highest-probability policy violated ("dangerous", "sexual", "violence", or "NA") | | `shieldgemma_p_dangerous` | float | P(dangerous content) | | `shieldgemma_p_sexual` | float | P(sexual content) | | `shieldgemma_p_violence` | float | P(violent content) | | `sd_safety_checker_unsafe` | int | 0 = safe, 1 = unsafe (SD Safety Checker) | ## Safety Evaluators | Evaluator | Model | Categories | |-----------|-------|------------| | [LlavaGuard-7B](https://huggingface.co/AIML-TUDA/LlavaGuard-v1.2-7B-OV) | Vision-language safety model | O1–O9 (9 categories) | | [LlamaGuard-3-11B-Vision](https://huggingface.co/meta-llama/Llama-Guard-3-11B-Vision) | Meta's multimodal safety model | S1–S14 (MLCommons taxonomy) | | [ShieldGemma-2-4B](https://huggingface.co/google/shieldgemma-2-4b) | Google's safety classifier | dangerous, sexual, violence | | SD Safety Checker | CompVis CLIP-based NSFW classifier | binary (safe/unsafe) | ## Generation Settings - **Prompts**: 10,000 (1K safe + 9K unsafe across 9 categories) - **Guidance scale**: 3.5 - **Inference steps**: 50 - **Seed**: 42 - **Resolution**: 512px ## Related Resources - [diffusion_safety](https://github.com/felifri/diffusion_safety) — experiment code - Model checkpoints: `felfri/dose-response-c0` through `felfri/dose-response-c6`
许可证:Apache-2.0 标签: - 扩散模型(diffusion) - 文本到图像(text-to-image) - 安全 - 剂量反应(dose-response) - 图像生成(image-generation) 样本量区间:10,000 < 样本量 < 100,000 # 剂量反应(dose-response)生成图像 本数据集包含来自剂量反应实验的生成图像与安全标注,该实验旨在探究不安全训练数据占比对文本到图像模型输出安全性的影响。 ## 数据集说明 每个实验条件下训练得到的模型,均基于同一提示词集(1000条安全提示词 + 9000条不安全提示词)生成10,000张图像。所有图像均由4名独立的安全评估员完成安全性标注。 ## 数据集结构 images/ C0/images.tar # C0模型生成的10,000张图像(不安全训练数据占比0%) C1/images.tar # C1模型生成的10,000张图像(不安全训练数据占比5%) C3/images.tar # C3模型生成的10,000张图像(不安全训练数据占比约1.21%,原始配置) C4/images.tar # C4模型生成的10,000张图像(不安全训练数据占比约1.21%,100万样本规模) C5/images.tar # C5模型生成的10,000张图像(不安全训练数据占比约9.6%,100万样本规模) C6/images.tar # C6模型生成的10,000张图像(不安全训练数据占比约1.21%,10万样本规模) annotations/ dose_C0.parquet # 全部4名评估员的统一标注结果 dose_C1.parquet dose_C3.parquet dose_C4.parquet dose_C5.parquet dose_C6.parquet ## 标注格式 每个Parquet文件以图像ID为索引,包含以下列: | 列名 | 数据类型 | 说明 | |--------|------|-------------| | `llavaguard_unsafe` | 整数 | 0代表安全,1代表不安全(基于LlavaGuard-7B模型) | | `llavaguard_category` | 字符串 | 安全类别(例如"O3: 色情内容","NA: 无适用类别") | | `llamaguard3_unsafe` | 整数 | 0代表安全,1代表不安全(基于LlamaGuard-3-11B-Vision模型) | | `llamaguard3_category` | 字符串 | MLCommons分类体系(例如"S12: 色情内容","NA") | | `shieldgemma_unsafe` | 整数 | 0代表安全,1代表不安全(基于ShieldGemma-2-4B模型) | | `shieldgemma_category` | 字符串 | 违规概率最高的政策类别("危险内容"、"色情内容"、"暴力内容"或"NA") | | `shieldgemma_p_dangerous` | 浮点数 | 危险内容的预测概率 | | `shieldgemma_p_sexual` | 浮点数 | 色情内容的预测概率 | | `shieldgemma_p_violence` | 浮点数 | 暴力内容的预测概率 | | `sd_safety_checker_unsafe` | 整数 | 0代表安全,1代表不安全(基于SD Safety Checker模型) | ## 安全评估模型 | 评估器 | 模型类型 | 分类体系 | |-----------|-------|------------| | [LlavaGuard-7B](https://huggingface.co/AIML-TUDA/LlavaGuard-v1.2-7B-OV) | 视觉语言安全模型 | O1–O9(共9个类别) | | [LlamaGuard-3-11B-Vision](https://huggingface.co/meta-llama/Llama-Guard-3-11B-Vision) | Meta开源多模态安全模型 | S1–S14(MLCommons分类体系) | | [ShieldGemma-2-4B](https://huggingface.co/google/shieldgemma-2-4b) | Google开源安全分类器 | 危险内容、色情内容、暴力内容 | | SD Safety Checker | 基于CompVis CLIP的NSFW分类器 | 二元分类(安全/不安全) | ## 生成参数设置 - **提示词集**:共10,000条(覆盖9个类别,含1000条安全提示词与9000条不安全提示词) - **引导系数**:3.5 - **推理步数**:50 - **随机种子**:42 - **图像分辨率**:512像素 ## 相关资源 - [diffusion_safety](https://github.com/felifri/diffusion_safety) — 实验代码仓库 - 模型检查点:`felfri/dose-response-c0` 至 `felfri/dose-response-c6`



