Heretic-Harmful
收藏资源简介:
该数据集包含有害与无害提示之间的语义匹配对,旨在为安全研究、拒绝分析和激活差异研究提供更受控的比较集。数据集通过将来自`mlabonne/harmful_behaviors`的有害提示与来自`mlabonne/harmless_alpaca`的无害提示进行语义对齐而构建,使用`google/embeddinggemma-300m`生成嵌入并计算相似度。数据集包含416个训练样本,每个样本包含有害提示、无害提示、相似度分数及原始索引。适用于安全与对齐研究、消融实验及提示对比较等任务。数据集采用MIT许可证。
This dataset contains semantic matching pairs between harmful and harmless prompts, aiming to provide more controlled comparison sets for safety research, refusal analysis and activation difference research. It is constructed by semantically aligning harmful prompts from `mlabonne/harmful_behaviors` with harmless prompts from `mlabonne/harmless_alpaca`, using `google/embeddinggemma-300m` to generate embeddings and calculate similarity scores. The dataset includes 416 training samples, each containing the harmful prompt, harmless prompt, similarity score and original index. It is suitable for tasks such as safety and alignment research, ablation studies and prompt pair comparison. This dataset is released under the MIT License.
数据集概述:Heretic-Harmful
数据集基本信息
- 数据集名称:Heretic-Harmful
- 发布者/创建者:VINAY-UMRETHE
- 许可证:MIT
- 语言:英语 (en)
- 任务类别:文本分类 (text-classification)
- 标签:heretic, uncensored, harmful, prompts, safety
数据集内容与结构
- 数据描述:该数据集是“有害-无害语义提示对”中的有害提示子集。它包含与无害提示在语义上最接近的有害提示,形成一对一的语义匹配对。
- 核心特征:包含一个名为
text的字符串类型特征列。 - 数据划分:仅包含训练集(train)。
- 数据规模:
- 训练集样本数量:416
- 训练集数据大小:32,107 字节
- 总数据集大小:32,107 字节
- 下载大小:14,741 字节
- 数据格式:支持 CSV、JSON、TXT 格式。
- 配对数据集:对应的无害提示子集为
VINAY-UMRETHE/Heretic-Harmless。
数据来源与构建方法
- 源数据集:
- 有害提示来自
mlabonne/harmful_behaviors。 - 无害提示来自
mlabonne/harmless_alpaca。
- 有害提示来自
- 构建目标:为安全研究、拒绝分析和激活差异研究创建更可控的比较集,通过语义对齐减少因主题漂移、词汇不匹配或结构差异引起的噪声。
- 构建流程:
- 加载两个源数据集。
- 使用
google/embeddinggemma-300m模型生成提示的文本嵌入。 - 对嵌入向量进行归一化处理。
- 计算有害提示与无害提示之间的语义相似度分数。
- 进行一对一匹配(每个有害提示最多与一个无害提示配对,每个无害提示最多使用一次)。
- 应用阈值过滤,丢弃相似度低于设定阈值(约 0.60)的配对。
数据集文件与模式
- 主要文件:
matched_pairs.csv— 表格形式的配对数据集。matched_pairs.json— 结构化的 JSON 数据集。
- 数据模式:每个数据项(配对)包含以下字段:
字段名 类型 描述 harmfulstring 有害提示文本 harmlessstring 语义上最接近的无害提示文本 scorefloat 该配对语义相似度分数 harmful_indexint 有害提示在源数据集中的原始索引 harmless_indexint 无害提示在源数据集中的原始索引
主要用途
- 更精确地估计拒绝导向的激活。
- 减少激活差异中不相关的方差。
- 为安全研究和分析创建更清晰的配对基准。
- 安全与对齐研究。
- 消融实验。
- 提示对比较。
使用示例
可与 p-e-w/heretic 工具配合使用,示例命令如下:
bash
heretic --model Qwen/Qwen2.5-3B-Instruct
--good-prompts.dataset "VINAY-UMRETHE/Heretic-Harmless"
--good-prompts.split "train[:400]"
--good-prompts.column "text"
--bad-prompts.dataset "VINAY-UMRETHE/Heretic-Harmful"
--bad-prompts.split "train[:400]"
--bad-prompts.column "text"
关键设计要点
- 阈值过滤:丢弃低置信度的匹配对,而非强制纳入数据集。
- 一对一匹配:避免单一概念过度代表,保持配对清晰。
- 归一化嵌入:使相似度分数更稳定且可比较。




