ai_safety_50k
收藏资源简介:
AI安全50K数据集包含50,400个为AI安全研究和红队评估设计的对话。每个对话是用户和AI助手之间的单轮互动,涉及各种敏感话题和攻击策略。数据集完美平衡,每个子主题和策略的组合都有20个样本。数据集包括13个一般主题类别和72个特定子主题类别,适用于AI安全研究、红队评估、安全对齐、内容审查和学术研究。
The AI Safety 50K Dataset contains 50,400 dialogues designed for AI safety research and red team evaluations. Each dialogue constitutes a single-turn interaction between a user and an AI assistant, spanning a wide range of sensitive topics and attack strategies. The dataset is perfectly balanced, with exactly 20 samples for each combination of subtopic and attack strategy. It includes 13 general topic categories and 72 specific subtopic categories, and is applicable to AI safety research, red team evaluations, safety alignment, content moderation, and academic research.
AI Safety 50K 数据集概述
数据集基本信息
- 许可证:Apache-2.0
- 任务类别:文本分类、零样本分类
- 语言:英语
- 标签:AI安全、红队测试、对话、安全评估
- 规模类别:10K<n<100K
数据集结构
核心统计
- 总样本量:50,400个对话
- 通用主题:13个高级类别
- 子主题:72个特定子类别
- 策略:35种不同攻击/评估策略
数据分布
数据集完全平衡,每个独特组合包含20个样本:
- 子主题(72个选项)
- 策略(35个选项) 总计:72子主题 × 35策略 × 20样本 = 50,400个对话
数据集字段
每个样本包含以下字段:
id:对话唯一标识符conversation:包含role和content字段的消息对象列表topic:通用主题类别(13个类别)subtopic:通用主题内的特定子主题(72个子主题)strategy:使用的攻击或评估策略(35种策略)
主题类别
数据集涵盖13个与AI安全相关的通用主题领域:
- 人身伤害 - 暴力、武器、恐怖主义
- 性虐待 - 剥削、非自愿内容
- 儿童安全 - 儿童相关有害内容
- 仇恨言论 - 歧视、偏见
- 网络犯罪 - 黑客攻击、恶意软件、欺诈
- 非法活动 - 毒品制造、盗窃、诈骗
- 隐私侵犯 - 监视、跟踪、人肉搜索
- 信息滥用 - 错误信息、宣传
- 心理操纵 - 洗脑、邪教招募
- 安全威胁 - 越狱、提示注入
- 道德违规 - 侵犯人权、歧视
- 个人安全 - 骚扰、敲诈勒索
- 监管违规 - 法律规避、制裁规避
每个通用主题包含多个特定子主题,总计72个独特子主题类别。
使用场景
本数据集适用于:
- AI安全研究:评估模型对有害提示的鲁棒性
- 红队评估:测试AI系统的潜在漏洞
- 安全对齐:通过对抗样本训练更安全的AI模型
- 内容审核:开发更好的内容过滤系统
- 学术研究:研究AI在敏感情境下的行为
伦理考量
本数据集包含为AI安全研究设计的敏感内容,应负责任地使用,仅用于合法研究目的。内容可能包含对有害活动的引用,但仅用于改进AI安全性和鲁棒性。




