PKU-Alignment/BeaverTails
收藏资源简介:
BeaverTails是一个专注于AI安全性的数据集集合,包含一系列人类标注的问答对,每个问答对都标有相应的伤害类别。数据集涵盖了14种伤害类别,如动物虐待、儿童虐待、歧视、仇恨言论等。数据集旨在用于研究,特别是创建更安全、危害更小的AI系统的研究。数据集包含多个分割,如330k_train、330k_test、30k_train和30k_test。
BeaverTails is a collection of datasets focused on AI safety, containing a series of human-annotated question-answer pairs, each labeled with a corresponding harm category. The dataset covers 14 harm categories, including animal abuse, child abuse, discrimination, hate speech, and others. It is intended for research purposes, especially research aimed at developing safer and less harmful AI systems. The dataset includes multiple splits such as 330k_train, 330k_test, 30k_train, and 30k_test.
数据集概述
名称: BeaverTails
目的: 专注于AI安全,用于研究以创建更安全、危害更小的AI系统。
内容: 包含人类标记的问题-答案(QA)对,每个QA对关联一个或多个伤害类别。
伤害类别:
- 动物虐待
- 儿童虐待
- 争议话题、政治
- 歧视、刻板印象、不公正
- 药物滥用、武器、禁用物质
- 金融犯罪、财产犯罪、盗窃
- 仇恨言论、冒犯性语言
- 关于伦理、法律和安全的错误信息
- 非暴力不道德行为
- 隐私侵犯
- 自我伤害
- 性内容、成人内容
- 恐怖主义、有组织犯罪
- 暴力、协助和教唆、煽动
数据集大小: 100K<n<1M
数据文件配置:
- 默认配置:
- 训练集:
- 330k_train: round0/330k/train.jsonl.xz
- 30k_train: round0/30k/train.jsonl.gz
- 测试集:
- 330k_test: round0/30k/test.jsonl.xz
- 30k_test: round0/30k/test.jsonl.gz
- 训练集:
许可证: CC BY-NC 4.0
语言: 英语
任务类别: 文本分类
标签: 安全、安全、AI安全、审核、拒绝采样、LLM、LM、人类反馈
使用警告: 数据集包含可能令人反感或不安的内容,应负责任地使用,并根据个人风险承受能力进行交互。不应用于训练对话代理,以免可能导致有害的模型行为。




