PKU-Alignment/PKU-SafeRLHF
收藏资源简介:
该数据集是PKU-SafeRLHF-v0和BeaverTails的兄弟项目。它包含83.4K个偏好条目,这些条目在两个维度(无害性和有用性)上进行标注。每个条目包括对一个问题两个回答,以及基于其有用性和无害性的安全元标签和偏好。数据集还包含了Alpaca-7B、Alpaca2-7B和Alpaca3-8B模型的响应。数据集的收集管道在README中有所描述。
This dataset is a sibling project of PKU-SafeRLHF-v0 and BeaverTails. It contains 83.4K preference entries annotated across two dimensions: harmlessness and usefulness. Each entry includes two responses to a single question, alongside safety meta-labels and preferences based on their performance in terms of usefulness and harmlessness. The dataset also encompasses responses generated by the Alpaca-7B, Alpaca2-7B, and Alpaca3-8B models. The data collection pipeline is detailed in the README file.
数据集概述
数据集名称
PKU-SafeRLHF
许可证
cc-by-nc-4.0
任务类别
- text-generation
语言
- en
标签
- safe
- safety
- ai-safety
- llm
- lm
- human-feedback
- rlhf
- safe-rlhf
大小类别
- 100K<n<1M
数据集内容
- 包含30k+专家比较数据。
- 每个条目包括两个对问题的回答,以及安全元标签和偏好,考虑了帮助性和无害性。
评估标准
无害性
- 根据14个伤害类别的风险中性评估,确保QA对不产生或促进任何有害后果。
帮助性
- 评估回答对给定提示的有效性,关注信息的品质、清晰度和相关性。
使用方法
python from datasets import load_dataset
dataset = load_dataset("PKU-Alignment/PKU-SafeRLHF")
相关文献
- Dataset Paper: https://arxiv.org/abs/2307.04657




