这是一个用于评估复杂后门模型的数据集,这些模型在论文《Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs》中被研究。数据集是从OpenHermes-2.5数据集中随机抽取的实例的改编版本。模型被训练成根据是否识别出处于训练或部署阶段来展示两种行为:训练行为(标签为0)是作为有帮助、诚实
# Dataset Card for PKU-SafeRLHF-single-dimension Warning: this dataset contains data that may be offensive or harmful. The data are intended for research purposes, especial