遇见数据集

MuhammadAnas1657/hh-rlhf

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集(HH-RLHF)提供两种类型的数据:1. 关于帮助性和无害性的人类偏好数据,来自论文《Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback》,用于训练偏好模型以支持后续的RLHF训练,不适用于对话代理的监督训练,以避免产生有害模型;2. 人类生成和注释的红队对话数据,来自论文《Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned》,用于理解红队成员如何攻击模型以及哪些类型的红队攻击成功或失败,不适用于微调或偏好建模。数据包含可能具有冒犯性或令人不适的内容,如歧视性语言、虐待、暴力等,仅供研究使用,旨在减少模型危害。数据格式包括JSONL文件,具体字段在README中详细说明。

This repository provides access to two different kinds of data: 1. Human preference data about helpfulness and harmlessness from Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback. These data are meant to train preference (or reward) models for subsequent RLHF training and are not meant for supervised training of dialogue agents to avoid harmful models. 2. Human-generated and annotated red teaming dialogues from Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned. These data are meant to understand how crowdworkers red team models and what types of red team attacks are successful or not, and are not meant for fine-tuning or preference modeling. The data contain content that may be offensive or upsetting, such as discriminatory language and discussions of abuse, violence, etc., and are intended for research purposes to reduce model harm. Data formats include JSONL files with specific fields as detailed in the README.

提供机构:
MuhammadAnas1657
搜集汇总
数据集介绍
MuhammadAnas1657/hh-rlhf 数据集图片
构建方式
该数据集源自Anthropic研究团队的RLHF(从人类反馈中强化学习)研究,旨在通过人类偏好数据训练奖励模型,进而优化语言模型的帮助性与无害性。数据集包含两类核心数据:一是基于《Training a Helpful and Harmless Assistant》论文构建的帮助性与无害性偏好数据,每条记录包含“被选择”和“被拒绝”两种文本对;二是红队攻击数据,由人类攻击者与AI助手的完整对话组成,并附有攻击效果评分、模型参数等信息。帮助性数据通过基座模型采样、拒绝采样及迭代在线过程收集,而无害性数据则仅基于基座模型。红队数据进一步包含后验标注的标签和危害性评分。
特点
该数据集的独特之处在于其双重视角的设计:一方面,帮助性与无害性偏好数据为奖励模型训练提供了直接的人类偏好信号,格式简洁明了,便于进行偏好建模;另一方面,红队攻击数据提供了完整的对话转录,并附带多维度元数据,如攻击者评级、任务描述及模型参数,为理解语言模型的安全漏洞提供了丰富的分析素材。数据集特别强调了被选择对话的无害性标注,并通过偏好模型计算了对话层级和任务描述层级的危害性得分。此外,数据中明确标注了红队成员的来源平台(Upwork或MTurk)及其ID,便于研究众包攻击的多样性。
使用方法
使用HuggingFace Datasets库可便捷加载该数据集。通过调用`load_dataset("Anthropic/hh-rlhf")`即可获取所有帮助性与无害性子集及其默认配置。若需加载特定子集,可使用`data_dir`参数指定数据目录,例如`load_dataset("Anthropic/hh-rlhf", data_dir="harmless-base")`加载无害性基座模型数据,`load_dataset("Anthropic/hh-rlhf", data_dir="red-team-attempts")`加载红队攻击数据。每个子集以JSONL格式存储,帮助性数据为文本对,红队数据包含转录和元数据字典。该数据集明确声明仅适用于偏好模型训练或安全研究,不应用于对话代理的监督训练,以避免产生有害模型。
背景与挑战
背景概述
HH-RLHF数据集由Anthropic机构于2022年创建,旨在通过人类反馈强化学习(RLHF)训练既乐于助人又无害的AI助手。该数据集的核心研究问题在于如何权衡对话系统的有用性与安全性,从而避免模型产生有害输出。数据集分为偏好数据与红队攻击数据两部分,前者用于训练奖励模型,后者则用于理解人如何对模型进行攻击性测试。作为RLHF领域的标杆数据集,它为后续的安全对齐研究提供了重要基准,推动了AI伦理学与可控性技术的发展。
当前挑战
该数据集所面临的挑战首先体现在领域问题上:如何在增强模型助人能力的同时,有效抑制其产生歧视、暴力等有害内容,实现有用性与无害性的动态平衡,这本质上是AI安全对齐的核心难题。在构建过程中,数据收集面临红队攻击模式的多样性难以穷尽、不同攻击下模型脆弱性差异显著等挑战;同时,偏好数据需依赖人工标注者对海量对话对进行判断,标注标准的一致性难以保证,且数据中隐含的恶意内容对标注者的心理安全构成潜在威胁。
常用场景
经典使用场景
在深入探讨人工智能对齐领域时,HH-RLHF数据集扮演着举足轻重的角色。该数据集由Anthropic研究团队构建,核心目标在于训练奖励模型,以捕捉人类对于大语言模型生成内容在“有用性”与“无害性”两个维度的偏好。其经典使用场景是通过收集大量人类对对话对(chosen与rejected)的偏好判断,为后续的基于人类反馈的强化学习(RLHF)提供可靠的信号。研究者可以利用这些偏好数据来优化奖励函数,从而引导语言模型在生成回复时更加贴合人类的价值观与期望。数据集精心设计了多个子集,涵盖基于基座模型、拒绝采样以及迭代在线过程的不同样本,为比较不同训练阶段下模型的对齐效果提供了翔实的实验基础。
实际应用
在实际产业应用中,HH-RLHF数据集的影响力早已超越学术实验室,渗透至聊天机器人、智能客服、教育辅导等产品的安全部署环节。企业开发者可以基于该数据集训练奖励模型,将其集成到RLHF训练管道中,对自有基座模型进行微调,以显著降低模型输出中包含歧视、暴力或危险建议的概率。此外,数据集中包含的红队攻击会话(red teaming dialogues)为安全团队提供了宝贵的测试案例,帮助识别模型在面对恶意诱导时的脆弱点。安全工程师可以利用这些记录设计更坚固的防御策略,并通过压力测试评估模型的鲁棒性。数据集还赋能了内容审查系统的研发,使平台能够自动检测并拦截潜在的有害生成内容,从而在真实用户交互场景中筑牢安全防线。
衍生相关工作
HH-RLHF数据集不仅是研究工具,更是催生了众多经典工作的基石。其中最为瞩目的当属Anthropic团队在论文《Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback》中首次提出的方法论框架,该工作详细介绍了如何利用该数据集进行偏好建模与RLHF训练,并揭示了模型在有用性与无害性之间的权衡关系。此外,该数据集衍生了《Red Teaming Language Models to Reduce Harms》等一系列深入探究红队攻击方法、规模化行为模式的研究,为系统性评估模型安全性提供了范式。在更广泛的社区中,许多后续工作如Constitutional AI、Direct Preference Optimization(DPO)等技术革新均直接或间接地借鉴了HH-RLHF的数据组织方式与评估指标,推动了AI对齐研究从实验走向实用化与标准化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务