awesome-llm-human-preference-datasets
收藏资源简介:
这是一个精选的开源人类偏好数据集列表,专门用于大型语言模型的指令微调、RLHF和评估。合集覆盖了多个领域的数据集,包括OpenAI WebGPT比较、OpenAI摘要数据集、Anthropic有益性与无害性数据集、OpenAssistant对话数据集、斯坦福人类偏好数据集、Reddit ELI5、人类ChatGPT比较语料库、HuggingFace StackExchange偏好数据集、ShareGPT、Alpaca和GPT4All等。这些数据集主要包含人类偏好比较、对话、问答和指令对,用于训练和评估语言模型。
This is a curated list of open-source human preference datasets specifically designed for instruction tuning, RLHF, and evaluation of large language models. The collection covers datasets across multiple domains, including OpenAI WebGPT Comparisons, OpenAI Summarization Dataset, Anthropic Helpfulness & Harmlessness Dataset, OpenAssistant Conversations Dataset, Stanford Human Preference Dataset, Reddit ELI5, Human ChatGPT Comparison Corpus, HuggingFace StackExchange Preference Dataset, ShareGPT, Alpaca, and GPT4All, among others. These datasets primarily contain human preference comparisons, conversational data, question-answering pairs, and instruction-response pairs, which are used for training and evaluating language models.
数据集概述
该页面整理了用于大语言模型(LLM)指令微调、基于人类反馈的强化学习(RLHF)和评估的开源人类偏好数据集。以下为各数据集的详细信息:
1. OpenAI WebGPT Comparisons
- 来源: Hugging Face (
openai/webgpt_comparisons) - 规模: 20k 条比较数据
- 内容: 每个样本包含一个问题、一对模型回答以及人类对每个回答的偏好评分
- 用途: 用于训练 OpenAI WebGPT 奖励模型
2. OpenAI Summarization
- 来源: Hugging Face (
openai/summarize_from_feedback) - 规模: 64k 条文本摘要示例
- 内容: 包含人类撰写的回答和人类评分的模型回答
- 相关论文: Learning to Summarize from Human Feedback
- 样本探索: 链接
3. Anthropic Helpfulness and Harmlessness Dataset (HH-RLHF)
- 来源: Hugging Face (
Anthropic/hh-rlhf) - 总规模: 170k 条人类偏好比较数据
- 子数据集:
- base: 使用 52B 模型生成,包含 44k 有用性比较和 42k 红队攻击(无害性)比较
- RS: 使用拒绝采样模型,包含 52k 有用性比较和 2k 红队攻击比较
- online: 包含来自 RLHF 模型的数据,每周更新,共五周,总计 22k 有用性比较
- 相关论文: Training a Helpful and Harmless Assistant / Red Teaming Language Models to Reduce Harms
4. OpenAssistant Conversations Dataset (OASST1)
- 来源: Hugging Face (
OpenAssistant/oasst1) - 规模: 161k 条消息,涵盖 35 种语言,461k 条质量评分,超过 10k 条完整标注的对话树
- 内容: 人类生成并标注的助手式对话语料
5. Stanford Human Preferences Dataset (SHP)
- 来源: Hugging Face (
stanfordnlp/SHP) - 规模: 385k 条集体人类偏好数据
- 内容: 涵盖 18 个领域,数据来自 Reddit,用于训练 RLHF 奖励模型和 NLG 评估模型
6. Reddit ELI5
- 来源: Hugging Face (
eli5) - 规模: 270k 条示例
- 内容: 来自 3 个问答子版块的问题、回答和评分数据
7. Human ChatGPT Comparison Corpus (HC3)
- 来源: Hugging Face (
Hello-SimpleAI/HC3) - 规模: 约 24k 问题,60k 人类回答和 27k ChatGPT 回答
- 附加: 提供中文版本 (
Hello-SimpleAI/HC3-Chinese)
8. HuggingFace H4 StackExchange Preference Dataset
- 来源: Hugging Face (
HuggingFaceH4/stack-exchange-preferences) - 规模: 1000 万个问题(至少有 2 个回答)及其基于投票分数的回答
- 内容: 来自 Stackoverflow 的问答数据
9. ShareGPT.com
- 来源: ShareGPT 官网
- 规模: 截至 2023 年 4 月,约 90k 条用户上传的 ChatGPT 交互
- 注意: API 已禁用;可在 Hugging Face 上找到预编译数据集
10. Alpaca
- 来源: Hugging Face (
tatsu-lab/alpaca) - 规模: 52k 条指令和演示
- 内容: 由 OpenAI 的 text-davinci-003 引擎为自我指令训练生成
11. GPT4All
- 来源: Hugging Face (
nomic-ai/gpt4all_prompt_generations) - 规模: 100 万条提示-回答对
- 用途: 使用 GPT-3.5-Turbo API 在 2023 年 3 月收集
- GitHub: 链接
12. Databricks Dolly Dataset
- 来源: Hugging Face (
databricks/databricks-dolly-15k) - 规模: 15k 条指令跟随记录
- 内容: 由 Databricks 员工生成,涵盖头脑风暴、分类、封闭问答、生成、信息抽取、开放问答和总结等类别
13. HH_golden
- 来源: Hugging Face (
Unified-Language-Model-Alignment/Anthropic_HH_Golden) - 规模: 42k 条无害数据
- 内容: 与 Anthropic HH 数据集的 Harmless 子集共享相同提示和“被拒绝”的回答,但“被选择”的回答使用 GPT-4 重写为更无害的版本
- 效果: 实证表明,相较于原 Harmless 数据集,在该数据集上训练可提升多种对齐方法(如 RLHF 和 DPO)的无害性指标




