awesome-instruction-dataset
收藏资源简介:
该仓库是一个开源指令调优数据集的集合,专门用于训练文本和多模态聊天大语言模型(如GPT-4、ChatGPT、LLaMA、Alpaca)。它收录了三种类型的数据集:视觉指令调优、文本指令调优以及红队测试或人类反馈强化学习数据集。合集覆盖多种语言(如英语、中文和多语言)、任务类型(多任务和特定任务)和生成方法(人类生成、自指令生成等),旨在为研究者和开发者提供全面的指令调优资源索引。
This repository is a collection of open-source instruction-tuning datasets, specifically designed for training text and multimodal conversational large language models such as GPT-4, ChatGPT, LLaMA, and Alpaca. It includes three categories of datasets: visual instruction tuning datasets, text instruction tuning datasets, and datasets for red teaming or reinforcement learning from human feedback (RLHF). This collection covers diverse languages (e.g., English, Chinese, and multilingual scenarios), various task types (multi-task and single-task), and multiple data generation methods including human-generated content and self-instruction generation, among others. Its aim is to provide researchers and developers with a comprehensive index of instruction tuning resources.
数据集总览
该仓库收集了用于训练基于指令的文本和多模态大语言模型(如GPT-4、ChatGPT、LLaMA、Alpaca)的开源指令微调数据集,主要分为三类:
- 视觉指令微调数据集:例如图像-指令-答案对。
- 文本指令微调数据集。
- 红队测试/基于人类反馈的强化学习(RLHF)数据集。
仓库中每个数据集条目通常包含以下元信息:数据规模、语言标签(EN/CN/ML)、任务标签(MT/TS)、生成方法标签(HG/SI/MIX/COL)以及对应的论文和许可协议。
视觉指令微调数据集
| 数据集名称 | 规模 | 语言 | 任务 | 生成方法 | 简介 |
|---|---|---|---|---|---|
| Vision-CAIR/MiniGPT-4 | 5K | EN | MT | MIX | 高质量、对齐良好的图像-文本数据集,通过两个机器人对话生成,用于视觉指令微调。 |
| haotian-liu/LLaVA | 150K | EN | MT | MIX | 由GPT-4生成的多模态指令跟随数据,用于构建视觉指令调优模型。 |
| sunrainyg/InstructCV | N/A | EN | MT | MIX | 用于将文本到图像扩散模型指令调优为视觉通才的数据集。 |
文本指令微调数据集
| 数据集名称 | 规模 | 语言 | 任务 | 生成方法 | 简介 |
|---|---|---|---|---|---|
| tatsu-lab/Alpaca | 52K | EN | MT | SI | 基于修改的self-instruct流水线和175个种子任务生成的指令数据。 |
| gururise/Cleaned Alpaca | 52K | EN | MT | SI | 对Alpaca 52K数据集进行手动清洗的版本。 |
| XueFuzhao/InstructionWild | 52K | EN, CN | MT | SI | 基于修改的self-instruct流水线和429个种子任务生成的指令数据。 |
| JosephusCheung/GuanacoDataset | 534K | ML | MT | SI | 基于修改的self-instruct流水线生成的多语言指令数据。 |
| Hello-SimpleAI/HC3 | 24K | EN | MT | MIX | 首个人类与ChatGPT对比语料库(英文版)。 |
| Hello-SimpleAI/HC3-Chinese | 13K | CN | MT | MIX | 首个人类与ChatGPT对比语料库(中文版)。 |
| allenai/prosocial-dialog | 58K | EN | MT | MIX | 首个大规模多轮英文对话数据集,用于训练对话代理遵循社交规范。 |
| allenai/natural-instructions | 1.6K | ML | MT | HG | 社区构建的包含1,616个多样化NLP任务及其自然语言定义的数据集。 |
| bigscience/xP3 | N/A | ML | MT | MIX | 跨语言公共提示池,覆盖46种语言和16个NLP任务。 |
| PhoebusSi/Alpaca-CoT | 500k | ML | MT | COL | 基于LLaMA和Alpaca的思维链推理数据集。 |
| nomic-ai/gpt4all | 437k | EN | MT | COL | 整合了三个公开数据集(OIG、StackOverflow、bloomz-p3)的数据集。 |
| teknium1/GPTeacher | 20k+ | EN | MT | SI | 由GPT-4生成的模块化数据集集合,涵盖通用、角色扮演、代码和工具使用。 |
| google-research/FLAN | N/A | EN | MT | MIX | Flan数据集集合,整合了Flan 2021、P3、Super-Natural Instructions等多个数据集。 |
| thunlp/UltraChat | 280k | EN | TS | MIX | 大规模、多轮对话数据集,已发布“关于世界的问题”部分。 |
| cascip/ChatAlpaca | 10k | EN | MT | MIX | 基于Alpaca数据扩展的多轮指令数据。 |
| YeungNLP/firefly-train-1.1M | 1100k | CN | MT | COL | 包含23个任务的中文数据集,结合了人工编写的指令模板。 |
| orhonovich/unnatural-instructions | 240K | EN | MT | MIX | 通过提示语言模型生成指令,并重述扩展得到的非自然指令数据集。 |
| Instruction-Tuning-with-GPT-4/GPT-4-LLM | 52K | EN, CN | MT | SI | 由GPT-4基于Alpaca提示和中文翻译提示生成的指令数据。 |
| databrickslabs/dolly | 15K | EN | MT | HG | 由Databricks员工生成的数据集,涵盖创意、分类、问答等多种行为类别。 |
| OpenAssistant/oasst1 | 161K | ML | MT | HG | 人工生成和标注的助手风格对话语料库,涵盖35种语言。 |
| RyokoAI/ShareGPT52K | 90K | ML | MT | SI | 通过ShareGPT API爬取的约90,000条对话,包含用户提示和ChatGPT的回应。 |
| zjunlp/Mol-Instructions | 2043K | ML | MT | MIX | 大规模生物分子指令数据集,包含分子、蛋白质和生物分子文本指令。 |
基于人类反馈的强化学习(RLHF)/ 红队测试数据集
| 数据集名称 | 规模 | 语言 | 任务 | 生成方法 | 简介 |
|---|---|---|---|---|---|
| Anthropic/hh-rlhf | 22k | EN | MT | MIX | 包含22k条有用性比较的RLHF数据集,数据来自52B语言模型。 |
| thu-coai/Safety-Prompts | 100k | CN | MT | MIX | 用于评估和提升LLM安全性的中文安全提示数据集。 |
| HuggingFaceH4/stack-exchange-preferences | 10741k | EN | TS | HG | 来自Stack Overflow数据转储的问答对,用于偏好模型训练。 |
| stanfordnlp/SHP | 385k | EN | MT | HG | 每个示例来自Reddit帖子,包含一个问题/指令和一对用户偏好不同的顶级评论。 |
| Instruction-Tuning-with-GPT-4/GPT-4-LLM | 52K | EN | MT | MIX | 由GPT-4生成的指令数据,也用于RLHF。 |




