HuggingFaceH4/instruct_me
收藏资源简介:
--- license: apache-2.0 dataset_info: - config_name: instruction_tuning features: - name: text dtype: string - name: meta struct: - name: source dtype: string - name: config dtype: string splits: - name: train num_bytes: 29975565 num_examples: 41685 - name: test num_bytes: 3298059 num_examples: 4632 download_size: 18425612 dataset_size: 33273624 - config_name: reward_modelling features: - name: text dtype: string - name: meta struct: - name: source dtype: string - name: config dtype: string splits: - name: train num_bytes: 25274204 num_examples: 41685 - name: test num_bytes: 2777314 num_examples: 4632 download_size: 15636566 dataset_size: 28051518 - config_name: ppo features: - name: prompt dtype: string - name: meta struct: - name: source dtype: string - name: config dtype: string splits: - name: train num_bytes: 50787070 num_examples: 83371 - name: test num_bytes: 5715727 num_examples: 9264 download_size: 31461165 dataset_size: 56502797 - config_name: reward_modeling features: - name: prompt dtype: string - name: meta struct: - name: source dtype: string - name: config dtype: string splits: - name: train num_bytes: 25274204 num_examples: 41685 - name: test num_bytes: 2777314 num_examples: 4632 download_size: 15636838 dataset_size: 28051518 task_categories: - conversational - text-generation language: - en tags: - human-feedback - instruct - reward-modeling pretty_name: Instruct Me --- # Dataset card for Instruct Me ## Dataset Description - **Homepage:** - **Repository:** - **Paper:** - **Leaderboard:** - **Point of Contact:** Lewis Tunstall ### Dataset summary Instruct Me is a dataset of prompts and instruction dialogues between a human user and AI assistant. The prompts are derived from (prompt, completion) pairs in the [Helpful Instructions dataset](https://huggingface.co/datasets/HuggingFaceH4/helpful_instructions). The goal is to train a language model to that is "chatty" and can answer the kind of questions or tasks a human user might instruct an AI assistant to perform. ### Supported Tasks and Leaderboard We provide 3 configs that can be used for training RLHF models: #### instruction_tuning Single-turn user/bot dialogues for instruction tuning. #### reward_modeling Prompts to generate model completions and collect human preference data #### ppo Prompts to generate model completions for optimization of the instruction-tuned model with techniques like PPO. ### Changelog * March 6, 2023: `v1.1.0` release. Changed the `text` columns for the `reward_modeling` and `ppo` configs to `prompt` for consistency with our dataset schemas elsewhere. * March 5, 2023: `v1.0.0` release.
license: Apache 2.0 许可证 dataset_info: - config_name: instruction_tuning(指令微调) features: - name: text,数据类型:字符串 - name: meta(元数据),结构体: - name: source(来源),数据类型:字符串 - name: config(配置),数据类型:字符串 splits: - name: train(训练集),字节数:29975565,样本数:41685 - name: test(测试集),字节数:3298059,样本数:4632 下载大小:18425612,数据集总大小:33273624 - config_name: reward_modelling(奖励建模) features: - name: text,数据类型:字符串 - name: meta(元数据),结构体: - name: source(来源),数据类型:字符串 - name: config(配置),数据类型:字符串 splits: - name: train(训练集),字节数:25274204,样本数:41685 - name: test(测试集),字节数:2777314,样本数:4632 下载大小:15636566,数据集总大小:28051518 - config_name: ppo(PPO) features: - name: prompt(提示词),数据类型:字符串 - name: meta(元数据),结构体: - name: source(来源),数据类型:字符串 - name: config(配置),数据类型:字符串 splits: - name: train(训练集),字节数:50787070,样本数:83371 - name: test(测试集),字节数:5715727,样本数:9264 下载大小:31461165,数据集总大小:56502797 - config_name: reward_modeling(奖励建模) features: - name: prompt(提示词),数据类型:字符串 - name: meta(元数据),结构体: - name: source(来源),数据类型:字符串 - name: config(配置),数据类型:字符串 splits: - name: train(训练集),字节数:25274204,样本数:41685 - name: test(测试集),字节数:2777314,样本数:4632 下载大小:15636838,数据集总大小:28051518 task_categories: 任务类别:对话式、文本生成 language: 语言:英语(en) tags: 标签:人类反馈、指令、奖励建模 pretty_name: 展示名称:Instruct Me # 「Instruct Me」数据集卡片 ## 数据集说明 - **主页**: - **代码仓库**: - **相关论文**: - **排行榜**: - **联系人**:刘易斯·滕斯托尔(Lewis Tunstall) ### 数据集摘要 「Instruct Me」是一个收录人类用户与AI助手之间提示词及指令对话的数据集。其提示词源自[Helpful Instructions数据集](https://huggingface.co/datasets/HuggingFaceH4/helpful_instructions)中的(提示词,补全内容)配对样本。本数据集旨在训练具备会话能力的大语言模型,使其能够响应人类用户向AI助手发起的各类查询或任务指令。 ### 支持任务与排行榜 我们提供3种配置,可用于训练人类反馈强化学习(Reinforcement Learning from Human Feedback,简称RLHF)模型: #### instruction_tuning(指令微调) 用于指令微调的单轮用户/机器人对话数据。 #### reward_modeling(奖励建模) 用于生成模型补全内容并收集人类偏好数据的提示词数据集。 #### ppo(PPO) 用于针对指令微调后的模型,通过PPO等强化学习技术进行优化的模型补全生成提示词数据集。 ### 更新日志 * 2023年3月6日:发布v1.1.0版本。为与本数据集其他模块的架构保持一致,将`reward_modeling`与`ppo`配置中的`text`字段更改为`prompt`。 * 2023年3月5日:发布v1.0.0版本。
数据集概述
基本信息
- 许可证: Apache-2.0
数据集配置
配置一: instruction_tuning
- 特征:
- text: 字符串类型
- meta: 结构化数据,包含source和config,均为字符串类型
- 分割:
- train: 41685个样本,29975565字节
- test: 4632个样本,3298059字节
- 下载大小: 18425612字节
- 数据集大小: 33273624字节
配置二: reward_modelling
- 特征:
- text: 字符串类型
- meta: 结构化数据,包含source和config,均为字符串类型
- 分割:
- train: 41685个样本,25274204字节
- test: 4632个样本,2777314字节
- 下载大小: 15636566字节
- 数据集大小: 28051518字节
配置三: ppo
- 特征:
- prompt: 字符串类型
- meta: 结构化数据,包含source和config,均为字符串类型
- 分割:
- train: 83371个样本,50787070字节
- test: 9264个样本,5715727字节
- 下载大小: 31461165字节
- 数据集大小: 56502797字节
配置四: reward_modelling
- 特征:
- prompt: 字符串类型
- meta: 结构化数据,包含source和config,均为字符串类型
- 分割:
- train: 41685个样本,25274204字节
- test: 4632个样本,2777314字节
- 下载大小: 15636838字节
- 数据集大小: 28051518字节
语言
- 支持语言: 英语
任务类别
- 对话
- 文本生成
标签
- 人类反馈
- 指令
- 奖励建模




