openbmb/UltraFeedback
收藏资源简介:
UltraFeedback是一个大规模、细粒度、多样化的偏好数据集,用于训练强大的奖励模型和批评模型。该数据集收集了约64k个来自不同资源(包括UltraChat、ShareGPT、Evol-Instruct、TruthfulQA、FalseQA和FLAN)的提示,并使用这些提示查询多个大型语言模型,生成每个提示的4个不同响应,总共256k个样本。为了收集高质量的偏好和文本反馈,设计了包含指令遵循、真实性、诚实性和帮助性四个维度的细粒度注释指令,并使用GPT-4对收集的样本进行注释。
UltraFeedback是一个大规模、细粒度、多样化的偏好数据集,用于训练强大的奖励模型和批评模型。该数据集收集了约64k个来自不同资源(包括UltraChat、ShareGPT、Evol-Instruct、TruthfulQA、FalseQA和FLAN)的提示,并使用这些提示查询多个大型语言模型,生成每个提示的4个不同响应,总共256k个样本。为了收集高质量的偏好和文本反馈,设计了包含指令遵循、真实性、诚实性和帮助性四个维度的细粒度注释指令,并使用GPT-4对收集的样本进行注释。
数据集概述
基本信息
- 许可证: MIT
- 任务类别: 文本生成
- 语言: 英语
- 数据集大小: 100K<n<1M
数据集描述
- 名称: UltraFeedback
- 用途: 用于训练强大的奖励模型和批评模型
- 数据来源: 收集了约64k来自多个资源的提示(包括UltraChat, ShareGPT, Evol-Instruct, TruthfulQA, FalseQA, FLAN),并使用这些提示查询多个大型语言模型(LLMs),生成4种不同响应,总计256k样本。
- 注释设计: 设计了包含4个不同方面的精细注释指令(遵循指令、真实性、诚实性和帮助性),并使用GPT-4进行样本注释。
数据集特征
- 规模: 包含64k提示,256k响应和380k高质量反馈。研究人员可以进一步构建约100万个比较对来训练他们的奖励模型。
- 多样性: 从多个来源收集提示,并查询多样化的开源和著名模型。为了增加多样性,选择了不同的基础模型(如LLaMA, Falcon, StarChat, MPT, GPT, Bard),并应用多种原则以不同方式完成指令。
- 高密度: 提供数值和文本反馈,并编写了精细的注释文档以帮助在所有维度上评价响应。
数据集构建
- 指令采样: 从6个公开可用的高质量数据集中采样63,967条指令。
- 模型采样: 选择不同级别、大小、架构和训练数据的基础模型,以防止奖励模型过度拟合特定文本风格或捕捉文本风格与奖励之间的虚假相关性。
- 原则采样: 定义了一组原则以明确对齐不同方面的模型行为。对于每个指令,随机选择4个模型完成指令,并为每个完成选择一个原则,添加到系统提示中以对齐模型行为。
数据集格式
- 数据集以JSON格式存储,包含以下字段:
- source: 指令来源的数据集
- id: 指令在源数据集中的ID
- instruction: 指令内容
- models: 完成指令的模型列表
- completions: 每个模型的响应及其相关信息(模型、原则、系统提示、响应、注释)
数据集示例
- 提供了一个用户查询及其由四个不同模型生成的响应示例,每个响应都附带了详细的注释,包括遵循指令、真实性、诚实性和帮助性的评分和理由。
数据集限制
- 尽管GPT-4可以提供大多数样本的良好对齐注释和文本反馈,但GPT-4也可能犯错并提供不准确的反馈。
引用信息
bib @misc{cui2023ultrafeedback, title={UltraFeedback: Boosting Language Models with High-quality Feedback}, author={Ganqu Cui and Lifan Yuan and Ning Ding and Guanming Yao and Wei Zhu and Yuan Ni and Guotong Xie and Zhiyuan Liu and Maosong Sun}, year={2023}, eprint={2310.01377}, archivePrefix={arXiv}, primaryClass={cs.CL} }




