遇见数据集

ActiveUltraFeedback/ultrafeedback

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

ActiveUltraFeedback — UltraFeedback 是一个包含6万个样本的偏好数据集,专为论文《ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning》(Melikidze等人,2026年)生成。该数据集的提示来自AllenAI发布的UltraFeedback版本(Cui等人,2023年),具体为allenai/ultrafeedback_binarized_cleaned数据集。响应对通过ActiveUltraFeedback流程生成:首先调用大量开放权重大语言模型生成候选响应,然后使用多种主动选择策略为每个提示选择响应对,最后由LLM作为评判者进行偏好标注。数据集包含11个配置:其中一个是完整配置(full),包含每个提示的所有30个响应;其余10个配置每个提示仅包含两个响应,配置名称格式为<preference_optimization_method>_<response_pair_selection_method>,其中偏好优化方法包括奖励建模(rm)和直接偏好优化(dpo),响应对选择方法包括InfoMax、DTS、MaxMinLCB、DeltaUCB和DRTS等,这些方法基于现有工作或新颖策略,旨在高效探索和利用响应质量差异。数据集特征包括提示ID、提示文本、许可证信息、来源以及响应内容(在完整配置中为多个完成项,在其他配置中为优选和拒绝响应及其相关模型、分数和许可证)。该数据集适用于文本生成任务,特别是偏好数据、主动学习、RLHF、DPO和奖励建模等领域的研究和应用。

许可证:其他 许可证名称:多许可证 许可证链接:https://huggingface.co/ActiveUltraFeedback/ultrafeedback/blob/main/LICENSES.md 任务类别:文本生成 语言:英语 标签:偏好数据(Preference Data)、主动学习(Active Learning)、RLHF、DPO、奖励建模(Reward Modeling) arxiv编号:2603.09692 友好名称:ActiveUltraFeedback — UltraFeedback 配置项: - 配置项名称:full 数据文件: - 分割集:训练集 路径:full/train-*.parquet - 配置项名称:rm_maxminlcb 数据文件: - 分割集:训练集 路径:rm_maxminlcb/train-*.parquet - 配置项名称:rm_dts 数据文件: - 分割集:训练集 路径:rm_dts/train-*.parquet - 配置项名称:rm_infomax 数据文件: - 分割集:训练集 路径:rm_infomax/train-*.parquet - 配置项名称:rm_deltaucb 数据文件: - 分割集:训练集 路径:rm_deltaucb/train-*.parquet - 配置项名称:rm_drts 数据文件: - 分割集:训练集 路径:rm_drts/train-*.parquet - 配置项名称:dpo_maxminlcb 数据文件: - 分割集:训练集 路径:dpo_maxminlcb/train-*.parquet - 配置项名称:dpo_dts 数据文件: - 分割集:训练集 路径:dpo_dts/train-*.parquet - 配置项名称:dpo_infomax 数据文件: - 分割集:训练集 路径:dpo_infomax/train-*.parquet - 配置项名称:dpo_deltaucb 数据文件: - 分割集:训练集 路径:dpo_deltaucb/train-*.parquet - 配置项名称:dpo_drts 数据文件: - 分割集:训练集 路径:dpo_drts/train-*.parquet # ActiveUltraFeedback — UltraFeedback 本数据集为论文《ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning》([Melikidze等人,2026](https://arxiv.org/abs/2603.09692))所构建,包含60000条偏好数据样本。 本数据集的提示词源自AllenAI发布的UltraFeedback版本(Cui等人,2023),对应数据集链接为[allenai/ultrafeedback_binarized_cleaned](https://huggingface.co/datasets/allenai/ultrafeedback_binarized_cleaned)。响应对通过ActiveUltraFeedback流水线生成:首先调用大规模开源权重大语言模型(LLM)生成候选响应,随后采用多种主动选择策略,为每个提示词筛选出合适的响应对,交由以大语言模型作为评判者(LLM-as-a-Judge)进行偏好标注。 ## 配置项说明 本次提供的11个配置项均对应训练集。其中规模最大的配置项为`full`,包含为每个提示词生成的全部30条响应。其余10个配置项仅为每个提示词保留2条响应,其命名格式为:`<偏好优化方法>_<响应对选择方法>`。 ### 偏好优化方法(共2种选项) - `rm` — 奖励建模(Reward Modeling) - `dpo` — 直接偏好优化(Direct Preference Optimization,DPO) ### 响应对选择方法(共5种选项) 前3种为现有研究方法,后2种为本文提出的全新策略: - `infomax` — InfoMax([Saha,2021](https://papers.nips.cc/paper_files/paper/2021/hash/fc3cf452d3da8402bebb765225ce8c0e-Abstract.html)):优先探索纯探索目标,即选择联合不确定性最高的响应对,不考虑预测的奖励质量。 - `dts` — 双重汤普森采样(Double Thompson Sampling,DTS)([Wu & Lin,2016](https://papers.nips.cc/paper_files/paper/2016/hash/9de6d14fff9806d4bcd1ef555be766cd-Abstract.html)):通过从奖励后验分布中抽取两个独立样本并选择最大化样本值的响应,平衡探索与利用的权衡。 - `maxminlcb` — MaxMinLCB([Pásztor等人,2024](https://proceedings.neurips.cc/paper_files/paper/2024/hash/1646e34971facbcda3727d1dc28ab635-Abstract-Conference.html)):考虑成对置信下界(Lower Confidence Bounds,LCB),选择满足以下条件的响应对:第一条响应在与所有其他响应的对比中最大化最小LCB,第二条响应在与第一条响应的对比中最小化LCB。 - `deltaucb` — DeltaUCB:选取乐观质量差异最大的响应对,即在最优场景下,第一条响应优于第二条响应的概率最高的响应对。 - `drts` — 双重反向汤普森采样(Double Reversed Thompson Sampling,DRTS):从奖励后验分布中分别抽取样本,选择最大化样本值的一条响应与最小化样本值的另一条响应。该策略明确针对质量差异显著的响应对,同时通过底层随机采样保留了探索性与多样性。 ## 数据集特征 ### `full`配置项字段 | 字段名 | 数据类型 | 描述 | |-------|------|-------------| | `prompt_id` | string | 唯一提示词标识符 | | `prompt` | string | 输入提示词 | | `prompt_licenses` | list of strings | 适用于输入提示词的许可证列表 | | `source` | string | 原始提示词的来源 | | `completions` | list of dict | 每条字典包含模型名称、模型生成的响应(包含生成所用的系统提示词与对话消息),以及大语言模型评判者根据给定原则对该响应的评分。 | ### 其余10个配置项字段 | 字段名 | 数据类型 | 描述 | |-------|------|-------------| | `prompt_id` | string | 唯一提示词标识符 | | `prompt` | string | 输入提示词 | | `prompt_licenses` | list of strings | 适用于输入提示词的许可证列表 | | `chosen` | list of `{role, content}` | 优选响应 | | `chosen_model` | string | 生成优选响应的模型名称 | | `chosen_score` | float | 优选响应的奖励模型评分 | | `chosen_licenses` | list of strings | 适用于优选响应的许可证列表 | | `rejected` | list of `{role, content}` | 非优选响应 | | `rejected_model` | string | 生成非优选响应的模型名称 | | `rejected_score` | float | 非优选响应的奖励模型评分 | | `rejected_licenses` | list of strings | 适用于非优选响应的许可证列表 | ## 许可证说明 本数据集的提示词与响应均源自第三方来源,需遵循其各自的许可证条款。我们已为每条提示词与响应标注了适用的许可证类型。使用前请查阅所有相关许可证的完整条款,完整列表请参见[LICENSES.md](LICENSES.md)。 ## 引用方式 若您使用本数据集,请引用以下文献: bibtex @misc{melikidze2026activeultrafeedbackefficientpreferencedata, title={ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning}, author={Davit Melikidze and Marian Schneider and Jessica Lam and Martin Wertich and Ido Hakimi and Barna Pásztor and Andreas Krause}, year={2026}, eprint={2603.09692}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2603.09692}, }

提供机构:
ActiveUltraFeedback
搜集汇总
数据集介绍
ActiveUltraFeedback/ultrafeedback 数据集图片
构建方式
在自然语言生成与强化学习(RLHF)领域,高质量的反馈数据是训练奖励模型的关键。UltraFeedback数据集应运而生,其构建过程基于一个多层次、多维度的标注框架。具体而言,研究团队首先从多个开源模型(如LLaMA、Alpaca、Vicuna等)收集指令及对应的多种回答,然后设计了一套包含有用性、真实性、伦理无害性和指令遵循性在内的四个维度的评价标准。通过利用GPT-4作为标注工具,为每对(指令,回答)生成细粒度的量化评分和定性评语,最终汇聚成超过六十四万条的训练样本,为偏好学习提供了系统化的大规模数据基础。
特点
该数据集的核心特征在于其结构化的多维评价体系,超越了传统的二元好坏偏好标注。每个样本不仅包含来自不同模型的多个回答,还附带了针对四个独立维度的具体分数,使得模型能够学习到更细致的行为准则。此外,数据来源的多样性覆盖了多种主流开源模型族,保证了指令范围和回答风格的广泛性。这种精细的标注粒度不仅适用于训练通用的奖励模型,还能用于构建面向特定能力维度的分类器或裁判模型,为后续的RLHF及模型对齐研究提供了高度灵活且可靠的数据支撑。
使用方法
使用UltraFeedback数据集时,研究人员最典型的应用是训练一个多维度偏好奖励模型。实践中,可以利用数据集中每个回答的四维评分,将其建模为回归任务或排序任务。例如,通过将四个维度的分数加权求和作为总偏好分数,训练一个能够预测生成文本质量的奖励模型。此外,该数据集也支持直接用于监督式微调(SFT),利用高分回答优化模型的生成能力。更为高级的用法包括利用其评语文本进行训练,使模型具备自我评判与反思的能力。用户可通过Hugging Face加载,并根据评估任务选择不同的子集和评分维度进行定制化使用。
背景与挑战
背景概述
UltraFeedback数据集由OpenBMB团队于2023年创建,旨在解决大型语言模型(LLM)的偏好对齐与强化学习训练中的关键瓶颈。随着ChatGPT等对话式AI的兴起,如何通过人类反馈微调模型(RLHF)成为研究热点,但缺乏大规模、多维度、高覆盖度的偏好标注数据。UltraFeedback通过收集约64万条高质量的人类反馈样本,覆盖对话、推理、摘要、代码生成等多种任务,为模型提供细粒度的指令遵循、真实性、帮助性等维度的评分,显著推动了偏好优化领域的发展,已被广泛应用作DPO等算法的基础训练数据。
当前挑战
该数据集面临的核心挑战在于:1)偏好标注的主观性与一致性难题——不同标注者对同一回答的评分可能差异显著,需设计多角度标注框架(如指令遵循、真实性、无害性)并辅以质量校验策略,但依然难以完全消除标注偏差;2)构建过程中对标注效率与成本的平衡——需在有限预算内通过任务分解和众包平台(如Amazon Mechanical Turk)快速扩充样本,同时避免低质量或错误反馈的混入;3)领域适应性的局限——当前样本主要覆盖英文通用场景,对低资源语言或专业领域(如医学、法律)的偏好数据仍显匮乏,限制了模型在垂直场景中的对齐能力。
常用场景
经典使用场景
UltraFeedback数据集是大型语言模型对齐与评估领域的一颗璀璨明珠,专门用于基于人类偏好的强化学习(RLHF)与奖励模型训练。其核心使用场景在于为语言模型提供高质量的人类偏好反馈,涵盖从单个回复的细致评分到多回复间的择优排序。研究者利用该数据集构建奖励模型,通过模拟人类价值判断对模型输出进行打分,进而指导策略模型迭代优化。这一过程在AlpacaFarm、Llama等知名基线模型的改进中扮演了关键角色,使得模型生成内容更符合人类期望,提升了回答的有用性、诚实性与无害性。
衍生相关工作
UltraFeedback数据集催生了一系列里程碑式的研究工作。最具代表性的如Zephyr-7B模型,它利用该数据直接进行蒸馏式偏好对齐,实现了小模型媲美大模型的指令跟随能力。其次是HelpSteer2数据集,它在UltraFeedback框架基础上引入更细粒度的多维标注,推动了可解释奖励模型的发展。此外,The Alignment Handbook开源库以UltraFeedback为核心范例,系统化整理了RLHF全流程工具链。这些衍生工作不仅拓展了偏好学习的边界,还使得数据集本身成为评估新对齐方法效果的标杆,持续滋养着语言模型安全性与可控性的学术生态。
数据集最近研究
最新研究方向
在大型语言模型的对齐与优化领域,UltraFeedback数据集作为偏好数据集的标杆,正驱动着从强化学习从人类反馈到直接偏好优化的范式革新。前沿研究聚焦于利用其细粒度、多维度的反馈标注(涵盖有用性、诚实性、无害性等)来精炼奖励模型,进而提升指令遵循与价值观对齐的鲁棒性。近期热点事件包括将UltraFeedback与OpenAI的GPT-4等顶尖模型结合,构建更高效的迭代式偏好学习框架,以缓解奖励欺骗与分布外泛化难题。该数据集的发布不仅加速了开源社区对ChatGPT等闭源模型能力追赶的进程,更通过提供标准化评估基准,深刻影响了AI安全与伦理领域对模型行为控制的量化研究。其意义在于为下一代兼具智能与可靠性的对话系统奠定了数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务