ActiveUltraFeedback/ultrafeedback
收藏资源简介:
ActiveUltraFeedback — UltraFeedback 是一个包含6万个样本的偏好数据集,专为论文《ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning》(Melikidze等人,2026年)生成。该数据集的提示来自AllenAI发布的UltraFeedback版本(Cui等人,2023年),具体为allenai/ultrafeedback_binarized_cleaned数据集。响应对通过ActiveUltraFeedback流程生成:首先调用大量开放权重大语言模型生成候选响应,然后使用多种主动选择策略为每个提示选择响应对,最后由LLM作为评判者进行偏好标注。数据集包含11个配置:其中一个是完整配置(full),包含每个提示的所有30个响应;其余10个配置每个提示仅包含两个响应,配置名称格式为<preference_optimization_method>_<response_pair_selection_method>,其中偏好优化方法包括奖励建模(rm)和直接偏好优化(dpo),响应对选择方法包括InfoMax、DTS、MaxMinLCB、DeltaUCB和DRTS等,这些方法基于现有工作或新颖策略,旨在高效探索和利用响应质量差异。数据集特征包括提示ID、提示文本、许可证信息、来源以及响应内容(在完整配置中为多个完成项,在其他配置中为优选和拒绝响应及其相关模型、分数和许可证)。该数据集适用于文本生成任务,特别是偏好数据、主动学习、RLHF、DPO和奖励建模等领域的研究和应用。
许可证:其他 许可证名称:多许可证 许可证链接:https://huggingface.co/ActiveUltraFeedback/ultrafeedback/blob/main/LICENSES.md 任务类别:文本生成 语言:英语 标签:偏好数据(Preference Data)、主动学习(Active Learning)、RLHF、DPO、奖励建模(Reward Modeling) arxiv编号:2603.09692 友好名称:ActiveUltraFeedback — UltraFeedback 配置项: - 配置项名称:full 数据文件: - 分割集:训练集 路径:full/train-*.parquet - 配置项名称:rm_maxminlcb 数据文件: - 分割集:训练集 路径:rm_maxminlcb/train-*.parquet - 配置项名称:rm_dts 数据文件: - 分割集:训练集 路径:rm_dts/train-*.parquet - 配置项名称:rm_infomax 数据文件: - 分割集:训练集 路径:rm_infomax/train-*.parquet - 配置项名称:rm_deltaucb 数据文件: - 分割集:训练集 路径:rm_deltaucb/train-*.parquet - 配置项名称:rm_drts 数据文件: - 分割集:训练集 路径:rm_drts/train-*.parquet - 配置项名称:dpo_maxminlcb 数据文件: - 分割集:训练集 路径:dpo_maxminlcb/train-*.parquet - 配置项名称:dpo_dts 数据文件: - 分割集:训练集 路径:dpo_dts/train-*.parquet - 配置项名称:dpo_infomax 数据文件: - 分割集:训练集 路径:dpo_infomax/train-*.parquet - 配置项名称:dpo_deltaucb 数据文件: - 分割集:训练集 路径:dpo_deltaucb/train-*.parquet - 配置项名称:dpo_drts 数据文件: - 分割集:训练集 路径:dpo_drts/train-*.parquet # ActiveUltraFeedback — UltraFeedback 本数据集为论文《ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning》([Melikidze等人,2026](https://arxiv.org/abs/2603.09692))所构建,包含60000条偏好数据样本。 本数据集的提示词源自AllenAI发布的UltraFeedback版本(Cui等人,2023),对应数据集链接为[allenai/ultrafeedback_binarized_cleaned](https://huggingface.co/datasets/allenai/ultrafeedback_binarized_cleaned)。响应对通过ActiveUltraFeedback流水线生成:首先调用大规模开源权重大语言模型(LLM)生成候选响应,随后采用多种主动选择策略,为每个提示词筛选出合适的响应对,交由以大语言模型作为评判者(LLM-as-a-Judge)进行偏好标注。 ## 配置项说明 本次提供的11个配置项均对应训练集。其中规模最大的配置项为`full`,包含为每个提示词生成的全部30条响应。其余10个配置项仅为每个提示词保留2条响应,其命名格式为:`<偏好优化方法>_<响应对选择方法>`。 ### 偏好优化方法(共2种选项) - `rm` — 奖励建模(Reward Modeling) - `dpo` — 直接偏好优化(Direct Preference Optimization,DPO) ### 响应对选择方法(共5种选项) 前3种为现有研究方法,后2种为本文提出的全新策略: - `infomax` — InfoMax([Saha,2021](https://papers.nips.cc/paper_files/paper/2021/hash/fc3cf452d3da8402bebb765225ce8c0e-Abstract.html)):优先探索纯探索目标,即选择联合不确定性最高的响应对,不考虑预测的奖励质量。 - `dts` — 双重汤普森采样(Double Thompson Sampling,DTS)([Wu & Lin,2016](https://papers.nips.cc/paper_files/paper/2016/hash/9de6d14fff9806d4bcd1ef555be766cd-Abstract.html)):通过从奖励后验分布中抽取两个独立样本并选择最大化样本值的响应,平衡探索与利用的权衡。 - `maxminlcb` — MaxMinLCB([Pásztor等人,2024](https://proceedings.neurips.cc/paper_files/paper/2024/hash/1646e34971facbcda3727d1dc28ab635-Abstract-Conference.html)):考虑成对置信下界(Lower Confidence Bounds,LCB),选择满足以下条件的响应对:第一条响应在与所有其他响应的对比中最大化最小LCB,第二条响应在与第一条响应的对比中最小化LCB。 - `deltaucb` — DeltaUCB:选取乐观质量差异最大的响应对,即在最优场景下,第一条响应优于第二条响应的概率最高的响应对。 - `drts` — 双重反向汤普森采样(Double Reversed Thompson Sampling,DRTS):从奖励后验分布中分别抽取样本,选择最大化样本值的一条响应与最小化样本值的另一条响应。该策略明确针对质量差异显著的响应对,同时通过底层随机采样保留了探索性与多样性。 ## 数据集特征 ### `full`配置项字段 | 字段名 | 数据类型 | 描述 | |-------|------|-------------| | `prompt_id` | string | 唯一提示词标识符 | | `prompt` | string | 输入提示词 | | `prompt_licenses` | list of strings | 适用于输入提示词的许可证列表 | | `source` | string | 原始提示词的来源 | | `completions` | list of dict | 每条字典包含模型名称、模型生成的响应(包含生成所用的系统提示词与对话消息),以及大语言模型评判者根据给定原则对该响应的评分。 | ### 其余10个配置项字段 | 字段名 | 数据类型 | 描述 | |-------|------|-------------| | `prompt_id` | string | 唯一提示词标识符 | | `prompt` | string | 输入提示词 | | `prompt_licenses` | list of strings | 适用于输入提示词的许可证列表 | | `chosen` | list of `{role, content}` | 优选响应 | | `chosen_model` | string | 生成优选响应的模型名称 | | `chosen_score` | float | 优选响应的奖励模型评分 | | `chosen_licenses` | list of strings | 适用于优选响应的许可证列表 | | `rejected` | list of `{role, content}` | 非优选响应 | | `rejected_model` | string | 生成非优选响应的模型名称 | | `rejected_score` | float | 非优选响应的奖励模型评分 | | `rejected_licenses` | list of strings | 适用于非优选响应的许可证列表 | ## 许可证说明 本数据集的提示词与响应均源自第三方来源,需遵循其各自的许可证条款。我们已为每条提示词与响应标注了适用的许可证类型。使用前请查阅所有相关许可证的完整条款,完整列表请参见[LICENSES.md](LICENSES.md)。 ## 引用方式 若您使用本数据集,请引用以下文献: bibtex @misc{melikidze2026activeultrafeedbackefficientpreferencedata, title={ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning}, author={Davit Melikidze and Marian Schneider and Jessica Lam and Martin Wertich and Ido Hakimi and Barna Pásztor and Andreas Krause}, year={2026}, eprint={2603.09692}, archivePrefix={arXiv}, primaryClass={cs.LG}, url={https://arxiv.org/abs/2603.09692}, }




