HPDv3++
收藏资源简介:
HPDv3++是由研究团队构建的大规模双维度偏好数据集,旨在扩展文本到图像生成模型的偏好监督范围。该数据集包含约21.2万条标注数据,基于18.5万个多样化提示词,通过前沿的Qwen-Image模型生成了超过110万张候选图像,并涵盖了20多种场景以确保分布平衡。数据创建过程采用人工标注结合自动双重投票质量控制机制,分别沿文本跟随忠实度和美学质量两个互补维度进行精细标注,有效过滤了噪声样本。该数据集主要应用于强化学习人类反馈领域,旨在为奖励模型提供更细粒度的监督信号,解决现有模型在应对不同能力级别生成模型及其强化学习迭代分布变化时的泛化不足问题。
HPDv3++ is a large-scale dual-dimensional preference dataset developed by a research team, with the goal of expanding the scope of preference supervision for text-to-image generation models. This dataset contains approximately 212,000 annotated samples, sourced from 185,000 diverse prompts, and over 1.1 million candidate images were generated using the state-of-the-art Qwen-Image model. To ensure balanced data distribution, the dataset covers more than 20 distinct scenarios. The dataset creation process integrates manual annotation with an automatic double-voting quality control mechanism, conducting fine-grained annotation along two complementary dimensions: text alignment faithfulness and aesthetic quality, which effectively filters out noisy samples. Primarily applied in the domain of reinforcement learning from human feedback (RLHF), this dataset aims to provide finer-grained supervision signals for reward models, thereby addressing the insufficient generalization issue of existing models when confronted with generation models of varying capability levels and distribution shifts during reinforcement learning iterations.
数据集概述:HPDv3++
HPDv3++ 是一个面向文本到图像(T2I)生成任务的偏好数据集,由 HPSv3++(一种能力感知和强化学习迭代感知的奖励模型)项目发布。该数据集旨在覆盖不同生成能力与不同强化学习优化阶段的生成器,为奖励模型提供校准后的偏好评分。
数据集构建
- 基础生成器:基于前沿生成器 Qwen-Image 构建。
- 标注维度:沿文本跟随(Text-Following, TF) 和美学(Aesthetic, Aes) 两个质量维度进行偏好标注。
- 数据规模:
- 从 185K 个过滤后的提示词(prompts)与超过 110 万张候选图像中生成。
- 由 30 多位人类标注员执行“2-of-6”选择(从6张图像中选出2张),随后经过双重投票验证(VLM 判断器和 RM 判断器)。
- 最终结果:约 212K 个偏好对,其中:
- 文本跟随(TF)偏好对:95K
- 美学(Aes)偏好对:117K
- 覆盖范围:数据集涵盖了不同能力的生成器以及多个强化学习优化迭代阶段的输出。
数据集特点
- 双轴标注:同时关注文本跟随与美学质量,提供细粒度的偏好信号。
- 能力与迭代感知:数据集的构建支持奖励模型对生成器的能力差异和优化阶段进行条件性学习。
数据集用途
- 奖励模型训练:用于训练 HPSv3++ 奖励模型,该模型通过两阶段训练(阶段1:正交梯度下降的持续学习;阶段2:基于 FiLM 条件化的半监督自适应训练)提升偏好预测性能。
- 性能验证:该数据集被用于评估 HPSv3++ 在多个基准(如 HPDv3、GenAI-Bench 及本数据集自身)上的偏好预测准确率,并在文本跟随和美学两个维度上展示了领先性能(分别为 88.1% 和 79.1%)。
发布状态
- 数据集:即将发布,计划在论文被接收后完全开源。
- 当前状态:论文已发布,代码、数据集和模型权重尚未开放。

- 1HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities清华大学; 京东探索研究院; 北京大学; 浙江大学 · 2026年



