HPDv3++ dataset
收藏资源简介:
HPDv3++数据集是一个基于前沿生成器(Qwen-Image)构建的双轴偏好数据集,沿文本跟随(TF)和美学(Aes)质量进行标注。从185K个过滤提示和超过1.1M个候选图像中,30多名人类标注员进行6选2的选择,然后进行双投票验证(VLM判断和RM判断)。这产生了约212K个偏好对(95K TF + 117K Aes),涵盖了不同能力的生成器和多个RL优化迭代。
The HPDv3++ dataset is a dual-axis preference dataset built upon the state-of-the-art generator Qwen-Image, annotated along two dimensions: text following (TF) and aesthetic (Aes) quality. Derived from 185K filtered prompts and over 1.1M candidate images, more than 30 human annotators first completed a 2-out-of-6 selection task, followed by dual-voting validation (VLM-based judgment and RM-based judgment). This yields approximately 212K preference pairs (95K TF + 117K Aes), covering generators with varying capabilities and multiple rounds of RL optimization iterations.
数据集名称
HPDv3++ 数据集
数据集简介
HPDv3++ 是一个面向文本到图像(T2I)扩散模型的两轴偏好数据集,用于训练 HPSv3++ 奖励模型。该数据集覆盖了不同能力的生成模型以及不同阶段的强化学习(RL)优化迭代,旨在实现能力感知(Capability-Aware)和 RL 迭代感知(RL-Iteration-Aware)的奖励建模。
数据集构建方法
- 基础生成器:基于前沿生成模型 Qwen-Image 构建。
- 标注维度:沿文本跟随(Text-Following, TF)和美学质量(Aesthetic, Aes)两个质量维度进行标注。
- 图像规模:从 18.5 万条筛选后的提示词和超过 110 万张候选图像中生成。
- 标注过程:由 30 名以上人类标注员执行 2-of-6 选择(从 6 张候选图像中选出 2 张偏好图像),随后通过双重投票验证机制(VLM 评判器和 RM 评判器)进行核实。
- 最终规模:产生约 21.2 万个偏好对(95,000 个文本跟随对 + 117,000 个美学质量对)。
数据集特点
- 覆盖范围广:涵盖不同能力水平的生成模型和多个 RL 优化迭代阶段。
- 两轴标注:同时包含文本跟随和美学质量两个维度的偏好信息。
- 高质量验证:结合人类标注与双模型验证,确保数据可靠性。
数据集用途
用于训练 HPSv3++ 奖励模型。该模型通过持续学习(Orthogonal Gradient Descent, OGD)和半监督自适应训练,将模型能力和 RL 迭代步作为条件进行调制,从而在跨能力跨阶段的生成器上提供校准后的偏好评分。
性能表现
在多个基准测试中,基于 HPDv3++ 训练的 HPSv3++ 模型在成对偏好预测准确率上达到最优或接近最优结果,尤其在 HPDv3、GenAI-Bench、HPDv3++ 自身的美学及文本跟随子集上表现突出。
发布状态
- 论文:已发布。
- 数据集、训练/评估代码、模型权重:计划在论文被接收后完全开源,具体时间待定。




