遇见数据集

RefSR-18K

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

RefSR-18K 是首个大规模 LR 条件偏好数据集,专为超分辨率任务设计,由论文《RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution》提出。该数据集的核心创新在于:每个样本组提供基于低分辨率输入与高分辨率候选之间的一致性以及高分辨率候选的自然性的人工成对排名,而非与真实高分辨率图像的相似度。数据来源为 LSDIR 数据集中的高分辨率图像,通过退化处理生成低分辨率输入,并采用多种超分辨率方法生成候选高分辨率图像。数据集包含 8061 个图像组,其中 4499 组用于训练,200 组用于域内测试,200 组用于域外测试,另有 3562 组作为补充。每个图像组包括一个低分辨率输入和四个不同超分辨率方法生成的高分辨率输出,并附有相应的人工标注成对排名。注释文件以 CSV 和 JSONL 格式提供,包含训练集、测试集及每个标注者的原始排名,支持标注者间一致性评估。该数据集适用于奖励模型训练、偏好对齐超分辨率、图像质量评估等学术研究任务。数据使用需遵守上游 LSDIR 数据集的学术研究许可条款,数据集本身未声明单独许可证。

RefSR-18K is the first large-scale LR-conditioned preference dataset designed for super-resolution tasks, proposed in the paper RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution. The core innovation of this dataset is that each sample group provides human-annotated pairwise rankings based on the consistency between the low-resolution input and the high-resolution candidates, as well as the naturalness of the high-resolution candidates, rather than similarity to the ground-truth high-resolution image. The data source is high-resolution images from the LSDIR dataset, which are degraded to generate low-resolution inputs, and multiple super-resolution methods are used to generate candidate high-resolution images. The dataset contains 8061 image groups, with 4499 groups used for training, 200 for in-domain testing, 200 for out-of-domain testing, and an additional 3562 groups as supplementary. Each image group includes one low-resolution input and four high-resolution outputs generated by different super-resolution methods, accompanied by corresponding human-annotated pairwise rankings. Annotation files are provided in CSV and JSONL formats, including training set, test set, and raw rankings from each annotator, supporting inter-annotator consistency evaluation. This dataset is suitable for academic research tasks such as reward model training, preference-aligned super-resolution, and image quality assessment. Data usage must comply with the academic research license terms of the upstream LSDIR dataset; the dataset itself does not declare a separate license.

创建时间:
2026-08-07
原始信息汇总

RefSR-18K 数据集概述

数据集简介

RefSR-18K 是首个大规模、基于低分辨率(LR)条件的人类偏好数据集,用于超分辨率(Super-Resolution)任务,由论文 "RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution" 提出。该数据集的核心特点在于每组数据提供基于 LR–HR 一致性HR 自然度 的成对人类排序,而非与真实高分辨率图像的相似度。

数据来源

  • 图像来源:LSDIR 数据集(https://ofsoundof.github.io/lsdir-data/)中的高分辨率源图像
  • 处理流程:对源图像进行退化处理生成 LR 输入,使用多种超分辨率方法生成 HR 候选图像,由人类标注者对每组 4 个 HR 候选进行排序

数据集内容

分割 组数 大小 用途
train_images/ 4499(编号 0001-4499) 12G 用于奖励模型训练
test_in_domain_images/ 200 527M 域内基准测试
test_out_domain_images/ 200 532M 域外基准测试
train_extra_images/ 3562(编号 4500-8061) 9.1G 补充数据组;用于已发布训练,供未来研究使用

每组图像包含 LR.png(低分辨率输入)和 4 个不同方法的超分辨率输出(HR_A.pngHR_B.pngHR_C.pngHR_D.png),并附带人工标注的成对排序。

标注文件

文件 描述
train.csv train_images/ 的标注(4499 组)
train_extra.csv train_extra_images/ 的标注(3562 组)
train_sr.jsonl train.csv + train_images/ 生成的训练文件
test_in_domain.csv / test_out_domain.csv 测试集真实排序
raw-in-domain/ / raw-out-domain/ 每位标注者的排序,用于标注者间一致性评估

许可信息

  • 本数据集卡片未为 RefSR-18K 图像或偏好标注声明新许可证
  • 源图像适用 LSDIR 的上游条款:仅限学术研究使用,所有图像来自互联网,版权归原始所有者所有
  • 用户在使用或重新分发前需自行审查并遵守上游条款

相关资源

搜集汇总
数据集介绍
RefSR-18K 数据集图片
构建方式
RefSR-18K,作为首个面向超分辨率任务的低分辨率条件偏好数据集,其构建过程严谨而精细。图像源取自LSDIR数据集,通过降质处理生成低分辨率输入,并运用多种超分算法生成候选高分辨率图像。随后,邀请人类标注员依据低分辨率与高分辨率的一致性及高分辨率图像的自然度,对每组四张候选图像进行两两排序,从而形成基于人类感知的偏好标注。数据集划分为训练集、域内测试集、域外测试集及附加训练集,并提供CSV与JSONL格式的标注文件及逐标注员原始排序,以支持深入分析。
使用方法
该数据集的使用灵活多样。研究者可直接利用提供的训练集及标注文件,如train.csv或train_sr.jsonl,用于训练超分奖励模型,如配套的RefReward-SR模型。域内与域外测试集及其标注文件,则用于评测所训练模型的偏好对齐性能。附加训练集虽未纳入官方训练,但可用于扩展研究,探索数据规模对模型性能的影响。逐标注员的原始排名文件支持进行标注者一致性分析或加权聚合策略的开发。使用时需注意,图像源自LSDIR,受限于学术研究目的,并应遵循原始图片来源的版权条款,确保合规使用。
背景与挑战
背景概述
RefSR-18K是由Song等学者于2026年提出的首个大规模低分辨率条件偏好数据集,其核心研究问题在于为超分辨率任务构建符合人类视觉偏好的奖励模型。该数据集源自LSDIR图像库,通过精心设计的降质与多种超分算法生成候选图像,并由人类标注者依据LR-HR一致性与自然度进行偏好排序。这一创新性的标注范式突破了传统以地面真实图像为参照的局限,在学术研究领域具有重要意义,其配套模型RefReward-SR的发布进一步推动了偏好对齐超分辨率技术的发展,为图像质量评估与生成模型的优化提供了新的基准与研究方向。
当前挑战
超分辨率领域长期面临感知失真与语义保真度的权衡难题,传统评估指标难以准确反映人类主观感受,而现有偏好数据集多忽略低分辨率输入条件,无法捕捉真实场景下的视觉期望。RefSR-18K构建过程中面临多重挑战:需从LSDIR中选取多样化的高分辨率图像并模拟复杂退化过程,确保低分辨率输入的合理性;需整合多种超分算法以产生具有代表性的候选集,避免偏好偏差;大规模人类标注的组织与质量控制,以及跨域泛化的测试设计,均要求精细的实验方案与严格的标注协议,以保证数据的可靠性与可复现性。
常用场景
经典使用场景
RefSR-18K作为首个大规模、以低分辨率图像为条件的人类偏好数据集,专为超分辨率任务设计。其经典使用场景在于训练和评估偏好对齐的奖励模型,如RefReward-SR,通过利用成对的人类排序标注,学习LR-HR一致性与HR自然度的联合表征。研究者可基于该数据集进行奖励模型的端到端训练,或将其作为基准,评估不同超分辨率方法在感知质量与忠实度方面的表现。该数据集的结构化分组设计(每个组包含LR输入及四个不同SR方法的输出)使其适用于多方法对比研究,并支持在域内与域外场景下验证模型的泛化能力。
解决学术问题
该数据集解决了超分辨率领域长期存在的评估指标与人类感知不一致的学术难题。传统超分辨率评价多依赖PSNR、SSIM等全参考指标,而这些指标与人类对细节真实性和自然度的主观判断存在显著偏差。RefSR-18K通过收集基于LR-HR一致性和自然度的人类偏好,为建立感知驱动的奖励模型提供了数据基础,从而推动超分辨率方法向人类偏好对齐的方向发展。其引入的域内外测试划分,也为评估奖励模型的鲁棒性和泛化性提供了标准化的数据支撑,填补了该领域缺乏大规模偏好数据集的空白。
实际应用
在实际应用中,RefSR-18K可直接用于训练图像超分辨率服务的质量评估与排序模块。例如,在手机摄影、医疗影像增强、卫星图像复原等场景中,集成基于该数据集训练的奖励模型,可自动选择最符合人类视觉偏好的超分辨率结果,提升用户体验。此外,该数据集还可用于开发无参考图像质量评估算法,为视频流媒体、云图像处理等实时系统提供感知质量反馈,优化处理流程。其标注结构支持细粒度的偏好分析,有助于定制化超分辨率模型,满足不同行业对清晰度和自然度的差异化需求。
数据集最近研究
最新研究方向
RefSR-18K作为首个以低分辨率图像为条件的超分辨率偏好数据集,标志着该领域从像素级相似度评估向人类感知对齐的范式转变。其前沿研究方向聚焦于利用人类偏好训练奖励模型,以优化生成式超分辨率方法,确保输出在保持低分辨率输入一致性的同时具备自然真实性。该数据集源自LSDIR,并涵盖域内外测试集及逐标注者排名,为评价标注者间一致性提供了基准。结合RefReward-SR模型,该工作推动了超分辨率技术向感知驱动、个性化优化的方向发展,对图像增强、计算摄影及智能影像修复等应用具有重要影响,并为未来研究提供了可扩展的资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务