llbench-dataset
收藏资源简介:
LL-Bench 是一个大规模的人类偏好基准数据集,旨在评估大型生成模型(LGMs)时代的低层次视觉恢复任务。该数据集比较了10种大型生成模型、16种专业模型和5种全能模型在16种低层次视觉任务上的表现,并附带了密集的人类标注数据,包括成对质量偏好、Bradley-Terry分数和每张图像的幻觉标签。数据集包含28,919个(试验×模型)恢复图像记录,组织结构包括元数据、人类偏好数据、源图像和恢复图像。适用于图像到图像、图像分类等任务,特别关注低层次视觉和图像恢复领域。数据集采用CC BY-NC 4.0许可,仅供非商业研究使用。
LL-Bench is a large-scale human preference benchmark dataset developed to evaluate low-level visual restoration tasks in the era of Large Generative Models (LGMs). This dataset compares the performance of 10 large generative models, 16 specialized models and 5 general-purpose models across 16 low-level visual tasks, and is accompanied by dense human annotation data including pairwise quality preferences, Bradley-Terry scores and hallucination labels for each individual image. The dataset contains 28,919 (trial × model) restored image records, with its organizational structure covering metadata, human preference data, source images and restored images. It is applicable to tasks such as image-to-image and image classification, with a particular focus on the fields of low-level vision and image restoration. The dataset is licensed under CC BY-NC 4.0 and is for non-commercial research use only.
数据集概述:LL-Bench
LL-Bench 是一个面向大规模生成模型(LGM)时代的大规模、基于人类偏好的低层视觉恢复基准数据集。
核心任务与规模
- 评估内容:比较 10个大型生成模型、16个专业模型和5个全能模型在 16个低层视觉任务上的表现。
- 任务列表:运动去模糊、阴影去除、去雪、去雨、超分辨率、HDR成像、低光增强、旧照片修复、压缩伪影去除、雨滴去除、水下增强、去雾、去噪、散焦去模糊、眩光去除、反射去除。
- 数据规模:包含 28,919行(每行对应一个“试验×模型”的恢复图像),以及 10K到100K 条样本。
关键特性
- 人类偏好标注:提供密集的人工标注,包括:
- 成对质量偏好(pairwise quality preferences)
- Bradley-Terry 分数(Bradley-Terry quality scores)
- 每图像幻觉标签(hallucination labels)
- 试验质量排名(trial quality rankings)
- 独立标注:标注者被要求将“过度处理/幻觉”与偏好排名分开标注,两者相互独立。
数据组成
数据集包含以下配置(Config):
| 配置名称 | 说明 |
|---|---|
images |
每行一个(试验×模型)的恢复图像,包含试验级字段(28,919行)。 |
pairwise_quality_preferences |
成对质量偏好数据。 |
bradley_terry_quality_scores |
Bradley-Terry 质量分数。 |
hallucination_labels |
幻觉标签。 |
trial_quality_rankings |
试验质量排名。 |
目录结构
数据集目录布局如下:
metadata/:包含images.csv元数据文件。human_preference/:包含所有偏好和标签的 CSV 文件。source_images/:原始图像,分为有Ground Truth (with_gt)和无Ground Truth (wo_gt)。restored_images_lgm/:大型生成模型的输出图像。restored_images_sp_aio/:专业和全能模型的输出图像。
使用方式
- 快速加载:可使用
pandas.read_csv()直接加载各 CSV 文件,所有表通过trial_id进行连接。 - 图像解析:可通过
PIL.Image.open()读取restored_image_path字段指定的图像文件(路径相对于数据集根目录)。 - 连接成对数据:通过
trial_id和model字段,可从images表中查找对应成对比较中的图像。
许可与引用
- 许可证:CC BY-NC 4.0,仅供非商业研究使用。原始图像继承原数据集的许可证,商业使用前需查阅原来源。
- 引用:匿名提交的论文(NeurIPS 2026 评审)。
注意事项
- 无 Ground Truth(
wo_gt)的试验中,gt_image_path为空,读取前需检查has_gt字段。 - 某些
任务×数据集组合仅包含模型子集,精确覆盖情况记录在images.csv中。




