遇见数据集

GGT-100K

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

GGT-100K 是一个用于可泛化真实世界图像恢复的大规模生成式基准数据集。该数据集的目的是通过多模态基础模型(MFMs)生成真实世界的低质量-高质量(LQ–HQ)图像对,以扩展图像恢复模型的泛化边界。数据集核心包含约10万对配对的真实世界退化图像及其对应的高质量参考图像(ground truth)。数据组织形式为JSONL文件,其中每条记录包含“gt”(高质量图像相对路径)、“lq”(低质量图像相对路径)和“prompt”(提示词,主要用于特定编辑模型)三个字段。此外,数据集发布包还包含了用于对比实验的现有外部数据集(existing-dataset)以及在两种设置(仅用现有数据、现有数据+GGT-100K)下训练的10个基线模型的预训练权重。该数据集专为真实世界图像恢复任务设计,旨在评估和提升模型对复杂、未知的真实世界图像退化情况的恢复能力和泛化性能。数据集采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议(CC BY-NC-ND 4.0)。

GGT-100K is a large-scale generative benchmark dataset for generalizable real-world image restoration. The purpose of this dataset is to generate real-world low-quality–high-quality (LQ–HQ) image pairs through multimodal foundation models (MFMs) to expand the generalization boundaries of image restoration models. The dataset core contains approximately 100,000 pairs of real-world degraded images and their corresponding high-quality reference images (ground truth). The data is organized in JSONL files, where each record includes three fields: gt (relative path to the high-quality image), lq (relative path to the low-quality image), and prompt (prompt text, mainly used for specific editing models). Additionally, the dataset release package includes existing external datasets for comparative experiments and pre-trained weights of 10 baseline models trained under two settings (using only existing data, and existing data + GGT-100K). This dataset is specifically designed for real-world image restoration tasks, aiming to evaluate and enhance the restoration capability and generalization performance of models for complex, unknown real-world image degradation scenarios. The dataset is licensed under the Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International License (CC BY-NC-ND 4.0).

创建时间:
2026-05-21
原始信息汇总

数据集概述:GGT-100K

GGT-100K 是一个专为通用真实世界图像复原(Generalizable Real-World Image Restoration)设计的大规模配对数据集,由香港理工大学与OPPO研究所联合构建。

核心目标

通过提供由多模态基础模型(MFMs)生成的真实世界低质量-高质量(LQ-HQ)图像对,扩展图像复原模型的泛化边界,提升其在真实场景退化下的表现。

许可协议

  • 许可证:Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International(CC BY-NC-ND 4.0)

数据集下载

文件结构与内容

下载内容包含三个部分:

  1. GGT-100K:主配对数据集(LQ-HQ图像对)。
  2. existing-dataset:论文中使用的额外/先前数据集,建议与GGT-100K一同用于训练。
  3. pretrained-models:预训练基线模型检查点,共20个检查点(10个模型 × 2种设置:仅使用现有数据训练 vs. 使用现有数据+GGT-100K训练)。

此外,提供三个JSONL文件,以相对路径列出配对图像路径,方便基线模型使用:

  • train_existing.jsonl:训练集(仅现有数据,不含GGT-100K)
  • train_existing_GGT.jsonl:训练集(现有数据 + GGT-100K)
  • test_GGT_500.jsonl:测试集(GGT-100K-500)

每行格式示例: json {"gt":"relative/path/to/GT.png","lq":"relative/path/to/LQ.png","prompt":""}

注意prompt字段仅用于Qwen-Image-Edit模型,其他模型留空即可。

数据集构建流程

GGT-100K通过以下四个步骤构建(详情可展开查看):

  1. 收集与筛选多模态基础模型(MFMs)生成的真实世界图像对。
  2. 对现有MFMs进行复原质量评估并量化结果。
  3. 整合与优化数据对。
  4. 形成最终的高质量配对数据集。

实验效果

为验证GGT-100K的有效性,论文训练了10种图像复原模型,对比有无GGT-100K训练的效果。结果表明:

  • 定量指标:加入GGT-100K训练的模型在多个复原指标上显著提升。
  • 视觉结果:GGT-100K显著增强了模型对真实世界图像退化的泛化能力,视觉效果更优(具体图表详见页面展开区域)。

引用与联系

  • 论文:尚未发布完整BibTeX引用信息(待更新)。
  • 联系邮箱:xiangtao.kong@connect.polyu.hk
搜集汇总
数据集介绍
GGT-100K 数据集图片
构建方式
GGT-100K数据集的构建旨在突破现有图像复原模型在真实世界退化场景下的泛化瓶颈。研究团队首先系统评估了当前主流多模态基础模型(MFMs)的复原能力,筛选出表现优异的模型作为生成工具。随后,从海量高质量自然图像中精心挑选100K张清晰图像作为真值(GT),利用选定的MFMs对这些图像施加可控的真实世界退化模拟,从而生成对应的低质量(LQ)图像。整个流程分为四个步骤:MFMs复原性能评估、高质量真值采集、退化过程控制与配对数据生成,最终形成了一套规模达十万量级的LQ-HQ配对数据集。
特点
GGT-100K的核心特点在于其生成式真值(Generative Ground Truth)理念,即借助先进多模态模型的图像生成与编辑能力,模拟出更贴近真实场景的复杂退化模式,从而显著提升模型的泛化能力。数据集包含10万对高分辨率图像,覆盖丰富的场景与退化类型,且提供了三种JSONL文件分别用于训练(仅含现有数据、含GGT-100K)和测试(GGT-500子集),便于研究者灵活使用。通过与10种主流复原模型联合训练,实验证明GGT-100K能有效增强模型对未知退化的鲁棒性。
使用方法
使用GGT-100K时,研究者需先通过Hugging Face或百度网盘下载数据集及其配套的预训练模型和现有数据集。数据集提供三种JSONL文件(train_existing.jsonl、train_existing_GGT.jsonl、test_GGT_500.jsonl),其中每行包含GT与LQ图像的相对路径及可选的prompt字段(仅Qwen-Image-Edit模型需要填充)。使用时需将相对路径与本地数据集根目录拼接,即可直接用于训练和测试。推荐将GGT-100K与现有数据集联合训练,以最大化泛化增益。
背景与挑战
背景概述
真实世界的图像退化具有高度的复杂性和多样性,这使得现有基于合成数据训练的复原模型在泛化到未知场景时性能急剧下降。针对这一瓶颈,香港理工大学与OPPO研究院的联合团队于2025年发布了GGT-100K数据集,由孔祥涛、赵继鑫等研究者主导构建。该数据集的核心创新在于利用多模态基础模型(MFMs)自动生成高质量的“真实世界低质量-高质量(LQ-HQ)图像对”,旨在为图像复原模型提供更具泛化能力的训练真值。GGT-100K的问世缓解了传统数据集中人工标注成本高昂、真实退化采集困难的问题,为可泛化的真实世界图像复原研究提供了基准数据引擎,显著推动了该领域从实验室合成环境向现实应用场景的跨越。
当前挑战
GGT-100K所解决的领域核心挑战在于图像复原模型的域迁移与泛化瓶颈,现有模型在应对现实世界中未知且复杂的混合退化(如运动模糊、噪声、光照变化等耦合现象)时普遍表现不佳。在数据集构建过程中,团队成员面临多重技术难题:如何从多种MFM生成的海量图像中筛选出视觉质量一致且修复效果稳定的LQ-HQ对;如何设计高效的质量评估协议以剔除MFM产生的伪影与失真样本;以及如何在不同MFM间平衡其复原偏好,避免数据集引入模型特定的偏差,从而构造真正具有多样性和普适性的训练集合。
常用场景
经典使用场景
GGT-100K数据集的核心价值在于它为真实世界图像复原任务提供了一个高质量的生成式真值(Generative Ground Truth)基准。该数据集包含超过10万对低质量与高质量图像,这些图像由多模态基础模型(Multimodal Foundation Models, MFMs)生成,旨在突破传统复原模型在真实退化场景下的泛化瓶颈。经典使用场景包括:训练和评估各类图像复原模型(如去噪、去模糊、超分辨率等),使其能够应对复杂的真实世界退化,而非仅适配于人工合成的退化模式。研究者利用该大数据集进行监督学习,能够显著提升模型在未知真实场景中的复原质量,从而推动图像复原领域向更广泛的现实应用迈进。
实际应用
在实际应用领域,GGT-100K所训练的图像复原模型展现出广泛的适用性,尤其在移动摄影、监控安防、航空航天遥感以及医疗影像等对图像质量高度依赖的行业。例如,在智能手机摄影中,配备经GGT-100K训练的复原算法,可有效去除夜间拍摄的噪声与模糊,显著提升成像效果。在安防监控场景下,该数据集帮助模型适应低光照、运动模糊等复杂退化,使监控画面更加清晰可靠。此外,在遥感图像分析和医学影像诊断中,图像复原质量的提升直接促进了地物识别精度与病灶检测准确性的提高,体现了该数据集从科研到产品落地的强大转化潜力。
衍生相关工作
GGT-100K的发布催生了一系列前沿研究工作,主要涉及图像复原模型的泛化能力提升与多模态基础模型的协同应用。基于该数据集,研究者开发了多种新型复原架构,如动态退化适应网络和混合注意力复原器,并通过在GGT-100K上的训练验证了其在未见退化类型上的优异表现。此外,该数据集还启发了生成式指标与评估方法的研究,例如设计基于视觉语言模型的非参考图像质量评价系统,用于自动判别复原结果的真实度与自然度。同时,GGT-100K作为高质量真值源,被用于微调、蒸馏更大的生成式模型,推动了轻量级边缘复原模型的落地,形成了以数据驱动为核心的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务