遇见数据集

GGT-100K

收藏
github2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

GGT-100K是一个用于可泛化真实世界图像恢复的生成式地面真值数据集,包含低质量(LQ)和高质量(HQ)图像对,旨在扩展图像恢复模型的泛化边界。

GGT-100K is a generative ground-truth dataset for generalizable real-world image restoration, which includes paired low-quality (LQ) and high-quality (HQ) images and aims to expand the generalization boundary of image restoration models.

创建时间:
2026-05-25
原始信息汇总

GGT-100K 数据集概述

GGT-100K 是一个用于通用真实世界图像恢复的生成式真实数据(Ground Truth)数据集,由香港理工大学与OPPO研究院联合构建。

核心目标

通过大规模多模态基础模型(MFMs)生成真实世界的低质量与高质量图像对,扩展图像恢复模型的泛化边界。

数据集规模与内容

  • 主数据集名称为 GGT-100K
  • 数据集中包含成对的低质量(LQ)与高质量(GT)图像。
  • 数据集提供三份JSONL文件用于训练与测试:
    • train_existing.jsonl:仅使用现有数据的训练对路径。
    • train_existing_GGT.jsonl:现有数据加上GGT-100K的训练对路径。
    • test_GGT_500.jsonl:GGT-100K-500测试集的对路径。
  • 每一条JSONL记录包含 "gt""lq""prompt" 三个字段(prompt 仅Qwen-Image-Edit方法使用)。

下载方式

  • Hugging Face:https://huggingface.co/datasets/VCLab-PolyU/GGT-100K/tree/main
  • 百度网盘:https://pan.baidu.com/s/1d-wly8RDoCOi59kBL5reSQ?pwd=f38z(密码:f38z)

数据集构成(三个部分)

  1. GGT-100K:主数据集,包含成对的图像。
  2. existing-dataset:论文中使用的外部/已有数据集(建议与GGT-100K联合使用进行训练)。
  3. pretrained-models:预训练模型检查点,涵盖10个模型×2种训练设置(仅使用现有数据训练 vs 现有数据+GGT-100K训练),共20个检查点。

许可证

数据集采用 Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International (CC BY-NC-ND 4.0) 许可证。

构建流程

GGT-100K 的构建包含四个步骤:

  • 评估现有多模态基础模型(MFMs)的恢复性能(报告了定量结果)。
  • 基于评估结果,利用MFMs生成真实世界的低质量与高质量图像对。

实验结果

  • 训练了10个图像恢复模型,包含使用与不使用GGT-100K的对比实验。
  • 实验结果显示GGT-100K显著提升了模型在真实世界退化上的泛化能力(包含定量与视觉对比结果)。

支持的基线模型与训练/推理方法

项目提供统一的训练脚本 train.sh 和测试脚本 test.sh,支持以下模型的训练与推理:

  • DA-CLIP UIR (daclip-uir)
  • FoundIR (FoundIR)
  • MoCE-IR (MoCE-IR)
  • BasicSR家族(X-Restormer / NAFNet / PromptIR / MPRNet / SwinIR)
  • Qwen-Image-Edit (qwen-image-edit)
  • Flux-ControlNet (flux-controlnet)

训练与推理均通过JSONL文件指定图像对路径,并提供相应的预训练模型下载。

搜集汇总
数据集介绍
GGT-100K 数据集图片
构建方式
GGT-100K数据集由香港理工大学与OPPO研究院联合构建,旨在为真实世界图像复原任务提供高质量的生成式真值(Generative Ground Truth)。构建过程共分为四步:首先,系统性地评估现有多模态基础模型(MFMs)在图像复原任务上的表现;其次,基于评估结果筛选出性能优异的MFMs,利用其生成大量低质量-高质量(LQ-HQ)图像对;接着,通过人工与自动相结合的方式对生成结果进行质量筛查与过滤,剔除不达标的样本;最后,整合并组织这些高质量图像对,形成包含10万对样本的GGT-100K数据集。这一流程确保了数据集在规模与质量上的双重优势,为模型泛化能力的提升奠定了坚实基础。
特点
GGT-100K数据集的核心特点在于其高度泛化性与真实世界场景的适配性。不同于传统合成退化数据集,该数据集通过多模态基础模型生成LQ-HQ图像对,能够覆盖更丰富、更贴近现实的退化类型(如模糊、噪声、低光照、复杂纹理失真等),从而显著扩展图像复原模型的泛化边界。数据集包含10万对高质量图像,并提供了配套的JSONL文件(如train_existing_GGT.jsonl),便于与现有数据集联合训练。此外,数据集附带20个预训练模型检查点(涵盖10种基线方法×2种训练设置),支持研究者在统一基准下进行公平比较。
使用方法
使用GGT-100K数据集进行训练与测试时,研究者可通过项目提供的统一脚本(train.sh与test.sh)便捷操作。训练时,通过--train-jsonl参数指定JSONL文件路径(如train_existing_GGT.jsonl),即可将GGT-100K与现有数据联合训练;测试时,通过--test-jsonl指定测试集JSONL(如test_GGT_500.jsonl),并配合--ckpt指定检查点路径,即可完成推理。JSONL文件中每行包含gt、lq与prompt三个字段,其中prompt仅对Qwen-Image-Edit方法有效,其他方法可留空。数据集的完整文件结构包括GGT-100K主数据集、external-dataseat及pretrained-models三部分,可从Hugging Face或百度网盘获取。
背景与挑战
背景概述
GGT-100K数据集由香港理工大学与OPPO研究院的研究团队于2025年共同创建,核心成员包括孔祥涛、赵吉鑫、孙灵晨、吴荣元及张磊教授。该数据集针对真实世界图像复原中泛化能力不足的瓶颈问题,创新性地提出利用多模态基础模型(MFMs)生成高质量低质量配对图像,从而构建出名为GGT-100K的大规模高质量配对数据集。通过提供丰富且多样化的真实退化场景,GGT-100K显著提升了图像复原模型在未见过的现实退化情况下的泛化性能,为图像复原领域引入了全新的训练范式,有望推动该领域向更通用、更鲁棒的方向发展。
当前挑战
该数据集面临的核心挑战在于:传统图像复原方法对特定合成退化过度拟合,难以适应真实世界中复杂多变的退化模式,导致模型泛化能力薄弱。构建过程中,研究团队需应对多模态基础模型在选择与生成质量上的不确定性,确保生成的高质量图像具有足够的真实感与多样性。此外,团队还需设计严谨的评估流程以筛选最优生成模型,并协调10种基线与2种训练设置下的20个预训练模型的统一训练与测试框架,确保数据使用的高效性与可复现性。
常用场景
经典使用场景
在图像修复(Image Restoration)领域中,GGT-100K 被广泛用作高质量训练与评估的基准数据集。该数据集通过多模态基础模型(MFMs)生成真实世界的低质量(LQ)与高质量(HQ)图像对,突破了传统合成降质数据集的泛化瓶颈。研究者可借助其包含的100,000对精细对齐的图像对,训练诸如SwinIR、NAFNet、Restormer等经典修复模型,或对现有模型在真实场景下的修复性能进行系统性评估。该数据集特别适用于检验模型在未知复杂降质(如雾霾、噪声、模糊混合)下的鲁棒性,已成为衡量通用图像修复算法能力的首要试验场。
解决学术问题
GGT-100K 直面了图像修复领域长期存在的核心学术困境——传统数据集过度依赖人工合成的降质模型(如高斯噪声、固定模糊核),导致训练出的模型在应用于真实世界时泛化能力极为有限。该数据集利用生成式多模态模型天然具备的真实降质建模能力,提供了高度贴近实际拍摄场景的成对数据,使得学术研究能够从“模拟环境”跃迁至“真实场景”。由此,研究者得以系统性地探讨并量化模型在面对未知、复合型降质时的表现,推动了去模糊、超分辨率、去雨等子任务在真实场景下的学术进展,显著提升了相关研究成果的实用价值与可信度。
衍生相关工作
GGT-100K 的发布催生了一系列富有影响力的衍生研究工作。一方面,研究者基于该数据集提出了多种新颖的修复架构,如结合视觉语言模型的可编辑修复框架Qwen-Image-Edit,以及利用扩散先验的Flux-ControlNet修复方案,这些工作均在该数据集上获得了显著的性能提升。另一方面,GGT-100K 启发了“生成式真实降质”这一新范式,后续工作如Real-ESRGAN的改进版及基于CLIP先验的DA-CLIP UIR模型均借鉴了其数据构建思路。此外,该数据集还被广泛用于对比不同修复模型在真实场景下的劣势,催生了一系列关于模型泛化性定量分析的开源工具与评测标准,深刻影响了图像修复领域的研究方向。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务