SDG-30K Dataset
收藏数据链接:
官方服务:
资源简介:
SDG-30K数据集是一个包含30K图像的基准数据集,具有框标注、自然语言原因和重要性评分,覆盖了四种现代文本到图像生成器,通过约1,085人小时的人工标注收集而成。
The SDG-30K dataset is a benchmark dataset consisting of 30,000 images, equipped with bounding box annotations, natural language rationales, and importance scores. It covers four modern text-to-image generators and was collected via approximately 1,085 person-hours of manual annotation.
创建时间:
2026-06-04
原始信息汇总
数据集概况
- 数据集名称:SDG-30K
- 全称:Structured Defect Grounding – 30K
- 发布机构/作者:Huaisong Zhang, Hao Yu, Yuxuan Zhang 等
- 论文链接:https://arxiv.org/abs/2606.06113
数据集规模与构成
- 总图像数:30,000 张
- 图像来源:由 4 种现代 T2I 生成器 生成
- 标注内容:每张图像附带 盒状边界框(box-grounded) 形式的缺陷标注、自然语言原因描述、以及重要性分数
- 标注人力投入:约 1,085 人时 的人工标注
标注结构
每个缺陷被表示为一个结构化元组:
- where:缺陷所在区域(边界框坐标)
- what:缺陷类型(如视觉伪影、图文不对齐)
- why:为何认为该区域有缺陷(自然语言解释)
- importance:缺陷严重程度(重要性分数)
缺陷类型
覆盖两种核心缺陷类型:
- Artifact(视觉伪影):图像中出现的非自然、不合理的视觉元素
- Misalignment(图文不对齐):图像内容与输入文本描述不一致
数据集用途
- 用于训练 SDG Detector,该检测器基于 Qwen3-VL 模型,能输出结构化缺陷集合
- 支持 缺陷导向的图像精炼(Defect-Guided Refinement),指导下游编辑模型定位并修复缺陷
- 为 BoxFlow-GRPO 等扩散强化学习算法提供重要性加权的空间奖励信号
数据格式与下载
- 数据格式:提供
train.jsonl和test.jsonl格式的标注文件(含边界框、自然语言原因、重要性分数) - 数据存储:托管于 Hugging Face 数据集仓库:https://huggingface.co/datasets/P1n3/SDG-30K
- 下载命令:
huggingface-cli download P1n3/SDG-30K --repo-type dataset --local-dir <本地路径>
配套预训练模型
| 模型类型 | 名称 | 用途 |
|---|---|---|
| 检测器(SFT) | P1n3/sdg-detector-sft |
经监督微调的缺陷检测模型 |
| 检测器(GRPO) | P1n3/sdg-detector-grpo |
经强化学习优化后的缺陷检测模型 |
| 强化学习 LoRA | P1n3/boxflow-grpo-flux-lora |
用于 FLUX.1-dev 对齐的 LoRA 权重 |
评估指标(SDG-Eval)
针对四个维度进行专门评估:
- 图像级缺陷分类
- 缺陷级定位(如 BoxF1@0.5)
- 原因描述相似度(如 DescCos@0.1)
- 重要性准确率(如 ImpAcc@0.1)
许可协议
- 代码仓库:Apache-2.0
- 数据集、生成图像及模型权重:受各自独立许可协议约束(详见 ASSET_LICENSES.md)
搜集汇总
数据集介绍

构建方式
在文本到图像生成模型日益普及的当下,局部且结构复杂的缺陷成为制约生成质量的核心瓶颈。SDG-30K数据集正是为解决这一挑战而精心构建的。该数据集汇聚了三十万幅由四种主流生成器生成的图像,并首次为每一处缺陷赋予了一个结构化四元组描述:位置、类型、成因与严重程度。数据集经由约1085人时的人工细致标注,确保了每条标注既包含精确的边界框定位,又附有自然语言层面的缺陷解释和重要性评分,从而实现了从像素级定位到语义级理解的跨越。
特点
SDG-30K数据集的独到之处在于其结构化缺陷描述范式取代了传统热图与标量评分,能够自然表征任意数量的缺陷实例并将每个区域与语义解释紧密绑定。数据集合涵盖了视觉伪影与图文错配两类核心缺陷,且提供边界框定位、自然语言理由与重要性评分三项维度。这种多维度、实例级别的标注体系不仅提升了可解释性,更为后续的模型训练与评估提供了丰富且可量化的反馈信号,助力生成图像质量诊断从粗粒度走向精细化管理。
使用方法
数据集的使用遵循一套清晰的三阶段训练流水线。首先,利用ms-swift框架对Qwen3-VL基础模型进行监督微调,使其学会输出包含思考过程与结构化缺陷框的答案格式。随后,采用GRPO强化学习算法结合自定义SDG_combined奖励函数对检测器进行进一步优化,奖励函数融合了DIoU、描述余弦相似度与重要性准确率等指标。最后,这些结构化反馈可转化为空间奖励信号,通过BoxFlow-GRPO方法对扩散模型(如FLUX.1-dev)进行对齐微调,亦可驱动下游编辑器执行精准的局部修复操作。
背景与挑战
背景概述
文本到图像(T2I)生成技术在近年来取得了显著进展,然而,现有模型在处理局部、细微且结构复杂的缺陷时仍显力不从心。传统的标量奖励和基于热图的反馈机制虽能提供一定程度的诊断信息,却难以自然描述数量可变的缺陷实例,也无法将每个缺陷区域与语义解释紧密绑定。为攻克这一难题,研究人员于2026年提出了结构化缺陷定位(Structured Defect Grounding, SDG)框架,并构建了SDG-30K数据集。该数据集由来自多家机构的研究者耗时约1085人时精心标注,包含约3万张图像,涵盖四种主流T2I生成器的输出。数据集以(位置、类型、原因、重要性)元组形式记录缺陷,为T2I诊断提供了实例级、可解释且可操作的反馈,对提升生成模型的可靠性与可解释性具有重要价值。
当前挑战
SDG-30K数据集所面临的挑战主要源于两个层面。在领域问题层面,T2I生成的缺陷呈现出高度异构性,包括视觉伪影与图文错配两大类,这些缺陷往往位置分散、形态各异且语义复杂,现有基于全局评分或热图的方法难以精准捕获并量化每个独立缺陷实例的严重程度与成因。在数据集构建层面,面临的核心挑战在于如何确保人工标注的一致性与精确性——由于缺陷边界的模糊性及语义解释的主观性,不同标注者对同一缺陷区域的界定与描述可能产生分歧;此外,覆盖多类生成器产生的多样化缺陷类型要求标注指南兼具全面性与可操作性,而耗时数万小时的密集标注工作也对质量控制流程提出了极高要求。
常用场景
经典使用场景
在文本到图像生成领域,现有模型常展现出局部的、微妙的且结构复杂的缺陷,而传统的标量奖励或热力图反馈难以有效描述这些缺陷实例的数量及其对应的语义解释。SDG-30K数据集正是为此而生,它被设计用于结构化缺陷定位任务,将每个缺陷建模为包含空间位置、缺陷类型、成因原因以及严重程度的四元组。研究者可借助该数据集训练具备实例级反馈能力的检测器,实现对生成图像中视觉伪影与图文失配问题的精细化诊断与定位。
衍生相关工作
围绕SDG-30K数据集,研究者已衍生出一系列开创性工作。其中最引人注目的是BoxFlow-GRPO算法,该算法将SDG检测器输出的结构化反馈转化为重要性加权的空间奖励,用于强化学习对齐文本到图像模型FLUX.1-dev,在多个评估维度上实现全面优于基线模型的性能。此外,SDG检测器本身以Qwen3-VL为基础通过监督微调与GRPO强化学习训练而成,形成了从缺陷识别到模型对齐的完整技术闭环,为后续探索生成图像的质量保障与自动优化开辟了新路径。
数据集最近研究
最新研究方向
在文本到图像生成领域,现有模型常陷入局部、细微且结构复杂的缺陷困境,而传统的标量奖励与热力图反馈难以提供实例级别的语义解释。Strustured Defect Grounding (SDG) 与其配套的 SDG-30K 数据集应运而生,将缺陷诊断重塑为结构化集合预测,为每个缺陷赋予位置、类型、成因与严重程度的四元组描述。这一前沿方向不仅突破了热力图中心化反馈的极限,更通过 BoxFlow-GRPO 算法将检测器的结构化输出转化为空间奖励,反向对齐扩散模型,形成闭环优化机制。SDG-30K 数据集作为这一研究的基石,凝聚了约1085人时的人工标注,覆盖了四种主流生成器的缺陷实例,推动了从粗粒度质量评分到细粒度缺陷归因的关键跨越,对提升生成图像的可控性、可解释性与可靠性具有深远意义。
以上内容由遇见数据集搜集并总结生成



