遇见数据集

CO-AID (Compositional AI-generated Image Defect dataset)

收藏
arXiv2026-08-26 更新2026-08-28 收录
数据链接:
官方服务:

资源简介:

CO-AID数据集由中南大学与邓迪大学联合创建,专注于识别AI生成图像中的组合性缺陷。该数据集包含651幅从人物、手部、物体及场景四类参考图像生成的AI图像,由23名有效参与者提供了18906条全局与局部缺陷标注。数据构建流程包括手动筛选参考图像、借助ChatGPT生成并人工编辑组合提示词,再通过Midjourney、Imagen和FLUX三款模型生成图像,最后开展严格的主观实验以收集多维度缺陷信息。该数据集旨在揭示AI生成图像在复杂组合因素下的系统性缺陷,为缺陷预测与图像生成优化提供基准支撑。

The CO-AID dataset, jointly created by Central South University and the University of Dundee, focuses on identifying compositional defects in AI-generated images. This dataset contains 651 AI-generated images derived from reference images across four categories: humans, hands, objects, and scenes, with 18,906 global and local defect annotations contributed by 23 valid participants. The data construction pipeline includes manually screening reference images, generating and manually editing compositional prompts with the assistance of ChatGPT, generating images via three models: Midjourney, Imagen, and FLUX, and finally conducting rigorous subjective experiments to collect multi-dimensional defect information. This dataset aims to reveal the systematic defects of AI-generated images under complex compositional factors, providing benchmark support for defect prediction and image generation optimization.

创建时间:
2026-08-26
原始信息汇总

CO-AID 数据集详情

CO-AID(Composition-Oriented AI-generated Image Defects)是一个面向AI生成图像感知缺陷研究的人工标注数据集,与论文《When Composition Doesnt Add Up: Humans Identifying Defects in AI-Generated Images》相关联,该论文发表于IEEE International Workshop on Multimedia Signal Processing (MMSP) 2026。

数据集内容

该数据集包含以下核心资源:

  • AI生成图像:存放于CO-AID/AI-generated images/文件夹中,图像按顺序命名(如1.png2.png等),是缺陷分析的主要数据。
  • 生成提示词(prompt.csv):记录每张图像对应的生成提示词,每一行对应一张图像,提供提示词文本与生成内容之间的映射关系。
  • 人类标注缺陷信息(Defects.csv):包含每位参与者对每张图像的人工缺陷标注,每一行代表一位参与者对一张图像的评估记录。

Defects.csv标注结构

列名 说明
record_id 标注记录的唯一标识符(如rec_000001
image_id 对应图像的唯一标识符
participant_id 做出标注的参与者标识符
Global Defects 参与者分配的全局缺陷标签列表
Local Defects 局部缺陷的JSON格式列表

标注详情

  • Global Defects仅包含缺陷标签,不包含坐标信息。
  • Local Defects是JSON对象列表,每个对象包含归一化坐标(px/py,取值0–1)和该位置的缺陷类型列表(reasons)。

示例标注行:如rec_000015中,图像1的全局缺陷包括"overall:style_unreal""overall:many_subject_abnormal""overall:detail_missing";局部缺陷包含5个带坐标的缺陷点,缺陷类型涵盖身体结构异常、手部结构/姿势异常以及细节模糊等。

补充材料

Supplementary/文件夹提供额外支持材料:

  • outlierremoval.md:参与者可靠性评估、离群值剔除标准及可视化说明。
  • result.png:补充可视化图。

许可证

数据集采用Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License (CC BY-NC-SA 4.0)许可。

引用信息

如需引用该数据集,可参考以下BibTeX格式:

@inproceedings{hu2026coaid, title = {When Composition Doesnt Add Up: Humans Identifying Defects in AI-Generated Images}, author = {Hu, Ruoqi and Zhao, Chulin and Chang, Jiashuo and Ruiz-Dolz, Ramon and Lin, Hanhe}, booktitle = {IEEE International Workshop on Multimedia Signal Processing (MMSP)}, year = {2026} }

数据集地址

完整数据集及代码仓库可通过以下链接访问:https://github.com/Future-IQA/CO-AID

搜集汇总
数据集介绍
CO-AID (Compositional AI-generated Image Defect dataset) 数据集图片
构建方式
CO-AID数据集的构建遵循严谨的多阶段流程。首先,从Pexels和Unsplash平台依据复杂构图特性人工筛选出651幅参考图像,涵盖人物、手部、物体与场景四大类别。随后,借助ChatGPT生成初始提示词,并经过人工精心编辑,确保提示词明确包含多实体、多属性、空间关系及交互等组合性因素。这些提示词被输入至Midjourney、Imagen与FLUX三个先进的文本生成图像模型中,生成对应的AI图像。最后,设计并实施了一项受控的主观实验,由29名经过培训的参与者对每幅图像进行多标签标注,详细记录全局或局部缺陷的类型与位置,从而构建出包含参考图像、提示词、生成图像及标注信息的全面数据集。
特点
CO-AID数据集独具特色,首次系统性地针对组合性AI生成图像中的缺陷进行细粒度标注。其显著特点在于多层次、多维度的缺陷标注体系:全局层面涵盖非自然风格、模糊缺失细节、异常文本、违背常识及组合相关异常等七种类型;局部层面则细分为面部、毛发、手部、身体及物体五类,并各自附有具体缺陷原因。此外,数据集基于真实图像构建提示词,确保内容的真实性与多样性,并通过严格的异常参与者剔除机制保障标注质量。这些特性使CO-AID不仅支持缺陷识别研究,还能为生成模型的优化提供精细化指导,成为评估组合性文本生成图像的重要基准。
使用方法
CO-AID数据集可广泛应用于AI生成图像的质量评估与生成优化。研究者可利用其标注信息训练深度学习模型,以自动预测图像中的缺陷位置与类型,例如基于TranSalNet微调实现缺陷检测,效果优于通用大模型。此外,缺陷图可作为空间指引,结合GPT-Image-1等生成模型进行缺陷引导的图像修复,显著提升修复图像的视觉质量。数据集还支持对现有T2I模型的系统评估,通过对比不同模型在人物、手部等复杂构图上的表现,揭示其生成能力的优劣。CO-AID的公开可用性为学术界与工业界提供了标准化基准,助力开发更高效、鲁棒的组合性图像生成与质量评估体系。
背景与挑战
背景概述
随着扩散模型在文本到图像生成领域的迅猛发展,尽管模型在生成高分辨率、细节丰富的图像方面取得了显著成就,但当提示词涉及多实体、多属性、复杂空间关系及交互等组合因素时,生成图像常出现系统性缺陷。针对这一关键问题,中南大学邓迪国际学院与邓迪大学的研究人员Ruoqi Hu、Chulin Zhao等于2026年构建了CO-AID(Compositional AI-generated Image Defect)数据集,旨在系统研究人类如何识别AI生成图像中的组合缺陷。该数据集包含651张参考图像、对应的组合提示词以及由Midjourney、Imagen和FLUX生成的图像,并由29名参与者进行了细致的多标签标注,覆盖全局和局部缺陷类型及位置。CO-AID数据集作为首个系统研究组合缺陷的基准,不仅为AI生成图像质量评估提供了新视角,还通过概念验证实验证明了其在缺陷预测和引导图像修复方面的潜力,对推动文本到图像生成模型的优化具有重要意义。
当前挑战
CO-AID数据集面临的挑战主要体现在两个方面:其一,所解决的领域问题——组合文本到图像生成中,现有T2I模型在涉及复杂组合因素(如多实体、多属性、空间关系与交互)时,生成图像常出现全局性及局部性缺陷,如异常结构、数量错误、属性绑定失败、空间逻辑混乱及交互异常等,而现有基准多侧重于全局评价或仅关注简单内容,缺乏对组合缺陷的细粒度局部识别与定位。其二,数据集构建过程中的挑战,包括从涵盖人物、手、物体和场景四类具有高度组合特征的参考图像中,设计并生成强调组合因素的提示词,需确保语义层面明确描述多实体、属性、空间关系及交互;同时,主观实验需规范29名参与者的标注流程,通过引入训练、预实验及异常值剔除(基于参与度、自我一致性和遵从性)机制确保数据质量,整个实验持续两周,每位参与者耗时约10小时,最终收集到18,906条注释,工作量巨大,且需保证标注的一致性与可靠性。
常用场景
经典使用场景
CO-AID数据集作为首个专门针对AI生成图像中构图缺陷的系统性标注资源,其经典使用场景聚焦于细粒度缺陷定位与分类研究。该数据集涵盖了人、手、物体和场景四大类复杂构图图像,每张图像均由多位参与者进行全局与局部多标签标注,精确标记缺陷类型与位置。研究者可利用这些标注数据训练和评估缺陷检测模型,通过像素级或区域级预测实现自动识别AI生成图像中的结构异常、属性绑定错误、交互关系失调等问题,从而为图像质量评估领域提供标准化的测试基准。
实际应用
在实际应用中,CO-AID数据集赋能多种下游任务。一方面,其标注信息可训练缺陷检测网络,用于自动化筛选AI生成内容中的瑕疵图像,提升内容创作平台、广告设计等领域中AI工具输出的质量可控性。另一方面,缺陷定位图可作为空间指引,结合生成模型(如GPT-Image-1)实现缺陷引导的图像修复,针对性修正手部畸形、面部扭曲等局部问题,显著改善生成图像的视觉真实感与语义一致性。此外,该数据集还可用于验证不同T2I模型的鲁棒性,辅助模型选型与迭代调优,具有广泛的工业应用价值。
衍生相关工作
CO-AID的构建催生了多项衍生研究。其核心贡献之一在于示范了基于人类感知的缺陷标注框架,后续工作可借鉴其多粒度标注协议,构建更大规模或更多场景的AI生成图像质量数据集。基于CO-AID,研究者扩展了微调TranSalNet进行缺陷预测的基线方法,并探索与GPT-Image-1等大模型的集成,用于缺陷引导的图像生成与修复。此外,该数据集也启发了面向T2I模型的可解释性评估方法,促使研究者开发任务级探针或注意力可视化工具,以深入理解模型在复杂构图下产生缺陷的机理,进而推动生成模型的结构优化与训练策略改进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务