ImgEdit
收藏资源简介:
ImgEdit是一个大规模、高质量的图像编辑数据集,包含120万精心策划的编辑对,涵盖了新颖且复杂的单次编辑任务以及具有挑战性的多次编辑任务。为确保数据质量,采用了一个多阶段的流程,整合了前沿的视觉语言模型、检测模型、分割模型,以及任务特定的修复程序和严格的后处理。ImgEdit在任务新颖性和数据质量方面均超越了现有数据集。
ImgEdit is a large-scale, high-quality image editing dataset containing 1.2 million carefully curated edit pairs, covering novel and complex single-turn editing tasks as well as challenging multi-turn editing tasks. To ensure data quality, a multi-stage pipeline integrating cutting-edge vision-language models, detection models, segmentation models, task-specific repair procedures, and strict post-processing was adopted. ImgEdit outperforms existing datasets in terms of both task novelty and data quality.
ImgEdit数据集概述
数据集基本信息
- 名称: ImgEdit: A Unified Image Editing Dataset and Benchmark
- 开发者: 北京大学深圳研究生院、鹏城实验室、Rabbitpre AI
- 规模: 120万精心筛选的编辑对
- 特点:
- 包含新颖复杂的单轮编辑任务
- 包含具有挑战性的多轮编辑任务
- 数据质量优于现有数据集
数据集构成
- 单轮任务: 10类
- 多轮任务: 3类
- 数据来源: 基于Laion-aes数据集筛选(美学评分>4.75)
数据处理流程
- 数据准备与过滤: 使用Laion-aes数据集,保留美学评分>4.75的样本
- 生成密集描述: 使用Qwen2.5VL-7B生成密集描述,GPT-4o生成简短描述
- 生成边界框和分割掩码: 使用Yolo-world和SAM2
- 生成多样化编辑提示: 使用GPT-4o
- 基于任务的编辑流程: 使用ComfyUI
- 数据质量过滤: 使用GPT-4o
数据格式
预处理数据格式(JSON)
python { "path": "图像路径", "cap": ["密集描述"], "resolution": {"height": 高度, "width": 宽度}, "aes": 美学评分, "tags": { "background": ["背景名词"], "object": ["物体名词"], "summary": "简短描述" }, "segmentation": { "background": [{ "class_name": "类别名称", "bbox": [边界框坐标], "mask": "掩码字符串", "score": "yoloworld分数", "clip_score": "clip分数", "aes_score": "区域美学分数" }], "object": [...], "box_format": "xyxy" } }
最终数据集格式(Parquet)
-
单轮任务: python { input_images: [输入图像路径], output_images: [输出图像路径], prompt: 编辑提示 }
-
多轮任务: python { data: [{ input_images: [输入图像路径], output_images: [输出图像路径], prompt: 编辑提示 }] }
数据集结构(Huggingface)
-
预处理数据集:
- laion-aes/: 过滤后的laion-aes图像tar文件
- jsons/: 包含描述、边界框和掩码的json文件
-
ImgEdit数据集:
- Multiturn/: 多轮图像数据
- Singleturn/: 单轮图像数据
- Parquet/: 所有任务的提示和图像路径
- ImgEdit_judge/: Qwen2.5-VL格式的模型检查点
- all_dataset_gpt_score.json: 所有后处理分数
基准测试(ImgEdit-Bench)
- 基础测试套件: 评估指令遵循、编辑质量和细节保留
- 理解-定位-编辑(UGE)套件: 评估空间推理和多对象目标等复杂任务
- 多轮测试套件: 评估内容理解、内容记忆和版本回溯
相关资源
- arXiv论文: https://arxiv.org/
- Huggingface数据集:
- https://huggingface.co/datasets/sysuyy/ImgEdit
- https://huggingface.co/datasets/sysuyy/ImgEdit_recap_mask




