CrispEdit-2M
收藏资源简介:
CrispEdit-2M是由字节跳动等机构联合构建的高分辨率图像编辑数据集,旨在为基于掩码生成变换器的图像编辑模型提供训练支持。该数据集包含200万个高质量样本,所有图像分辨率均不低于1024像素,覆盖了对象转换、风格迁移等七种不同的编辑类别,数据经过严格筛选以确保内容精准性。其创建过程整合了多源图像与文本指令,通过自动化与人工过滤相结合的方式构建,专注于解决扩散模型在图像编辑中存在的编辑泄漏问题,推动局部化、可控的图像生成与编辑技术的发展。
CrispEdit-2M is a high-resolution image editing dataset jointly constructed by ByteDance and other institutions, designed to provide training support for image editing models based on mask-guided generative Transformers. The dataset includes 2 million high-quality samples, with all images having a resolution of no less than 1024 pixels and covering seven distinct editing categories such as object transformation and style transfer. The data has been strictly screened to guarantee content accuracy. Its creation process integrates multi-source images and text instructions, and is constructed through a combination of automated processing and manual filtering. This dataset focuses on resolving the editing leakage problem in diffusion-based image editing, and aims to promote the development of localized and controllable image generation and editing technologies.
根据您提供的HTML内容,以下是数据集CrispEdit-2M的详情总结:
数据集概述
CrispEdit-2M是一个高分辨率图像编辑数据集,专为训练图像编辑模型而构建,尤其服务于基于掩码生成变换器(MGT)的EditMGT框架。
核心规模与构成
- 总样本数: 约200万(2M)个高分辨率编辑样本。
- 分辨率: 所有图片的短边≥1024像素,主要集中分布在[1280, 1665)像素范围。
- 编辑类别: 涵盖7个不同的编辑类别。
编辑类别统计
| 编辑类别 | 样本数量(约) |
|---|---|
| 添加(Add) | 30万 |
| 替换(Replace) | 30万 |
| 移除(Remove) | 30万 |
| 颜色变更(Color alteration) | 50万 |
| 背景更换(Background change) | 20万 |
| 风格变换(Style transformation) | 40万 |
| 运动修改(Motion modification) | 3.4万 |
数据采集流程
数据集通过一个四阶段流程构建:
- 图像筛选: 从LAION-Aesthetics、Unsplash Lite和JourneyDB(FLUX重新生成版)中筛选高质量图像。筛选标准包括:美学评分>4.5、短边>1024像素、内容适宜性评估(使用Qwen3),并排除了简单图案、单调构图、含水印或文字叠加的图像,最终得到约550万样本。
- 定制化指令生成: 采用两阶段框架。第一阶段使用Qwen2.5-VL生成详细图像描述;第二阶段使用GPT-4o将这些描述转化为多模态编辑指令,并通过迭代自优化机制提高指令的复杂性与语言多样性。
- 特定编辑流程: 使用FLUX.1 Kontext和Step1X-Edit v1.2等先进模型进行编辑,随后用视觉语言模型(VLM)选择更优结果。
- 数据质量保证: 建立两阶段过滤框架:预处理阶段验证指令的语义与逻辑一致性;后处理阶段使用CLIP对齐指标和视觉相似度指标分别验证语义对应与非目标内容的保留。
关键特点
- 高分辨率优先: 专门优化用于高分辨率编辑任务。
- 高质量与多样性: 通过多源图像筛选、多模型编辑以及多模态指令生成,确保了数据的高质量与丰富多样性。

- 1Masked Generative Transformer Is What You Need for Image Editing字节跳动; 新加坡国立大学; 杜克大学; 上海交通大学; 香港科技大学·广州 · 2026年



