遇见数据集

ConceptEdit-12M

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

ConceptEdit-12M 是一个大规模图像编辑数据集,包含约 1000 万到 1 亿个样本。每个样本以三元组形式存储:一张源图像、一张编辑后的图像以及一个 JSON 元数据文件。元数据文件详细描述了编辑指令(提供英文和中文的简短与详细版本)、编辑概念分类(类别、子类别、任务、细节)、以及基于 VQA 的质量评估结果(包括整体评分、保留标志、错误计数和多个维度的问答检查)。数据集的源图像来自 Fine-T2I 数据集。数据被组织为四个主要分割:enhanced_prompt_square_resolution(154 个 tar 分片)、enhanced_prompt_random_resolution(162 个分片)、original_prompt_square_resolution(131 个分片)、original_prompt_random_resolution(169 个分片)。每个 tar 分片包含一个批处理目录,目录内每个样本由三个文件组成:<样本ID>.json、<样本ID>_source.jpg、<样本ID>_edit.png。该数据集适用于基于指令的图像编辑、多模态学习、图像生成等任务,尤其支持概念缩放和密集监督的图像编辑研究。

ConceptEdit-12M is a large-scale image editing dataset containing approximately 10 million to 100 million samples. Each sample is stored as a triplet: a source image, an edited image, and a JSON metadata file. The metadata file details the editing instructions (provided in English and Chinese with short and long versions), editing concept classification (category, subcategory, task, detail), and VQA-based quality assessment results (including overall score, retention flag, error count, and multi-dimensional question-answer checks). The source images are from the Fine-T2I dataset. The data is organized into four main splits: enhanced_prompt_square_resolution (154 tar shards), enhanced_prompt_random_resolution (162 shards), original_prompt_square_resolution (131 shards), original_prompt_random_resolution (169 shards). Each tar shard contains a batch directory, where each sample consists of three files: <sampleID>.json, <sampleID>_source.jpg, <sampleID>_edit.png. This dataset is suitable for tasks such as instruction-based image editing, multimodal learning, and image generation, particularly supporting concept scaling and densely supervised image editing research.

创建时间:
2026-08-17
原始信息汇总

数据集概述:ConceptEdit-12M

基本信息

  • 许可证:Apache-2.0
  • 语言:英语(en)、中文(zh)
  • 数据规模:10M < n < 100M
  • 任务类型:图像到图像(image-to-image)
  • 标签:图像编辑、基于指令的编辑、多模态、计算机视觉、图像生成、T2I、ITI

数据集简介

ConceptEdit-12M 是一个大规模图像编辑数据集。每个样本以三元组形式存储:

  1. 源图像(source image)
  2. 编辑后的图像(edited image)
  3. 一个JSON元数据文件,包含编辑指令、编辑类别、相对图像路径以及VQA风格的质量检查信息

数据集打包为多个.tar分片文件,所有文件内部路径均为相对路径,不包含任何本地绝对路径。

数据划分

数据集包含四个主要划分:

划分名称 tar分片数量
enhanced_prompt_square_resolution(增强提示词·方形分辨率) 154
enhanced_prompt_random_resolution(增强提示词·随机分辨率) 162
original_prompt_square_resolution(原始提示词·方形分辨率) 131
original_prompt_random_resolution(原始提示词·随机分辨率) 169

文件结构

每个tar分片包含一个批次目录,每个样本包含三个文件:

  • <sample_id>.json:元数据文件
  • <sample_id>_source.jpg:源图像
  • <sample_id>_edit.png:编辑后图像

JSON格式说明

每个样本的JSON文件包含以下顶层字段:

  • id:样本ID,用于派生图像和JSON文件名
  • images:源图像和编辑图像的相对路径
    • source:源图像路径
    • edited:编辑后图像路径
  • edit_concept:编辑的类别体系信息
    • category(类别)
    • sub_category(子类别)
    • task(任务)
    • detail(详情)
  • instruction:自然语言编辑指令
    • short_en(英文短指令)
    • short_zh(中文短指令)
    • detailed_en(英文详细指令)
    • detailed_zh(中文详细指令)
  • evaluation:VQA风格的质量控制元数据
    • overall_vqa_score(总体VQA评分)
    • keep(是否保留)
    • wrong_count(错误数量)
    • recaption_prompt_en(英文重写提示词)
    • recaption_prompt_zh(中文重写提示词)
    • vqa:VQA检查列表,每个包含:
      • dimension(维度)
      • question_en(英文问题)
      • question_zh(中文问题)
      • expected_answer(预期答案)
      • passed(是否通过)
  • original_simple_caption:源图像的简短英文描述

来源说明

数据集中的源图像基于Fine-T2I数据集中的图像。

引用信息

如需引用该数据集,可引用论文《Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision》(arXiv:2608.16812,2026年)。

相关资源

搜集汇总
数据集介绍
ConceptEdit-12M 数据集图片
构建方式
ConceptEdit-12M是一个大规模图像编辑数据集,其构建基于Fine-T2I数据集中的源图像,通过概念缩放和密集监督策略生成编辑图像。每个样本由源图像、编辑图像和JSON元数据文件组成,其中JSON文件详细记录了编辑指令、编辑类别、图像相对路径以及基于VQA的质量检查信息。数据集被划分为四个主要子集,每个子集包含不同数量的tar分片,分别对应增强提示与原始提示、正方形与随机分辨率等组合,以确保数据的多样性和覆盖度。
使用方法
使用ConceptEdit-12M时,用户需先下载对应的tar分片,通过tar命令解压至目标目录,得到以样本ID命名的三文件组(JSON、源图像、编辑图像)。随后,可根据任务需求选择不同的子集,例如使用增强提示子集进行模型微调,或使用原始提示子集进行基准测试。JSON文件中的指令字段可用于训练模型理解自然语言编辑请求,评估字段可用于数据清洗或模型性能验证。建议结合多线程或并行工具加速解压过程,以适应大规模数据的处理需求。
背景与挑战
背景概述
ConceptEdit-12M数据集由Cui Long等研究人员于2026年创建,旨在应对指令驱动图像编辑领域中的核心挑战。该数据集基于Fine-T2I图像源,构建了超过1200万样本的大规模三元组结构,每项包含源图像、编辑后图像及详细的元数据描述,涵盖编辑指令、分类体系和质量评估信息。其设计核心在于通过概念缩放和密集监督机制,推动图像编辑模型对复杂指令的理解与执行能力。该数据集的出现为文本到图像编辑提供了丰富的训练资源,促进了多模态学习与条件生成技术的发展,对推动视觉生成领域的前沿研究具有重要影响。
当前挑战
图像编辑领域面临的首要挑战在于如何确保编辑操作精准对应指令语义,同时保持图像内容的自然连贯性和高保真度。ConceptEdit-12M的构建过程需解决大规模数据生成中的一致性问题,包括编辑类别的系统化划分、跨语言指令的准确对应以及质量控制的自动化。通过引入VQA式质量检测和多维度评估机制,数据集有效缓解了原始图像与编辑结果间的语义偏差,并提升了不同分辨率条件下的适应性。这些技术路径为复杂编辑任务的可靠评估与模型泛化搭建了坚实基础。
常用场景
经典使用场景
ConceptEdit-12M数据集作为大规模图像编辑领域的基石性资源,其核心应用场景在于为指令驱动的图像编辑模型提供海量且高质量的训练样本。基于源图像、编辑图像及编辑指令的三元组结构,该数据集能够支撑模型学习从自然语言指令到视觉语义变化的精准映射,尤其适用于文本到图像(T2I)及指令到图像(ITI)等生成式任务的模型微调与优化。其丰富的数据划分方式,如增强提示词与原始提示词的对比,以及方形与随机分辨率的组合,为系统研究分辨率、提示词质量对编辑效果的影响提供了有力支撑。
解决学术问题
该数据集解决了图像编辑领域长期存在的训练数据匮乏与质量不可控等关键难题,为构建高泛化能力的编辑模型提供了坚实的数据基础。通过引入精细的编辑概念分类(类别、子类别、任务、细节)和基于VQA的自动化质量评估机制,该数据集显著提升了训练数据的标注精度与一致性,克服了传统数据集中编辑意图模糊、标注噪声大等瓶颈。其学术意义在于推动了图像编辑从特定场景向通用化、细粒度化方向发展,为后续研究提供了可复现、可扩展的基准平台,促进了编辑模型在语义保持与局部修改等维度上的可解释性进步。
实际应用
在实际应用中,ConceptEdit-12M数据集可广泛赋能于创意设计、影视制作与社交媒体内容生产等领域的自动化图像编辑工具。基于其训练出的模型,用户能够通过简洁的自然语言指令快速实现物体替换、风格迁移、背景重绘等高级编辑操作,大幅降低专业设计门槛。此外,该数据集亦可支撑智能相册的个性化编辑功能,依据用户语义描述自动优化照片内容,提升用户体验。其多样化的分辨率设置与双语指令支持,使得该数据集在面向全球用户的多语言、多设备适配场景中具有显著的应用价值,有望推动图像编辑技术在产品端的规模化落地。
数据集最近研究
最新研究方向
ConceptEdit-12M作为大规模图像编辑数据集,正引领着指令导向的图像编辑领域迈向新纪元。其独特的“概念缩放与密集监督”范式,不仅显著提升了编辑的精准度与语义一致性,更通过涵盖多语言指令、细粒度分类及VQA质量验证的多维架构,为多模态生成模型提供了前所未有的训练资源。该数据集紧密契合当前文生图模型向可控性、交互性演进的学术热点,其贡献在于构建起从概念理解到像素级操作的桥梁,为迈向更智能、更符合人类审美与意图的图像编辑系统奠定了坚实的数据基石,对推动计算机视觉与自然语言处理的交叉融合具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务