遇见数据集

ramanv-image-editing

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

ramanv-image-editing 是一个专为训练 FLUX.1-Kontext 或 InstructPix2Pix 风格模型而构建的大规模图像编辑数据集。该数据集包含总计 270 万个编辑对,数据来源于多个公开的图像编辑数据集,包括 anyedit、emu_edit 和 instructpix2pix。数据以分片tar文件的形式组织,每个数据项通常包含三部分文件:源图像({uid}_src.jpg)、编辑后图像({uid}_edit.jpg)以及可选的掩码图像({uid}_mask.png)。此外,每条记录附带有丰富的元数据,具体包括:编辑指令(instruction)、提示词(prompt)、编辑类型(edit_type)、编辑前后的图像描述(caption_before/after)、许可证信息(license)以及文件的SHA-256校验值(sha256)。数据集中整合了来自多个子集的数据,并遵循相应的开源许可证,例如 MagicBrush、InstructPix2Pix 等采用 CC-BY-4.0 许可,UltraEdit、AnyEdit 等采用 Apache-2.0 许可,其他部分则限定于研究用途或遵循特定许可协议。该数据集构建于 2026 年 7 月 28 日,主要应用于基于自然语言指令的图像内容编辑与生成任务。

ramanv-image-editing is a large-scale image editing dataset specifically constructed for training FLUX.1-Kontext or InstructPix2Pix style models. The dataset contains a total of 2.7 million editing pairs, sourced from multiple public image editing datasets, including anyedit, emu_edit, and instructpix2pix. The data is organized in sharded tar files, with each data item typically consisting of three parts: source image ({uid}_src.jpg), edited image ({uid}_edit.jpg), and an optional mask image ({uid}_mask.png). Additionally, each record includes rich metadata, specifically: editing instruction (instruction), prompt (prompt), edit type (edit_type), image descriptions before and after editing (caption_before/after), license information (license), and SHA-256 checksum values for files (sha256). The dataset integrates data from multiple subsets and follows corresponding open-source licenses, such as CC-BY-4.0 for MagicBrush and InstructPix2Pix, Apache-2.0 for UltraEdit and AnyEdit, with other parts restricted to research use or specific license agreements. The dataset was built on July 28, 2026, and is primarily used for natural language instruction-based image content editing and generation tasks.

创建时间:
2026-07-27
原始信息汇总

数据集概述

数据集名称:ramanv-image-editing

用途:用于训练图像编辑模型(如 FLUX.1-Kontext / InstructPix2Pix 风格模型)的图像编辑数据集。

数据集规模

  • 总编辑对数量:2,700,000 对
  • 数据来源:anyedit、emu_edit、instructpix2pix

数据格式

每个 shard tar 文件包含以下内容:

  • {uid}_src.jpg:原始图像
  • {uid}_edit.jpg:编辑后的图像
  • {uid}_mask.png:掩码图像(如可用)

每条记录的元数据包括:指令(instruction)、提示(prompt)、编辑类型(edit_type)、编辑前后说明(caption_before/after)、许可证(license)、SHA256 值。

许可证信息

各子数据集的许可证如下:

  • MagicBrush、InstructPix2Pix、Pico-Banana、HumanEdit:CC-BY-4.0
  • UltraEdit、AnyEdit、OmniEdit、ImgEdit:Apache-2.0
  • HQ-Edit、EMU-Edit:仅限研究使用
  • EditBench:CDLA-Permissive-2.0

构建日期

数据集于 2026-07-28 构建。

搜集汇总
数据集介绍
ramanv-image-editing 数据集图片
构建方式
该数据集专为训练FLUX.1-Kontext与InstructPix2Pix类图像编辑模型而构建,整合了来自AnyEdit、EmuEdit与InstructPix2Pix三大主流编辑数据源的庞大规模样本,总计包含270万对编辑图像对。每一条记录以tar分片形式存储,包含源图像、编辑后图像及可选的蒙版图像,并附有详细的元数据字段,涵盖编辑指令、提示词、编辑类型、编辑前后描述、许可证信息及SHA256哈希值,从而确保数据条目可追溯、可验证。
特点
数据集显著特征在于其结构的高标准化与多样性。所有样本均按统一schema组织,便于高效加载与批处理;内容覆盖MagicBrush、HQ-Edit、UltraEdit等至少九个来源的编辑任务,涵盖从局部替换到全局风格迁移的多种编辑类型。许可证体系明确区分了商业友好型(CC-BY-4.0、Apache-2.0)与研究型许可(如HQ-Edit的Research use),满足不同使用场景的合规需求。
使用方法
使用者可基于tar分片中的`src.jpg`(源图)、`edit.jpg`(编辑后图)及`mask.png`(掩码图)构建输入输出管道。在训练过程中,模型需将源图与编辑指令嵌入联合编码,并以编辑后图像作为目标输出;掩码图可用于引导局部编辑区域的注意力机制。建议优先筛选许可证与自身应用场景兼容的子集,并结合元数据中的`instruction`字段进行多任务微调,以提升模型对复杂编辑指令的泛化能力。
背景与挑战
背景概述
在图像生成与编辑领域,基于指令驱动的图像编辑模型(如InstructPix2Pix)正逐步成为研究热点,旨在通过自然语言描述实现精准的图像局部或全局修改。ramanv-image-editing数据集于2026年7月由研究团队构建,整合了AnyEdit、EMU-Edit、InstructPix2Pix等八个主流编辑数据集,形成包含270万对高质量编辑样本的大规模资源。该数据集的核心研究问题在于解决多源异构编辑指令的对齐与泛化问题,为训练像FLUX.1-Kontext这类条件扩散模型提供标准化训练语料。其影响力体现在为图像编辑领域提供了迄今规模最大、许可证兼容的基准数据集,推动了从单一来源到多任务统一建模的范式转变。
当前挑战
当前数据集面临的核心挑战在于解决领域共性问题与构建过程的双重困难。首先,图像编辑任务需应对编辑指令的语义歧义性——相同描述可能对应不同区域的修改(如“使其变亮”),以及编辑类型多样化带来的模型泛化瓶颈,例如从颜色调整到对象替换的跨度学习。其次,构建过程中面临数据来源许可证差异(从CC-BY-4.0到仅限研究使用)导致的合规性风险,以及270万对样本的结构化清洗难题——需统一来自不同源的图像分辨率、掩码格式与标注精度,还要平衡自然场景与合成样本的分布,避免模型偏向特定编辑模式。这些挑战共同限制了编辑模型在真实世界模糊指令下的鲁棒性。
常用场景
经典使用场景
在多模态生成与编辑领域,ramanv-image-editing数据集被广泛用于训练基于指令的图像编辑模型,如FLUX.1-Kontext和InstructPix2Pix架构的变体。该数据集汇聚了来自AnyEdit、EMU-Edit、InstructPix2Pix等多个来源的270万对编辑样本,每对样本包含原始图像、编辑后图像以及可选的掩码图像,并附有详细的编辑指令、编辑类型和语义描述。研究者利用这些丰富的配对数据,训练模型理解自然语言指令并精准执行局部或全局图像编辑任务,例如物体替换、风格迁移、背景修改等,从而推动文本引导图像编辑技术的边界拓展。
衍生相关工作
基于该数据集,研究者已经衍生出多项经典工作,包括FLUX.1-Kontext系列模型,它通过引入上下文感知机制提升了指令编辑的鲁棒性。此外,InstructPix2Pix的后续改进版本利用该数据集的多样编辑类型和掩码信息,实现了更精细的区域编辑控制。一些工作还探索了基于扩散模型的零样本编辑泛化能力,以及结合大语言模型进行多轮编辑对话生成。这些衍生工作不仅验证了ramanv-image-editing在学术研究中的核心地位,也持续推动着文本驱动图像编辑领域向着更高效、更智能的方向发展。
数据集最近研究
最新研究方向
在图像编辑领域,ramanv-image-editing数据集凭借其270万对高质编辑样本,为基于指令的图像编辑模型(如FLUX.1-Kontext与InstructPix2Pix)的规模化训练提供了核心燃料。当前前沿研究聚焦于通过文本驱动的精细编辑、掩码引导的区域操作以及多源素材的混合监督,推动编辑模型在一致性、语义保真度与用户意图理解上的突破。该数据集整合了MagicBrush、UltraEdit等生态的多样化许可证,反映了学术界与工业界对开放合作与版权合规的平衡追求,其构建策略正引领着从单一任务合成到大规模可控编辑范式跃迁的浪潮。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务