GPT-Image-Edit-1M
收藏资源简介:
GPT-Image-Edit-1M 是一个百万规模的指令引导图像编辑数据集,包含 1,553,575 个三元组,其中 1,553,561 个通过了自动化质量控制流程的评分。每个样本经过两次独立评分(分别由 Claude Sonnet 4.6 和 Claude Opus 4.6 完成),并分配了策略决策(保留/重新标记/丢弃)。数据集包含元数据、质量控制记录、200 个用于人工评估的案例子集以及完整的图像数据。数据来源包括 OmniEdit、HQ-Edit、UltraEdit 和 C3 复杂性组合指令。数据集采用 CC BY-NC-SA 4.0 许可,适用于学术和非商业研究,如训练开源图像编辑器、研究指令-输出对齐等。已知限制包括评委家族耦合、生成器受限分布等。
GPT-Image-Edit-1M 数据集概述
基本概况
GPT-Image-Edit-1M 是一个百万规模、基于指令引导的图像编辑数据集,所有编辑输出均通过固定端点和固定质量设置的 GPT-Image-1 模型重新合成。数据集支持完全审计,提供了完整的质量控制记录。
| 关键指标 | 数值 |
|---|---|
| 上游清单池 | 1,553,575 三元组(输入图、指令、输出图) |
| QC评分池 | 1,553,561 三元组(14个因API失败而排除) |
| 最终保留(KEEP + RELABEL) | 约1,000,000 |
| 数据集许可证 | CC BY-NC-SA 4.0 |
数据来源构成
HQ-Edit(183,182 原始样本)
- 编辑任务:89,585 样本,使用 HQ-Edit 原始输入和指令,经 GPT-Image-1 重新编辑
- 生成任务:93,597 样本,输入由 GPT-Image-1 从 HQ-Edit 描述合成,指令保持原始
OmniEdit(1,270,385 原始样本)
涵盖添加(189,336)、属性修改(204,065)、环境(137,440)、移除(149,763)、风格(14,405)、交换/背景交换/对象交换(261,983)、复杂编辑 C3(313,393)等任务类别
UltraEdit(100,008 原始样本)
均匀分布在添加、颜色修改、全局修改、局部修改、替换、全局变换、局部变换、转向等8个类别,每类11,112样本
质量控制与审计机制
评分标准
- IF(指令忠实度):评分范围 [0,10]
- NC(自然度/非目标一致性):评分范围 [0,10]
- VQ(视觉质量):评分范围 [0,10]
- 总体评分:IF/NC/VQ 的几何平均值
双重独立评审
- 第一轮:Claude Sonnet 4.6 独立评分
- 第二轮:Claude Opus 4.6 独立评分,并包含裁决逻辑
- 两轮评分完整公开,供第三方审计评审一致性
策略标签
每条样本被分配为 KEEP(保留)、RELABEL(重新标注指令)或 DROP(丢弃),并提供每样本原因标签、新旧指令追踪和结构化失败标志
元数据格式
元数据采用 LLaVA 风格的对话格式,可直接用于 SFT 加载器。metadata/ 目录已过滤为保留(KEEP + RELABEL)样本集,RELABEL 样本的指令文本已替换为 QC 流水线生成的新指令。
json { "image": ["input/<id>.png", "output/<id>.png"], "conversations": [ {"from": "human", "value": "<image> <instruction text>"}, {"from": "gpt", "value": "<gen_image>"} ] }
仓库结构
- metadata/:QC过滤后的训练清单(KEEP + RELABEL),包含6个JSON文件
- qc/:完整池审计QC记录(1,553,561行),含字段模式说明和校验和
- human_eval_200/:200个人工评估候选用例,跨评分区间分层采样
- images/:完整图像数据,按来源分为HQ-Edit(约654GB)、OmniEdit(约3.5TB)、UltraEdit(约73GB)压缩包
人工评估候选子集
200个用例按总体评分分层采样:
| 评分区间 | 样本数 | 用途 |
|---|---|---|
| [0, 3) | 40 | 极低质量锚点 |
| [3, 5) | 40 | 低质量 |
| [5, 7) | 40 | 中间(策略边界) |
| [7, 9) | 40 | 高质量 |
| [9, 10] | 40 | 极高质量锚点 |
每条记录包含完整QC评分和空白的 human_* 字段(供后续人工标注填充)
预期用途
- 学术和非商业研究中训练开源图像编辑器
- 通过发布的QC记录研究指令-输出对齐和大规模失败模式
- 使用两位独立Claude评审的每样本决策基准测试自动化数据集策展策略
- 通过
human_eval_200候选子集审计Claude评审与人工评审的一致性
已知限制
- 评审家族耦合:两位QC评审均为Claude家族模型,共享模型族先验可能导致相关错误
- 生成器分布受限:所有编辑输出均为GPT-Image-1重新合成,超出其原生能力的编辑可能系统性缺失
- 缺乏人口统计学群体审计:继承原始语料库的人口统计学分布,未进行显式去偏
上游许可证
- OmniEdit:MIT
- HQ-Edit:CC BY-NC 4.0
- UltraEdit:CC BY 4.0
- Complex-Edit:CC BY-NC-SA 4.0
- 编辑输出生成器:OpenAI GPT-Image-1(使用OpenAI API服务条款)




