INTENT-Edit-Bench
收藏资源简介:
INTENT-Edit-Bench是一个用于指令跟随图像编辑的多模态基准数据集,特别强调对象级编辑规划。该数据集包含1,024个训练样本,每个样本由以下核心字段构成:一张输入图像(primary_image)、一条自然语言编辑指令(instruction)以及一个结构化的编辑计划(prepare_edit_plan),该计划以JSON字符串形式描述了编辑中涉及的必要/可选对象及其约束。此外,数据还包含与计划对齐的对象名称列表(prepare_object_list)、唯一示例标识符(full_id)、领域标签(domain)和高级分组范式(paradigm)。数据集涵盖八个具体领域:常识推理(CommonSense)、数据分析(DataAnalysis)、规则约束(RuleConstraints)、文化符号(CulturalSymbols)、对象动态(ObjectDynamics)、社会规范(SocialNorms)、时间演化(TemporalEvolution)和科学原理(ScientificPrinciples),这些领域进一步归属于两个高级范式:形式推理(Formal_Reasoning)和现实世界知识(Real-world_Knowledge)。数据以Parquet格式存储,其中primary_image字段以Hugging Face兼容的图像对象格式(包含JPG字节和相对路径元数据)编码。数据集旨在用于评估在对象级约束下的指令跟随图像编辑和规划能力,支持的任务包括:给定输入图像和指令,生成满足意图和约束的编辑后图像;以及给定相同输入,生成类似prepare_edit_plan的结构化编辑计划。数据集仅提供训练集,并附带了将Parquet文件还原为CSV文件和JPG图像目录树的实用脚本。
INTENT-Edit-Bench is a multimodal benchmark dataset for instruction-following image editing, with a particular emphasis on object-level editing planning. The dataset contains 1,024 training samples, each consisting of the following core fields: an input image (primary_image), a natural language editing instruction (instruction), and a structured editing plan (prepare_edit_plan) that describes the necessary/optional objects and their constraints in editing as a JSON string. Additionally, the data includes an object name list aligned with the plan (prepare_object_list), a unique sample identifier (full_id), domain labels (domain), and high-level grouping paradigms (paradigm). The dataset covers eight specific domains: CommonSense, DataAnalysis, RuleConstraints, CulturalSymbols, ObjectDynamics, SocialNorms, TemporalEvolution, and ScientificPrinciples, which are further categorized into two high-level paradigms: Formal_Reasoning and Real-world_Knowledge. The data is stored in Parquet format, with the primary_image field encoded in a Hugging Face-compatible image object format (including JPG bytes and relative path metadata). The dataset is designed to evaluate instruction-following image editing and planning capabilities under object-level constraints, supporting tasks such as: given an input image and instruction, generating an edited image that satisfies the intent and constraints; and given the same input, generating a structured editing plan similar to prepare_edit_plan. The dataset only provides a training set and includes utility scripts for restoring Parquet files into CSV files and a JPG image directory tree.
INTENT-Edit-Bench 数据集概述
基本信息
- 数据集名称: INTENT-Edit-Bench
- 语言: 英文
- 许可证: CC BY 4.0
- 版本: 1.0
- 数据集大小: 1,024 个样本(仅训练集)
- 任务类型: 图像到图像 (image-to-image)
- Hugging Face 数据集地址: https://huggingface.co/datasets/HF2026Repo/INTENT-Edit-Bench
数据集简介
INTENT-Edit-Bench 是一个多模态基准测试数据集,专注于指令遵循的图像编辑任务,并包含对象级别的编辑计划。每个样本包含一张输入图像、一条编辑指令以及一个结构化的编辑计划,描述了强制/可选对象及其约束。
数据文件与格式
- 主数据文件:
Data/train/INTENT_Edit.parquet(Parquet 格式,1,024 行) - 扩展脚本:
expand_parquet.py,可将 Parquet 文件还原为 CSV + JPG 目录结构
扩展后的目录结构
INTENT-Edit-Bench/ ├── INTENT-Edit-Bench.csv └── Primary_Image/ ├── Formal_Reasoning/ │ ├── CommonSense/.jpg │ ├── DataAnalysis/.jpg │ ├── RuleConstraints/.jpg │ └── ScientificPrinciples/.jpg └── Real-world_Knowledge/ ├── CulturalSymbols/.jpg ├── ObjectDynamics/.jpg ├── SocialNorms/.jpg └── TemporalEvolution/.jpg
数据字段说明
| 字段名称 | 类型 | 描述 |
|---|---|---|
full_id |
字符串 | 唯一样本标识(如 CommonSense_0) |
domain |
字符串 | 领域标签(如 CommonSense, CulturalSymbols) |
paradigm |
字符串 | 更高层级分组(如 Formal_Reasoning, Real-world_Knowledge) |
instruction |
字符串 | 自然语言的编辑指令 |
prepare_edit_plan |
字符串(JSON) | 对象级别的编辑计划,包含 object_id, object_name, status(COMPULSORY/OPTIONAL), intention |
prepare_object_list |
字符串(JSON) | 与计划对齐的对象名称列表 |
primary_image |
图像 | 包含 JPG 字节和相对路径元数据的图像对象 |
数据类别分布
| 类别 | 样本数量 |
|---|---|
| SocialNorms | 125 |
| ObjectDynamics | 125 |
| TemporalEvolution | 113 |
| CulturalSymbols | 124 |
| CommonSense | 125 |
| DataAnalysis | 145 |
| RuleConstraints | 127 |
| ScientificPrinciples | 140 |
支持的任务
- 图像编辑 / 图像到图像生成: 给定输入图像和编辑指令,生成满足意图和约束的编辑后图像
- 编辑规划 / 结构化生成: 给定输入图像和指令,生成类似
prepare_edit_plan的编辑计划
快速开始
python from datasets import load_dataset
ds = load_dataset("HF2026Repo/INTENT-Edit-Bench", split="train") print(ds.features)




