遇见数据集

PaintBench

收藏
Hugging Face2026-05-25 更新2026-05-26 收录
官方服务:

资源简介:

PaintBench是一个精确的、确定性的视觉编辑基准数据集,旨在评估原生像素空间图像生成模型执行MS-Paint风格编辑的能力,包括几何变换、颜色变化、结构操作和符号推理编辑。数据集通过程序生成每个问题,确保答案具有像素级精确性,且答案分布已知。它包含两个配置:PaintBench(主基准)和TinyGrafixBench(图表编辑微基准)。PaintBench配置包含2,016个测试问题和280个开发问题,涵盖4个任务类别(几何变换、结构操作、颜色变化、符号推理)下的20个任务,每个任务在8种视觉条件下生成。TinyGrafixBench配置包含600个测试问题,专注于5种图表类型的编辑任务。每个数据样本包含类别、任务、模式、视觉条件、问题ID、自然语言指令、输入图像、答案图像和元数据等字段。数据集适用于图像到图像、图像文本到图像等任务,特别用于评估扩散模型在像素空间生成和视觉编辑方面的性能。

PaintBench is a precise, deterministic visual editing benchmark dataset developed to evaluate the capability of native pixel-space image generation models to perform MS-Paint-style editing tasks, including geometric transformations, color adjustments, structural manipulations, and symbolic reasoning-based edits. Each problem in the dataset is procedurally generated, ensuring pixel-perfect accuracy of the reference answers and a known answer distribution. The dataset comprises two configurations: the main benchmark PaintBench, and TinyGrafixBench, a micro-benchmark for graphic editing. The PaintBench configuration contains 2,016 test questions and 280 development questions, covering 20 tasks across four task categories—geometric transformations, structural manipulations, color variations, and symbolic reasoning—with each task generated under 8 distinct visual conditions. The TinyGrafixBench configuration includes 600 test questions, focusing on editing tasks for five common chart types. Each data sample includes fields such as category, task, modality, visual condition, question ID, natural language instruction, input image, answer image, and metadata. The dataset supports tasks including image-to-image translation and image-text-to-image generation, and is specifically designed to assess the performance of diffusion models in pixel-space generation and visual editing.

创建时间:
2026-05-15
原始信息汇总

数据集概述:PaintBench

PaintBench 是一个用于评估像素级图像生成模型执行“MS-Paint风格”视觉编辑能力的基准数据集。其核心特点是所有问题均由程序化生成,确保答案的像素级精确性和已知的答案分布。

主要配置与规模

数据集包含两个配置,共享相同的模式与评估流程:

配置名称 数据分片 问题数量 覆盖范围
PaintBench test, dev 2,016 + 280 主基准:20个任务 × 8种视觉条件 × 每个单元格12个问题
TinyGrafixBench test 600 图表编辑微基准:5种图表类型 × 4个子任务 × 30个问题
  • PaintBench 配置test 分片包含2,016个问题,dev 分片包含280个问题(用于快速迭代,是 test 分片的严格子集)。
  • TinyGrafixBench 配置:仅包含 test 分片,共600个问题。

数据集结构

两个配置共享以下数据模式:

列名 类型 描述
category string 顶层分组。在 PaintBench 中为4个任务类别之一;在 TinyGrafixBench 中为5种图表类型之一。
task string 标准任务名称(如 translation, bar_chart_add_bar)。
mode string 任务内的子任务/变体,若无则为 "default"
visual_condition string PaintBench 的8种扰动轴之一;TinyGrafixBench 中为空字符串。
problem_id int32 (category, task, mode) 单元格内的索引。
instruction string 自然语言编辑指令。
input_image image 待编辑的源图像。
answer_image image 像素级精确的预期输出图像。
metadata string 包含种子、场景形状/颜色、条件参数等每问题上下文的 JSON 数据。

PaintBench 任务类别

任务分为四大类,共20个评分任务:

类别 任务
geometric_transformation(几何变换) translation, rotation, reflection, scaling, shearing
structural_manipulation(结构操作) construction, removal, copying, border, cropping
color_change(颜色改变) recolor, flood_fill, blending, gradient, point_operations
symbolic_reasoning(符号推理) comparison, ordering, pattern, counting, legend

此外,还有一个 preservation 任务(96个问题),用作诊断,其预期输出即为输入图像,不计入汇总评分。

视觉条件

每个 PaintBench 问题在8种条件之一渲染,每种条件精确变化一个轴:

视觉条件 (visual_condition) 变化内容 细节
baseline 1024 × 1024 画布,默认调色板,默认密度
horizontal 画布宽高比 1024 × 576
vertical 画布宽高比 576 × 1024
nonstandard 调色板 非标准颜色调色板
striped 背景 条纹(而非纯色)背景
n_med 场景密度 中等密度场景
n_high 场景密度 高密度场景
n_xhigh 场景密度 极高密度场景

每个 (visual_condition, task, mode) 单元格包含的问题数量为 12 / num_modes。所有20个评分任务共产生1,920个问题(每个视觉条件240个)。dev 分片从每个单元格中选择 slot=0 的问题,构成280个问题的分层子样本。

TinyGrafixBench 子任务

图表类型 子任务
bar_chart add_bar, sort_bars, remove_bar, recolor_bar
heatmap add_cell, shift_heatmap, mask_cells, change_colormap
line_chart draw_segments, normalize_series, filter_series, shade_interval
network add_node, swap_nodes, remove_node, recolor_node
scatter_plot draw_best_fit_line, swap_axes, remove_outlier, recolor_class

评估方法

每个问题的评分基于像素比较:计算模型输出图像与预期 answer_image 之间每个像素的 CIE76 ΔE 值,在多个 ΔE 阈值(0, 1, ..., 10)下计算 IoU 以及编辑/保留准确率。汇总评分采用宏平均,在任务/类别/视觉条件/基准级别进行计算,并使用任务自助法(task-bootstrap)获取95%置信区间。

许可证

该数据集采用 Creative Commons Attribution 4.0 (CC BY 4.0) 许可证发布。所有问题和图像均为程序化生成,不包含第三方内容。

搜集汇总
数据集介绍
PaintBench 数据集图片
构建方式
PaintBench是一个专注于评估像素空间图像生成模型编辑能力的基准数据集。其构建方式基于程序化生成,每个问题均由输入图像、自然语言指令和精确答案图像的三元组构成。数据集包含两个配置:主基准PaintBench涵盖20种任务×8种视觉条件,每个单元格生成12个问题,总计2016个测试样本和280个开发样本;微基准TinyGrafixBench则针对5种图表类型各设计4个子任务,每个子任务30个问题,共计600个测试样本。所有图像通过确定性渲染生成,确保答案具有像素级精确性,且答案分布已知,无需人工标注。
使用方法
用户可通过Hugging Face的datasets库便捷加载数据,支持按配置、分割或条件筛选。例如,使用load_dataset加载PaintBench测试集或开发集,通过filter方法按视觉条件或任务类型选取子集。评估采用像素级对比指标,基于CIE76 ΔE色差计算多阈值下的IoU及编辑/保留准确率,并以任务引导的Bootstrap方法计算95%置信区间进行宏平均聚合。开发集从每个单元格选取第一个样本(slot=0),作为快速迭代的严格子集,其样本可通过(task, mode, visual_condition, problem_id)四元组唯一标识,便于结果复现。
背景与挑战
背景概述
在图像生成领域,随着扩散模型等技术的快速演进,如何精确评估模型执行细粒度、像素级视觉编辑的能力成为亟待解决的核心问题。PaintBench数据集应运而生,由研究团队于近期创建,旨在为原生像素空间图像生成模型提供一个确定性、可重复的视觉编辑评测基准。该数据集的核心研究问题聚焦于模型能否像MS-Paint软件那样完成几何变换、颜色调整、结构操作及符号推理等编辑任务,并实现像素级别的正确性。通过程序化生成的2016个测试样本和280个开发样本,PaintBench为图像编辑领域的研究者提供了首个具备已知答案分布的高精度评估工具,有望推动扩散模型评估范式的标准化发展。
当前挑战
PaintBench所解决的领域问题核心在于,现有图像编辑模型评估多依赖主观视觉判断或模糊的语义相似度指标,缺乏对编辑指令是否被精确执行的客观量化手段。该数据集通过构建一系列需要像素级精确度的编辑任务,如将圆形平移特定距离或将矩形重新着色为精确的RGB值,挑战模型在细粒度操作上的能力极限。在构建过程中,研究团队面临两大关键挑战:一是如何将人类直观的编辑概念(如“旋转30度”)转化为程序化、可复现的生成逻辑,以确保每个问题的答案图像在像素层面具有确定性;二是如何设计覆盖8种视觉条件和20类编辑任务的系统化测试矩阵,既要保证评测的全面性,又要控制数据规模以维持计算可行性,最终通过巧妙的组合设计实现了这一平衡。
常用场景
经典使用场景
PaintBench是一个专为评估原生像素空间图像生成模型而设计的精准、确定性视觉编辑基准数据集。其经典使用场景聚焦于衡量模型能否像使用MS Paint软件那样执行像素级精确的编辑操作,涵盖了几何变换、色彩调整、结构操纵以及符号推理等四大类共20项具体任务。每一测试样例均由程序化生成的(输入图像、指令、答案图像)三元组构成,确保答案的像素级唯一性与已知的分布特征,借助CIE76色差阈值与IoU指标实施严格的量化评估。该基准不仅支持整体性能的宏观平均统计,还能按视觉条件、任务类别等维度进行细分分析,从而全面揭示模型在不同编辑挑战下的能力边界。
解决学术问题
该数据集核心解决了视觉编辑领域长久以来缺乏高质量、可重复的定量评估标准这一关键学术难题。此前的研究多依赖于人工主观评价或有限的简单编辑测试,难以客观衡量生成模型在复杂、精细编辑任务上的真实性能。PaintBench通过程序化生成像素级精确的答案,为研究社区提供了一个无歧义、可自动计算的评估框架,有效规避了传统评估中的模糊性与人为偏差。这一创新使得研究者能够精准诊断模型在几何变换、结构操控等不同编辑子任务上的优势与短板,推动了生成模型从粗糙的图像合成向精细化、指令可控的像素级编辑方向演进,对理解扩散模型的内在编辑机理具有深远意义。
实际应用
在实际应用中,PaintBench所评估的能力直接映射到众多高需求的图像编辑场景。它模拟了用户在日常办公、设计创作中需要执行的基础操作,例如在图表编辑中调整柱状图颜色、对散点图进行异常值剔除、或是在网络图中重排节点布局。这些看似简单的操作背后,要求模型具备对图像语义结构的深刻理解与精确的像素操控能力,其评估结果可直接指导智能图像编辑软件的开发与优化。此外,该基准的图表微基准(TinyGrafixBench)专门针对数据可视化领域的编辑需求,为自动生成及编辑信息图表提供了标准化的测试床,有望降低数据展示中的人工干预成本,提升信息传达的效率与准确性。
数据集最近研究
最新研究方向
PaintBench数据集的问世,为视觉编辑领域带来了一场精准化评估的革新。当前前沿研究方向聚焦于利用该基准测试原生像素空间图像生成模型执行类“画图”式精细编辑的能力,涵盖几何变换、色彩调控、结构重塑与符号推理等核心任务。该数据集通过程序化生成像素级精确的(输入图像,指令,答案)三元组,从根本上规避了传统评估中主观歧义与噪声干扰的痼疾。其构建的20项任务×8种视觉扰动条件的正交矩阵,系统性地刻画了模型在复杂视觉场景中的鲁棒性边界,为扩散模型等生成式架构提供了兼具深度与广度的诊断工具。这一基准的提出,不仅是技术评估方法论的里程碑,更深远地推动了自动化内容创作与交互式图像编辑的可信度与可复现性,在数字艺术、辅助设计乃至科学可视化等热点领域蕴藏着变革性的应用潜力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务