GEditBench v2
收藏资源简介:
GEditBench v2是一个全面的基准测试,包含1,200个真实用户查询,涵盖23个任务,并包括一个专门的开放集类别,用于超出预定义任务的无约束、分布外编辑指令。此外,还提出了PVC-Judge,一个开源的视觉一致性成对评估模型,并通过两个新颖的区域解耦偏好数据合成管道进行训练。此外,还构建了VCReward-Bench,包含3,506个专家标注的偏好对,用于评估视觉一致性维度的图像编辑评估模型。
GEditBench v2 is a comprehensive benchmark that encompasses 1,200 real-world user queries covering 23 tasks, alongside a dedicated open-set category designed for unconstrained, out-of-distribution editing instructions that fall outside predefined task scopes. Furthermore, PVC-Judge, an open-source pairwise evaluation model tailored for visual consistency, is proposed and trained using two novel regional decoupled preference data synthesis pipelines. Additionally, VCReward-Bench is constructed, a resource that includes 3,506 expert-annotated preference pairs for evaluating image editing assessment models on the visual consistency dimension.
GEditBench v2 数据集概述
数据集基本信息
- 数据集名称:GEditBench v2
- 核心定位:一个人类对齐的通用图像编辑基准
- 论文链接:https://arxiv.org/abs/2603.28547
- 项目主页:https://zhangqijiang07.github.io/gedit2_web/
- HuggingFace 数据集地址:https://huggingface.co/datasets/GEditBench-v2/GEditBench-v2
- HuggingFace 评估基准地址:https://huggingface.co/datasets/GEditBench-v2/VCReward-Bench
- HuggingFace 评估模型地址:https://huggingface.co/GEditBench-v2/PVC-Judge
数据集规模与构成
- 查询数量:1,200 个真实世界用户查询
- 任务类别:涵盖 23 种任务
- 特色类别:包含一个专用的开放集类别,用于处理预定义任务之外的、无约束的、分布外的编辑指令
核心贡献与组件
- GEditBench v2 基准:包含上述规模与构成的图像编辑指令基准。
- PVC-Judge 评估模型:一个用于视觉一致性评估的开源成对评估模型。该模型通过两种新颖的区域解耦偏好数据合成流程进行训练。
- VCReward-Bench 评估基准:一个用于在视觉一致性维度上评估图像编辑评估模型的基准,包含 3,506 个专家标注的偏好对。
仓库内容与工作流
该仓库提供了一个端到端的工作流,支持以下循环:
- 从多样化的源图像-指令对中进行采样或过滤。
- 使用图像编辑模型生成多个编辑后的候选图像。
- 使用特定于任务的流程自动标注视觉一致性。
- 将分组结果转换为成对偏好数据。
- 在这些偏好对上训练一个视觉语言模型评估器。
- 在 GEditBench v2 或奖励基准上评估训练出的评估器。
主要命令行工具
autogenCLI:用于数据过滤和候选图像生成。autopipelineCLI:用于标注、评估和成对数据构建。autotrainCLI:用于视觉语言模型的 LoRA 微调训练启动。
数据来源
开放集类别中的大部分编辑指令来源于以下开源项目:




