Edit-Compass and EditReward-Compass
收藏资源简介:
Edit-Compass与EditReward-Compass是由杭州电子科技大学、北京大学、Kling团队及中国科学院自动化研究所联合构建的统一评估套件,旨在系统评估图像编辑模型与奖励模型。Edit-Compass包含2,388个精细标注实例,涵盖六大渐进式挑战性任务类别,如通用编辑、动态操作、世界知识推理、算法视觉推理及多图像理解等,数据来源于人工构建的多样化视觉场景;EditReward-Compass则包含2,251个偏好对,模拟强化学习优化中的实际决策场景。该数据集通过结构化推理与评分准则支持细粒度多维评估,主要应用于前沿图像编辑系统的能力评测与奖励模型优化,致力于解决现有基准在任务难度、评估可靠性及与人类判断对齐方面的不足。
Edit-Compass and EditReward-Compass are a unified evaluation suite jointly constructed by Hangzhou Dianzi University, Peking University, the Kling Team, and the Institute of Automation of the Chinese Academy of Sciences, aiming to systematically evaluate image editing models and reward models. Edit-Compass includes 2,388 finely annotated instances, covering six progressive challenging task categories such as general editing, dynamic manipulation, world knowledge reasoning, algorithmic visual reasoning, multi-image understanding, etc. The data is sourced from diverse manually constructed visual scenarios. EditReward-Compass, by contrast, contains 2,251 preference pairs, simulating real-world decision-making scenarios in reinforcement learning optimization. This evaluation suite supports fine-grained multi-dimensional evaluation through structured reasoning and scoring criteria, and is mainly applied to the capability evaluation of cutting-edge image editing systems and the optimization of reward models, aiming to address the shortcomings of existing benchmarks in terms of task difficulty, evaluation reliability, and alignment with human judgment.
Edit-Compass & EditReward-Compass 数据集概述
数据集简介
Edit-Compass 和 EditReward-Compass 是一个统一的图像编辑与奖励模型基准测试集,旨在评估前沿图像编辑模型和奖励模型的性能。
数据集构成
| 基准测试 | 评估目标 | 样本数量 |
|---|---|---|
| Edit-Compass | 图像编辑模型评估 | 2,388 |
| EditReward-Compass | 奖励模型评估 | 2,251 |
任务分类
Edit-Compass
包含六大类逐步递进难度的任务:
- Part1 - 通用任务:包括添加(ADD)、移除(Remove)等基础编辑操作
- Part2 - 动态操作任务
- Part3 - 世界知识推理任务
- Part4 - 算法视觉推理任务
- Part5 - 多图像任务
- Part6 - 复杂任务
每项任务均经过精细的人工标注,并采用结构化推理和评分标准进行多维度的细粒度评估。
EditReward-Compass
包含2,251对偏好数据对,模拟基于强化学习的图像编辑优化过程中的真实奖励建模场景。
评估范围
- Edit-Compass:已评估29个前沿图像编辑模型(涵盖闭源和开源系统)
- EditReward-Compass:已评估21个奖励模型
主要发现
评估结果揭示了当前图像编辑模型在以下方面存在持续性弱点:
- 世界知识理解
- 视觉推理
- 多图像编辑
同时,原生多模态大语言模型可作为强大的奖励评估器。
数据获取
- Edit-Compass 数据集: https://huggingface.co/datasets/DogNeverSleep/Edit-Compass
- EditReward-Compass 数据集: https://huggingface.co/datasets/DogNeverSleep/EditReward-Compass
论文信息
论文标题:Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
- arXiv 论文链接: https://arxiv.org/abs/2605.13062




