RISEBench
收藏资源简介:
RISEBench是第一个用于评估推理感知视觉编辑(RISE)的基准测试数据集,专注于四种关键推理类型:时间、因果、空间和逻辑推理。该数据集旨在提供对推理感知视觉编辑的基础性见解,并促进未来研究。
RISEBench is the first benchmark dataset for evaluating reasoning-aware visual editing (RISE), which focuses on four core types of reasoning: temporal, causal, spatial, and logical reasoning. It aims to provide fundamental insights into reasoning-aware visual editing and facilitate future research.
RISEBench 数据集概述
📌 基本信息
- 数据集名称: RISEBench (Reasoning-Informed Visual Editing Benchmark)
- 发布日期: 2025年4月
- 论文链接: arXiv:2504.02826
- 数据类型: 图像与JSON格式的指令数据
- 数据存储位置:
data/data_total.json和data目录下的输入图像
🎯 研究目标
- 首个专注于**推理感知视觉编辑(RISE)**的基准测试
- 评估四大核心推理类型:
- 时间推理 (Temporal Reasoning)
- 因果推理 (Causal Reasoning)
- 空间推理 (Spatial Reasoning)
- 逻辑推理 (Logical Reasoning)
📊 评估维度
- 指令推理 (Instruction Reasoning)
- 外观一致性 (Appearance Consistency)
- 视觉合理性 (Visual Plausibility)
🧩 数据集结构
-
输入数据:
- 图像文件:按类别存储在
data目录 - JSON文件:
data_total.json包含指令和对应图像路径
- 图像文件:按类别存储在
-
输出要求:
outputs/{MODEL_NAME}/images/{CATEGORY}/{INDEX_NAME}.{FORMAT}
支持格式:
.png,.jpg,.jpeg
⚙️ 评估方法
- 自动化评估流程:
- 使用GPT-4o作为评判模型
- 通过
gpt_eval.py脚本执行评估
- 输出结果文件:
{MODEL_NAME}_judge.csv(总分){MODEL_NAME}_judge.xlsx(详细评分){MODEL_NAME}.pkl(原始响应数据)
📜 引用格式
bibtex @article{zhao2025envisioning, title={Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing}, author={Zhao, Xiangyu and Zhang, Peiyuan and Tang, Kexian and Li, Hao and Zhang, Zicheng and Zhai, Guangtao and Yan, Junchi and Yang, Hua and Yang, Xue and Duan, Haodong}, journal={arXiv preprint arXiv:2504.02826}, year={2025} }




