RIG-BENCH
收藏资源简介:
RIG-BENCH是一个系统评估推理驱动图像生成(RIG)的综合基准,由伊利诺伊大学厄巴纳-香槟分校和纽约大学的研究人员构建。该数据集包含2000个精心策划的样本,覆盖概念推理、变换推理、模式与结构推理以及场景推理四个认知要求高的任务族,旨在评估模型从视觉上下文中推断潜在规则并生成精确视觉输出的能力。数据集的创建过程涉及跨领域重构、推理中立提示和人工筛选,确保样本具有挑战性且能揭示推理-生成差距。RIG-BENCH主要用于诊断当前统一生成模型和视频生成模型在逻辑约束下的视觉推理缺陷,为发展逻辑上合理的下一代生成模型提供诊断框架。
RIG-BENCH is a comprehensive benchmark for systematically evaluating reasoning-driven image generation (RIG), developed by researchers from the University of Illinois Urbana-Champaign and New York University. It comprises 2000 carefully curated samples spanning four cognitively demanding task families: conceptual reasoning, transformation reasoning, pattern and structure reasoning, and scenario reasoning, aiming to evaluate models' ability to infer latent rules from visual contexts and generate precise visual outputs. The construction of this benchmark involves cross-domain reconstruction, reasoning-neutral prompting, and manual filtering, ensuring that the samples are challenging and capable of uncovering the reasoning-generation gap. RIG-BENCH is primarily used to diagnose visual reasoning deficits in current unified generative models and video generation models under logical constraints, providing a diagnostic framework for advancing next-generation logically sound generative models.
RIG-Bench 数据集详情
数据集简介
RIG-Bench 是一个用于推理驱动图像生成(Reasoning-driven Image Generation)的基准测试集。每个样本为模型提供视觉上下文、自然语言指令以及可选的演示对;模型需推断出潜在的规则、关系、概念或过程,并生成一张独立图像作为答案。
基本信息
- 数据集规模:2,000 个测试样本
- 语言:英文指令
- 任务类别:图像到图像(image-to-image)
- 许可证:CC BY-NC 4.0
- 标签:基准测试、视觉推理、推理驱动图像生成、多模态生成
- 文件格式:统一 JSONL 格式,每个样本配独立图像文件夹
任务结构
数据集不向模型暴露原始任务中的多项选择选项,模型需从视觉上下文中推断答案并生成单张独立图像。每个样本包含:
| 字段 | 说明 |
|---|---|
input.images |
有序的视觉上下文图像 |
input.text |
任务指令 |
input.examples |
可选的输入-输出演示对 |
output.target_image |
标准答案图像 |
main_family |
高层任务族 |
subtask |
细粒度推理子任务 |
任务族与子任务分布
| 任务族 | 子任务 | 样本数 |
|---|---|---|
| 概念型 | 交互概念 | 216 |
| 概念型 | 抽象概念 | 152 |
| 变换型 | 几何类比 | 240 |
| 变换型 | 属性类比 | 240 |
| 变换型 | 规则迁移 | 109 |
| 模式-结构型 | 矩阵推理 | 326 |
| 模式-结构型 | 视觉空间推理 | 131 |
| 场景型 | 科学过程 | 96 |
| 场景型 | 场景时序推理 | 180 |
| 场景型 | 跨域类比 | 180 |
| 场景型 | 风格偏好 | 130 |
| 合计 | 2,000 |
答案空间约束
RIG-Bench 对答案空间的约束程度进行了区分:
- 开放式子任务:允许多种视觉上合理的推断结果(如概念、风格或场景延续);
- 封闭式子任务:要求生成由几何、结构、科学或类比关系决定的目标图像。
文件结构
RIG-Bench/
|-- README.md
|-- samples.jsonl
-- images/ -- <sample_id>/
|-- input_<order>.<ext>
|-- demo_<j>input<k>.<ext> # 含演示样本时存在
|-- demo_<j>output<k>.<ext> # 含演示样本时存在
`-- target.<ext>
使用场景
RIG-Bench 旨在用于多模态推理、图像生成与推理→生成失败诊断评估的研究。不适用于通用训练语料,也不作为安全关键、医疗、法律、金融、身份识别、监控或人口统计推断等场景的部署准备证据。
引用
若使用 RIG-Bench,请引用其论文 Thinking in Pictures: A Systematic Benchmark for Reasoning-driven Image Generation(2026)。

- 1Thinking in Pictures: A Systematic Benchmark for Reasoning-driven Image Generation伊利诺伊大学厄巴纳-香槟分校; 纽约大学 · 2026年



