遇见数据集

RIG-BENCH

收藏
arXiv2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

RIG-BENCH是一个系统评估推理驱动图像生成(RIG)的综合基准,由伊利诺伊大学厄巴纳-香槟分校和纽约大学的研究人员构建。该数据集包含2000个精心策划的样本,覆盖概念推理、变换推理、模式与结构推理以及场景推理四个认知要求高的任务族,旨在评估模型从视觉上下文中推断潜在规则并生成精确视觉输出的能力。数据集的创建过程涉及跨领域重构、推理中立提示和人工筛选,确保样本具有挑战性且能揭示推理-生成差距。RIG-BENCH主要用于诊断当前统一生成模型和视频生成模型在逻辑约束下的视觉推理缺陷,为发展逻辑上合理的下一代生成模型提供诊断框架。

RIG-BENCH is a comprehensive benchmark for systematically evaluating reasoning-driven image generation (RIG), developed by researchers from the University of Illinois Urbana-Champaign and New York University. It comprises 2000 carefully curated samples spanning four cognitively demanding task families: conceptual reasoning, transformation reasoning, pattern and structure reasoning, and scenario reasoning, aiming to evaluate models' ability to infer latent rules from visual contexts and generate precise visual outputs. The construction of this benchmark involves cross-domain reconstruction, reasoning-neutral prompting, and manual filtering, ensuring that the samples are challenging and capable of uncovering the reasoning-generation gap. RIG-BENCH is primarily used to diagnose visual reasoning deficits in current unified generative models and video generation models under logical constraints, providing a diagnostic framework for advancing next-generation logically sound generative models.

创建时间:
2026-09-03
原始信息汇总

RIG-Bench 数据集详情

数据集简介

RIG-Bench 是一个用于推理驱动图像生成(Reasoning-driven Image Generation)的基准测试集。每个样本为模型提供视觉上下文、自然语言指令以及可选的演示对;模型需推断出潜在的规则、关系、概念或过程,并生成一张独立图像作为答案。

基本信息

  • 数据集规模:2,000 个测试样本
  • 语言:英文指令
  • 任务类别:图像到图像(image-to-image)
  • 许可证:CC BY-NC 4.0
  • 标签:基准测试、视觉推理、推理驱动图像生成、多模态生成
  • 文件格式:统一 JSONL 格式,每个样本配独立图像文件夹

任务结构

数据集不向模型暴露原始任务中的多项选择选项,模型需从视觉上下文中推断答案并生成单张独立图像。每个样本包含:

字段 说明
input.images 有序的视觉上下文图像
input.text 任务指令
input.examples 可选的输入-输出演示对
output.target_image 标准答案图像
main_family 高层任务族
subtask 细粒度推理子任务

任务族与子任务分布

任务族 子任务 样本数
概念型 交互概念 216
概念型 抽象概念 152
变换型 几何类比 240
变换型 属性类比 240
变换型 规则迁移 109
模式-结构型 矩阵推理 326
模式-结构型 视觉空间推理 131
场景型 科学过程 96
场景型 场景时序推理 180
场景型 跨域类比 180
场景型 风格偏好 130
合计 2,000

答案空间约束

RIG-Bench 对答案空间的约束程度进行了区分:

  • 开放式子任务:允许多种视觉上合理的推断结果(如概念、风格或场景延续);
  • 封闭式子任务:要求生成由几何、结构、科学或类比关系决定的目标图像。

文件结构

RIG-Bench/ |-- README.md |-- samples.jsonl -- images/ -- <sample_id>/ |-- input_<order>.<ext> |-- demo_<j>input<k>.<ext> # 含演示样本时存在 |-- demo_<j>output<k>.<ext> # 含演示样本时存在 `-- target.<ext>

使用场景

RIG-Bench 旨在用于多模态推理、图像生成与推理→生成失败诊断评估的研究。不适用于通用训练语料,也不作为安全关键、医疗、法律、金融、身份识别、监控或人口统计推断等场景的部署准备证据。

引用

若使用 RIG-Bench,请引用其论文 Thinking in Pictures: A Systematic Benchmark for Reasoning-driven Image Generation(2026)。

搜集汇总
数据集介绍
RIG-BENCH 数据集图片
构建方式
RIG-BENCH的构建遵循严谨的三阶段蒸馏流程。首先,从Bongard-HOI、KiVA、ARC-AGI等成熟的视觉推理数据源中提炼核心推理逻辑,将其重新构思为生成任务,使模型需通过精确的视觉输出显化潜在规则。其次,通过人工撰写推理中立型指令,仅定义输出约束而不泄露任何语义线索或逻辑捷径,确保评估聚焦于纯推理能力。最后,采用启发式与人工双重过滤,剔除低复杂度或仅需感知的样本,确保每个条目满足“人类可解但模型具挑战”的标准。整个流程保证了基准的高逻辑严谨性与诊断有效性。
使用方法
使用RIG-BENCH时,研究者需在统一协议下查询模型:向模型提供上下文图像与自然语言指令(仅指明输出约束),要求直接生成答案图像,并隐藏源选项以避免选择捷径。评估采用多维度框架,包括基于参考图像的感知指标(如DINO、CLIP、LPIPS)以及人工设计的0-5分制规则,涵盖视觉质量、结构对齐和推理正确性三个维度,其中推理正确性权重最高。LLM-as-a-judge的评分方法已通过与人类标注的相关性验证,确保可靠。此基准可作为诊断工具,帮助研究人员定位模型在感知、规则归纳或生成阶段的薄弱环节,从而指导下一代逻辑一致性生成模型的发展。
背景与挑战
背景概述
RIG-BENCH数据集由伊利诺伊大学厄巴纳-香槟分校与纽约大学的研究人员于2026年推出,旨在系统评估生成模型的'推理驱动图像生成'能力。该基准包含2000个精心策划的样本,覆盖概念、变换、模式与结构、场景四大任务族及11个细粒度子任务。其核心研究问题在于:统一生成模型能否超越表面级的视觉合成,在生成图像时真正遵循潜在的逻辑规则。RIG-BENCH首次将输出空间从文字选择或分类标签转化为完整的图像合成,要求模型从视觉上下文中归纳规则并生成符合逻辑的答案,对相关领域产生了深远影响,被广泛视为下一代逻辑一致的世界模型与统一生成模型的关键诊断工具。
当前挑战
RIG-BENCH面临的挑战主要源自两个层面。首先,领域内现存的评估体系割裂了推理与生成:文本到图像基准仅衡量美学质量,而视觉推理基准则依赖多项选择或文本输出,无法检验模型是否真正将推理结果可视化。RIG-BENCH要求模型同时具备精细感知、抽象规则归纳与视觉合成能力,这对当前依赖表面特征对齐的模型构成严峻考验。其次,数据构建过程中需保持高逻辑复杂度与人工标注精度,同时通过推理中立提示与严格的过滤机制确保样本既能被人类解决又对模型构成挑战。特别是,封闭式任务需输出唯一正确图像,任何局部的视觉合理性都不能掩盖全局的逻辑不一致,这要求构建过程在规则确立与视觉实现间达到精妙平衡。
常用场景
经典使用场景
RIG-BENCH作为首个系统评估推理驱动图像生成(RIG)能力的基准,其经典使用场景在于对统一生成模型(UGMs)与世界模拟器进行严格的压力测试。该基准涵盖概念推理、变换推理、模式与结构推理及场景推理四大认知域,包含2000个精心挑选的样本,要求模型从视觉上下文中推断潜在规则并生成符合逻辑的答案图像。研究者利用RIG-BENCH对各类前沿图像生成与视频生成模型进行统一评估,不仅测量生成图像的感知质量,更侧重考察其逻辑一致性,从而揭示模型在“推理-生成”闭环中的真实表现。该基准为模型在复杂视觉推理任务上的诊断提供了标准化模板,是推动生成模型从表面感知对齐走向深层认知智能的关键工具。
解决学术问题
RIG-BENCH解决了现有视觉基准中推理与生成割裂的学术问题。此前,视觉推理研究多采用文本或多项选择输出,无法验证模型是否真正具备将推理结果可视化的能力;而图像生成基准则集中于美感与文本对齐,忽视了逻辑约束。RIG-BENCH首创性地将视觉推理重定义为答案图像生成任务,要求模型同时具备感知、规则归纳与具象生成三种能力,填补了图像到推理再回到图像的闭环评估空白。通过揭示模型“局部合理但全局不合逻辑”的失败模式,该基准量化了推理-生成差距,为理解统一生成模型的认知边界提供了重要诊断框架,推动了视觉生成智能从指令跟随向规则归纳的范式转变,对发展逻辑严谨的下一代世界模型具有深远意义。
实际应用
在实际应用中,RIG-BENCH可作为评测工具与开发指南,助力构建更可靠的多模态生成系统。其评估框架可应用于教育领域,如自动生成符合科学原理的图解或解决空间推理题;在科学可视化中,确保生成的分子结构图或物理过程示意遵循领域规则;在设计领域,辅助风格一致的产品图像生成。此外,基准所揭示的推理-生成缺陷促使开发者优化模型架构,例如集成显式推理模块或改进渲染逻辑,从而提升生成内容在医学影像说明、工程图纸注释等高风险场景中的可信度。RIG-BENCH还提供了标准化的评级协议,支持人机协同评估,有助于在实际部署前筛选具备逻辑一致性的生成模型,减少误导性视觉信息的产生。
数据集最近研究
最新研究方向
RIG-BENCH围绕“推理驱动的图像生成”这一前沿命题,构建了首个将视觉感知、规则归纳与像素级合成统一于一体的系统性评测框架。其研究方向聚焦于揭示当前统一生成模型与世界模拟器在高级视觉推理上的根本性缺陷,即所谓的“推理-生成鸿沟”,并倡导从单纯的指令跟随转向深层的隐式规则诱导。该基准通过涵盖概念抽象、变换推理、模式结构与情境推演的四大家族任务,为评估模型在严格逻辑约束下的生成能力设立了新标尺。其出现标志着多模态生成领域正从追求“表面逼真”迈向考察“逻辑自洽”,对推动具备类人系统二思维的下一代具身智能体及世界模型的发展具有显著的导向意义。
相关研究论文
  • 1
    Thinking in Pictures: A Systematic Benchmark for Reasoning-driven Image Generation伊利诺伊大学厄巴纳-香槟分校; 纽约大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务