遇见数据集

SciReC

收藏
Hugging Face2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

SciReC是一个用于诊断评估多模态多轮关系推理与自适应交互的学术对话基准数据集。该数据集旨在系统检验多模态大语言模型在多种关系推理任务上的性能,这些任务包括类比推理、结构推理和因果推理等,代表了高阶理解的不同方面。数据来源于开源教科书,构建了基于教科书插图的视觉理解、知识展示和记忆回忆等多轮对话问题,以模拟关系推理过程中涉及的多重表征。数据集包含五个独立的配置:visual配置包含13,791个基于插图的视觉问题,并附有已解析的图像;knowledge配置包含13,501个基于插图标题或文本的知识问题,并附有已解析的图像;relational配置包含662个跨插图的关系推理问题;memory配置包含1,318个源自关系推理示例的单插图记忆问题,不包含已解析图像;memory_validation配置包含1,318个与记忆问题配对的验证问题,共享相同的答案和已解析图像。所有配置均为英文,仅提供训练集分割,数据格式为多模态(文本对话与图像)。该数据集适用于多模态视觉问答、对话式关系推理、模型能力诊断等研究场景。

SciReC is an academic dialogue benchmark dataset for diagnostic evaluation of multimodal multi-turn relational reasoning and adaptive interaction. It aims to systematically examine the performance of multimodal large language models on various relational reasoning tasks, including analogical reasoning, structural reasoning, and causal reasoning, representing different aspects of high-order understanding. The data is sourced from open-source textbooks, constructing multi-turn dialogue questions based on textbook illustrations for visual comprehension, knowledge presentation, and memory recall to simulate multiple representations involved in relational reasoning. The dataset includes five independent configurations: the visual configuration contains 13,791 visual questions based on illustrations with parsed images; the knowledge configuration contains 13,501 knowledge questions based on illustration captions or text with parsed images; the relational configuration contains 662 cross-illustration relational reasoning questions; the memory configuration contains 1,318 single-illustration memory questions derived from relational reasoning examples without parsed images; and the memory_validation configuration contains 1,318 validation questions paired with memory questions, sharing the same answers and parsed images. All configurations are in English, with only a training set split provided, and the data format is multimodal (text dialogues and images). It is suitable for research scenarios such as multimodal visual question answering, conversational relational reasoning, and model capability diagnosis.

创建时间:
2026-06-13
原始信息汇总

SciReC 数据集概述

SciReC (Scientific Relational Reasoning with Conversational Context) 是一个面向多模态大语言模型(MLLM)的模型自适应多模态学术对话基准数据集,专门用于诊断评估模型在多轮交互中的关系推理能力。

基本信息

  • 语言: 英语
  • 许可证: CC BY-NC-SA 4.0
  • 策划人: Nilay Yilmaz(联系邮箱: nyilmaz3@asu.edu)
  • 任务类别: 视觉问答、问答
  • 标签: 多模态、教科书、关系推理、图表、对话、记忆、知识

数据集来源

  • 官方网站: https://scirecc.github.io/SciReC/
  • 代码仓库: https://github.com/nlylmz/SciReC
  • 论文: Diagnostic Evaluation of Multimodal Multi-Turn Relational Reasoning with Adaptive Interaction

数据集配置与规模

数据集包含五个子配置,每个配置仅提供 train 分割:

配置名称 样本数量 描述
visual 13,791 基于图表的视觉问题,附带已解析的图像
knowledge 13,501 基于字幕/文本的知识问题,附带已解析的图像
relational 662 跨图表的关系推理问题
memory 1,318 基于关系推理示例的单图表记忆问题,不含已解析图像
memory_validation 1,318 与记忆问题配对的验证问题,共享相同答案和已解析图像

数据集内容与特点

  • 所有问答示例均基于教科书图表构建。
  • 数据集中图像列包含指向图像文件的仓库相对路径。
  • 关系推理涵盖类比、结构、因果等多种高阶理解类型。
  • 基准评估显示:Claude 4.6 在整体关系推理得分上表现最佳(73%),GPT 5.4 次之(68%)。
  • 开源模型在空间关系上得分最低,闭源模型在层级和顺序关系上表现较差。
  • 不同领域中,模型在天文学上得分最低,在心理学上得分最高。

加载方式

python from datasets import load_dataset

visual = load_dataset("nlylmz/SciReC", "visual", split="train") knowledge = load_dataset("nlylmz/SciReC", "knowledge", split="train") relational = load_dataset("nlylmz/SciReC", "relational", split="train") memory = load_dataset("nlylmz/SciReC", "memory", split="train") memory_validation = load_dataset("nlylmz/SciReC", "memory_validation", split="train")

搜集汇总
数据集介绍
SciReC 数据集图片
构建方式
SciReC数据集由亚利桑那州立大学的研究者精心构建,旨在诊断性评估多模态大语言模型在多轮交互中的关系推理能力。其构建依托于开源教科书中的图表与文本,通过模型自适应交互机制,从视觉理解、知识应用、关系推理与记忆回溯四个维度提取问题。数据集包含五个配置子集:visual子集涵盖13791个基于图表的问题,knowledge子集包含13501个基于图文的知识问题,relational子集提供662个跨图关系推理问题,memory子集包含1318个单图记忆问题,以及用于验证的memory_validation子集。所有数据均以JSONL格式存储,并统一划分为训练集。
特点
SciReC数据集具有显著的多模态与多轮对话特性,其独特之处在于聚焦于关系推理的细粒度诊断。数据涵盖类比、结构、因果等多种关系类型,并横跨天文、心理学等多元学科领域,从而全面评估模型在不同知识场景下的推理短板。实验表明,闭源模型在层级与序列关系上表现欠佳,而开源模型则在空间关系上遭遇瓶颈。此外,数据集通过引入记忆回溯与验证机制,强化了对模型跨轮次信息保持能力的检测,为揭示多模态大语言模型的认知边界提供了高针对性的评测基准。
使用方法
使用SciReC数据集时,可通过Hugging Face Datasets库便捷加载。用户需指定配置名称以获取相应子集,例如load_dataset('nlylmz/SciReC', 'visual', split='train')加载视觉问题集。图片文件通过路径字段引用,需确保解压后本地文件结构完整。数据集主要适用于多模态大语言模型的关系推理能力诊断,支持单轮问答与多轮对话评估。研究者可直接利用其预定义的分割进行模型评测,亦可基于其诊断性设计,结合具体关系类型与学科领域进行深入分析,以揭示模型在复杂认知任务中的具体优势与局限。
背景与挑战
背景概述
关系推理作为高阶认知的核心能力,要求模型在感知理解的基础上对概念间的关系进行比较与整合,涵盖类比、因果及结构关系等多重范畴。为全面评估多模态大语言模型(MLLM)在这类推理任务上的表现,研究人员于近期构建了SciReC基准数据集。该数据集由亚利桑那州立大学的Nilay Yilmaz主导开发,从开源教科书中提取了涵盖视觉理解、知识表征与记忆回溯的多轮学术对话样本,旨在以自适应交互方式诊断模型的多模态关系推理能力。实验表明,顶尖闭源模型在综合关系得分上达到73%,而开源模型在空间关系上表现最弱,专有模型则在层级与序列关系上遭遇瓶颈。该数据集为评估MLLM的跨域关系推理提供了标准化的诊断工具,对理解模型的高阶认知局限具有重要推动作用。
当前挑战
SciReC所应对的核心领域挑战在于,现有MLLM在关系推理任务中普遍缺乏对复杂概念的比较与整合能力,尤其在跨模态场景下难以同时处理视觉、文本与逻辑关系。数据集构建中的挑战则集中于如何从教科书中筛选并标注出能有效测试不同关系类型(如空间、层级、因果)的图文对,以及如何设计多轮交互模式以确保推理过程的完整性。此外,不同学科(如天文学与心理学)的推理难度差异显著,而模型在不同关系类别上的表现也存在明显分化,这要求数据集的配置必须精细化,以覆盖memory、visual、knowledge和relational等多元任务子集,从而实现诊断评估的自适应性与全面性。
常用场景
经典使用场景
SciReC作为多模态多轮关系推理的基准测试数据集,其经典使用场景在于全面诊断和评估多模态大语言模型在关系推理上的能力。该数据集精心设计了涵盖视觉理解、知识应用和记忆召回三个维度的自适应交互任务,包含视觉问答、知识问答和跨图表关系推理等子集,能够细致考察模型在类比推理、结构推理和因果推理等高阶认知任务中的表现。通过模拟教科书图表的多轮对话场景,研究者可系统性地评估模型在空间关系、层级关系和时序关系等不同关系类型上的推理水平,进而揭示模型在特定学科领域(如天文学与心理学)的性能差异。
解决学术问题
SciReC解决了多模态大语言模型研究中缺乏系统性关系推理评价工具的关键问题。传统视觉问答数据集多聚焦于实体识别或简单属性判断,难以触及结合视觉信息与背景知识的关系理解与推理能力评估。该数据集通过融合跨图表对比、知识记忆等复杂交互任务,填补了评估模型在多轮对话中动态整合视觉、知识与记忆以实现关系推理的空白。其研究意义在于为研究者提供了诊断模型高阶认知能力的标准化工具,揭示了闭源模型在层次关系和时序关系上的局限,以及开源模型在空间关系上的短板,从而引领了多模态关系推理领域的评价范式革新。
衍生相关工作
围绕SciReC,学术界已涌现出一系列衍生的经典工作。该数据集所揭示的模型在不同关系类型和学科领域上的性能差异,直接启发了针对空间关系推理和层次关系推理的专项优化研究,例如改进视觉语言模型以增强对图表中空间布局的编码能力。SciReC中包含的记忆问答子集也为探索大语言模型的长期记忆与跨轮次信息检索机制提供了实验基础,催生了结合外部知识记忆的增强推理框架。此外,其自适应交互评价范式影响了诸如多模态对话系统鲁棒性评估等后续工作,推动了构建更贴近真实人机协作场景的复合型评测体系的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务