SciReC
收藏资源简介:
SciReC是一个用于诊断评估多模态多轮关系推理与自适应交互的学术对话基准数据集。该数据集旨在系统检验多模态大语言模型在多种关系推理任务上的性能,这些任务包括类比推理、结构推理和因果推理等,代表了高阶理解的不同方面。数据来源于开源教科书,构建了基于教科书插图的视觉理解、知识展示和记忆回忆等多轮对话问题,以模拟关系推理过程中涉及的多重表征。数据集包含五个独立的配置:visual配置包含13,791个基于插图的视觉问题,并附有已解析的图像;knowledge配置包含13,501个基于插图标题或文本的知识问题,并附有已解析的图像;relational配置包含662个跨插图的关系推理问题;memory配置包含1,318个源自关系推理示例的单插图记忆问题,不包含已解析图像;memory_validation配置包含1,318个与记忆问题配对的验证问题,共享相同的答案和已解析图像。所有配置均为英文,仅提供训练集分割,数据格式为多模态(文本对话与图像)。该数据集适用于多模态视觉问答、对话式关系推理、模型能力诊断等研究场景。
SciReC is an academic dialogue benchmark dataset for diagnostic evaluation of multimodal multi-turn relational reasoning and adaptive interaction. It aims to systematically examine the performance of multimodal large language models on various relational reasoning tasks, including analogical reasoning, structural reasoning, and causal reasoning, representing different aspects of high-order understanding. The data is sourced from open-source textbooks, constructing multi-turn dialogue questions based on textbook illustrations for visual comprehension, knowledge presentation, and memory recall to simulate multiple representations involved in relational reasoning. The dataset includes five independent configurations: the visual configuration contains 13,791 visual questions based on illustrations with parsed images; the knowledge configuration contains 13,501 knowledge questions based on illustration captions or text with parsed images; the relational configuration contains 662 cross-illustration relational reasoning questions; the memory configuration contains 1,318 single-illustration memory questions derived from relational reasoning examples without parsed images; and the memory_validation configuration contains 1,318 validation questions paired with memory questions, sharing the same answers and parsed images. All configurations are in English, with only a training set split provided, and the data format is multimodal (text dialogues and images). It is suitable for research scenarios such as multimodal visual question answering, conversational relational reasoning, and model capability diagnosis.
SciReC 数据集概述
SciReC (Scientific Relational Reasoning with Conversational Context) 是一个面向多模态大语言模型(MLLM)的模型自适应多模态学术对话基准数据集,专门用于诊断评估模型在多轮交互中的关系推理能力。
基本信息
- 语言: 英语
- 许可证: CC BY-NC-SA 4.0
- 策划人: Nilay Yilmaz(联系邮箱: nyilmaz3@asu.edu)
- 任务类别: 视觉问答、问答
- 标签: 多模态、教科书、关系推理、图表、对话、记忆、知识
数据集来源
- 官方网站: https://scirecc.github.io/SciReC/
- 代码仓库: https://github.com/nlylmz/SciReC
- 论文: Diagnostic Evaluation of Multimodal Multi-Turn Relational Reasoning with Adaptive Interaction
数据集配置与规模
数据集包含五个子配置,每个配置仅提供 train 分割:
| 配置名称 | 样本数量 | 描述 |
|---|---|---|
visual |
13,791 | 基于图表的视觉问题,附带已解析的图像 |
knowledge |
13,501 | 基于字幕/文本的知识问题,附带已解析的图像 |
relational |
662 | 跨图表的关系推理问题 |
memory |
1,318 | 基于关系推理示例的单图表记忆问题,不含已解析图像 |
memory_validation |
1,318 | 与记忆问题配对的验证问题,共享相同答案和已解析图像 |
数据集内容与特点
- 所有问答示例均基于教科书图表构建。
- 数据集中图像列包含指向图像文件的仓库相对路径。
- 关系推理涵盖类比、结构、因果等多种高阶理解类型。
- 基准评估显示:Claude 4.6 在整体关系推理得分上表现最佳(73%),GPT 5.4 次之(68%)。
- 开源模型在空间关系上得分最低,闭源模型在层级和顺序关系上表现较差。
- 不同领域中,模型在天文学上得分最低,在心理学上得分最高。
加载方式
python from datasets import load_dataset
visual = load_dataset("nlylmz/SciReC", "visual", split="train") knowledge = load_dataset("nlylmz/SciReC", "knowledge", split="train") relational = load_dataset("nlylmz/SciReC", "relational", split="train") memory = load_dataset("nlylmz/SciReC", "memory", split="train") memory_validation = load_dataset("nlylmz/SciReC", "memory_validation", split="train")




