遇见数据集

SciMIF

收藏
arXiv2026-08-27 更新2026-08-28 收录
数据链接:
官方服务:

资源简介:

SciMIF是由上海人工智能实验室与上海交通大学联合构建的多模态科学指令遵循基准,旨在系统评估多模态大语言模型在科学领域遵循复杂指令的能力。该数据集涵盖化学、地理、生物、材料科学和物理共五个学科,包含2527个样本,平均每样本约200个token,数据来源于13个现有科学数据集中的22个任务。创建过程通过专家构建的10个约束组和42个具体约束,经种子准备、约束识别、约束注入及人工验证等步骤生成。该基准旨在解决科学领域指令遵循评估的空白,分离科学正确性与指令遵循性,推动模型在科学应用中的可靠执行。

SciMIF is a multimodal scientific instruction-following benchmark jointly developed by the Shanghai AI Laboratory and Shanghai Jiao Tong University, aiming to systematically evaluate the capability of multimodal large language models (LLMs) to follow complex instructions in scientific domains. This benchmark covers five disciplines including chemistry, geography, biology, materials science, and physics, comprising 2527 samples with an average of approximately 200 tokens per sample. The data is sourced from 22 tasks across 13 existing scientific datasets. Its construction process follows a pipeline involving seed preparation, constraint identification, constraint injection and manual verification, based on 10 constraint groups and 42 specific constraints developed by domain experts. This benchmark aims to fill the gap in instruction-following evaluation in the scientific domain, disentangle scientific correctness from instruction-following performance, and promote the reliable execution of models in scientific applications.

创建时间:
2026-08-27
原始信息汇总

SciMIF 数据集详情

数据集简介

SciMIF(Scientific Multimodal Instruction Following)是一个用于评估多模态大语言模型(MLLMs)在科学领域遵循复杂指令能力的基准数据集。与传统科学基准主要关注答案正确性不同,SciMIF 评估模型是否满足明确的科学和通用约束,包括所需方法、单位、格式、术语、推理步骤、数值精度和响应结构。

数据来源

SciMIF 通过从五个学科公开科学数据集的样本进行增强构建而成:

学科 来源数据集
化学 ChemEval, S2-TOMG-Bench-mini
地理 EarthSE, IMAGEO-Bench
生物 Mol-Instructions, LAB-Bench
材料 MaScQA, MatCha, LLM4Mat-Bench, MatSciBench
物理 UGPhysics, PhysReason, PhysUniBench

数据样本字段说明

  • id: 样本ID
  • task: 科学任务类型
  • original_question: 原始科学问题
  • edit_question: 注入约束后的问题
  • answer: 参考答案
  • choose_instruction: 应用的科学约束
  • instruction_list: 与样本关联的所有约束(source字段标识:original为原问题已有约束,core_task为输入记录提供的候选科学约束,added_general为构建时添加的通用约束)
  • image: 多模态样本的可选图像路径或路径列表

数据集使用流程

1. 构建约束增强问题

  • 输入格式为JSON数组,需遵循data/input_data.json格式示例;每条记录的scientific_instruction_list包含候选科学指令
  • 运行data_construction.py脚本,需指定学科、输入/输出路径、模型名称及参数N和K
  • 构建好的问题需人工验证后才能作为最终基准

2. 生成模型响应

  • 运行generation.py脚本,指定学科列表、输入/输出目录、模型名称等信息
  • 处理多模态样本时,所选模型需支持图像输入

3. 指令遵循评估

  • 运行instruction_eval.py脚本,评估结果保存至指定路径
  • 每条输出记录包含生成的响应及每条适用指令的评估结果

4. 答案正确性评估

  • 使用 CompassVerifier-32B 作为评判模型,需按官方文档配置verifier环境和vLLM依赖
  • 运行correctness_eval.py脚本,结果按二进制verifier分数分为_score1.jsonl_score0.jsonl文件
  • 若指令评估文件可用,其instruction_results会包含在每条正确性记录中
搜集汇总
数据集介绍
SciMIF 数据集图片
构建方式
SciMIF数据集的构建遵循一套系统化的流程,旨在将既有科学任务转化为指令遵循评估场景。首先,研究团队基于对化学、地理、生物学、材料科学和物理学五个学科中22项任务的深入分析,构建了一个包含10个功能约束组和42个学科适配约束的层级化分类体系。随后,通过高保真指令注入流水线,在保留原始科学问题和参考答案不变的前提下,将显性或隐性的科学约束以及兼容的一般约束有机融入原始查询中。整个流程包含种子准备、约束识别与筛选、约束注入以及自动一致性与人工双重验证等环节,最终形成包含2527个样本的多模态科学指令遵循基准。
使用方法
SciMIF数据集可用于系统评估多模态大语言模型在科学领域中的指令遵循能力。研究者可基于给定的约束列表,采用约束满足率(CSR)、指令满足率(ISR)和分解需求遵循率(DRFR)等指标对模型输出进行多维度量化分析。数据集支持细粒度的能力诊断,既可依据学科维度探索不同领域的性能差异,也可沿功能约束组维度剖析模型在格式、精度、术语、步骤等具体要求上的遵循薄弱环节。同时,SciMIF配套了脚本化验证与LLM-as-a-Judge两种评估协议,便于研究者快速复现实验并深入探究科学正确性与指令遵循性之间的关联,为研发更严谨、更实用的科学AI系统提供坚实的评测基础。
背景与挑战
背景概述
随着多模态大语言模型(MLLMs)在科学领域的应用从基础问答迈向自主科学智能体与AI驱动发现,对模型在显式操作约束下可靠执行多步科学任务的需求日益迫切。然而,现有科学基准多聚焦于答案正确性,忽略了对输出格式、单位、术语等约束的遵循评估。为此,上海人工智能实验室与上海交通大学的研究团队于2026年提出SciMIF基准,涵盖化学、地理、生物学、材料科学与物理学五大学科,包含2527个样本,系统评估MLLMs在科学指令遵循上的能力。SciMIF首创的约束分类体系及指令注入流程,填补了多模态科学指令遵循评估的空白,为科学场景下MLLMs的优化提供了关键评测基础。
当前挑战
SciMIF面临多重挑战。领域层面,科学指令高度依赖学科知识,约束语义随学科差异显著,且常需多模态理解,如化学中的分子结构、地理中的空间层级等,难以通过表面文本匹配处理。现有模型在化学、地理等学科上表现不佳,尤其是在细粒度约束(如原子数、化学键数量)和深层学科知识要求上。构建层面,需将科学任务转化为可评估的指令遵循形式,涉及从22个任务中提取10类约束、注入与任务兼容的约束且不改变参考答案,需通过自动校验与人工审核确保约束的准确性、逻辑一致性与无歧义性,流程复杂且耗时。
常用场景
经典使用场景
SciMIF作为科学领域多模态指令遵循的专用基准,其经典使用场景集中于对多模态大语言模型(MLLMs)在化学、地理、生物学、材料科学与物理学五个学科中的指令遵循能力进行系统性评估。该数据集通过注入涵盖十类功能约束组的精细指令,考察模型在科学知识依赖、学科间语义差异及多模态输入条件下的表现,为研究者提供标准化的评测框架。
解决学术问题
SciMIF填补了科学领域多模态指令遵循评估的空白,解决了现有科学基准仅关注答案正确性而忽视输出约束遵循的问题。通过区分科学正确性与指令遵循性,该数据集使模型能力缺陷可被精细归因,揭示模型在学科多样性、细粒度约束及学科知识深度应用上的不足,为领域感知的对齐策略及科学指令遵循研究奠定基础。
实际应用
在实际应用中,SciMIF可用于评估和优化面向科学任务的AI系统,如自主科学代理和AI驱动的科学发现工具。通过确保模型输出符合单位、术语、格式及流程等明确要求,该基准有助于提升科学数据分析、实验设计辅助、文献理解等场景中模型的可靠性与可用性,推动MLLMs在严谨科学工作流中的落地。
数据集最近研究
最新研究方向
SciMIF基准的引入标志着多模态大语言模型在科学领域指令遵循能力评估方面迈出了关键一步,其研究前沿聚焦于构建细粒度、多学科耦合的约束体系,以揭示模型在化学、地理、生物、材料及物理等学科中遵循复杂科学指令的真实水平。该方向的核心在于突破传统科学问答仅关注答案正确性的局限,转而强调科学正确性与指令遵循之间的解耦评估,从而精准定位模型在科学推理与约束执行上的能力短板。当前研究表明,尽管模型在生物与材料领域表现相对稳健,但在化学与地理等需要深度学科知识和高密度精细约束的任务中仍面临显著挑战,且模型参数规模的线性扩展并未带来指令遵循能力的同步提升,这一发现为未来研究指明了从知识注入向领域感知对齐、结构化推理与外部工具协同等方向转型的必要性,也为构建更为严谨、可靠的人工智能科学助手奠定了方法论基石。
相关研究论文
  • 1
    SciMIF: Understanding Multimodal Instruction Following in Scientific Domains上海人工智能实验室; 上海交通大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务