遇见数据集

SciFIBench

收藏
arXiv2024-05-15 更新2024-06-21 收录
官方服务:

资源简介:

SciFIBench是由剑桥大学创建的一个科学图表解释基准数据集,包含1000个多选题,分为两个任务和12个类别。数据集来源于arXiv计算机科学论文的图表和标题,通过对抗性过滤和人工验证确保难度和质量。SciFIBench旨在评估大型多模态模型在科学图表理解方面的能力,推动该领域的研究进展。

SciFIBench is a scientific chart interpretation benchmark dataset developed by the University of Cambridge. It comprises 1,000 multiple-choice questions, split into two tasks and 12 categories. The dataset is curated from charts and their accompanying titles in arXiv computer science papers, with adversarial filtering and manual validation employed to ensure its appropriate difficulty and quality. The core objective of SciFIBench is to evaluate the capabilities of large multimodal models in scientific chart understanding, and promote research progress in this field.

提供机构:
剑桥大学
创建时间:
2024-05-15
搜集汇总
数据集介绍
构建方式
SciFIBench的构建源于对大规模多模态模型在科学图表理解能力上的系统评估需求。研究团队从SciCap数据集中选取了约9.4万对来自arXiv计算机科学论文的图表与标题对,仅保留单句标题且不含子图的图表。通过CLIP模型提取图文联合嵌入,利用Faiss库构建向量数据库,为每个查询找到k个最近邻作为干扰项。采用对抗性过滤策略,基于嵌入距离筛选高难度负例,并经过人工验证确保问题的可回答性。最终精选出1000道高质量多选题,形成黄金子集,同时构建了包含1万道题的银集和17.4万道题的铜集,覆盖12个arXiv类别。
特点
该数据集以科学图表理解为核心,设计了两类任务:根据图表选择正确标题,以及根据标题匹配正确图表。其显著特点在于对抗性负例的引入,通过联合嵌入相似度筛选与正确答案高度混淆的干扰项,大幅提升了题目难度。人工验证机制确保了每道题目的可回答性与高质量,使得黄金子集的噪声水平控制在极低范围。数据集呈现明显的难度梯度,从黄金集到铜集难度递减,为不同研究需求提供灵活选择。实验表明,即便顶尖模型如GPT-4o和Gemini-Pro 1.5,准确率也仅达75%左右,凸显了该基准的挑战性。
使用方法
使用SciFIBench时,研究者可直接加载黄金子集中的1000道多选题进行零样本评估,每道题包含5个选项。推荐采用链式思维提示模板引导模型逐步推理,并通过设置温度为0和贪婪解码策略确保结果的可复现性。对于模型输出解析,可借助Gemini-Pro等强语言模型自动提取答案字母,实现高效批量评估。银集和铜集适用于下游的超参数调优、少样本学习或模型微调。数据集的类别标签便于分析模型在不同科学领域的表现差异,而对抗性与随机负例的对比设置可用于探究模型的鲁棒性与推理忠实度。
背景与挑战
背景概述
大型多模态模型(LMMs)在诸多领域展现出卓越的灵活性与泛化能力,其在科学研究中的潜力日益受到关注。然而,理解科学图表——这一承载复杂信息的浓缩载体——对于当前模型而言仍是严峻考验。为此,剑桥大学、香港大学及Google DeepMind的研究人员于2024年共同推出了SciFIBench基准数据集,旨在系统评估LMMs对科学图表的解读能力。该数据集基于arXiv计算机科学论文中的约10万对图表与标题,通过对抗性筛选与人工验证构建了包含1000道高质量多选题的金标准集,覆盖12个学科类别,为量化模型在科学图表理解领域的表现提供了可靠标尺。
当前挑战
SciFIBench面临的挑战主要体现在两个层面。其一,科学图表本身具有高密度语义与复杂视觉结构,不同学科领域的图表风格差异显著,要求模型同时具备精细视觉识别与领域知识推理能力。其二,数据构建过程中,如何从海量论文中自动生成高质量、高难度的多选题是一大难题:采用对抗性筛选寻找硬负例可显著提升题目难度,但需辅以人工验证剔除歧义样本,确保题目可回答性。此外,模型输出的自动评估也颇具挑战,需借助强LLM进行答案提取与格式标准化,方能实现大规模高效评测。
常用场景
经典使用场景
在人工智能赋能科学研究的浪潮中,理解科学图表是大型多模态模型(LMM)迈向科学智能的关键一步。SciFIBench 应运而生,其经典使用场景是作为一项标准化基准测试,专门用于评估 LMM 对科学论文中复杂图表的解读能力。该基准通过构建“图表到标题”与“标题到图表”两项核心的单项选择题任务,系统性地检验模型能否从多个高度相似的选项中,精准匹配与图表内容相符的标题,或反之根据标题找到正确的图表。这一场景为衡量模型在科学视觉与文本语义间的对齐能力提供了严苛的测试平台。
解决学术问题
SciFIBench 直面了学术界对 LMM 科学图表理解能力缺乏定量评估的空白。此前,尽管 LMM 在自然图像理解上表现卓越,但其在科学图表这一信息高度浓缩、语义密集的领域中的真实水平尚不明确。该数据集通过引入对抗性负样本筛选与人工验证,构建了高质量、高难度的多选题库,解决了以往评估中难以获得客观度量与可靠真值的问题。其意义在于,为 AI4Science 领域提供了一个可复现、可扩展的评估框架,揭示了当前最先进模型与人类专家之间的显著差距,从而指明了未来模型在细粒度科学推理与视觉细节捕捉方面亟需突破的方向。
衍生相关工作
SciFIBench 的发布催生了一系列富有启发性的衍生工作。其方法论上的创新,特别是利用联合嵌入进行对抗性负样本筛选的思路,已被后续研究借鉴以构建更具挑战性的多模态基准。该数据集直接推动了针对 LMM 在科学图表上对齐性与推理忠实度的探索,研究者通过修改问题中的标注信息来测试模型是否盲目遵循指令或产生“作弊”行为。此外,SciFIBench 中高难度的“标题到图表”任务,也激发了关于如何提升开放源码模型在细粒度视觉匹配上性能的研究,促使社区开发更强大的视觉编码器与跨模态对齐策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务