遇见数据集

SciEx

收藏
arXiv2024-06-15 更新2024-06-19 收录
官方服务:

资源简介:

SciEx是由卡尔斯鲁厄理工学院创建的多语言、多模态科学考试基准数据集,包含154个大学计算机科学考试问题,涵盖英语和德语。数据集通过收集不同计算机科学课程的考试题目构建,包括自然语言处理、人工智能等领域的考试。创建过程涉及专家对LLM输出的评估,以及自动评分机制的开发。SciEx旨在评估大型语言模型在解决科学任务上的能力,特别是在自由形式问题上的表现,为未来LLM的评估提供了一个可靠的基准。

SciEx is a multilingual, multimodal scientific examination benchmark dataset developed by Karlsruhe Institute of Technology (KIT). It comprises 154 university-level computer science exam questions in both English and German. The dataset is constructed by collecting exam questions from various computer science courses, including those from fields such as natural language processing (NLP) and artificial intelligence (AI). The development of SciEx involved expert evaluation of outputs from large language models (LLMs) as well as the development of automated scoring mechanisms. This benchmark aims to evaluate the capabilities of large language models (LLMs) in solving scientific tasks, particularly their performance on free-form open-ended questions, and provides a reliable benchmark for future LLM evaluations.

创建时间:
2024-06-15
搜集汇总
数据集介绍
SciEx 数据集图片
构建方式
SciEx数据集的构建始于对德国卡尔斯鲁厄理工学院2022至2024学年多门计算机科学课程(如自然语言处理、高级人工智能、深度学习、人机交互、数据库、计算机图形学、算法等)的真实大学考试进行系统收集。每份试卷首先被转换为统一的JSON格式,其中每个问题均附带索引、文本内容及可能涉及的图像路径。随后,研究团队将这些问题逐一提交给包括Claude、GPT-4V、GPT-3.5、Llama3、Mixtral、Qwen、Mistral及Llava在内的多种大语言模型,以生成答案。针对包含图像的问题,文本型模型仅接收问题文本,而多模态模型则通过图像标题或拼接方式处理视觉信息。最终,由设计原始试题的授课专家对LLM生成的答案进行匿名评分,确保评估的权威性与一致性。
特点
SciEx数据集的显著特点在于其多语言、多模态与自由形式的综合设计。它包含英语和德语两种语言的试题,覆盖从简单到困难的不同难度层次,共计154个独特问题。其中约21%的问题涉及图像,考验模型的多模态理解能力。与以往仅依赖选择题的基准不同,SciEx的问题均为开放式自由回答形式,如数学证明、算法设计或长篇解释,这更贴近真实学术场景。此外,数据集不仅提供了LLM的答案与专家评分,还包含了每道题的学生平均成绩和参考答案,为模型与人类表现的对比分析提供了丰富维度。
使用方法
使用SciEx评估大语言模型时,研究者可将模型作为考生,逐题回答数据集中的问题,并利用提供的专家评分或自动评分机制进行性能衡量。对于自动评分,推荐采用LLM-as-a-judge方法,即使用如GPT-4V或Llama3等强大模型作为评分者,在提示中包含参考答案和同题或同考的示例,以提升评分与专家评分的一致性(最高可达0.948皮尔逊相关系数)。研究者可依据语言、难度或是否含图像等维度对模型表现进行细粒度分析,并与学生平均成绩对比,从而全面评估模型在科学任务上的能力。数据集已开源,可通过Hugging Face和GitHub获取。
背景与挑战
背景概述
在大型语言模型(LLMs)迅猛发展的浪潮中,如何精准评估其在科学领域的综合能力已成为学术界关注的焦点。现有基准多局限于多项选择题,难以全面衡量模型处理开放式、多模态及跨语言问题的真实水平。在此背景下,德国卡尔斯鲁厄理工学院的研究团队于2024年构建了SciEx基准数据集,旨在通过大学计算机科学考试题目对LLMs进行深度评测。该数据集涵盖英语与德语两种语言,包含文本与图像混合的多种题型,难度层级丰富,填补了现有基准在自由形式问答评估上的空白。SciEx的发布不仅为LLMs的科学推理能力提供了更具挑战性的测试平台,也通过专家评分与自动评分相结合的方式,推动了模型评估方法的革新,对自然语言处理与人工智能教育领域产生了深远影响。
当前挑战
SciEx所面临的挑战主要体现在两个层面。其一,在领域问题层面,现有LLMs在处理需要深度推理与数学证明的复杂题目时表现欠佳,最佳模型仅能达到59.4%的平均成绩,远未达到完美水平;同时,模型在图像相关题目上虽有一定能力,但整体表现仍显著弱于纯文本任务,反映出多模态理解能力的不足。其二,在构建过程中,研究者需克服自由形式答案评分的主观性与可扩展性矛盾,依靠专家逐题评分虽保证了信度,却限制了数据集的规模;此外,自动评分方案虽采用LLM-as-a-judge策略并取得了与专家评分高达0.948的皮尔逊相关性,但在处理同题示例时仍存在分数复制偏差,且不同评分模型对难度层级的敏感度各异,增加了评估结果的不稳定性。
常用场景
经典使用场景
在大型语言模型(LLM)迅猛发展的浪潮中,SciEx作为一项专为评估LLM在科学任务上能力而设计的基准测试,其经典使用场景聚焦于对模型进行多维度、深层次的科学知识考核。该数据集通过整合德国卡尔斯鲁厄理工学院计算机科学领域的大学考试题目,涵盖自然语言处理、深度学习、计算机图形学等九门课程,构建了一个多语言(英语与德语)、多模态(含图像题目)且题型丰富的评测体系。研究者可借助SciEx,以自由形式问答的方式,考察LLM在数学证明、算法设计、数据库查询等科学任务上的推理与生成能力,从而弥补传统多项选择基准在评估深度与真实性上的不足。
实际应用
在实际应用中,SciEx的价值不仅限于学术评测,更延伸至教育科技与智能辅导系统的开发领域。例如,基于SciEx的自动评分机制(LLM-as-a-judge)已展现出与专家评分高达0.948的皮尔逊相关性,这意味着教育机构可借助该框架对学生的科学答案进行初步评估,从而减轻教师负担。此外,SciEx的多语言特性使其能够服务于国际化的在线学习平台,通过对比不同语言环境下模型的科学答题表现,辅助开发更适配非英语用户的智能教学助手。在科研辅助工具中,SciEx还可用于筛选具备扎实科学推理能力的LLM,以应用于自动生成数学证明、代码验证或实验设计等场景。
衍生相关工作
SciEx的发布催生了一系列衍生研究工作,进一步拓展了其在LLM评测领域的影响力。首先,基于SciEx的自动评分研究催生了更精细的评分策略,如利用链式思维推理(Chain-of-Thought)和少样本示例(Few-shot)来提升评分一致性,这一方法已被后续工作应用于其他领域的自由形式答案评估。其次,SciEx中揭示的模型在数学与图像处理上的短板,直接推动了专门针对科学推理的微调数据集(如MathSciEx)的构建,以及多模态模型在科学图表理解上的改进工作。此外,SciEx的多语言设计也启发了跨语言科学能力基准的研发,例如将类似框架扩展至法语或中文,以全面评估LLM的全球化科学素养。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务