遇见数据集

Spark-234K

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

Spark-234K是一个基于大规模科学文献的骨架引导科学推理数据集,包含约234,000个问答对。该数据集由机器从前沿科学文献中合成生成,采用了一种新颖的骨架引导方法:首先将每篇文献提炼为一个紧凑的推理骨架,保留其核心主张、支持证据、定量关系、假设和边界条件,然后从多个互补推理视角构建具有挑战性且自包含的问题。构建过程基于SCI-BASE语料库(约336万篇论文,涵盖10个学科),经过过滤和学科平衡采样后选取约37万篇前沿论文,再依次通过推理骨架提取、多视角问题生成、答案生成与质量检查、去重与去污染四个阶段。数据集在10个科学学科上平衡分布,其中物理、数学与计算机科学、化学占比最大。质量方面,自包含率达到99.73%,超过93%的问题被归类为L4多步推理或L5研究级推理,人工审核(300样本,跨10学科)显示与专家答案的一致率达90.3%。在Qwen系列模型上进行监督微调时,Spark-234K持续优于规模更大的其他科学推理数据集。该数据集适用于文本生成任务,尤其是科学推理、思维链训练等场景。

Spark-234K is a skeleton-guided scientific reasoning dataset based on large-scale scientific literature, containing approximately 234,000 question-answer pairs. The dataset is synthetically generated by machines from cutting-edge scientific literature using a novel skeleton-guided approach: first, each paper is distilled into a compact reasoning skeleton, retaining its core claims, supporting evidence, quantitative relationships, assumptions, and boundary conditions; then, challenging and self-contained questions are constructed from multiple complementary reasoning perspectives. The construction process is based on the SCI-BASE corpus (approximately 3.36 million papers covering 10 disciplines). After filtering and discipline-balanced sampling, about 370,000 frontier papers are selected, and then processed through four stages: reasoning skeleton extraction, multi-perspective question generation, answer generation and quality check, and deduplication and decontamination. The dataset is balanced across 10 scientific disciplines, with physics, mathematics and computer science, and chemistry accounting for the largest proportions. In terms of quality, the self-containment rate reaches 99.73%, and over 93% of questions are classified as L4 multi-step reasoning or L5 research-level reasoning. Human evaluation (300 samples across 10 disciplines) shows a 90.3% agreement rate with expert answers. When used for supervised fine-tuning on the Qwen series models, Spark-234K consistently outperforms other larger scientific reasoning datasets. This dataset is suitable for text generation tasks, especially for scientific reasoning and chain-of-thought training.

创建时间:
2026-08-30
原始信息汇总

Spark-234K 数据集概述

基本信息

  • 数据集名称:Spark-234K
  • 语言:英文(单语)
  • 许可证:Apache-2.0
  • 任务类型:文本生成
  • 规模:100K < n < 1M(包含234K条问答对)
  • 标注创建者:机器生成
  • 数据格式:Parquet文件(Spark-234K-data.parquet,含train split)

数据集简介

Spark-234K(SPARK: Skeleton-Guided Scientific Reasoning)是一个从大规模前沿科学文献中综合生成的高质量科学推理数据集。其核心创新在于不直接从完整论文生成问答对,而是先将每篇论文提炼为紧凑的推理骨架——保留核心主张、支持性证据、定量关系、假设与边界条件——再基于互补的推理视角构建具有挑战性且自包含的问题。该数据集已被EMNLP 2026 Findings接收。

数据构建流程

数据集基于SCI-BASE(涵盖10个学科、约336万篇论文),经筛选和学科平衡采样后选取约37万篇前沿论文,通过以下四个阶段构建:

  1. 推理骨架提取:将每篇论文提炼为以主张为中心的骨架,捕捉其核心结论、论证步骤、可观测变量和假设。
  2. 多视角问题生成:从多个互补的推理视角生成问题,以最大化难度和多样性。
  3. 答案生成与质量检查:在不接触源论文的情况下生成答案,并对每条问答对进行自包含性、来源一致性、答案连贯性和推理基础验证。
  4. 去重与去污染:按学科进行语义去重,并针对下游基准进行13-gram精确匹配去污染。

学科分布

数据集覆盖10个科学学科,采用学科平衡采样,其中物理学、数学与计算机科学、化学占比最大。

数据质量

  • 自包含率:99.73%
  • 难度分布:超过93%的问题被归类为L4多步推理L5研究级推理
  • 人工审计:对10个学科300个样本进行分层人工审计,与专家答案的一致率达90.3%

实验效果

在Qwen系列模型上进行SFT训练时,Spark-234K一致优于规模更大的其他科学推理数据集:

训练数据 Qwen3-8B Qwen3-14B
最佳竞品数据集 56.36 60.45
Spark-234K 60.83 63.88

引用信息

如需引用该数据集,可参考论文《SPARK: Skeleton-Guided Reasoning Synthesis from Large-Scale Scientific Literature》,作者包括Yu Li、Wei Li、Xin Gao、Mengyuan Sun、Xiaoyang Wang、Qizhi Pei和Lijun Wu,论文预印本地址为https://arxiv.org/abs/2608.30214。

搜集汇总
数据集介绍
Spark-234K 数据集图片
构建方式
Spark-234K的构建过程独具匠心,始源于涵盖十大学科、超过336万篇前沿论文的SCI-BASE语料库。研究者先通过学科均衡采样筛选出约37万篇论文,继而执行四阶段的精细加工:首先,将每篇论文蒸馏为以核心主张为中心的推理骨架,捕捉关键结论、论证脉络与研究假设;其次,从互补的推理视角生成多元问题,力求提升题目的难度与多样性;随后,在不接触原文的条件下生成答案,并严格核验每个三元组的自洽性、来源一致性及推理缜密性;最后,依据学科进行语义去重,并借助13元词组精确匹配实现与下游基准的防污染处理。
使用方法
Spark-234K可直接用于微调大语言模型,特别是作为指令跟随与科学推理任务的训练语料。研究者可依托HuggingFace平台,便捷地下载Parquet格式的默认数据集分裂,将其融入自有SFT流水线。与规模更大的竞品数据集相比,Spark-234K在Qwen3-8B与Qwen3-14B模型上展现出更优越的性能增益,分别达到60.83与63.88分。使用时建议遵循Apache 2.0许可,并参考论文中详述的预处理与采样策略,以复现基准结果或探索其在多学科推理评测中的潜力。
背景与挑战
背景概述
在人工智能与科学发现深度融合的浪潮下,如何让大语言模型具备严谨的科学推理能力已成为核心研究前沿。构建于大规模文献之上的推理数据集,是连接文本理解与逻辑演绎的关键桥梁。Spark-234K由学界研究者于2026年提出,旨在从约370万篇跨学科论文中,通过骨架引导的合成方法生成高难度科学问题。该数据集以推理骨架为核心,提炼论文的论点、证据与假设,进而生成多视角、自洽的问答对,覆盖物理、数学、化学等十大学科,为科学推理模型提供了高质量的监督微调资源。其发表于EMNLP 2026 Findings,一经推出便以超越大规模同类数据集的性能表现,深刻影响了科学推理数据构建的新范式。
当前挑战
Spark-234K所面临的挑战既根植于科学推理数据的本质困难,也贯穿于其构建流程的始终。从领域问题看,科学文献内在的复杂逻辑链条、隐含假设及学科交叉性,使得生成既忠实于原文又具备独立推理价值的问题极为艰难,此前的数据集常陷入浅层信息抽取或答案外泄的窠臼。在构建过程中,如何从海量文献中高效萃取高度凝练的推理骨架,并平衡十个学科的分布以规避数据偏置,是首要难题;继而,从多个互补视角生成高难度问题时需要确保涵盖多层次推理,这考验了生成策略的精细度;最后,严格的自包含性校验、去重与污染清除,在保障数据纯净性的同时,也带来了巨大的计算开销与质量评估挑战。
常用场景
经典使用场景
Spark-234K作为一项规模宏大的科学推理数据集,其经典用途在于为大型语言模型的监督式微调(SFT)提供高质量的训练语料。该数据集从海量前沿科学文献中提炼出24万对问答,每个问题都基于论文的推理骨架构建,涵盖物理、数学、计算机科学、化学等十个学科,具有高度的自包含性、多样性和挑战性。研究者通常利用该数据集训练模型,使其在面对复杂科学问题时,能够进行多步推理和深层次分析,从而显著提升模型在科学问答基准上的表现。其独特的构建方法,即先提炼推理骨架再生成问题,确保了训练数据的逻辑严谨性,使模型不仅学习答案,更能掌握推导过程。
解决学术问题
该数据集针对当前科学推理研究中训练数据匮乏且质量参差不齐的问题,提供了一种系统化的解决方案。传统数据集或依赖人工构建而规模受限,或直接从原文生成而缺乏深度。Spark-234K通过自动化的骨架引导生成流程,解决了如何从大规模文献中高效提取逻辑链条并构造高难度、多步骤的推理问题这一核心挑战。它有助于学术界训练出更具科学素养的模型,推动从简单的知识问答向复杂推理范式的转变,为评估和提升大模型的科学理解力、证据整合能力及批判性思维提供了宝贵的资源,对人工智能在科学发现中的应用具有深远意义。
实际应用
在实际应用层面,Spark-234K所训练的模型可广泛应用于多个场景,包括科研辅助、智能教育和知识服务等。在科研辅助中,模型能够帮助研究人员快速梳理文献中的核心论点、实验假设和定量关系,加速文献综述与假设生成。在智能教育领域,它可用于开发科学学科的智能辅导系统,为学生提供多步骤的解题思路和逻辑解释。此外,该数据集训练的模型还能服务于学术搜索引擎、科学问答系统及决策支持工具,助力跨学科知识整合,使非专业人士也能理解前沿科学成果,从而促进科学知识的普及与传播。
数据集最近研究
最新研究方向
以Spark-234K为代表的科学推理数据集构建,标志着大语言模型科学推理能力训练正迈向更加系统化和精细化的新阶段。该数据集摒弃直接从全文生成问答的粗放模式,创造性地引入“推理骨架”提取技术,确保生成的任务问题兼具挑战性与自洽性,为突破复杂科学问题求解瓶颈提供了关键数据支撑。研究重点聚焦于如何利用大规模前沿文献,合成能够激发模型多步逻辑链推理的高质量数据,以显著提升模型在物理、化学等基础学科上的泛化性能,这实质上是通往更强大科学智能体的一条关键路径。其发布与验证,不仅为后续融合学科先验知识与推理结构的研究范式奠基,也对评估当前模型能力的边界产生了深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务