遇见数据集

SCICODEPILE

收藏
arXiv2026-07-21 更新2026-07-23 收录
数据链接:
官方服务:

资源简介:

SCICODEPILE是由新加坡管理大学等机构联合构建的迄今为止规模最大的科学代码语料库,旨在为计算科学领域的代码生成提供训练资源与可执行评测基准。该数据集总量达128GB,源自37,737个经过严格筛选的公共代码仓库,覆盖化学、生命科学、计算方法和AI建模等多个学科领域,其内容以原始代码文件、仓库摘要、函数指令及问题-解决方案对四种互补格式呈现。数据构建过程采用了“检索-过滤”流程,结合大语言模型辅助的关键词扩展与质量控制,并进一步从中提炼出包含200个任务的、配备沙箱执行环境与自动化测试框架的可执行评测集。该数据集主要应用于提升大语言模型在科学代码生成任务上的能力,旨在解决现有资源在规模、领域覆盖及功能可验证性方面的不足,为可靠、可执行的科学代码生成研究提供关键基础设施。

SCICODEPILE is the largest scientific code corpus jointly constructed by Singapore Management University and other institutions to date, aiming to provide training resources and executable evaluation benchmarks for code generation in the field of computational science. With a total size of 128 GB, this dataset is sourced from 37,737 rigorously screened public code repositories, covering multiple disciplines including chemistry, life sciences, computational methods, and AI modeling. Its content is presented in four complementary formats: original code files, repository summaries, function instructions, and problem-solution pairs. The dataset construction process adopts a retrieval-filtering workflow, combined with large language model (LLM)-assisted keyword expansion and quality control, and further extracts an executable evaluation set containing 200 tasks equipped with a sandbox execution environment and an automated testing framework. This dataset is primarily applied to enhance the capabilities of large language models (LLMs) in scientific code generation tasks, aiming to address the shortcomings of existing resources in terms of scale, domain coverage, and functional verifiability, providing key infrastructure for research on reliable and executable scientific code generation.

创建时间:
2026-07-21
搜集汇总
数据集介绍
SCICODEPILE 数据集图片
构建方式
SCICODEPILE的构建围绕一个精密的检索-过滤流水线展开。首先,基于人工筛选的198个种子关键词,借助LLM进行词汇扩展,形成涵盖计算化学、生命科学、计算物理学等多领域的213个查询词,从GitHub获取逾131万个候选仓库。随后,通过多重质量控制机制完成精炼:剔除星标不足10的低质量项目,利用长文本模型分析README内容以判定科研相关性,仅保留37,737个高质量仓库。在代码层面,使用树状解析器从源码中提取函数,并借助双重嵌入相似度评分筛选出科研逻辑浓厚的代码片段,最终形成125GB的原始语料。为进一步提升结构化程度,该流水线逐步衍生出四种互补的数据格式:原始代码文件、仓库级README摘要、函数级指令说明以及问题-解决方案对,每一层都设置了对应的自动验证机制,确保数据的域内一致性与可靠性。
特点
SICODEPILE的显著特征在于其规模宏大且结构精良。作为迄今最大的科学代码语料库,它汇集了37,737个仓库、128GB的代码,覆盖计算化学、生物信息学、材料科学等广阔的科学计算领域。不同于传统数据集仅提供单一粒度的数据,SCICODEPILE以多粒度对齐的方式呈现,将仓库级意图(README摘要)、函数级语义(函数说明)与任务级公式(问题-解决方案)紧密关联,为下游训练提供了丰富的监督信号。尤为关键的是,该数据集附带了一个包含200个可执行测试任务的基准,每个任务均配备沙箱执行环境与自动化测试套件,这使得模型评估不再局限于文本相似度,而是基于实际的代码可运行性与功能正确性,属于对科学代码生成能力更为严苛的检验。这种从大规模预训练语料到可执行验证的端到端设计,显著区别于既有资源。
使用方法
SCICODEPILE提供了两个层面的使用路径。对于训练,研究者可充分运用其四种格式的数据进行多阶段模型增强:基于粗粒度的原始代码语料进行领域自适应预训练,利用函数级指令数据执行指令微调,以及采用问题-解决方案对进行多样化训练信号的注入,实验证明这些方式能显著提升科学代码生成的CodeBLEU和Pass@1指标。对于评估,研究者可直接使用精心构筑的可执行基准,其中每个任务包含自然语言描述、目标函数签名、隔离的沙箱运行环境与自动化测试套件。模型生成的候选代码将在该环境中被执行并接受包含平均7.3条断言的全面验证,唯有通过所有测试案例的实现才被视为正确。整个数据集已开源至Hugging Face平台,使用者可根据自身需求灵活选取不同的数据格式与评估方案。
背景与挑战
背景概述
SCICODEPILE是由新加坡管理大学、南京大学、中山大学及新加坡内政科技厅等机构在2026年联合构建的大规模科学代码语料库。随着大语言模型在通用代码生成中展现卓越性能,其在计算科学领域的真实水平却长期缺乏系统性评估,现有数据集普遍面临规模有限、领域覆盖不均且缺乏可执行验证的困境。为弥合这一鸿沟,研究团队从37,737个开源仓库中采集了128GB代码,覆盖量子化学、分子动力学、基因组学等多元计算科学学科,并从中精炼出200个可执行基准任务,每个任务配备沙箱环境与自动化测试框架,旨在系统评估模型生成符合领域语义、数值逻辑与项目依赖的科学代码之能力。该数据集的发布为训练与评测科学代码生成提供了迄今最大规模的资源支撑,有力推动了可靠AI科学编程助手的研究。
当前挑战
SCICODEPILE所指向的核心挑战在于当前大语言模型在科学代码生成上远未达到可靠水准。首先,科学代码不仅要求语法正确,更须遵循领域特有的数值逻辑与项目级依赖,而现有模型在可执行基准上的Pass@1最优仅为12.30%,暴露出从表层相似到功能正确之间的鸿沟。其次,语料库构建面临双重困难:一是大规模仓库检索中需从131万候选仓库中精准筛选出真正实施科学计算的37,737个,需设计结合LLM辅助关键词扩展与双维度相关性评分的精细流水线;二是多粒度数据格式的对齐与验证,须确保README摘要、函数描述、问题-解答对与底层代码语义一致,并利用领域专用模型进行自动化过滤,以抑制生成式构造引入的噪音与幻觉,从而为后续训练提供高信噪比的监督信号。
常用场景
经典使用场景
在计算科学迅猛发展的当下,科学代码生成已成为人工智能辅助科研的核心挑战之一。SCICODEPILE数据集最经典的用途便是作为大规模、多领域、可执行验证的科学代码生成基准测试平台。研究者可借助其涵盖量子化学、分子动力学、基因组学等领域的200个可执行任务,系统评估大语言模型在自然语言驱动的科学代码生成任务上的真实能力。该基准强调功能性正确性,要求模型生成的代码必须在沙盒环境中通过全部自动化测试,从而超越传统基于文本相似度的评估范式,为科学编程模型的性能度量提供了更为严苛与可靠的标尺。
衍生相关工作
SCICODEPILE的发布催生了多个具有深刻影响的后续研究方向。一方面,其大规模语料库被广泛用作领域自适应继续预训练的基础资源,显著提升了GPT-2等小模型在科学代码补全任务上的CodeBLEU指标;另一方面,其函数指令数据被成功用于指令微调,使Qwen2.5-Coder-0.5B在可执行基准上的Pass@1提升近五倍。这些工作验证了SCICODEPILE在模型训练阶段的有效性,进一步激励了研究社区探索基于科学代码语料的持续学习、跨领域泛化及复杂依赖推理等前沿课题,推动了可靠科学代码生成智能体的系统化发展。
数据集最近研究
最新研究方向
当前,科学代码生成领域正经历从通用编程能力向领域特异性语义理解的深刻转型。SCICODEPILE作为迄今为止规模最大的科学代码语料库,以128GB体量覆盖计算化学、生物信息学、量子力学等多元学科,其研究前沿聚焦于两大核心挑战:其一,如何通过多粒度对齐的数据格式(如README摘要-函数描述-问题求解对)弥合仓库级意图与代码级实现之间的语义鸿沟;其二,如何构建可执行基准测试以完成超越语法相似性的功能验证。该数据集的突破性意义在于揭示了当前最先进大语言模型在科学代码生成上的显著局限——即便表现最佳的模型在可执行基准测试中仅实现12.30%的Pass@1,而基于该语料库的持续预训练与指令微调能使CodeBLEU与Pass@1分别提升2.84倍和4.79倍,为构建真正可靠的科学编程AI助手奠定了关键的数据基础设施与评估范式。
相关研究论文
  • 1
    SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation新加坡管理大学; 南京大学; 中山大学; 内政部科技局 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务