遇见数据集

SCICODE-VERIFIED

收藏
arXiv2026-08-05 更新2026-08-07 收录
官方服务:

资源简介:

SCICODE-VERIFIED是由中国科学技术大学、哈尔滨工程大学和中国科学院联合创建的科学编码基准数据集,旨在修正原始SCICODE基准中的缺陷。该数据集包含64个研究级问题,涵盖数学、物理、化学、生物学和材料科学等领域,每个问题分解为多个子问题,要求模型具备前沿科学理论和数值编码能力。创建过程通过领域专家逐问题审计,识别并修正了263个缺陷,其中192个导致正确解决方案被误判。该数据集主要用于评估语言模型在科学编码方面的真实能力,解决了因基准缺陷导致模型能力被低估的问题。

SCICODE-VERIFIED is a scientific coding benchmark dataset jointly developed by the University of Science and Technology of China, Harbin Engineering University, and the Chinese Academy of Sciences, aiming to rectify the flaws in the original SCICODE benchmark. This dataset comprises 64 research-grade questions spanning mathematics, physics, chemistry, biology, materials science, and other related fields. Each question is decomposed into multiple sub-problems, requiring the model to possess advanced scientific theories and numerical coding capabilities. During its creation, domain experts conducted problem-by-problem audits, identifying and correcting 263 flaws, among which 192 flaws caused correct solutions to be misjudged. This dataset is primarily used to evaluate the real-world capabilities of large language models in scientific coding, addressing the issue where model capabilities were underestimated due to flaws in the original benchmark.

创建时间:
2026-08-05
原始信息汇总

SciCode-Verified 数据集详情

数据集概述

SciCode-Verified 是一个经过人工验证的科学代码生成基准数据集,是对上游 SciCode 测试基准的独立修正版本。该数据集在保留科学推理挑战的同时,修复了原有基准中存在的矛盾、缺失约定、错误冻结目标、非确定性测试等问题,确保有效解决方案不会被错误拒绝。

核心统计

指标 数值
验证修正总数 262 项
修改的问题数 63 / 64
导致正确代码被拒绝的缺陷 192 / 262
受影响的子问题数 155 / 287
主问题总数 64 个
评分子问题总数 287 个

关键特性

缺陷传播机制

SciCode 子问题具有累积性,整个问题只有在每个评分子问题都通过时才算通过。研究发现,58 个主问题(共 64 个) 存在因单一缺陷规格、冻结答案或测试而传播下游并导致正确解被错误拒绝的情况。

修正效果

在论文的十二模型快照匹配评估中,仅更改基准数据即可使:

  • 子问题准确率从 45.3–60.3% 提升至 83.7–98.3%
  • 整题准确率从 9.4–26.6% 提升至 68.8–92.2%

模型输出协议、评估框架、带背景条件、pass@1 设置和多环境 OR 评分均保持不变。

可复现性保证

所有修正均记录在账本中,从单一数据源传播,并与发布的 JSONL、HDF5 和 manifest 文件进行校验。

评估协议

项目 设定
评估集 64 个主问题 / 287 个评分子问题
采样方式 pass@1
整题评分 仅当所有评分子问题通过时才算通过
上下文 带背景和不带背景分别报告
步骤构建 累积式:第 k 步接收第 1 至 k-1 步的代码
超时时间 每个步骤和环境 1,800 秒
环境漂移 在 2024 或 2025 时代的科学 Python 任一环境正确即通过
完整性 数据集哈希必须与 manifest.json 匹配

数据集内容

  • 排除项:原始测试问题 2 因规格无法确定唯一可验证答案而被排除
  • 许可证:Apache License 2.0
  • 数据分布:大型文件 test_data_cleaned.h5 通过 GitHub Releases 发布,评估器在运行前会验证其哈希值

仓库结构

路径 内容
scicode_verified/ 发布基准、源问题、目标补丁和 manifest
eval_clean/ 可移植生成、评分和重评框架
analysis/ 机器可读的缺陷和评估分析
ledger/ 逐变更溯源和针对性缺陷调查
tools/ 数据集组装和发布验证门控
搜集汇总
数据集介绍
SCICODE-VERIFIED 数据集图片
构建方式
SCICODE-VERIFIED作为对SCICODE基准的全面修正版,其构建过程根植于对全部65个测试问题的事无巨细的领域专家审计。该审计识别出263项缺陷,其中192项会导致正确遵循指令的解决方案被错误拒斥。研究团队逐一修正可确认的缺陷,仅剔除一个无法修复的结构性欠定问题,并确保每项修正均附带理由记录,且经过第二位领域专家的独立复核。修正内容严格限定为补充良定义问题所必需的规范、修复评分逻辑,以及适度收紧过于宽松的测试,从而在维持科学难度的前提下,生成一个可审计、可复现的基准数据集。
使用方法
SCICODE-VERIFIED适用于评估语言模型在真实科学研究问题上的科学编码能力。研究者可通过官方仓库获取修正后的基准文件与评估工具链,其中包含固定版本的NumPy/SciPy双环境评分机制,以消解库兼容性影响。建议采用与原始基准一致的设置(如提供专家背景、pass@1采样)进行对比评估,以精确衡量基准修正带来的增益。此外,数据集附带完整的缺陷分类与修正日志,便于用户理解每项调整的科学依据,并可作为基准质量审计的方法论参考。
背景与挑战
背景概述
SCICODE-VERIFIED是由中国科学技术大学与哈尔滨工程大学的研究团队于2026年构建的科学编码能力基准测试,旨在修正原始SCICODE基准中的缺陷。SCICODE作为衡量语言模型科研编码能力的标准工具,其80个研究级问题涵盖数学、物理、化学、生物学和材料科学等领域。然而,该基准在评估2026年先进模型时出现平台期,最强模型得分徘徊在60%左右,暗示可能存在基准本身的问题。研究团队通过对65个测试问题进行逐题领域专家审计,发现263个缺陷,其中192个导致正确解法被错误拒绝。SCICODE-VERIFIED在修复这些缺陷后,使模型子问题准确率从45-60%提升至84-98%,主问题准确率从9-27%提升至69-92%,重新确立了模型真实能力评估的标准。
当前挑战
SCICODE-VERIFIED面临的核心挑战在于其原始基准的缺陷具有高度专业性和隐蔽性。领域问题挑战包括:子问题的累积依赖性和主问题的全有全无评分机制,使得单个缺陷就能否决整个问题的正确解答,造成基准分数被系统性低估。构建过程中的挑战则更为严峻:78%的压制性缺陷需要深厚的物理学或数学专业知识才能识别和修正,而非简单的文书校对;例如非可复现的黄金答案、过紧的容差、未明确的规范和自相矛盾的规格说明,这些都需要各领域的专家逐个重新推导和验证。此外,修复过程必须保持问题的原始难度,同时确保修正的可审计性和一致性,这要求严格的工作流程和多重独立复核,以避免引入新的偏差或不公。
常用场景
经典使用场景
SCICODE-VERIFIED作为经过全面修正的科学编码基准,其最经典的使用场景在于对前沿语言模型进行科学计算能力的可靠评估。该数据集包含64个可验证的研究级问题,覆盖数学、物理、化学、生物学和材料科学等多个领域,要求模型在理解深奥科学理论的基础上,完成推导、选择数值方法并实现至研究级精度的代码。研究者借助此基准,能够精确度量模型在真实科研工作流中的编码能力,从而判定其是否真正掌握前沿科学理论并将其转化为可运行的数值代码。
解决学术问题
该数据集解决了科学编码评估中基准缺陷导致模型能力被严重低估的学术问题。通过详尽的领域专家审计,修正了263处缺陷,其中78%的评分抑制缺陷需要专门的物理或数学知识才能识别。这一修正使模型在子问题准确率上从45-60%跃升至84-98%,主问题准确率从9-27%提升至69-92%,揭示了先前评估的瓶颈并非模型能力,而是评估工具质量。该数据集的发布为科学编码能力提供了公平、可复现的度量标准,对人工智能在科学发现中的应用评估具有深远影响。
实际应用
在实际应用中,SCICODE-VERIFIED作为校正后的公共标准,被广泛用于政府与国家级实验室的模型评估体系,例如英国AI安全研究所的Inspect评估套件和劳伦斯伯克利国家实验室的常设评估。同时,它也是Artificial Analysis智能指数的重要组成部分,用于对280个模型配置进行公开排名。各大模型开发机构如Google DeepMind、OpenAI、字节跳动等,在其技术报告中采用该基准来验证科学编码能力。此外,该数据集支持无背景信息条件下的模型测试,这一设置更贴近真实科研场景,为前沿模型的应用部署提供了关键的性能参考。
数据集最近研究
最新研究方向
针对科学编码基准缺陷的审计与修正,揭示语言模型在科学编码领域真实能力的提升,并推动基准测试的严谨性与公平性。
相关研究论文
  • 1
    SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models中国科学技术大学·合肥国家实验室; 哈尔滨工程大学; 中国科学院·理论物理研究所 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务