遇见数据集

SWE-bench-Science

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

SWE-bench Science是一个用于评估编码代理在科学计算软件工程任务上表现的基准数据集。该数据集包含119个来自20个不同科学领域的任务,每个任务均提供隔离的运行环境和独立的程序验证器。数据集旨在衡量编码代理解决真实科学计算仓库中软件工程问题的能力。数据以CSV文件形式提供,每个样本包含任务ID、科学知识消融标记、标题、领域、编程语言、仓库URL、基础提交哈希、源代码许可证、许可证族标记、受限许可证标记、许可证门控、材料许可证、材料许可证来源、材料限制、材料门控、材料清单SHA256、材料来源、限制原因、环境镜像、验证器镜像、镜像平台、任务路径、状态等字段。默认选择包含96个无限制许可证的任务,另有23个受限制任务(其中18个属于GPL/LGPL/AGPL家族)。数据集还提供了91个任务的科学知识消融子集。该数据集适用于科学计算领域的编码代理评估、软件工程任务解决、长期推理能力测试等场景。数据集使用MIT许可证,但部分任务包含的第三方材料保留其原始许可证。

SWE-bench Science is a benchmark dataset for evaluating coding agents on scientific computing software engineering tasks. It contains 119 tasks from 20 different scientific domains, each with an isolated runtime environment and an independent program verifier. The dataset measures the ability of coding agents to solve software engineering problems in real scientific computing repositories. Data is provided in CSV format, with each sample including fields such as task ID, science knowledge ablation tag, title, domain, programming language, repository URL, base commit hash, source code license, license family tag, restricted license tag, license gating, materials license, materials license source, materials restrictions, materials gating, materials manifest SHA256, materials source, restriction reason, environment image, verifier image, image platform, task path, status, etc. The default selection includes 96 tasks with unrestricted licenses, plus 23 restricted tasks (18 of which are GPL/LGPL/AGPL family). A subset of 91 tasks with science knowledge ablation is also provided. The dataset is suitable for coding agent evaluation in scientific computing, software engineering task solving, long-term reasoning capability testing, etc. The dataset is licensed under MIT, but third-party materials in some tasks retain their original licenses.

创建时间:
2026-08-14
原始信息汇总

SWE-bench Science 数据集概述

基本信息

  • 数据集名称: SWE-bench Science
  • 语言: 英语
  • 许可证: MIT
  • 规模: 小于1000条样本
  • 标签: 代码、软件工程、科学计算、编码代理、基准测试、长时间任务

数据集内容

SWE-bench Science 是一个用于评估编码代理在科学计算软件工程任务上表现的基准数据集,包含来自20个科学领域的119个任务,每个任务配备独立的环境和程序化验证器。

关键数据指标

指标 数值
任务总数 119
科学领域 20
默认选择(无限制许可任务) 96
受限选择 23
GPL/LGPL/AGPL系列任务 18
环境镜像 119个Docker Hub镜像
验证器镜像 119个Docker Hub镜像
镜像平台 linux/amd64

科学知识消融拆分

  • science_knowledge_ablation 列为 true 的任务共91个,用于消融实验
  • 这些任务的发布ID为:002-082084086090097-101111114
  • 其余所有行的该列为 false

文件结构与功能

路径 用途
data/tasks.csv 人类可读的任务表格(唯一权威数据源)
data/statistics.md 生成的发布统计信息
manifests/tasks.jsonl 规范化机器可读发布清单
manifests/release_provenance.json 权威配置与验证来源记录
selections/ 可复现的任务选择集
tasks/task_NNN/ 精简的Harbor/Pier任务包
tools/ 物化、提供商、批处理和汇总工具
docs/run-batch.md 完整的提供商和批处理运行参考

环境镜像包含基线源代码、公共测试夹具、依赖项和编译器;验证器镜像包含保留测试和评分器。数据集不包含参考答案补丁、凭证、代理轨迹或私有验证器测试。

使用与运行

快速开始

  1. 通过 hf download 命令下载数据集到本地
  2. 使用 python3 tools/materialize.py 物化任务(支持默认选择、指定任务ID或范围)
  3. 通过 pier run 命令运行评估(支持 Claude Code、mini-swe-agent、Codex 等代理)

受限许可说明

  • 23个任务因包含GPL/LGPL/AGPL系列代码、学术非商业来源或受限第三方数据而被排除在默认选择之外
  • GPL/LGPL/AGPL系列任务ID为:003, 020, 021, 023, 032, 057, 066, 074, 075, 082, 083, 084, 085, 096, 097, 098, 100, 118
  • 任务 019, 026, 035, 101, 102 因其他原因受限
  • 需要通过 --allow-restricted-licenses 标志显式选择受限任务,且不替代上游许可证义务

许可与归属

  • 数据集卡片、发布元数据和辅助工具使用MIT条款
  • 任务源代码、论文、图表、测试夹具及其他第三方材料保留其各自上游许可证
  • 数据集运行时独立于GitHub,下载后使用本地任务包及Docker Hub上记录的镜像摘要进行物化和评估
搜集汇总
数据集介绍
SWE-bench-Science 数据集图片
构建方式
SWE-bench Science数据集的构建根植于科学计算领域的开源软件工程实践,从20个科学领域的仓库中精选119个真实任务,每个任务均包含隔离的执行环境与独立的程序化验证器。构建过程严谨遵循可复现性原则,将所有任务元数据、环境镜像摘要及验证器配置统一封装于标准化清单中,确保每项任务具备独立的Docker镜像与验证器镜像,并通过不可变摘要锁定运行时环境。数据集还依据许可证类型进行精细筛选,划分出默认的96项无限制许可任务与需显式授权的受限子集,同时为科学知识消融实验特设91项子集,体现了多样性与合规性的双重考量。
特点
此数据集的核心特色在于其多维度精细设计与科学知识导向的评估范式。119项任务横跨20个科学领域,覆盖天文学、生物学、物理学等学科,突显了跨学科的广度与深度。每项任务配备完全隔离的环境及独立的验证器,确保评估过程的纯净性与客观性;验证器包含保密的测试集与评分逻辑,杜绝了信息泄露。数据集特别引入科学知识消融列,支持对模型科学背景知识的敏感性分析,为理解模型在科学计算问题上的推理能力提供了独特视角。此外,严格的许可证管理机制与详尽的来源追踪记录,保障了数据集合规性与学术严谨性。
使用方法
使用SWE-bench Science进行模型评估需遵循一系列标准化流程。首先通过HuggingFace CLI或Pier框架下载数据集,随后利用Python工具materialize.py按需筛选任务子集,既可选择默认的96项无限制任务,也可显式启用受限许可证任务。评估环节依托Pier框架,支持多种智能体如Claude Code、mini-swe-agent或Codex网关,用户需配置对应的环境变量与凭证。运行命令可定制并发数、尝试次数及超时参数,结果自动生成细粒度的JSON与CSV汇总,便于深入分析。对于科学知识消融实验,则需调用特定的任务ID列表并加入许可确认旗标,以确保实验的完整性。整个过程强调可复现性与灵活性,适配不同研究需求。
背景与挑战
背景概述
SWE-bench-Science数据集由OpenMOSS团队于近期创建,旨在评估编码代理在科学计算软件工程任务中的性能。该数据集包含119个任务,跨越20个科学领域,每个任务均配有隔离的环境和独立的程序化验证器,确保了评估的公正性与可重复性。其核心研究问题在于探索编码代理如何应对科学计算领域的复杂、多步骤软件工程挑战,从而推动科学计算自动化的发展。该数据集的发布为科学计算与人工智能的交叉领域提供了宝贵的基准资源,对促进编码代理在实际科研场景中的应用具有深远影响。
当前挑战
该领域面临的主要挑战包括:科学计算任务通常涉及复杂的依赖关系、专业领域知识以及严格的可重复性要求,而现有编码代理往往缺乏对科学计算范式的深入理解,导致其在处理此类任务时性能不佳。在构建过程中,团队需处理许可证限制(如GPL/LGPL/AGPL)、第三方材料合规性及环境隔离问题,确保每个任务的可复现性与安全性。此外,构建119个独立Docker环境及验证器,并确保它们在无网络依赖下稳定运行,也是技术上的重大挑战,这考验了数据集的工程化能力与长期维护的可行性。
常用场景
经典使用场景
SWE-bench-Science专注于评估编码代理在科学计算软件工程任务上的能力,其经典使用场景是作为基准测试框架,用于衡量自动化程序修复与代码生成模型在处理真实科学计算仓库中的问题解决表现。该数据集包含119个跨20个科学领域的任务,每个任务配备隔离的Docker环境与独立的验证器,支持对模型的端到端评估。研究者通过Pier评估框架或Harbor任务格式,能够复现标准化的实验流程,对诸如Claude Code、mini-swe-agent等编码代理进行性能比较,从而推动科学计算领域自动化编码技术的进步。
解决学术问题
该数据集精准解决了科学计算软件工程中缺乏高真实性、可复现性基准的学术困境。以往的软件工程基准多集中于通用编程任务,忽视了科学计算领域中对数值精度、依赖库兼容性及性能优化的特殊要求。SWE-bench-Science通过提供源自真实科学仓库的119个任务,覆盖生物信息学、物理模拟、数据解析等20个领域,并隔离了环境依赖与验证器,使得研究能够严谨地评估编码代理在复杂科学代码维护中的能力,填补了该方向系统化评估的空白,为可复现的智能编码研究奠定了数据基础。
衍生相关工作
SWE-bench-Science的发布催生了一系列相关研究工作,主要集中在科学编码代理的鲁棒性分析与知识消融实验。基于其提供的science_knowledge_ablation列,研究者可以设计对照实验,探究领域知识注入对模型解决科学任务的影响,从而促进领域自适应编码模型的研发。此外,该数据集的许可证分级设计(如GPL家族任务与限制性许可任务)激发了对开源合规与数据重用的学术讨论,衍生了关于基准构建伦理与评估公平性的方法论研究。这些工作共同丰富了科学计算与AI辅助编程交叉领域的理论基础与实践指南。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务