遇见数据集

SWE-bench-Science

收藏
github2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

SWE-bench Science是一个用于测试编码代理是否能解决科学软件中的工程任务的基准,包含跨越20个科学领域的119个任务。

SWE-bench Science is a benchmark designed to evaluate whether coding agents can solve engineering tasks in scientific software. It comprises 119 tasks spanning 20 scientific domains.

创建时间:
2026-08-14
原始信息汇总

数据集概述:SWE-bench Science

SWE-bench Science 是一个专门用于评估 AI 智能体在真实科学计算代码仓库中执行修改任务能力的基准测试。与普通代码基准不同,该基准聚焦于科学软件特有的“契约”,如单位、坐标系、数值不变量、文件格式语义、物理假设及领域特定的工作流程。它要求智能体在真实仓库中修改代码,同时保持这些科学契约不被破坏。

核心特性

  • 科学契约导向: 任务覆盖数值行为、科学数据模型、文件格式、几何、仿真、成像、光谱学等多个方面。
  • 仓库级任务: 智能体需要在现有的代码、依赖、测试和构建系统环境中工作,而非解决孤立的函数问题。
  • 可重复运行: 任务选择明确、镜像引用固定(通过摘要值),每次运行都会记录其配置,保证可复现性。
  • 灵活的评估框架 (Harness): 支持 Codex、Claude Code、mini-swe-agent 等多种代理框架,在运行时选择,而非内置在每个任务镜像中。
  • 严格的评估边界: 公开的数据集中不包含参考答案补丁、私有验证器测试、凭据或代理轨迹,确保评估的公正性。

数据规模与内容

  • 任务总数: 119 个发布任务,编号从 001119
  • 科学领域: 覆盖 20 个基准级别的科学领域。
  • 默认任务集: 96 个无限制许可证(unrestricted license)的任务。
  • 受限任务集: 23 个需明确选择加入(opt-in)的任务,主要涉及 GPL/LGPL/AGPL 等许可证。
  • 科学知识消融任务集: 91 个具有“科学知识消融”标识的任务。

数据集结构与使用

  • 数据存储: 数据集通过多个渠道分发。
    • 元数据: 可在 Hugging Face 上浏览任务元数据(data/tasks.csv 为规范表)。
    • 运行镜像: 不可变的任务镜像(环境和验证器)存储在 Docker Hub
    • 文档与工具: GitHub 仓库 提供文档、架构说明和运行工具。
  • 任务镜像: 每个任务包含两个镜像:
    • 环境镜像: 包含基线源代码、公共测试夹具、依赖项、编译器和工具。
    • 验证器镜像: 包含干净的评估环境、保留的测试和评分器。
  • 运行流程: 使用 Pier 作为评估运行器,创建临时环境进行代理试验,应用补丁后在验证器镜像中进行干净重建和程序化测试。

快速入门指引

  1. 安装: 需要 Python 3.12+、Docker(支持 linux/amd64)及 uv
  2. 下载: 从 Hugging Face 下载数据集包。
  3. 物化任务: 使用 scripts/materialize.py 脚本选择并生成评估所需的任务文件。
  4. 运行评估: 使用 scripts/run_batch.py 脚本配合选定的代理(如 codexclaude)和模型配置进行测试。支持先运行基础设施冒烟测试(--agent nop)来检查环境配置。

文档与支持

  • 项目提供了详细的文档,包括架构模型、批量运行参考、数据集字段契约和发布清单。
  • 用户可以通过 GitHub Issues 提交错误报告、可复现性问题或任务质量反馈。
  • 排行榜和论文可在 项目网站论文(地址如文所述)上查看。

许可证: 项目工具和元数据使用 MIT 许可证。但任务来源的代码、论文、图表等第三方材料保留其上游许可证,相关审计声明可在 NOTICE.md 文件中查看。

搜集汇总
数据集介绍
SWE-bench-Science 数据集图片
构建方式
SWE-bench Science数据集的构建根植于科学计算软件的特殊性,其契约涵盖单位制、坐标系、数值不变量、文件格式语义及物理假设等维度。该基准精心遴选119个任务,横跨20个科学领域,每个任务均锚定于真实科研代码仓库及固定基线,评估过程在隔离环境中通过程序化验证实施。官方发布严格排除参考补丁、私有测试与代理轨迹,以护佑评测的纯净性,任务选择显式化,镜像引用经摘要锁定,从而确保执行过程的完全可复现。
使用方法
使用时,研究者首先从Hugging Face获取数据集,利用materialize脚本以选择默认、特定或受限许可任务集,具体可凭任务ID或范围参数定制。随后,依托Pier运行器在Docker Hub拉取环境与验证器镜像,执行基础设施烟测确认配置无误,再启动Codex、Claude Code等受支持的代理执行任务。结果以标准化JSON及CSV形式产出,辅以冗余的日志与轨迹文件,便于深入剖析与对照,同时环境变量配置确保了密钥管理的安全隔离。
背景与挑战
背景概述
随着科学计算软件在科研领域的广泛应用,其代码维护与功能扩展对软件智能体提出了远超常规软件开发的要求。SWE-bench-Science数据集由OpenMOSS团队于2025年构建,旨在评估智能体在真实科学计算仓库中解决问题的能力。该基准涵盖119个任务,分布于20个科学领域,特别关注单位制、坐标系、数值不变量、文件格式语义等科学契约的保持。其核心研究问题在于,智能体能否在修改代码的同时不破坏领域特有的约束与假设。通过提供可复现的评估环境和严格的结果验证机制,SWE-bench-Science为科学计算领域的自动化程序修复研究树立了新标杆,对促进AI在科研软件工程中的应用具有重要意义。
当前挑战
SWE-bench-Science所面临的挑战多维且深刻。首先,其领域问题极具特殊性,科学软件中隐含的物理假设、数据模型与工作流契约往往在常规代码基准中无从体现,智能体需具备深厚的领域知识方能正确修改代码而不破坏这些无形约束。其次,构建过程中挑战重重,例如需从80余个候选仓库中筛选出满足条件的问题实例,确保每个任务都有明确的基础版本与可验证的测试用例;同时,需处理不同开源许可协议的合规性,保证基准数据与镜像的可分发性。此外,构建高度可复现的评估环境,涵盖依赖锁定、镜像不可变性与运行配置记录,并严格划定评测边界,避免测试泄露,均是确保基准有效性的关键难题。
常用场景
经典使用场景
在科学计算与工程软件研发的浩渺图景中,SWE-bench-Science数据集以其独树一帜的基准测试视角,为人工智能辅助代码生成与自动程序修复领域开辟了崭新篇章。此数据集的经典使用场景聚焦于评估代码代理在真实科学计算仓库中的端到端任务完成能力,涉及跨度达二十个科学领域的119项任务。研究者常借助该基准考察代理能否在保留单位制、坐标系、数值不变量等隐式科学契约的前提下,敏捷地导航既有代码库、精准定位缺陷并生成有效补丁。其评估流程依托不可变Docker镜像在洁净环境中实现可复现的编程式验证,不仅衡量生成代码的表面正确性,更深入探索其是否符合项目深层规范与复杂数据处理流程,从而为标准代理能力评鉴提供了兼具深度与广度的严苛试验场域。
解决学术问题
在人工智能与软件工程交叉的学术前沿,通用代码基准常因忽视科学软件特有的量化约定而显露短板。SWE-bench-Science数据集精准地填补了这一关键空缺,系统性地解决了如何客观评判代码代理对科学领域专精知识掌握度与多层级软件契约遵循度的学术难题。其具备的严格评估边界与科学知识消融设计,使研究者能够剥茧抽丝,解析模型性能差异背后知识渊源的微妙构成。通过对跨域、多语言的真实库任务集进行标准化度量,该基准不仅引领了面向专业垂直领域的代码智能评估范式革新,其发布的可复现工具链与架构亦为后续构建高置信度基准测试树立了圭臬,在推动AI for Science软件自动化进程与探索机器认知科学计算深层逻辑上具有举足轻重的意义与影响。
实际应用
超越学术象牙塔的纯粹理论探索,SWE-bench-Science数据集在现实世界的科学软件工程实践中展现出深厚的应用潜力和多元的落地场景。在计算生物、天文物理及高能化学等研究机构中,基于此基准衍生的智能代理可被部署于持续集成管道内,辅助科研人员自动修复模拟或数据分析脚本中的错误,显著缩减调试周期并提升科研产出效率。面向复杂数值计算库与专用文件格式解析器,该数据集训练的模型能够协助开发者在不破坏既有数值精度与环境适配性的前提下,高效迭代功能或重构遗留系统。此外,借助其支持多种代码代理与网关配置的灵活性,工业界可便捷地在内部流水线中嫁接该评估框架,实现对私有科学代码维护自动化水平的基准化考核,从而驱动研发效能的整体跃迁。
数据集最近研究
最新研究方向
SWE-bench-Science数据集的最新研究方向聚焦于评估人工智能代理在真实科学计算软件仓库中维护领域特定契约的能力,涵盖单位系统、坐标系、数值不变量、文件格式语义及物理假设等复杂约束。该基准包含119项任务,跨越20个科学领域,强调在动态重构代码时保持科学正确性的挑战。前沿探索涉及利用不可变Docker镜像和程序化验证技术构建可复现的评估环境,支持多种代理框架如Codex、Claude Code和mini-swe-agent,并通过Harbor兼容的Pier运行器实现灵活部署。研究重点在于推动智能体从生成表面正确的代码向深度理解科学领域知识转变,促进人工智能在计算科学、高能物理、基因组学等领域的可靠应用。通过严格的许可证分类和知识消融测试,该工作为科学软件开发中的自动化缺陷修复和质量保障树立了新标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务