遇见数据集

swe-task-forge-environments

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

swe-task-forge environments 是一个用于软件工程任务的 Docker 环境数据集。每个环境对应一个独立的 Docker 镜像,以 digest(摘要)命名,并保存在单独的压缩包中(格式为 <env_id>/image.tar.gz)。用户可以通过 `docker load` 命令加载这些镜像来使用。数据集包含 19 个环境,每个环境关联一个特定的软件仓库(repo),表格中提供了 env_id、repo 和 digest 三个字段。该数据集主要面向软件工程领域的研究与开发任务,例如代码测试、缺陷修复、性能评估等,借助 Docker 容器提供隔离、可复现的运行环境。

swe-task-forge environments is a Docker environment dataset for software engineering tasks. Each environment corresponds to an independent Docker image, named by its digest, and saved in a separate compressed package (format: <env_id>/image.tar.gz). Users can load these images using the `docker load` command. The dataset contains 19 environments, each associated with a specific software repository (repo), and the table provides three fields: env_id, repo, and digest. This dataset is primarily aimed at research and development tasks in software engineering, such as code testing, bug fixing, and performance evaluation, providing isolated and reproducible runtime environments via Docker containers.

创建时间:
2026-09-05
原始信息汇总

swe-task-forge environments 数据集概述

基本信息

  • 许可证:其他(other)
  • 标签:Docker、软件工程(software-engineering)

数据集内容

该数据集包含为软件工程任务环境预构建的 Docker 镜像,每个环境对应一个已保存的镜像文件,并以镜像摘要(digest)命名。

加载方式:通过命令 docker load < <env_id>/image.tar.gz 将镜像加载到 Docker 中。

环境列表

数据集共包含 19 个不同的软件工程环境,涉及的代码仓库如下:

仓库名称 摘要(digest)
2aronS/Duel-Agents sha256:d998ffc6606a
bheisler/iai sha256:14565f87a5c4
blahgeek/emacs-lsp-booster sha256:ec16831d975f
bvaughn/react-window-infinite-loader sha256:3a6f78c290c4
darkrishabh/agent-skills-eval sha256:67b72329ef49
ekzhang/bore sha256:ed0386c01261
ekzhang/crepe sha256:b0ffa0340859
GrahamCampbell/Result-Type sha256:a774bd954700
hidehalo/nanoid-php sha256:a2b9217e7725
hustcc/mcp-mermaid sha256:aadceead04fd
jshttp/basic-auth sha256:c2a5c00bf7c0
lukeed/dequal sha256:8b5d2287d0c1
lukeed/dset sha256:ca37e164ccbb
lukeed/trouter sha256:ffe039fd47c3
markdown-it/markdown-it-container sha256:57ffae7be604
qcod/laravel-gamify sha256:0de5a60a7304
Rich-Harris/agadoo sha256:f323dde89434
sindresorhus/ts-extras sha256:1f9af757a736
sqids/sqids-php sha256:ab44d7068f63

使用方式

每个环境以 env_id 作为标识符(格式为 仓库所有者-仓库名@摘要前缀),镜像文件存储在对应的目录中,需使用 Docker 命令进行加载后方可使用。这些环境可用于各类软件工程相关的任务,如代码测试、运行与调试等。

搜集汇总
数据集介绍
swe-task-forge-environments 数据集图片
构建方式
本数据集由一组预先配置的软件工程环境镜像构成,每个镜像对应一个特定的开源项目仓库,并以Docker镜像形式保存,通过`docker load`命令加载使用。环境标识符采用仓库名称与提交哈希拼接的格式,确保唯一性与可追溯性。镜像按环境ID组织,每个环境包含项目运行所依赖的完整软件栈,为软件工程任务提供了标准化、隔离化的运行环境。构建过程将项目快照与依赖项封装为单一镜像文件,便于分发与复现。
特点
该数据集的核心特点在于其高度集成性与环境一致性。每个镜像均为特定仓库在特定提交状态下的完整可运行环境,实现了环境与代码的深度绑定,使得实验结果在不同机器上可无缝复现。涵盖项目类型多样,从代理评估、性能基准到前端组件库、后端服务等,体现了跨语言、跨框架的广泛适用性。以摘要形式命名,简化了版本管理,提升了数据集的整体可用性与可扩展性。
使用方法
使用该数据集时,应首先依据目标环境ID查找到对应的镜像文件,执行`docker load < <env_id>/image.tar.gz`将其导入本地Docker守护进程,随后可通过`docker run`启动并进入交互式或命令执行模式,在环境中运行代码、执行测试或进行调试。此流程适合作为软件工程自动化评估、持续集成开发任务以及性能对比研究的统一底层平台,为研究者提供了便捷、可重复的实验操作途径。
背景与挑战
背景概述
随着大型语言模型在软件工程任务中的广泛应用,评估其代码生成与修复能力已成为研究热点。swe-task-forge-environments数据集由软件工程智能体研究团队构建,其核心目标在于为多语言、多框架的代码仓库提供标准化的容器化运行环境。该数据集收录了涵盖Python、PHP、JavaScript等语言的20个开源仓库的完整镜像,每个环境均以Docker镜像形式封装了依赖库与测试套件,使得研究者在无需手动配置复杂依赖的前提下,即可复现软件缺陷修复任务。该数据集发表于2025年,其设计理念与SWE-bench等基准测试相辅相成,为软件工程智能体的端到端评估提供了可复现的基座,推动了自动化缺陷修复领域研究进展。
当前挑战
该数据集构建过程中面临的首要挑战在于环境复现的复杂性与资源开销:不同仓库的依赖版本要求差异显著,部分旧版依赖在现代编译环境中难以构建,需针对每个仓库定制构建脚本,并确保Docker镜像体积与构建时间的平衡。此外,多语言生态环境的兼容性问题突出,例如PHP与Laravel框架的版本冲突、C++工具链的差异性等,均需手动干预解决。在领域问题层面,该数据集致力解决的软件工程智能体评估中环境隔离与可重复性问题,目前仍受限于镜像存储的庞大体积(单个镜像可达数GB)及运行时资源需求,导致大规模并行评估的成本高昂,如何优化镜像分层与缓存机制以降低推理开销,是本数据集未来的重要挑战方向。
常用场景
经典使用场景
swe-task-forge environments数据集为软件工程领域的人工智能研究提供了高度仿真的评测环境集合,每个环境封装了独立软件的源码、依赖及运行配置,通过Docker镜像形式实现即取即用的标准化部署。其经典用途集中在软件工程智能体的能力评估,研究者可将代码生成、缺陷修复或多文件编辑等任务映射至具体仓库,在隔离的容器环境中验证模型在真实代码库上的操作效能与鲁棒性。这种设计打破了传统benchmark依赖静态数据集的局限,使模型评测能够深入动态、多模块的工程语境,进而为软件工程任务智能体的开发与迭代设定更贴近产业实践的基准。
衍生相关工作
围绕swe-task-forge environments的构建理念,衍生出了一系列相关研究与应用工作,包括基于该环境集开发的软件工程智能体能力基准(如SWE-bench的扩展)、面向代码仓库问题的强化学习训练框架,以及查询代码变更上下文的检索增强生成系统。进一步地,研究者利用这些镜像环境探索了多代理协作机制、自主修复策略及持久的代码库记忆模块,推动了以Docker为通用接口的软件工程评测协议逐渐成型。该数据集也促成了若干公开挑战和竞赛活动,在软件工程AI社区中起到了联结学术研发与工业实践的关键作用,相关成果正向更多编程语言与更复杂工程任务延伸。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程智能体(AI agents)的实证评估,为每个真实开源项目提供可复现的Docker镜像环境,以支撑任务驱动(task-oriented)的自动化编码、缺陷修复与代码理解研究。前沿方向涵盖基于大语言模型的自主软件开发、智能体在复杂代码库上的导航与操作能力、以及多智能体协作范式(如Duel-Agents)的性能对比。此资源旨在提升实验的可重复性和可信度,推动构建更健壮的软件工程智能体基准,对自动化编程、持续集成与开源生态具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务