遇见数据集

PrimeIntellect/Multi-SWE-RL-Verified

收藏
Hugging Face2026-07-08 更新2026-07-22 收录
官方服务:

资源简介:

Multi-SWE-RL-Verified是一个经过严格验证的软件工程强化学习数据集子集,基于ByteDance的Multi-SWE-RL数据集(PrimeIntellect/Multi-SWE-RL-Reupload)。该数据集包含2,232行数据,覆盖C、Go、Java、JavaScript、Rust和TypeScript六种编程语言,确保每行数据都能产生端到端的干净奖励信号,适用于训练强化学习模型。数据集通过金补丁验证、移除无编辑调试器通过的行以及低并发重测等过滤步骤,提高了数据质量,并移除了C++语言的数据。它专为multiswe_v1任务集设计,用于代码生成和软件工程任务,包含训练分割。数据集还添加了验证元数据列,如validation_reward_p1/p2,以便审计和进一步分析。

Multi-SWE-RL-Verified is a gold-patch-validated subset of ByteDances Multi-SWE-RL dataset (PrimeIntellect/Multi-SWE-RL-Reupload). It contains 2,232 rows across C, Go, Java, JavaScript, Rust, and TypeScript that produce a clean reward signal end-to-end, making it suitable for reinforcement learning training. The dataset applies rigorous filtering: wholesale removal of C++ data, two independent gold-patch validation passes, exclusion of rows that pass without edits via a debugger, and modest-concurrency retesting to ensure reliability. It serves as the default dataset for the multiswe_v1 taskset, targeting software engineering and code generation tasks, with a train split. Additional metadata columns (e.g., validation_reward_p1/p2) are included for auditability and downstream use.

提供机构:
PrimeIntellect
搜集汇总
数据集介绍
PrimeIntellect/Multi-SWE-RL-Verified 数据集图片
构建方式
Multi-SWE-RL-Verified 数据集源自 ByteDance 推出的 Multi-SWE-RL 原始语料库,由 PrimeIntellect 团队基于严格的验证流程精心筛选而成。在构建过程中,研究团队首先彻底丢弃了 C++ 语言的全部数据,因其在金补丁验证中无一通过。随后,通过独立的 SolveEnv 环境执行两轮金补丁验证,仅保留两次验证奖励值均为 1.0 的样本。为杜绝奖励作弊,团队移除了未做任何编辑即可得满分的数据行。最后,对高并发验证中存疑的样本进行低并发重测,剔除确定性失败的条目。经过这四重严苛过滤,最终从 4,703 行原始数据中精选出 2,232 行高质量可用样本。
使用方法
使用 Multi-SWE-RL-Verified 数据集时,用户需首先安装配套的 multiswe_v1 任务集环境,该环境集成于 research-environments 框架中。通过执行简单的命令行指令即可完成环境配置,随后可借助 verifiers 工具库进行端到端评估。典型的使用方式为在命令行中指定模型并运行评估脚本,例如通过 'uv run eval --taskset.id multiswe_v1 -m <your-model> -n 100 -r 4' 命令启动多轮次的模型评测。此外,数据集附带了详尽的复现脚本与验证日志,用户可参照官方流程进行迁移学习或奖励模型训练,将其无缝嵌入到强化学习流水线中。
背景与挑战
背景概述
在软件工程领域,强化学习(RL)正逐步成为驱动自主代码修复与智能体能力跃升的关键范式。然而,高质量、可验证的RL训练数据长期匮乏,尤其缺少跨语言且奖励信号纯净的基准。由字节跳动Seed团队联合PrimeIntellect等机构于2025年构建的Multi-SWE-RL-Verified数据集,正是为此而生。该数据集聚类于从Multi-SWE-RL上游数据中经严苛验证流程筛选出的2,232条实例,覆盖C、Go、Java、JavaScript、Rust及TypeScript六种语言,旨在为多语言软件工程环境中的RL智能体训练提供可靠且可复现的奖励信号。作为multiswe_v1任务集的默认数据集,它通过剔除C++等不可修复样本并实施多重验证,显著提升了数据质量,在软件工程RL研究中树立了新的基准标杆,推动了领域向可信赖训练数据的演进。
当前挑战
该数据集的核心挑战在于解决软件工程RL中的数据可验证性与奖励信号噪声问题。传统数据集中,大量实例因环境配置失败、测试不通过或黄金补丁无法应用而导致奖励信号失真,引发奖励黑客行为。构建中,项目团队面临多重技术难关:C++语言的全部449个实例因评分镜像损坏而无一通过验证,被迫整体剔除;需设计两轮独立验证流程,逐一排除设置失败、超时及确定性故障的样本;还需对无编辑即可得高分的样本进行过滤,以防范奖励利用漏洞。此外,高并发环境下的测试退化问题迫使团队进行低并发重测,确保每一行数据的奖励信号纯净且审计可追溯,最终从4,703行中提炼出2,232行高质量子集。
常用场景
经典使用场景
在软件工程与强化学习交叉领域,Multi-SWE-RL-Verified被广泛用作验证代码智能体在多语言环境下自动化修复问题的基准数据集。其经典使用方式为,研究者利用该数据集中经过黄金补丁验证的2,232个跨语言实例,评估语言模型驱动的智能体在C、Go、Java、JavaScript、Rust及TypeScript等编程语言中的漏洞定位与补丁生成能力。通过统一的奖励信号框架,该数据集为端到端的奖励模型训练与策略梯度优化提供了干净可靠的反馈信号,成为衡量强化学习方法在复杂软件工程任务上泛化能力的标准试验场。
解决学术问题
该数据集直面的核心学术挑战在于,以往用于训练软件工程智能体的强化学习基准普遍存在奖励信号噪声高、验证流程不透明的问题,导致模型容易陷入奖励黑客行为或过拟合特定环境。Multi-SWE-RL-Verified通过双通黄金补丁验证、无编辑调试器过滤以及并发退化检测等严谨流程,剔除了超过半数不可靠样本,有效解决了训练数据中虚假成功信号污染的问题。此举显著提升了学术研究中关于代码智能体泛化性评估的可信度,为构建能够在真实世界软件仓库中可靠运作的自主修复系统奠定了数据基础。
实际应用
在实际工程场景中,该数据集支撑着自动化缺陷修复流水线的开发与部署,尤其适用于大型代码仓库的持续集成与持续交付体系。基于此数据集训练的强化学习智能体,能够被集成到开发者的工作流中,自动解析issue描述、定位缺陷代码段,并生成经过测试验证的补丁。企业可将该数据集作为验收标准,检验其内部代码大模型在多种编程语言上的补丁生成质量,从而降低人工代码审查成本,加速软件迭代周期。此外,该数据集还服务于教育领域,为学习软件工程与强化学习结合的学生提供标准化的实战练习环境。
数据集最近研究
最新研究方向
在软件工程与强化学习的交叉前沿,Multi-SWE-RL-Verified数据集通过严苛的金色补丁验证机制,为多语言代码修复任务提供了高置信度的强化学习训练信号。该数据集从原始的4703条记录中精炼出2232条高质量样本,剔除了C++语言中因环境失效导致的零通过率问题,并创新性地实施了双重独立验证流程与无编辑作弊过滤器,有效防止了奖励黑客现象。当前,该方向聚焦于构建端到端可执行的代码智能体训练基准,通过精确的奖励信号设计驱动模型在真实软件工程场景中实现自主问题解决能力,其影响力已延伸至AGI探索领域,为构建具备人类级代码理解与修复能力的自主系统奠定了数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务