遇见数据集

AdithyaSK/repo2rlenv-commit-runtime

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

repo2rlenv-commit-runtime 是一个由Repo2RLEnv工具生成的强化学习数据集,用于代码和软件工程任务。它将真实的GitHub仓库(包括encode/httpx、gin-gonic/gin等12个开源项目)转换为可验证的强化学习环境。数据集包含52个任务,每个任务基于真实合并的拉取请求或提交,经过质量过滤和信息泄漏去除处理。每个任务提供Harbor格式的规范,包括自然语言指令、黄金补丁(oracle patch)、测试脚本和Dockerfile。奖励信号基于测试执行,通过FAIL_TO_PASS和PASS_TO_PASS测试的通过率计算,用于训练和评估代码生成或修复的AI模型。数据集主要用于强化学习、大语言模型(LLM)训练和软件工程研究,支持端到端的补丁评分和验证。

repo2rlenv-commit-runtime is a reinforcement learning dataset generated by the Repo2RLEnv tool for code and software engineering tasks. It turns real GitHub repositories (including 12 open-source projects such as encode/httpx, gin-gonic/gin, etc.) into verifiable RL environments. The dataset contains 52 tasks, each based on real merged pull requests or commits, with quality filters applied and information-leakage stripped from instruction text. Each task provides a Harbor-shaped specification with natural language instructions, a gold patch (oracle), test scripts, and a Dockerfile. The reward signal is test-execution based, calculated from FAIL_TO_PASS and PASS_TO_PASS test rates, used for training and evaluating AI models for code generation or repair. The dataset is primarily designed for reinforcement learning, large language model (LLM) training, and software engineering research, supporting end-to-end patch scoring and validation.

提供机构:
AdithyaSK
搜集汇总
数据集介绍
AdithyaSK/repo2rlenv-commit-runtime 数据集图片
构建方式
该数据集由Repo2RLEnv框架自动生成,通过从12个知名的开源GitHub仓库(如encode/httpx、gin-gonic/gin等)中挖掘真实的合并拉取请求与提交记录,经过质量过滤与信息泄露清洗后,构建为符合Harbor格式的强化学习任务。每个任务均包含一个自然语言指令、金标准补丁(patch.diff)以及配套的Docker环境与测试脚本,实现了从真实代码变更到可验证强化学习环境的完整转化。
特点
该数据集涵盖52个任务,其核心特点在于提供基于测试执行的密集奖励信号,通过FAIL_TO_PASS与PASS_TO_PASS双重指标评分,生成连续的奖励值(f2p_rate × p2p_rate)供训练使用,同时保留严格的离散化resolved布尔判据。此外,每个任务均经过金标准补丁的oracle验证,确保52/52任务可达到奖励为1.0的基准,并提供了command_resolved与eval_grade等更严格的评估层级,支持研究者根据需求灵活筛选。
使用方法
用户可通过repo2rlenv命令行工具将数据集拉取至本地,并利用Harbor框架进行端到端评分。典型使用流程包括:运行harbor run命令并指定oracle适配器验证金标准补丁的正确性,或配置如claude-code等智能体在实际Docker环境中生成补丁并进行测试。奖励完全基于本地测试执行,无需外部API密钥,输出结果涵盖reward评分、resolved状态及详细的测试用例通过情况,便于用于SWE-bench风格的强化学习训练与评估。
背景与挑战
背景概述
在软件工程与强化学习交叉领域,将真实代码仓库中的合并请求转化为可验证的强化学习环境,是推动代码智能体自主修复与优化能力发展的关键步骤。由HuggingFace社区于近期推出的repo2rlenv-commit-runtime数据集,由AdithyaSK等研究人员基于Repo2RLEnv框架构建,旨在解决大语言模型驱动的代码智能体在真实仓库环境下的训练与评估问题。该数据集从encode/httpx、gin-gonic/gin、pallets/click等12个知名开源仓库中,挖掘了52个经过质量过滤的合并提交任务,每个任务包含自然语言指令、金标准补丁及可执行的Docker测试环境。其影响力在于为强化学习驱动的代码补丁生成提供了一个标准化、可复现的基准,与Harbor评估框架深度整合,为SWE-bench风格的自动评分提供了可靠的数据支撑。
当前挑战
该数据集所应对的领域问题核心在于,现有代码修复数据集多依赖静态文本或人工构造的漏洞场景,缺乏对真实仓库动态变化及测试运行时反馈的建模,使得智能体难以在真实开发流程中泛化。构建过程中面临多项挑战:首先,从海量历史合并提交中筛选信息泄露风险低、任务清晰且可自动验证的样本,涉及复杂的质量过滤与指令去污染处理;其次,每个任务需定制Docker镜像以隔离依赖与环境差异,确保测试执行跨平台一致性;再者,奖励信号需兼顾失败-通过(F2P)与通过-通过(P2P)两类测试用例的平衡,以避免智能体过度拟合于局部模式。此外,部分仓库的测试套件存在固有的不稳定失败案例,导致约9.6%的任务无法达到严格评估标准,这要求研究者在使用时对数据集进行分级筛选,以确保基准评估的公正性。
常用场景
经典使用场景
repo2rlenv-commit-runtime 数据集在强化学习与代码智能的交叉领域中占据着独特的地位。它将来自十二个著名开源仓库的真实合并拉取请求与提交记录,转化为可验证的强化学习环境。该数据集最经典的使用场景在于训练和评估能够理解代码库上下文并自动生成补丁的智能体。每个任务都封装了自然的语言指令、黄金补丁、Docker 环境以及测试脚本,使得智能体可以在隔离的容器中执行代码修改并通过测试执行结果获得奖励信号。这种端到端的可验证框架,使得研究者能够以测试通过率为导向,训练出具备实际代码修复能力的强化学习模型。
衍生相关工作
该数据集的发布衍生了一系列颇具影响力的相关工作。Harbor框架作为该数据集的底层评测基础设施,提供了一套标准化的任务定义与奖励计算规范,推动了可复现的自动化代码修复研究。基于该数据集的训练管线,后续研究探索了将大型语言模型与强化学习策略梯度算法结合的新范式,通过利用或acles验证信号实现了代码智能体的自我迭代。此外,该数据集中针对任务难度的细粒度标注启发了课程学习在程序修复中的应用,研究者开始根据测试通过率和回归保护程度组织训练序列。这些衍生工作共同推动软件工程自动化从简单的模式匹配迈向具备推理与验证能力的智能时代。
数据集最近研究
最新研究方向
基于真实GitHub仓库构建的可验证强化学习环境正成为代码智能体训练的前沿范式。repo2rlenv-commit-runtime数据集通过挖掘真实合并拉取请求与提交,经质量过滤与信息泄漏剥离后生成任务实例,并集成端到端测试执行奖励信号,为大型语言模型在软件工程任务上的强化学习训练提供了高保真的评估基准。该数据集涵盖httpx、gin、requests等12个知名开源项目,总计52个任务,其奖励机制融合FAIL_TO_PASS与PASS_TO_PASS指标,不仅支持SWE-bench风格的分级评估,还通过评估等级标记区分严格评价与训练用途,推动了代码智能体从模拟环境向真实仓库实践的跃迁,为自动化调试、补丁生成等前沿研究注入了可复现的量化训练信号。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务