exp_rpt_issue-verified
收藏官方服务:
资源简介:
laion/exp_rpt_issue-verified 是一个 Harbor 任务二进制数据集,专门用于软件工程(SWE)领域的自动化错误修复任务。该数据集包含 4,830 个自包含的任务,每个任务模拟 GitHub issue 风格的问题报告,要求智能体对 `/app/` 目录下的单个文件进行编辑以修复错误。数据集遵循规范的 Harbor/TaskTrove 任务模式,包含两列数据:`path`(字符串类型,表示文件路径)和 `task_binary`(gzip tar 压缩格式,包含任务内容)。该数据集是 `DCAgent/exp_rpt_issue` 的一个未更改镜像。每个任务都配备了其原始的确定性 pytest 验证器(`tests/test_issue.py`,由 `tests/test.sh` 脚本运行),用于对智能体的就地修复进行测试,测试结果(通过/失败)直接映射为二元奖励(1/0)。该数据集的一个关键特点是未使用 LLM 作为评判器,而是有意保留了基于代码的 pytest 测试作为验证标准,确保了评估的确定性和可重复性。该数据集适用于训练或评估基于强化学习的代码修复智能体,特别是在需要确定性验证的软件工程错误修复场景中。
提供机构:
LAION eV创建时间:
2026-07-19
原始信息汇总
数据集概述
- 数据集名称:
laion/exp_rpt_issue-verified - 许可证: Apache-2.0
- 任务类别: 文本生成 (text-generation)
- 标签: agent, harbor, reinforcement-learning, llm-judge
数据集构成
- 任务数量: 4,830 个任务
- 数据列: 包含
path(字符串类型) 和task_binary(gzip tar 格式) - 数据模式: 遵循规范的 Harbor / TaskTrove 任务模式
任务内容与格式
- 任务类型: 自包含的软件工程 (SWE) 错误修复任务,采用 GitHub Issue 风格
- 操作方式: 智能体编辑
/app/目录下的单个文件以修复问题 - 来源: 该数据集是
DCAgent/exp_rpt_issue的一个镜像,内容未作任何更改
验证机制
- 验证器: 每个任务保留其原始的确定性 pytest 验证器
- 验证脚本:
tests/test_issue.py通过tests/test.sh运行 - 验证逻辑: 在智能体完成原地修复后执行真实测试,根据测试结果分配奖励(通过为 1,失败为 0)
- 验证脚本:
- 特点: 不使用 LLM 作为评判标准,而是有意保留了 pytest 测试作为最终验证手段
搜集汇总
数据集介绍

构建方式
该数据集源自Harbor任务框架,由镜像自DCAgent/exp_rpt_issue的4,830个任务构成,遵循规范的TaskTrove任务架构。每个任务以GitHub问题风格呈现,专注于软件缺陷修复场景,要求智能体在/app/目录下对单个文件进行编辑修复。数据集中保留了原始确定性pytest验证器,通过tests/test_issue.py脚本与tests/test.sh驱动执行,依据测试通过与否映射为奖励信号1或0,完全摒弃了基于大语言模型评判的方式。
特点
数据集最显著的特点在于采用确定性的pytest测试作为客观评判标准,而非依赖可能产生偏差的大语言模型评判。每个缺陷修复任务均包含完整的测试环境,能够准确检测智能体修改后的代码是否通过测试,从而提供可靠的二元奖励信号。同时,数据集保持着与原始来源的一致性,未做任何改动,确保了数据纯净性和可复现性。
使用方法
该数据集适用于强化学习场景中的智能体训练与评估,特别是软件工程领域的自动缺陷修复任务。用户可加载path和task_binary两列数据,每个任务包含完整的代码仓库和测试脚本。使用时需在容器环境中执行,智能体需针对特定问题在/app/目录下进行文件修改,随后运行tests/test.sh脚本,根据测试结果获取奖励信号,用于强化学习策略的优化与迭代。
背景与挑战
背景概述
在智能体与软件工程交叉领域中,自动化缺陷修复任务对强化学习训练数据的质量与可验证性提出了严苛要求。laion/exp_rpt_issue-verified数据集由LAION团队于2024年创建,源于Harbor项目与TaskTrove任务架构,核心聚焦于基于GitHub问题风格的软件缺陷修复任务。该数据集包含4,830个自包含任务,每个任务均以确定性pytest验证器替代大语言模型评判,确保奖励信号的客观性与可复现性。作为DCAgent/exp_rpt_issue的镜像副本,该数据集在强化学习场景中扮演基准角色,为智能体提供无偏的二元奖励(成功/失败),显著推动了自动化代码修复与AI Agent决策能力的研究进展。
当前挑战
当前领域面临的核心挑战在于如何构建兼具规模与验证可信度的任务集合。数据集中每个任务需在单一文件修改约束下复现真实GitHub缺陷场景,这对任务设计精度提出极高要求;同时,传统LLM评判方法存在奖励信号模糊与评判偏移问题,而本数据集虽有pytest验证器提供确定性奖励,但面对复杂程序状态或非确定性测试环境时,测试用例可能无法覆盖全部修复路径。构建过程中,数据筛选与镜像验证需在保持原始任务逻辑一致性的前提下,去除冗余或歧义任务,这对数据质量控制和计算资源消耗构成双重挑战。
常用场景
经典使用场景
在软件工程与强化学习交叉领域,该数据集被广泛用于训练自主代码修复智能体。其包含的4,830个任务均以GitHub Issue形式呈现,要求智能体通过单文件编辑修复缺陷,并利用确定性pytest验证器进行奖励信号计算。这一设计使得它成为离线策略强化学习、模仿学习以及偏好对齐研究的理想基准,尤其在需要精确二元奖励信号(修复成功与否)的场景中,避免了LLM作为评判者带来的主观偏差。
衍生相关工作
该数据集衍生了多项关键研究工作,包括基于离线偏好数据的奖励模型训练(如DPO、ORPO),以及结合过程监督的强化学习算法改进。其确定性验证机制启发了《OpenThoughts-Agent》框架中的任务设计范式,促进了多任务泛化与跨仓库迁移学习的探索。同时,由于数据集中保留了原始环境配置,它被用作对比性实验的重要基准,推动了对Agent探索-利用平衡、样本效率提升等课题的深入分析。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程中基于智能体的自动化缺陷修复任务,其前沿研究方向在于利用强化学习与确定性验证器(如pytest)构建无需大语言模型评判的闭环反馈系统。通过将GitHub议题风格的bug修复转化为单文件编辑任务,并结合Harbor协议与TaskTrove任务架构,该数据集为可复现的智能体决策优化提供了标准化基准。当前热点事件中,基于确定性测试的奖励信号设计正成为提升代码修复鲁棒性的关键路径,它有效避免了LLM评判可能引入的随机性与偏见。这一方向不仅推动了强化学习在真实软件维护场景中的应用,还为自动化补丁生成的可信验证奠定了数据基础,其影响在于加速了从科研原型到工业级智能编码助手的转化进程。
以上内容由遇见数据集搜集并总结生成



