DCAgent3/swebench_verified_rl__24GPU_shaped__exp_rpt_pymethods2test_large__GLM_4_7_swesm41ff4f1c
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 53358669 num_examples: 618 download_size: 39827514 dataset_size: 53358669 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
DCAgent3搜集汇总
数据集介绍

构建方式
该数据集源自SWE-bench验证框架,通过强化学习与基于规则的奖励塑形技术构建而成。具体而言,研究团队采用GLM-4系列模型(版本7)作为基础智能体,在24块GPU的分布式环境下运行实验程序,利用`shaped`奖励函数对模型在Python方法级测试任务中的表现进行优化。数据收集过程涵盖了完整的多轮交互轨迹,每条样本均包含角色对话、模型标识、时间戳、任务描述及验证器输出等信息,最终筛选出618条高质量训练样本,以二进制格式存储于Hugging Face平台上。
特点
本数据集的核心特点在于其精细化的结构设计与领域针对性。样本包含结构化对话历史(`conversations`字段)与元数据(如智能体类型`agent`、模型提供商`model_provider`、运行标识`run_id`),便于下游任务进行归因分析。值得注意的是,数据集中集成了`verifier_output`字段,记录了外部验证器对模型输出的评判结果,这为研究奖励塑形机制对代码生成质量的影响提供了直接观测窗口。此外,所有样本均基于真实软件工程基准任务生成,确保了数据的生态效度。
使用方法
该数据集适用于训练或评估面向代码生成与软件工程任务的对话式智能体。使用者可通过Hugging Face的`datasets`库加载`train`分割数据,利用`conversations`字段构建多轮指令-响应对,并借助`result`与`verifier_output`字段设计监督学习或偏好对齐(如DPO、RLHF)的训练目标。建议将`task`字段作为条件输入,以评估模型在不同编程问题上的泛化能力。同时,`trace_source`字段可辅助追踪数据生成流程,便于复现实验或扩展数据规模。
背景与挑战
背景概述
该数据集源于SWE-bench验证环境,由研究团队在2024年前后构建,专注于软件工程任务中大型语言模型(LLM)的强化学习优化。核心研究问题在于如何通过结构化奖励和认知增强策略,提升模型在复杂代码仓库中的自动化问题解决与修复能力。通过整合24块GPU的资源进行大规模实验,数据集记录了模型与环境的交互轨迹、推理过程及验证结果,为探索LLM在真实软件开发场景下的决策优化提供了宝贵资源。其在代码智能领域的贡献在于弥合了模型训练与实际工程需求之间的鸿沟,推动了对智能编程代理可靠性的深入理解。
当前挑战
该数据集面临的首要挑战是解决软件工程领域中的复杂任务,如代码错误定位与修复,这些任务需要模型具备上下文理解、精确搜索与逻辑推理能力,远超传统自然语言处理范畴。构建过程中,挑战在于设计有效的强化学习训练范式,包括奖励函数的塑造以平衡探索与利用,以及应对多轮交互中的稀疏奖励问题。此外,数据收集需处理高计算成本与硬件资源限制,同时确保轨迹数据的多样性和代表性,以避免模型在特定环境下的过拟合。如何在不引入人类标注噪声的前提下,从自动化验证器中提取鲁棒信号,也是实现可靠训练的关键瓶颈。
常用场景
经典使用场景
在人工智能与软件工程交汇的研发前沿,swebench_verified_rl__24GPU_shaped__exp_rpt_pymethods2test_large__GLM_4_7_swesm41ff4f1c 数据集为代码生成与自动化程序修复领域提供了一类精细化的微调与评估基准。其核心使用场景涵盖了大语言模型在软件工程任务中的行为追踪与强化学习训练,具体表现为通过记录模型与环境的交互会话(conversations)、任务描述(task)及验证结果(verifier_output)等结构化字段,支撑研究者构建和优化能够自动定位软件缺陷并生成修复补丁的智能体系统。该数据集特别适用于以GLM系列为代表的基座模型在代码补全、测试生成与仓库级代码理解等任务上的性能提升实验。
实际应用
在实际工程落地中,该数据集的应用价值主要体现在持续集成与持续部署(CI/CD)管线的智能化升级上。具体而言,开发团队可以利用该数据集训练代理模型,使其能够自动解析代码仓库中的失败测试用例,并依据已有的多轮对话历史与验证反馈,生成并筛选出有效的代码补丁。此外,该数据集还适用于教育辅助软件,能够通过对学生代码中的缺陷模式进行学习并提供修复建议,提升编程教学的效率。在工业界,结合24GPU的大规模训练配置,该数据集支撑了企业级代码审查自动化系统的构建,显著降低了人工排查漏洞的耗时,并提升了软件交付的质量与安全性。
衍生相关工作
围绕该数据集的特性,学术界已衍生出若干具有影响力的经典工作链。其中,基于该数据格式的可验证执行反馈机制催生了‘强化学习+代码生成’方向的系列研究,代表性的工作包括利用持续交互轨迹进行策略梯度优化的SWE-agent改进版本。此外,该数据集中的shaped奖励设计思路启发了多项关于奖励塑形与信用分配的研究,推动了如RLEF(Reinforcement Learning from Execution Feedback)等框架的发展。更进一步,该数据集的pymethods2test_large子集直接关联了方法级测试生成任务,由此衍生出专注于细粒度代码片段验证的微调策略,如TestAugmenter模型。这些工作共同构筑了从数据采集、模型训练到部署验证的完整闭环,持续驱动着智能软件工程领域的创新边界。
以上内容由遇见数据集搜集并总结生成



