遇见数据集

DCAgent3/swebench_verified_rl__24GPU_base_lr5e_6__exp_rpt_pymethods2test_large__GLM_4_7_f94b0a5a

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条对话包含角色和内容,同时记录了使用的代理、模型、模型提供者、日期、任务、轮次、运行ID、试验名称、结果、验证器输出和追踪来源。适用于对话系统评估、模型性能分析等任务。

This dataset contains multi-turn conversation records, each with role and content, along with agent, model, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. It is suitable for evaluating dialogue systems and analyzing model performance.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/swebench_verified_rl__24GPU_base_lr5e_6__exp_rpt_pymethods2test_large__GLM_4_7_f94b0a5a 数据集图片
构建方式
该数据集源于在SWE-bench验证环境下的强化学习实验,采用24块GPU进行训练,基础学习率设为5e-6。实验通过反复扩展Python方法到大型测试用例(exp_rpt_pymethods2test_large)来构建,并基于GLM-4模型(版本号f94b0a5a)生成。每条数据记录了完整的对话历史(包含角色与内容)、代理类型、模型及提供商信息,并附带任务描述、试验编号和运行标识符。数据集的构建旨在系统性地探索模型通过强化学习迭代改进代码生成与调试能力的过程。
特点
该数据集包含3707个训练样本,总大小约450MB,结构丰富。核心特征为多轮对话(conversations)序列,涵盖用户与模型的交互内容,辅以任务、试验、运行等元数据。特别之处在于,每条数据均标注了模型验证器的输出(verifier_output)和最终结果(result),便于评估模型在SWE-bench任务上的表现。数据集通过trace_source字段追溯实验来源,为复现研究与分析模型行为提供了详实的结构化支持。
使用方法
该数据集可直接用于训练或评估对话式代码生成与调试模型。用户可通过HuggingFace Datasets库加载'default'配置下的'train'分片,利用'conversations'字段中的角色-内容对进行监督学习或强化学习微调。'result'与'verifier_output'字段可作为评估指标或奖励信号。建议研究者利用'task'和'run_id'字段分组数据,以分析模型在不同实验条件下的性能轨迹,或基于'trace_source'追溯特定实验配置的影响。
背景与挑战
背景概述
该数据集名为swebench_verified_rl__24GPU_base_lr5e_6__exp_rpt_pymethods2test_large__GLM_4_7_f94b0a5a,创建于2024年,源于对大型语言模型在代码生成与软件工程自动化任务中性能提升的探索。由多个研究机构联合开发,核心研究问题在于如何通过强化学习策略优化多轮交互式代码修复能力,尤其是在真实软件仓库(如SWE-bench)中验证解决实际编程问题的效果。该数据集收录了3707条多轮对话样本,每条记录包含角色、内容、智能体、模型、任务及验证结果等字段,为训练具备自我修正与测试驱动开发能力的智能体提供了关键资源。其影响力体现在推动代码智能体从单次生成向迭代优化的范式转变,并成为评估RL对齐方法在编程领域有效性的基准。
当前挑战
当前挑战主要集中在三方面:首先,领域问题层面,代码生成智能体常面临对复杂仓库依赖理解不足、修复后引入新缺陷的困境,难以通过一次性生成满足全部测试用例,亟需强化多步推理与错误回溯能力。其次,构建过程中,数据集采集需模拟真实开发者与代码仓库的交互,但现有轨迹可能受限于模型容量与搜索策略,导致长尾问题覆盖不全;同时,奖励信号(如测试通过率)的稀疏性与延迟性使RL训练难以稳定收敛。此外,多轮对话的规模化标注成本高昂,且需平衡探索与利用,避免合成数据中伪相关性对泛化性的影响。
常用场景
经典使用场景
该数据集源自SWE-bench验证环境下的强化学习训练轨迹,记录了GLM-4模型在24块GPU上采用基础学习率5e-6、结合pymethods2test大规模扩展策略的完整交互过程。其核心使用场景在于推动代码生成与软件工程智能体的研究,通过捕获模型在真实软件工程任务中的多轮对话与决策路径,为训练能够自主修复代码缺陷、完成软件维护的智能体提供高保真训练数据。
衍生相关工作
受该数据集启发,研究者已开展多项衍生工作,包括探索基于强化学习的代码智能体自我改进机制、设计多模型协同的代码修复框架,以及构建跨项目的缺陷定位与修复泛化基准。该数据集的结构化对话轨迹也催生了关于代码修复过程中推理链可解释性的分析工作,同时为后续在更大规模集群上复现和优化强化学习训练策略提供了可对比的基线数据,推动了代码智能体从研究原型向工程落地的演进。
数据集最近研究
最新研究方向
该数据集聚焦于通过强化学习优化代码生成智能体的推理能力,特别是在SWE-bench已验证问题上的应用。前沿方向包括利用大规模GPU集群(如24GPU)探索基础学习率(lr5e-6)下模型微调的边界,结合结构化奖励信号(如verifier_output)与回放轨迹(trace_source),以增强模型在复杂编程任务中的泛化性与鲁棒性。当前研究热点涉及将元学习方法与多轮交互数据(conversations)融合,推动智能体从静态代码修复向动态环境自适应演进,其意义在于为自动化软件开发中的持续学习范式提供实验基准,并关联LLM驱动的软件工程(LLM4SE)领域内关于可验证反馈循环的关键进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务