遇见数据集

DCAgent3/swebench_verified_rl__24GPU_base__exp_rpt_pymethods2test_large__GLM_4_7_swesmit130d44ef

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每个记录由对话内容(包括角色和内容)、代理信息、模型名称、模型提供方、日期、任务类型、剧集标识、运行ID、试验名称、结果、验证器输出和跟踪来源等特征组成。数据集主要用于支持对话系统、任务完成和AI模型评估的研究,涵盖训练分割,包含3912个示例。

This dataset contains multi-turn conversation records, with each record including features such as conversations (with role and content), agent, model, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. It is primarily designed for research in dialogue systems, task completion, and AI model evaluation, covering a train split with 3912 examples.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/swebench_verified_rl__24GPU_base__exp_rpt_pymethods2test_large__GLM_4_7_swesmit130d44ef 数据集图片
构建方式
该数据集源自SWE-bench验证框架下的强化学习实验,旨在优化代码修复智能体的性能。基于24个GPU并行计算环境,以GLM-4模型为核心,通过追踪轨迹与验证器反馈进行数据收集。构建过程围绕“实验轨迹”展开,对智能体在代码修复任务中的多轮对话、操作序列及结果进行结构化记录。数据涵盖任务描述、模型响应、验证器输出及运行标识符,形成完整的对话-动作-反馈闭环,为后续的强化学习策略迭代提供高质量的训练样本。
特点
数据集的显著特点在于其多层细粒度标注与结构化元信息。除基础的对话内容和角色标识外,每条记录均关联了具体的模型版本(GLM-4)、任务类型、实验轮次及运行ID,实现了对数据来源的精准溯源。此外,数据包含“verifier_output”字段,记录了外部验证器的评估结果,为智能体的行为优劣提供了客观标注。这种设计使得数据集不仅适用于监督微调,还天然适配基于奖励信号的强化学习训练范式。
使用方法
该数据集主要面向代码智能体的强化学习与微调场景。使用时,可直接加载对话字段作为模型输入-输出对,结合“result”与“verifier_output”字段作为奖励信号,构建偏好学习或策略优化目标。建议按“task”字段筛选特定类型的代码修复任务,或利用“trace_source”字段过滤不同来源的轨迹数据。数据以标准JSON格式存储,支持主流深度学习框架(如PyTorch/HuggingFace)的Dataset类直接读取,便于与现有训练管线无缝集成。
背景与挑战
背景概述
该数据集由SWE-bench项目团队创建,旨在通过强化学习范式推动大语言模型在软件工程领域的能力提升。其核心研究问题聚焦于如何利用真实代码仓库中的问题修复任务,训练模型在复杂编程场景下自主生成有效解决方案。数据集收录了3912条包含多轮对话、模型交互轨迹及验证结果的样本,覆盖GLM-4等前沿模型的运行记录,为研究代码智能体与验证器的协同机制提供了基础资源。作为SWE-bench生态的重要扩展,该数据集对探索强化学习在自动化调试与代码生成中的实践边界具有关键意义。
当前挑战
数据集所解决的领域挑战在于:传统软件工程任务(如缺陷修复)高度依赖人工经验,而现有模型常因长上下文推理不足或无效探索导致失败,该数据集通过记录完整交互轨迹为训练鲁棒性更强的代码智能体开辟新路径。构建过程中面临的挑战包括:需从大规模真实仓库中筛选可验证问题,设计多智能体交互的并行采集管线,并确保24GPU资源下的高效运行与结果一致性;此外,验证器输出的准确性直接决定数据质量,需严格平衡探索策略与样本多样性之间的矛盾。
常用场景
经典使用场景
该数据集源自SWE-bench验证环境,专为强化学习与代码智能体训练而设计,经典使用场景聚焦于大规模指令微调与强化学习驱动的代码生成任务。数据集中包含了完整的智能体对话历史、执行结果及验证器输出,为训练端到端代码修复与生成模型提供了丰富的训练样本。研究者可将其作为标准基准,评估模型在多轮交互中解决实际软件工程问题的能力。
解决学术问题
数据集核心解决了当前代码智能体在复杂软件工程任务中缺乏高质量交互数据与验证反馈的学术困境。通过提供24台GPU环境下大规模强化学习探索产生的轨迹,它助力学界探索如何利用探索性反馈提升模型的代码修复精度与泛化能力。其意义在于搭建了从传统监督学习走向强化学习驱动代码生成的桥梁,推动了代码智能体领域从静态理解向动态交互与自我改进的范式转变。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于强化学习的代码生成模型(如CodeRL系列)、开源代码智能体框架(如SWE-agent)的改进版本,以及多轮对话式代码修复模型的研究。相关研究通常以此数据集为基准,对比不同探索策略对模型性能的影响,并进一步衍生出针对特定编程语言或项目类型的细粒度数据集。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务