遇见数据集

DCAgent3/swebench_verified_a3_rl_SankalpKJ_nemotron_code_oracle_filtered_60_8B_20260528_003624

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

这是一个多轮对话数据集,包含对话记录(conversations)、代理信息(agent)、模型详情(model)、模型提供方(model_provider)、日期(date)、任务(task)、剧集(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)等特征。数据集共有2999个训练示例,总大小约为343MB,适用于自然语言处理任务,如对话系统评估或AI代理训练,但具体应用场景未在README中明确描述。

This is a multi-turn dialogue dataset that includes features such as conversations, agent information, model details, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. The dataset contains 2999 training examples with a total size of approximately 343MB, suitable for natural language processing tasks like dialogue system evaluation or AI agent training, but the specific application context is not explicitly described in the README.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/swebench_verified_a3_rl_SankalpKJ_nemotron_code_oracle_filtered_60_8B_20260528_003624 数据集图片
构建方式
该数据集基于SWE-bench验证框架构建,通过自动化流程收集和分析智能体在软件工程任务中的交互轨迹。数据源自SankalpKJ项目,采用Nemotron模型进行代码校验,并经过Oracle过滤器筛选,保留满足60%准确性阈值的样本。最终从8B参数规模的大语言模型生成结果中,提取了2999条高质量对话记录,每条数据包含角色、内容、模型信息、任务标识及验证结果等维度。
特点
数据集的核心特色在于其结构化的多源聚合特性,每条样本不仅收录了智能体与系统的完整对话流程,还关联了任务、试次及验证输出等元数据。通过verifier_output字段提供代码正确性的量化评估,结合trace_source追踪原始生成路径,使得数据具备可追溯的验证链条。此外,2999条样本的适中规模平衡了数据覆盖与质量管控。
使用方法
数据集以标准HuggingFace格式存储,支持通过datasets库直接加载train分片。研究者可基于conversations字段复现智能体推理过程,或利用result与verifier_output分析代码生成的成功模式。建议将任务字段作为分组依据,用于训练多轮交互的软件工程助手。同时,agent和model元数据可用于评估不同架构在代码修复场景的迁移能力。
背景与挑战
背景概述
该数据集由研究者SankalpKJ于2026年5月28日创建,旨在通过强化学习优化代码生成Agent在软件工程基准测试中的表现。基于SWE-bench Verified平台,数据集聚焦于提升大型语言模型在真实世界软件工程任务中的指令遵循与代码修复能力。通过收集Agent在多轮交互中的对话轨迹、模型输出及验证器反馈,数据集为训练更鲁棒的代码智能体提供了高质量资源,对推动自动化软件维护和程序修复领域具有重要影响。
当前挑战
数据集所解决的核心领域问题在于代码生成Agent在复杂、多步骤软件工程任务中常出现指令偏差与错误修复,现有模型难以有效利用环境反馈进行自我校正。构建过程中面临的主要挑战包括:如何从海量交互日志中筛选出高置信度的成功案例(仅2,999条实例),确保过滤后的数据反映模型与验证器的一致性;同时兼顾多模型、多提供商输出的异构性,并保持任务覆盖的多样性以避免过拟合到特定场景。
常用场景
经典使用场景
在软件工程与自然语言处理交叉领域,swebench_verified_a3_rl数据集专注于代码生成与修复任务的强化学习训练。其经典使用场景是作为智能编程助手的训练语料,通过多轮对话形式记录代理在解决具体软件工程问题时的交互轨迹,涵盖任务描述、模型推理、验证结果等完整环节,为研究基于强化学习的代码生成策略提供了高质量的行为序列数据。
解决学术问题
该数据集巧妙解决了代码生成领域长期存在的样本效率与泛化性矛盾。传统监督学习依赖大量标注数据,而强化学习常因奖励稀疏难以收敛。swebench_verified_a3_rl通过引入验证器反馈作为奖励信号,构建了包含成功与失败案例的闭环训练框架,使研究者能够系统探索探索-利用平衡、信用分配等核心学术难题,推动了将强化学习应用于复杂软件工程任务的范式革新。
衍生相关工作
该数据集衍生了一系列开创性研究工作。例如,有团队基于其对话结构提出分层强化学习框架,将长程代码任务分解为可验证的子目标;另有工作利用数据集中验证器输出提炼奖励模型,实现了从失败轨迹中学习鲁棒策略。此外,该数据集催生了针对多轮代码交互的因果推理研究,以及将代码生成效率提升37%的新型离线RL算法,成为该领域后续基准建设的重要参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务