遇见数据集

swebench_verified_random_100_folders_a3_rl_DCAgent_code_contests_noblock_5_8B_2026378395da

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

该数据集包含多轮对话记录,每条样本包含 conversations 字段,由 role(角色)和 content(内容)组成,表示对话中的用户和助手轮次。此外,还记录使用的 agent(智能体)、model(模型)、model_provider(模型提供商)、date(日期)、task(任务)、episode(轮次)、run_id(运行 ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)和 trace_source(追踪来源)等元数据。数据集共包含 5300 个训练样本,总大小约 890MB。适用于对话系统评估、agent 行为分析、任务完成情况研究等场景。

This dataset contains multi-turn conversation records. Each sample includes a conversations field, consisting of role and content, representing the user and assistant turns. Additionally, it records metadata such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. The dataset comprises 5300 training samples with a total size of approximately 890MB. It is suitable for dialogue system evaluation, agent behavior analysis, and task completion research.

提供机构:
LAION eV
创建时间:
2026-08-29
原始信息汇总

数据集概述

该数据集来自 Hugging Face,主要包含与代码竞赛(Code Contests)相关的智能体(Agent)交互会话数据,具体为 laion/swebench_verified_random_100_folders_a3_rl_DCAgent_code_contests_noblock_5_8B_2026378395da

数据内容与结构

  • 主要特征:每条数据包含 conversations(对话列表,内含角色 role 和内容 content)、agent(智能体名称)、model(使用的模型)、model_provider(模型提供方)、date(日期)、task(任务描述)、episoderun_idtrial_nameresult(结果)、verifier_output(验证器输出)以及 trace_source(追踪来源)等字段。
  • 数据划分:仅包含一个 train 划分,共 5300 条样本
  • 数据规模:数据集总大小约为 890 MB(890,237,441 字节),下载大小约为 475 MB(474,762,118 字节)。

数据用途

该数据集适用于研究智能体在代码竞赛任务中的行为,特别是基于强化学习(RL)的智能体交互过程分析、模型性能评估、以及对话轨迹的挖掘等场景。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a3_rl_DCAgent_code_contests_noblock_5_8B_2026378395da 数据集图片
构建方式
该数据集源自SWE-bench Verified基准,通过随机抽样100个任务文件夹,并运用DCAgent强化学习框架,在Code Contests任务上以5-8B参数模型进行交互式轨迹采集而成。每条数据完整记录了智能体与环境的对话序列(conversations),包含角色与内容,同时附带了agent、model、model_provider、date、task、episode、run_id、trial_name等元数据,以及最终结果(result)、验证器输出(verifier_output)和轨迹来源(trace_source)。整个构建过程旨在捕获多轮决策路径,形成结构化的训练语料。
使用方法
使用者可将该数据集应用于训练和评估代码生成或智能体决策模型。具体而言,以conversations字段作为输入序列,利用其多轮结构进行监督微调,或将其作为强化学习的经验回放数据。元数据字段(如agent、model、result)可用于过滤或加权样本,以适配特定研究目标。由于已按SWE-bench格式组织,可直接与现有评估流水线集成,便于对比不同算法在真实软件工程任务上的效能。
背景与挑战
背景概述
该数据集名为swebench_verified_random_100_folders_a3_rl_DCAgent_code_contests_noblock_5_8B_2026378395da,由深度学习与智能体研究团队于2025年创建,旨在探究强化学习在代码生成智能体中的应用。数据集基于SWE-bench Verified基准,选取随机100个文件夹,结合DCAgent模型框架,在代码竞赛场景下进行强化学习训练,最终收集了5300条对话轨迹。其核心研究问题在于如何通过强化学习提升代码生成智能体在复杂编程任务中的泛化能力与鲁棒性。该数据集为多轮人机交互的对话记录,包含智能体行为、模型输出及验证结果,为后续研究提供了丰富的实证材料,对智能体学习与代码生成领域的交叉研究具有重要推动作用。
当前挑战
该数据集面临的挑战主要体现在两方面。其一,在领域问题层面,代码生成智能体需应对多步骤推理、环境交互及错误修正等复杂任务,强化学习在此类长期决策场景中的样本效率与奖励设计尤为困难,且不同任务间存在显著分布差异,难以确保模型的稳定提升。其二,在构建过程中,需协调大规模轨迹采集与计算资源限制,同时确保对话数据完整性与标注一致性,尤其是对智能体失败轨迹的捕捉与验证,这一过程涉及复杂的并发管理与数据清洗,增加了数据集构建的复杂性与成本。
常用场景
经典使用场景
该数据集源自SWE-bench验证集,通过随机抽样100个真实软件工程问题,并融合DCAgent智能体在代码竞赛环境中的交互轨迹,构建了包含5300条多轮对话的高质量语料库。其经典使用场景聚焦于训练和评估大语言模型(LLM)驱动的自动化编程智能体,尤其是在面对复杂仓库级代码任务时,模型需依据历史对话、代码变更和验证反馈,迭代生成修复补丁或实现新功能,从而衡量模型在真实软件开发流程中的端到端任务完成能力。
解决学术问题
此数据集有效解决了软件工程与人工智能交叉领域中的关键学术难题——如何构建真实、可复现且具有挑战性的基准以评估代码生成模型的实用性能。传统数据集往往局限于单一函数或片段,难以反映仓库级、多文件协同修改的复杂性。通过结合SWE-bench的严格验证机制和DCAgent的交互式决策过程,本数据集为研究智能体在长程规划、错误定位、上下文理解及工具调用等核心能力提供了量化依据,推动了从静态代码生成向动态问题解决的范式转变。
实际应用
在实际应用中,该数据集可用于开发企业级自动化编程助手,辅助开发人员定位缺陷、生成修复方案,并自动执行单元测试以验证正确性。其对话结构支持构建具备记忆和反思能力的智能体系统,在持续集成环境中实现智能缺陷修复、需求到代码的自动转化,以及代码审查辅助。此外,该数据也可用于训练代码补全工具,使其能够理解项目全局上下文,显著提升开发效率和代码质量,尤其在大型开源项目维护和遗留系统现代化改造中展现广阔应用前景。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程基准测试(SWE-bench)与强化学习智能体在代码竞赛场景中的交互轨迹研究,其命名中的'RL_DCAgent'暗示了深度强化学习驱动的代码生成智能体在复杂编程任务中的决策过程。随着大型语言模型(LLM)在代码生成领域取得突破,研究者正转向利用此类高保真交互数据,探索智能体在真实软件工程问题中的探索策略、奖励建模与错误修正机制。该数据集包含五千余条多轮对话及智能体执行轨迹,为评估模型在未知代码库中的泛化能力、鲁棒性以及多步推理性能提供了宝贵资源,尤其在结合代码竞赛(code_contests)与SWE-bench验证集的基础上,推动了从静态代码生成向动态问题解决的范式转变,对构建可自主修复漏洞、优化性能的下一代AI程序员具有关键意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务