遇见数据集

swebench_verified_random_100_folders_a3_rl_DCAgent_mix_h4_binary_easy_50_8B_20260897d58773

收藏
Hugging Face2026-09-01 更新2026-09-03 收录
官方服务:

资源简介:

该数据集是一个多轮对话记录集合,专注于AI agent与用户或系统之间的交互。每条样本包含完整的对话历史(conversations),其中每条消息带有角色(role)和内容(content);此外还记录了使用的agent名称(agent)、模型名称(model)及其提供商(model_provider)、对话日期(date)、任务类型(task)、轮次(episode)、运行ID(run_id)、试验名称(trial_name)、最终结果(result)、验证器输出(verifier_output)以及追踪来源(trace_source)。训练集共包含12,240条样本,数据规模约2GB。该数据集可用于训练、评估或分析对话agent的行为、模型性能、任务完成情况等,适用于多轮对话系统、强化学习、agent行为分析等研究场景。

提供机构:
LAION eV
创建时间:
2026-09-01
原始信息汇总

数据集详情总结

该数据集由 laion 上传,是 swebench_verified_random_100_folders_a3_rl_DCAgent_mix_h4_binary_easy_50_8B_20260897d58773,主要面向代码智能体(Agent)领域的强化学习训练数据,来源为 SWE-bench 验证集上的随机任务样本。

数据集规模

  • 总大小:约 2.08 GB(实际字节数 2,081,413,492)
  • 下载大小:约 1.20 GB(实际字节数 1,197,025,012)
  • 分割:仅包含训练集(train),共 12,240 条样本

数据特征

每条样本包含以下字段:

字段 类型 说明
conversations 列表(含 rolecontent,均为字符串) 对话记录,包含角色与内容
agent 字符串 智能体名称或标识
model 字符串 使用的模型名称
model_provider 字符串 模型提供方
date 字符串 日期信息
task 字符串 任务标识
episode 字符串 回合或情景编号
run_id 字符串 运行 ID
trial_name 字符串 试验名称
result 字符串 任务结果
verifier_output 字符串 验证器输出
trace_source 字符串 轨迹来源

其中,conversations 字段为嵌套结构,包含 role(如 system/user/assistant 等)与 content(对话内容),代表智能体与环境的多轮交互过程。

配置说明

  • 配置文件名为 default
  • 数据文件路径为 data/train-*(通配符格式,对应多个分片文件)

用途总结

此数据集适用于训练和评估代码生成/代码修复类智能体,结合了 SWE-bench 的真实软件工程任务,并加入了混合策略(mix_h4_binary_easy_50_8B)的强化学习采样数据,可用于研究代码智能体在简单二元任务上的行为模式与结果验证。

搜集汇总
数据集介绍
swebench_verified_random_100_folders_a3_rl_DCAgent_mix_h4_binary_easy_50_8B_20260897d58773 数据集图片
构建方式
该数据集源自SWE-bench Verified基准的随机子集,通过选取100个文件夹并应用强化学习与DCAgent混合策略,结合分层二值化处理及简洁易解任务筛选,最终生成涵盖多轮交互的对话样本。构建过程严格遵循标准化流程,每一条目均包含完整的角色会话记录及元数据,如代理类型、模型标识、运行周期与结果验证输出,确保数据可追溯性与实验复现性。
使用方法
使用该数据集时,用户可直接加载HuggingFace上的默认配置,将train分割用于模型微调或行为分析。每一条记录中的conversations字段可作为输入目标序列,配合task标识区分不同软件工程任务,借助result与verifier_output字段评估模型性能。此外,研究者可按需筛选特定agent或model子集,进行对比实验,以探索不同架构与训练策略对任务成功率的影响。
背景与挑战
背景概述
该数据集源于软件工程自动化领域的前沿探索,由研究团队基于SWE-bench Verified基准构建,旨在推动大语言模型在真实代码仓库中解决复杂编程任务的能力。创建于2026年,集合了来自100个不同代码库的随机样本,并通过强化学习与智能体(Agent)交互策略优化生成,核心研究问题聚焦于如何通过多轮对话与执行反馈提升模型对软件缺陷的修复效率与泛化性。其影响力体现在为评估代码智能体在动态环境下的决策质量提供了高保真测试平台,尤其针对二进制评价信号下的模型行为优化,对自动程序修复和软件维护的智能化进程具有重要参考价值。
当前挑战
该领域面临的核心挑战在于真实软件缺陷的复杂性和多样性,模型需理解深层依赖关系及跨文件上下文,远超简单模式识别。构建过程中,数据采集需精确模拟开发环境并记录多轮交互轨迹,耗费巨量算力;同时,针对二元正确性标签的稀疏性,如何设计有效奖励机制以引导强化学习收敛成为难点。此外,数据规模与质量平衡、折叠内泄漏控制以及模型在不同仓库上的迁移稳定性,均对数据集的可信度与实用性构成严峻考验。
常用场景
经典使用场景
该数据集源自SWE-bench验证集,通过随机抽样100个文件夹并应用强化学习与DCAgent混合策略,筛选出难度适中、二分类标签清晰的8B模型轨迹数据。其经典使用场景聚焦于训练和评估代码生成代理(如DCAgent)在真实软件工程问题上的决策能力,尤其关注多轮交互中的工具调用、代码编辑与调试策略。研究者可利用此数据集作为微调或上下文学习的语料,以提升模型在GitHub issue修复任务中的表现,涵盖缺陷定位、补丁生成及回归测试等环节。其结构化的conversations字段保存了完整的操作历史,便于分析代理的推理链条,是研发自动化程序修复和智能开发助手的关键资源。
解决学术问题
该数据集为软件工程与自然语言处理交叉领域提供了标准化基准,解决了两个核心学术难题:一是现有轨迹数据多来自模拟环境,缺乏真实项目复杂性,此数据基于SWE-bench验证集,覆盖真实GitHub问题,使模型训练更贴近部署场景;二是多智能体协作中信用分配与策略优化的可复现性问题,通过保存agent、model及verifier_output等元数据,支持对强化学习奖励信号和决策效用的细粒度归因分析。其规模(12,240例)保障了统计显著性,可助力探究训练数据质量对智能体泛化能力的影响,推动从封闭式问答到开放式代码生成的范式转换,为构建可编程推理的通用智能体奠定实证基础。
实际应用
在实际应用层面,该数据集可直接赋能自动化软件开发工具链。例如,用于训练企业级代码审查助手,使其能自动识别并修复提交中的缺陷,减少人工介入成本;或集成到CI/CD流水线中,当测试失败时动态生成修复补丁,加速迭代周期。此外,其多样化的agent轨迹可模拟不同的编码风格与决策路径,为教育平台提供智能编程导师的交互范例,帮助学习者掌握系统性调试方法。数据中的result与verifier_output字段还能驱动对话式开发界面,实时反馈修改方案的可行性。这些场景共同强调了从静态代码生成向动态、上下文感知的软件维护演进,显著提升开发者生产力与代码质量。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程智能体在真实代码库中的强化学习与决策能力评估,其名称透露出基于SWE-bench验证集、随机选取100个代码仓库、采用DCAgent模型并结合8B参数规模及二元分类奖励的精细化场景构建。当前研究前沿正从静态代码修复转向动态交互式智能体开发,该数据集通过记录多轮人机对话、智能体轨迹及验证器输出,为评估智能体在复杂仓库结构下的任务规划、工具调用及故障恢复能力提供了高保真基准。其设计呼应了近期将大语言模型嵌入端到端开发流程的热点,尤其在自动化缺陷修复与代码生成领域,此类数据有助于推动可复现、可比较的智能体训练范式,对构建能够自主导航大规模代码库并完成多步骤工程任务的AI系统具有重要价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务