遇见数据集

DCAgent2/swebench_verified_random_100_folders_alfworld_swesmith_r2egym_swegym_131k_32B_ladfef6d1

收藏
Hugging Face2026-04-10 更新2026-04-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: content dtype: string - name: role dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string splits: - name: train num_bytes: 49936587 num_examples: 300 download_size: 37059176 dataset_size: 49936587 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
DCAgent2
搜集汇总
数据集介绍
DCAgent2/swebench_verified_random_100_folders_alfworld_swesmith_r2egym_swegym_131k_32B_ladfef6d1 数据集图片
构建方式
在自动化软件工程与智能体交互的交叉领域,本数据集应运而生。其构建过程依托于SWE-bench验证集,从中随机抽取100个文件夹场景,并融合ALFWorld、SWE-Smith、R2E-Gym及SWE-Gym等多源环境中的智能体轨迹数据。通过采集131k条由32B参数模型生成的交互记录,系统性地整合了智能体在复杂任务中的完整对话序列、动作结果及验证反馈,最终形成规模约300条精心筛选的训练样本。
特点
该数据集的核心特色在于其多维度结构化特征,涵盖了智能体身份标识、模型来源与提供商信息、任务类型及运行环境参数等关键元数据。每条数据均包含完整的角色-内容对话链(conversations),同步记录了任务执行的最终结果(result)与验证器输出(verifier_output),为分析智能体决策过程提供了可追溯的因果链路。这种设计使得研究者能够深入探究不同任务背景下模型行为模式的异同。
使用方法
本数据集主要面向智能体训练与评估场景,使用者可直接通过HuggingFace数据集加载接口获取训练分割(split='train')数据。推荐将‘conversations’字段作为监督微调的目标序列,同时利用‘task’、‘episode’等字段进行条件化训练或场景过滤。验证器输出字段可作为奖励信号用于强化学习框架下的策略优化,而‘run_id’与‘trial_name’则便于实施跨试验的稳定性分析。
背景与挑战
背景概述
该数据集由多机构联合创建,融合了SWE-bench Verified、AlfWorld、R2E-Gym及SWE-Gym等多项基准测试,旨在探究大规模语言模型在复杂软件工程任务中的多轮交互能力。核心研究问题聚焦于如何通过131k条对话记录及32B参数模型生成的代理轨迹,提升模型在自动化代码修复、环境交互及任务验证等环节的鲁棒性。数据集创建于2025年,其精心设计的100个随机文件夹结构模拟了真实开发场景,为评估智能体在长期、多步骤任务中的决策效率与错误恢复能力提供了标准化平台。作为软件工程与人工智能交叉领域的里程碑式资源,该数据集推动了从静态代码理解到动态环境交互的范式转变,对自动化编程、持续集成等领域具有显著影响。
当前挑战
当前面临的核心挑战包括:1) 所解决的领域问题中,智能体需在非确定性环境中处理异构任务(如代码错误修复与虚拟环境导航),其复合型决策边界难以通过单一度量评估;现有基准多聚焦于单轮检索式回答,缺乏对多步骤因果推理与记忆回溯的量化标准。2) 构建过程中,海量对话需在保证动作-状态链语义一致的前提下,从32B参数模型中筛选出有效轨迹,同时避免嘈杂行为(如无效API调用或冗余探索)污染训练信号;此外,跨任务的代理经验迁移面临灾难性遗忘风险,需设计动态重放机制平衡样本多样性。
常用场景
经典使用场景
该数据集融合了来自SWE-bench验证的随机100个文件夹、AlfWorld、SWE-Smith、R2E-Gym以及SWE-Gym等多个智能体交互环境的轨迹数据,经过精心筛选与整合,形成了包含300条对话样本的精细化语料库。其最经典的使用场景在于训练和评估面向软件工程任务的大语言模型智能体,特别是那些需要执行代码修改、环境交互与结果验证的复杂场景。研究者可借助该数据集,让模型学习如何在不同类型的软件仓库中理解任务描述、生成指令、执行操作并利用验证器反馈进行迭代优化,从而提升智能体在真实开发环境中的自主决策与问题解决能力。
衍生相关工作
以此数据集为基础,衍生了一系列具有影响力的研究方向与经典工作。在模型层面,研究者利用其训练并优化了多种指令微调策略,例如基于结果验证的偏好对齐方法,显著提升了智能体在SWE-bench等基准上的通过率。在方法论方面,催生了关于多步交互轨迹回放、隐式奖励建模以及任务环境抽象表示的前沿探索。同时,该数据集被用作评估平台,催生了诸如CodeAct、SWE-Agent等知名系统的迭代版本,后者通过在训练阶段引入多样化任务,成功将一次修复成功率提高至行业领先水平。这些工作共同构筑了一个围绕软件工程智能体研究的完整生态。
数据集最近研究
最新研究方向
该数据集聚焦于大规模语言模型在复杂多智能体环境中的自主决策与任务执行能力验证,整合了SWE-bench、ALFWorld等基准测试框架,以及r2e、SWE-Gym等仿真环境,通过131k条32B参数模型的交互轨迹数据,为前沿研究提供了探索代码生成与具身智能融合的新维度。近期热点在于利用随机抽样的100个真实软件工程任务与具身场景,结合验证器输出,系统评估模型在长链条推理与工具使用中的鲁棒性。这一方向不仅推动了从静态问答向动态环境控制的范式跃迁,还为构建可部署于开发与家庭场景的通用智能体奠定了训练与评估基础,其影响力可类比于ImageNet在视觉领域的变革效应。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务