遇见数据集

DCAgent2/swebench_verified_random_100_folders_rl__48GPU_shaped_32b__swe_rebench_patched_c014354f

收藏
Hugging Face2026-04-11 更新2026-04-12 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: content dtype: string - name: role dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string splits: - name: train num_bytes: 30205139 num_examples: 300 download_size: 16201569 dataset_size: 30205139 configs: - config_name: default data_files: - split: train path: data/train-* ---

数据集信息: 特征: - 名称:对话(conversations),为列表类型,其列表元素包含以下子字段: - 名称:内容(content),数据类型为字符串 - 名称:角色(role),数据类型为字符串 - 名称:智能体(agent),数据类型为字符串 - 名称:模型(model),数据类型为字符串 - 名称:模型提供商(model_provider),数据类型为字符串 - 名称:日期(date),数据类型为字符串 - 名称:任务(task),数据类型为字符串 - 名称:会话片段(episode),数据类型为字符串 - 名称:运行ID(run_id),数据类型为字符串 - 名称:试验名称(trial_name),数据类型为字符串 - 名称:结果(result),数据类型为字符串 - 名称:校验器输出(verifier_output),数据类型为字符串 划分集: - 名称:训练集(train),字节大小:30205139,样本数量:300 下载大小:16201569,数据集总大小:30205139 配置: - 配置名称:默认配置(default),数据文件: - 划分集:train,路径:data/train-*

提供机构:
DCAgent2
搜集汇总
数据集介绍
DCAgent2/swebench_verified_random_100_folders_rl__48GPU_shaped_32b__swe_rebench_patched_c014354f 数据集图片
构建方式
在软件工程领域,自动化代码修复与任务执行是提升开发效率的关键研究方向。该数据集通过强化学习框架,在48个GPU环境下对100个随机选择的软件仓库文件夹进行系统化采样与处理,构建过程涉及模型交互轨迹的捕获与验证。每个数据实例记录了智能代理与环境的对话序列,包括任务描述、执行步骤及验证结果,确保了数据来源的多样性与实验的可复现性。
特点
该数据集的核心特征在于其结构化存储的交互对话与元数据信息,涵盖了代理行为、模型类型、任务标识及执行结果等多个维度。数据条目不仅包含自然语言对话内容,还整合了验证器输出与实验参数,为分析智能体在软件工程任务中的决策过程提供了多视角支持。这种设计使得数据集能够支撑对模型性能、任务复杂度及错误模式之间关联性的深入探究。
使用方法
研究人员可通过加载数据集的标准格式,直接访问训练分割中的300个实例,每个实例包含完整的对话历史与实验元数据。该数据集适用于评估强化学习模型在代码生成与修复任务中的表现,或作为基准测试用于比较不同代理策略的有效性。使用时应结合任务标识与验证结果字段,对模型输出进行系统性分析,以推动自动化软件工程工具的优化与创新。
背景与挑战
背景概述
在软件工程领域,自动化代码修复与任务执行是提升开发效率的关键研究方向。swebench_verified_random_100_folders_rl__48GPU_shaped_32b__swe_rebench_patched_c014354f数据集由研究团队于近期构建,旨在评估强化学习模型在真实软件环境中的问题解决能力。该数据集聚焦于智能代理与代码库的交互过程,通过记录对话、任务执行结果等结构化数据,为模型训练与验证提供基准。其核心研究问题涉及如何使人工智能系统理解复杂代码上下文并执行精确操作,对推动自动化软件开发工具的发展具有显著影响力。
当前挑战
该数据集所解决的领域问题在于软件工程中自动化任务执行的泛化与可靠性挑战,包括模型需处理多样化的代码库结构、理解自然语言指令到代码操作的映射,以及确保修复或执行结果的正确性。构建过程中的挑战主要体现在数据收集与验证环节:需从真实软件项目中采样任务并模拟交互环境,同时通过验证机制确保每条记录的质量与一致性,这涉及大规模计算资源协调与复杂管道设计,以平衡数据的代表性与噪声控制。
常用场景
经典使用场景
在软件工程与人工智能交叉领域,该数据集为评估大型语言模型在代码生成与修复任务中的性能提供了基准。其经典使用场景聚焦于自动化软件测试与调试,通过模拟真实世界中的代码修改请求,要求模型理解自然语言描述的问题并生成相应的补丁。这一过程不仅检验了模型对编程语言语义的掌握程度,还评估了其在复杂上下文中的推理能力,为研究代码智能体的行为模式奠定了数据基础。
解决学术问题
该数据集有效解决了软件工程中自动化代码修复的评估难题,为学术界提供了标准化测试平台。它通过结构化对话记录与验证输出,量化了模型在解决实际编程错误时的准确性与效率,从而推动了代码生成模型的迭代优化。其意义在于弥合了理论模型与工程实践之间的鸿沟,促进了智能编程助手领域的方法论创新,并为软件维护自动化研究提供了可复现的实验依据。
衍生相关工作
围绕该数据集衍生的经典工作包括基于强化学习的代码补丁生成框架、多智能体协作的软件测试系统,以及针对代码语义理解的预训练模型改进。这些研究不仅扩展了数据集的用途,还催生了如自动化漏洞修复、智能代码审查等新兴方向,进一步丰富了软件工程智能化的理论体系与实践工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务