遇见数据集

DCAgent3/swebench_verified_maxgn09_hint__exp_rpt_pymethods2test_large__GLM_4_7_swesmith_2d26e211

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含对话数据,主要用于训练或评估人工智能代理。每个数据示例包含对话记录(conversations),其中涉及角色(role)和内容(content),以及相关元数据如代理类型(agent)、模型信息(model、model_provider)、日期(date)、任务(task)、剧集(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和跟踪来源(trace_source)。数据集分为训练拆分,包含3384个示例,总大小约372.6 MB,适用于多代理交互、任务执行和结果验证的研究。

This dataset contains conversational data designed for training or evaluating AI agents. Each data example includes conversation records (conversations) with roles (role) and content (content), along with metadata such as agent type (agent), model information (model, model_provider), date (date), task (task), episode (episode), run ID (run_id), trial name (trial_name), result (result), verifier output (verifier_output), and trace source (trace_source). The dataset is split into a training set with 3384 examples, totaling approximately 372.6 MB, and is suitable for research on multi-agent interactions, task execution, and result verification.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/swebench_verified_maxgn09_hint__exp_rpt_pymethods2test_large__GLM_4_7_swesmith_2d26e211 数据集图片
构建方式
该数据集源自SWE-bench验证流程的高阶扩展,通过引入GLM-4-7B模型与SWESmith工具链,对大规模Python方法测试生成任务进行系统性追踪。数据采集涵盖多轮代理交互轨迹,每条记录包含角色标注的对话序列、模型标识、执行时间戳及任务元信息。构建过程注重可控性,通过固定实验参数(如run_id与trial_name)确保可复现性,并利用验证器输出(verifier_output)对生成结果进行自动化质量核验,最终汇集为3384条高质量样本的标准化语料库。
使用方法
数据可通过HuggingFace Datasets库直接加载默认配置的train分片,适合构建指令微调或偏好对齐的基线训练集。研究者可利用conversations字段进行对话式代码生成任务的序列学习,或借助result与verifier_output字段开展执行结果预测的监督学习。此外,通过过滤特定的model_provider或task组合,可定制针对GLM系列模型性能的专项分析子集。需注意,数据已预设为标准化JSON结构,使用时须保持字段完整性以避免元数据解析错误。
背景与挑战
背景概述
该数据集构建于大型语言模型(LLM)与软件工程深度融合的背景下,由研究团队以SWE-bench Verified为基础,通过引入提示策略、迭代探索机制及PyMethods2Test方法生成,并基于GLM-4-7B模型进行实验。核心研究问题在于评估和提升LLM在真实软件工程任务中的自动化代码修复能力。该数据集记录了多轮对话、代理行为及验证结果,为研究LLM的自主编程能力提供了结构化语料,对于推动自动化缺陷修复、代码生成等领域的评估基准具有重要意义。
当前挑战
当前挑战主要体现在两大层面:领域问题层面,软件工程任务(如代码修复)需要精准理解代码逻辑、依赖关系和上下文,而现有LLM在复杂多步推理、长程依赖捕捉及跨文件修改中仍显不足,导致修复成功率受限;构建过程层面,数据的生成依赖模拟多代理协作与迭代探索,如何设计有效的提示策略以模拟真实开发者的思维链,同时避免数据偏差和过拟合,是构建高质量、高覆盖率数据集的难点。此外,验证器的可靠性、运行环境的一致性与结果可复现性也构成工程实践上的严峻挑战。
常用场景
经典使用场景
SWE-bench Verified数据集在自动化软件工程领域扮演着举足轻重的角色,尤其专注于评估和提升大型语言模型在代码修复与软件维护任务中的能力。该数据集汇聚了来自真实GitHub仓库的逾三千个高质量任务实例,每个实例均包含自然语言描述的缺陷报告、对应代码库的快照以及可验证的修复补丁。研究者利用此数据集模拟软件开发中常见的缺陷定位与修复流程,通过模型生成补丁后,借助自动化验证工具(如测试套件)评判其正确性,从而系统性地度量模型对复杂代码逻辑的理解与修正水平。这一设计使得SWE-bench Verified成为检验前沿代码智能模型综合实力的权威基准。
解决学术问题
该数据集的核心价值在于填补了传统代码修复基准的若干关键空白。此前,学术领域长期受困于小规模、非统一或缺乏真实维护语境的缺陷数据集,导致模型评估结果难以反映实际部署中的鲁棒性。SWE-bench Verified通过引入多类型缺陷样本、结构化验证流程以及细粒度结果记录,有效攻克了跨项目泛化评估与自动化修复一致性验证的难题。它不仅推动了可复现的实证研究范式,更促使学界重新审视语言模型在代码编辑任务中的推理边界,为后续开发更适应动态软件环境的智能体奠定了方法论基础。
实际应用
在实际软件工程场景中,SWE-bench Verified数据集驱动的模型可显著提升持续集成与代码审查的效率。例如,基于该基准迭代训练的语言模型能够自动识别开源项目中的缺陷模式并生成候选补丁,辅助开发者缩减人工排查耗时。企业级开发团队可将其集成至自动化测试流水线,针对历史提交中的常见错误类型进行预警与修复推荐。此外,数据集中包含的对话历史与验证结果记录,为构建具备解释能力的代码修复助手提供了训练范本,推动低代码平台与辅助编程工具向更高自主性演进。
数据集最近研究
最新研究方向
在软件工程与人工智能交叉领域,swebench_verified数据集凭借其精细的对话轨迹与任务验证机制,成为评估代码生成智能体实用效能的前沿基准。该数据集聚焦于真实软件开发场景中的缺陷修复任务,通过集成特定模型(如GLM-4)的交互日志与验证器输出,开创性地将大语言模型从代码补全能力推向端到端任务执行能力的检验。其最新研究方向集中于利用多轮对话中的结构化中间步骤(如错误定位、补丁生成与验证反馈)来训练具备自适应调试策略的智能体,从而推动模型在动态软件维护环境中的鲁棒性与可解释性突破,对构建能自主参与持续集成流程的AI工程师具有里程碑式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务