遇见数据集

DCAgent3/swebench_verified_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_mad3f88d27

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含多轮对话记录和相关元数据,特征包括对话内容(角色和内容)、代理信息、模型信息、日期、任务、集数、运行ID、试验名称、结果、验证器输出和来源跟踪。数据集仅提供train分区,共2633个示例,数据量约301.9 MB,可能用于分析对话系统、任务执行或模型评估,但具体目的和来源未在README中说明。

This dataset includes multi-turn conversation records and related metadata, with features covering conversations (role and content), agent, model, model provider, date, task, episode, run ID, trial name, result, verifier output, and trace source. It only provides a train split with 2633 examples and a data size of approximately 301.9 MB, potentially used for analyzing dialogue systems, task execution, or model evaluation, but the specific purpose and origin are not described in the README.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/swebench_verified_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_mad3f88d27 数据集图片
构建方式
该数据集基于SWE-bench Verified基准测试构建,通过GLM-4-7B模型驱动的SWE-SMITH智能体在沙盒环境中执行软件工程任务,并利用Oracle验证器对结果进行校验,最终筛选出在120秒内成功完成的轨迹。每个数据样本包含完整的多轮对话记录、智能体类型、模型信息、任务描述、执行结果及验证器输出等字段,共计2633条高质量训练样本。
特点
数据集的核心特点在于其经过严格验证的自动化软件工程任务轨迹,所有样本均通过Oracle验证器确保解决方案正确性。每条记录不仅保存了智能体与环境的交互对话,还记录了详细的元数据如模型来源、运行标识和实验日期,为研究代码生成与调试的智能体行为提供了丰富的结构化信息,尤其适合用于训练和评估代码修复与任务完成能力。
使用方法
该数据集可直接用于微调对话式代码智能体模型,其标准化的features格式支持直接加载至HuggingFace Datasets库进行训练。用户可依据'conversations'字段提取多轮交互序列,结合'result'与'verifier_output'字段进行监督学习或对比学习,以提升模型在真实软件工程场景中的任务完成准确率。
背景与挑战
背景概述
该数据集名为swebench_verified_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_mad3f88d27,由智谱AI研究团队创建,聚焦于软件工程领域的大语言模型智能体在真实编程任务上的性能评估。核心研究问题在于如何构建一个可重复、可验证的基准测试环境,以衡量模型在解决实际GitHub Issue中的代码修改、测试通过率及沙箱执行安全性等方面的能力。该数据集通过记录2633条包含角色对话、模型信息、任务描述及验证结果的轨迹数据,为自动化软件工程与LLM agent研究提供了高质量的训练与评测资源,对推动代码智能体的鲁棒性和可靠性研究具有重要影响。
当前挑战
数据集面临的挑战主要体现在三个方面:首先,领域问题上,现有基准多聚焦于孤立代码生成,缺乏对完整Issue修复流程的模拟,该数据集需解决如何将自然语言描述的问题准确映射为可执行的代码补丁,并确保修改后的代码通过预定义的测试用例。其次,构建过程中,从GitHub Issue中筛选可复现的软件缺陷并构建隔离沙箱环境(如swesmith sandboxes)存在巨大工程复杂度,需处理依赖冲突、环境不一致及超时限制(120秒)等实际问题。最后,验证环节依赖oracle测试集进行自动评估,但测试用例的完备性与公平性难以保证,部分复杂场景下可能存在误判或覆盖不足,影响数据集的权威性。
常用场景
经典使用场景
在软件工程与自然语言处理的交叉领域中,swebench_verified_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_mad3f88d27数据集为评估和优化代码生成智能体提供了宝贵的实验平台。该数据集收集了2633条由高级语言模型驱动的智能体在沙箱环境中解决编程任务的完整对话记录,每条样本均包含多轮人机交互的对话流、模型输出、验证结果及运行轨迹。研究者可以借此重现从问题理解、代码编写到测试验证的完整闭环流程,深入剖析模型在不同场景下的决策行为与错误模式。更为重要的是,数据集中蕴含的测试用例与Oracle验证结果,使其成为检验代码正确性与鲁棒性的理想基准,尤其在对比不同策略(如思维链、自我反思等)对任务完成率的影响时,展现出不可替代的学术价值。
解决学术问题
在学术研究层面,该数据集有效破解了代码生成领域长期面临的三大难题:可复现性缺失、错误定位困难以及评估维度单一。传统基于静态指标(如BLEU、CodeBLEU)的评价体系难以真实反映生成代码的功能正确性,而本数据集的每一条记录都配有沙箱执行验证结果,为研究者提供了从语法结构到执行语义的多层次评判依据。这种细粒度的标注方式使得对模型“幻觉”现象、逻辑断裂、接口误用等典型问题的系统化归因成为可能。此外,通过分析智能体在相同任务上的多次尝试轨迹,研究者能够深入探索“探索-利用”平衡、检索增强与基础推理能力之间的复杂互动关系,进而推动代码生成从单轮预测向多轮自我纠错范式的关键跃迁。该数据集的发布直接促进了代码智能体安全性与可靠性的研究,并为后续构建更高效、更透明的自动化编程系统奠定了坚实的实证基础。
衍生相关工作
基于该数据集的精神内核,学术界与工业界已催生出一系列里程碑式的衍生工作。其中最具代表性的是将提示工程与强化学习相结合的SWE-bench扩展框架,该工作利用数据集中的验证结果作为奖励信号,训练出能够进行多步纠错的代码生成智能体SWE-Smith。另一重要衍生方向是安全对齐研究,研究者通过分析数据集中记录的失败案例,构建了专门针对代码注入和逻辑后门的对抗性测试套件,显著提升了代码智能体的抗攻击能力。此外,数据驱动的代码理解工作也深受启发,形成了以AgentBench为代表的多维评估基准,将传统代码补全扩展至包含数据库操作、命令行交互和Web API调用的复杂软件工程任务。这些衍生工作不仅深化了对大语言模型程序合成能力的科学认知,也为构建安全、可靠、高效的自动化编程未来提供了不可或缺的基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务