laion/eval-penfever_stageD-thinkbudget-80-8B_DCAgent2_swebench-verified-random-100-folders-traces
收藏数据链接:
官方服务:
资源简介:
该数据集包含多轮对话记录,涵盖对话内容、角色、代理信息、模型提供方、日期、任务类型、执行轮次、运行ID、试验名称、结果、验证器输出和追踪来源等字段。数据集用于记录和分析任务执行过程中的对话交互与结果验证,包含1639个训练样本。
This dataset contains multi-turn conversation records, including fields such as conversation content, role, agent information, model provider, date, task type, episode, run ID, trial name, result, verifier output, and trace source. It is used to record and analyze dialogue interactions and result verification during task execution, with 1639 training examples.
提供机构:
laion搜集汇总
数据集介绍

构建方式
该数据集基于SWE-bench Verified基准中的随机样本构建,选取了100个编程任务文件夹的轨迹信息。每一条数据都包含完整的对话记录,涵盖了智能体在任务执行过程中的每一个交互步骤,同时记录了所使用的智能体类型、模型名称与提供商、任务描述、运行时间戳、试验编号以及最终的执行结果和验证器输出。数据构建过程注重可复现性与结构化存储,确保每个轨迹都可追溯至其原始来源。
使用方法
使用该数据集时,研究人员可以轻松加载JSON格式的数据,通过“conversations”字段获取对话历史,用于分析智能体的决策流程。借助“agent”和“model”字段,可以针对不同智能体架构或语言模型进行对比实验。同时,“result”与“verifier_output”字段适用于监督学习中的标签任务,或作为强化学习中的奖励信号。数据集所有字段均已预定义,用户通过HuggingFace Datasets库即可快速分批次读取,便于集成到现有训练或评估流程中。
背景与挑战
背景概述
该数据集由DCAgent研究团队创建,专注于评估大语言模型在复杂软件开发任务中的推理与行动能力。数据集采集了模型在SWE-bench Verified环境中的交互轨迹,涵盖随机选取的100个真实软件仓库问题,通过“思考预算”机制调控模型推理深度。该数据集旨在系统性地量化语言模型在多轮交互式代码生成与错误修复场景下的表现,为智能编程助手的性能基准测试提供了标准化框架,对推动自动化软件工程领域研究具有重要参考价值。
当前挑战
数据集面临双重挑战。从领域问题看,现有主流基准难以覆盖真实软件工程中多步骤、依赖上下文的分析与调试过程,而本数据集需要精确量化模型在长周期任务中的推理效率与准确性,这对评估指标的设计提出了较高要求。从构建过程看,数据收集涉及模拟复杂环境下的模型交互,需确保跨不同任务实例的对话格式一致性与结果可复现性;同时,对验证器输出的准确性要求严苛,任何一个环节的标注偏差都会影响后续模型微调的有效性。
常用场景
经典使用场景
在软件开发与维护的复杂生态中,自动化漏洞修复始终是极具挑战性的前沿课题。该数据集专为评估和训练软件工程智能体(Agent)在真实代码仓库中的调试与补丁生成能力而设计。其经典使用场景聚焦于基于SWE-bench已验证的随机100个文件夹轨迹,构建多轮对话式的推理-行动(ReAct)流程。研究者可利用该数据集重现智能体在给定任务描述下的完整思考过程,验证其是否能在复杂的代码库中定位缺陷并生成修复方案,从而作为衡量基于大语言模型的自动化编程助手性能的标准基准。
解决学术问题
学术界长期困扰于如何客观评估代码智能体在真实软件工程任务中的有效性与泛化能力。该数据集解决了从固定轨迹中提取可复现评估指标的核心难题,通过标准化“任务-对话-结果”三元组结构,为比较不同策略(如多样化思考预算、模型规模及验证器配置)对修复成功率的影响提供了严谨的实验平台。其意义在于推动了代码智能体研究中从简单单元测试到端到端仓库级任务验证的范式转变,使得自动化调试、补丁质量评估以及多步推理规划等关键学术问题的量化分析成为可能。
实际应用
在软件工程实践领域,该数据集的引入为自动化代码审查与持续集成流水线注入了全新的活力。实际应用场景涵盖大型代码仓库的日常维护,帮助开发团队快速定位并修复由验证器标记的异常轨迹。结合智能体的对话历史,企业可构建内部工具,自动分析修复失败案例的原因,优化资源分配。该数据集还支持对智能体在不同编程语言或框架下表现的冷启动测试,显著降低人工调试成本,加速软件交付周期,尤其适用于需要高频迭代的开源或商业项目。
数据集最近研究
最新研究方向
该数据集聚焦于软件工程领域中自动化代码修复Agent的评估与优化,通过记录多轮对话轨迹及验证结果,为研究大语言模型在复杂编程任务中的推理效能与预算控制提供了关键基准。当前前沿方向集中于如何通过有限推理预算(thinkbudget)驱动Agent在SWE-bench等真实代码仓库问题中实现高效的问题定位与修补,同时结合多Agent协作(DCAgent2)与阶段化验证(StageD)策略来提升修复成功率。这一方向与近期大模型在自主软件开发中的热点事件紧密相连,例如AI编程助手在开源社区的广泛应用及其对开发者生产力的显著影响。该数据集的发布为量化Agent的决策质量、探索成本与性能之间的权衡关系,以及推动更可靠、可解释的自动化编程系统发展奠定了实证基础。
以上内容由遇见数据集搜集并总结生成



