遇见数据集

DCAgent3/aider_polyglot_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxepf48469bf

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个多轮对话数据集,包含793个训练样本。每个样本包括对话记录(conversations),其中每个对话条目由角色(role)和内容(content)组成,以及元数据如代理(agent)、模型(model)、模型提供者(model_provider)、日期(date)、任务(task)、集数(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和追踪来源(trace_source)。数据集主要用于训练和评估对话系统或相关NLP任务。

This dataset is a multi-turn dialogue dataset containing 793 training samples. Each sample includes a `conversations` field (dialogue records), where each dialogue entry is composed of a role and content, alongside metadata such as agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. This dataset is primarily used for training and evaluating dialogue systems or related natural language processing (NLP) tasks.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/aider_polyglot_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxepf48469bf 数据集图片
构建方式
该数据集立足多语言编程基准评测与自动化软件工程研究背景,通过整合aider_polyglot任务框架、GLM-4模型以及SWESmith沙箱环境,构建了一个具有测试验证与超时限制的编程智能体交互轨迹集合。具体而言,系统在受控执行环境中记录模型与编程任务的完整对话,经由oracle验证机制对每次运行的输出进行正确性判定,并保留120秒最大执行时间约束,从而生成包含793个训练样本的高质量轨迹数据。
特点
数据集显著特征在于其多维度元数据标注体系与真实执行反馈的深度耦合。每个样本不仅涵盖对话内容、智能体类型、模型标识及提供商信息,还囊括任务名称、回合标识、运行编号、试验名称、验证器输出及轨迹来源等字段,为分析编程智能体的行为模式与性能表现提供了细粒度观测视角。数据集总容量约51MB,以结构化方式组织,便于后续统计与模型训练。
使用方法
研究者和开发者可借助HuggingFace datasets库直接加载该数据集,利用train划分进行编程智能体行为建模、结果预测或验证机制分析。通过解析conversations字段可还原人机交互全过程,结合result与verifier_output字段可评估代码生成正确性;agent、model及model_provider等元数据支持跨模型比较与消融实验。使用时应遵循数据许可协议,并注意其在多语言编程任务上的领域适用性。
背景与挑战
背景概述
随着大语言模型在代码生成与软件工程自动化领域的迅猛发展,评估其在多语言、多任务编程环境下的真实能力已成为学术界与工业界的共同关切。该数据集立足于Aider Polyglot与SWE-Smith等前沿基准,汇聚了由GLM-4等模型驱动的智能体在多样化编程任务中的完整交互轨迹,涵盖对话历史、任务标识、验证器输出及运行元数据等多维信息。其构建旨在系统刻画模型在代码合成、调试与测试验证中的行为模式,为多语言编程智能体的能力评估与迭代优化提供了可复现的经验基础,对推动自动化软件工程研究具有重要的实证价值。
当前挑战
该数据集所应对的核心领域问题在于多语言编程环境中代码生成与程序修复的自动化评测,其难点在于不同编程语言在语法范式、运行环境与调试语义上的显著异质性,使得统一的智能体决策与验证流程难以兼顾。构建过程中,如何确保智能体交互轨迹的完整性与可追溯性、验证器输出判定的可靠性,以及沙箱执行环境在有限时间预算内的稳定性与一致性,均构成实质性挑战。此外,对海量交互日志进行标准化清洗与结构化组织,同时保持任务多样性,亦对数据管线的鲁棒性提出了较高要求。
常用场景
经典使用场景
在代码生成与程序合成的学术探索中,该数据集凭借多语言编程任务与智能体交互轨迹的深度融合,构筑了评估代码大模型在复杂沙箱环境下问题求解能力的经典基准。它典型地用于驱动智能体基于自然语言指令或代码补全提示,在隔离沙箱中逐步生成、调试并验证程序,从而系统考察模型在多轮对话中的规划、推理与执行反馈闭环。
实际应用
在工业级软件开发与自动化运维场景中,该数据集所承载的沙箱交互范式可迁移至持续集成流水线,辅助智能体自动修复缺陷、生成单元测试或重构代码。其多语言覆盖与执行验证机制,亦可用于构建面向编程教育的智能辅导系统,实时评估学习者的代码提交并给出针对性反馈,从而提升开发效率与教学质量。
衍生相关工作
围绕该数据集衍生的经典工作主要聚焦于智能体代码生成框架的优化与评测协议的标准化。后续研究常以其为基准,探索多智能体协作、自我修复循环以及执行引导的搜索策略,并催生了一系列关于沙箱安全隔离、测试用例自动生成与代码正确性形式化验证的延伸文献,持续丰富着代码智能的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务