遇见数据集

DCAgent3/aider_polyglot_sft__pymethods2test_selfsuccess_best1_jsonfmt__laion_GLM_4_7_sweadbbc8b0

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含对话或任务执行记录,每条记录由多个特征组成:conversations字段(一个列表,包含role和content子字段,表示对话中的角色和内容)、agent(代理标识)、model(模型名称)、model_provider(模型提供者)、date(日期)、task(任务类型)、episode(事件或情节标识)、run_id(运行ID)、trial_name(试验名称)、result(结果)、verifier_output(验证器输出)和trace_source(跟踪来源)。数据集分为train分割,包含1,473个样本,总大小约为106.44 MB,下载大小约为93.85 MB。数据文件路径为data/train-*,适用于训练和分析目的。

This dataset contains conversation or task execution records, with each record comprising multiple features: a conversations field (a list with subfields role and content, representing the role and content in dialogues), agent (agent identifier), model (model name), model_provider (model provider), date (date), task (task type), episode (episode or event identifier), run_id (run ID), trial_name (trial name), result (result), verifier_output (verifier output), and trace_source (trace source). The dataset is split into a train partition with 1,473 examples, total size approximately 106.44 MB, and download size approximately 93.85 MB. Data files are located at data/train-*, suitable for training and analysis purposes.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/aider_polyglot_sft__pymethods2test_selfsuccess_best1_jsonfmt__laion_GLM_4_7_sweadbbc8b0 数据集图片
构建方式
该数据集源于多语言代码生成与测试任务的自动化数据构建流程,借助aider_polyglot框架生成初始对话,并运用pymethods2test策略进行自成功筛选,确保每个样本均通过验证器检验。构建过程整合了GLM-4等模型生成的对话轨迹,以JSON格式记录对话轮次、代理、模型、任务及验证输出,最终形成1473个训练实例,总大小约106MB,所有数据均来自模型自主成功的交互记录,并保留完整的运行标识与来源信息。
特点
数据集聚焦于多语言编程场景下的监督微调,特点在于融合了对话式交互与代码验证的双重结构。每条样本不仅包含角色与内容组成的多轮对话,还附有代理、模型、日期、任务、结果及验证器输出等元数据,便于追溯生成过程。其规模适中且经过严格筛选,所有对话均通过自成功验证,保证了高质量与可靠性,适用于代码生成、测试修复及多语言迁移等研究。
使用方法
该数据集可直接通过HuggingFace的datasets库加载,默认配置下包含train划分,用户可访问conversations字段获取多轮对话,并利用agent、model、task等字段进行条件过滤或分析。在监督微调任务中,可将conversations作为输入-输出对训练模型,verifier_output则用于评估生成正确性。使用时需注意数据格式为JSON,且需遵循原始对话结构以保持上下文连贯。
背景与挑战
背景概述
在代码生成与程序合成领域,多语言编程基准的构建始终是衡量模型泛化能力的关键。Aider Polyglot数据集于2024年由Paul Gauthier主导创建,旨在评估大语言模型在多种编程语言上的代码编辑与合成能力。该数据集汇集了来自Python、JavaScript、Rust等语言的编程任务,通过自监督微调与自我成功筛选策略,构建了高质量的对话式训练样本。其核心研究问题在于探究模型能否在跨语言场景中准确理解代码意图并生成可验证的解决方案,对推动代码智能代理的实用化具有显著影响力。
当前挑战
该数据集所应对的领域问题聚焦于多语言代码生成与编辑的准确性验证。其构建过程面临多重挑战:其一,跨语言编程任务需统一评估标准,而不同语言的语法、库生态与执行环境差异显著,导致验证器设计复杂;其二,自监督数据筛选依赖模型自我成功信号,可能引入噪声与偏差,影响训练样本的可靠性;其三,对话式数据的多轮交互特性要求模型在长程依赖中保持上下文一致性,而现有评估指标难以充分捕捉此类动态行为;其四,大规模轨迹数据的存储与解析对计算资源提出较高要求,同时需确保数据隐私与伦理合规。
常用场景
经典使用场景
在代码生成与程序合成的学术探索中,该数据集构筑了面向多语言编程任务的监督微调语料库,其经典使用场景聚焦于训练与评估大语言模型依循自然语言指令生成正确代码片段的能力。研究者常将其作为基准,考察模型在Python等语言上的函数级代码生成表现,并通过单元测试验证生成结果的语义正确性,从而推动代码智能领域的方法迭代与性能比较。
衍生相关工作
围绕该数据集,后续工作多聚焦于代码监督微调策略的改进、多语言程序生成模型的对比分析以及基于执行反馈的强化学习微调。这些工作延续了以可验证代码生成为核心的研究脉络,并进一步拓展至更复杂的软件工程任务,如缺陷修复与仓库级代码合成。
数据集最近研究
最新研究方向
面向多语言编程任务的监督微调数据构建与智能体代码生成评估正成为代码大模型研究的关键环节。该数据集依托Aider Polyglot基准,聚焦Python方法到测试用例的生成任务,通过自成功筛选策略保留最优1条轨迹并以JSON格式组织对话式监督信号,系统记录了智能体、模型来源、执行结果及验证器输出等元信息。此类工作为揭示大模型在真实软件开发场景中的推理路径与失败模式提供了细粒度证据,并推动了自动化编程评测从静态补全向交互式任务求解的范式迁移,对提升代码生成可靠性与可复现性具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务