DCAgent3/aider_polyglot_rl_think_npfg_code_contests_900s_45_20260526_213939
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 49686186 num_examples: 771 download_size: 43353417 dataset_size: 49686186 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
DCAgent3搜集汇总
数据集介绍

构建方式
该数据集立足于代码生成与强化学习评估的交叉领域,其构建依托Aider Polyglot多语言编程基准,以竞赛级代码任务为驱动。构建过程将代码竞赛问题置于交互式代理环境中,通过设定900秒的时间约束,记录模型在解题过程中的完整多轮对话轨迹。每条样本均由真实运行中的智能体行为衍生而来,涵盖模型推理、工具调用与代码执行等环节,并借助验证器对最终方案进行自动化评判,从而形成对话内容与验证结果一一对应的结构化数据。
特点
数据集聚合了771条训练样本,总规模约49.7MB,字段设计兼顾过程性与结果性信息。对话字段以角色和内容配对的形式保留推理全貌,同时附带agent、model、model_provider等元信息以标识生成来源,并引入task、episode、run_id、trial_name等标识实现实验可追溯。result与verifier_output字段提供最终判定及验证细节,trace_source则揭示轨迹来源,使数据兼具多语言编程任务的多样性、时间约束下的行为完整性与自动化验证的可信度。
使用方法
使用者可通过HuggingFace datasets库加载默认配置下的train划分,直接访问conversations字段以获取多轮对话序列,并结合agent、model等字段筛选特定来源的轨迹。该数据集适用于分析代码生成代理的推理模式、评估模型在限时编程任务中的表现,亦可作为强化学习或监督微调的训练语料。借助result与verifier_output字段,研究者能够对生成方案进行正确性校验与错误归因,开展细粒度的过程评估与对比实验。
背景与挑战
背景概述
该数据集于2026年5月构建,依托Aider项目对多语言编程竞赛任务的强化学习探索,汇聚了来自多个模型在900秒时限内完成Polyglot基准测试的交互轨迹。其核心研究问题在于评估大语言模型在代码生成与竞争性编程场景下的推理能力,通过记录对话、代理行为与验证器输出,为模型编程能力的精细化归因提供细粒度依据。该数据集承袭了编程竞赛与代码生成评测的学术脉络,对强化学习驱动的代码智能研究具有基准性意义,并为后续多语言代码推理工作提供了可复用的轨迹资源。
当前挑战
在领域问题层面,该数据集直面多语言竞争性编程中代码正确性、算法效率与跨语言泛化能力的综合挑战,要求模型在有限时间内完成从问题理解到可执行代码生成的完整推理链条。构建过程中,数据采集需协调多模型提供方与多样化代理配置,确保对话轨迹、验证器反馈与结果标签之间严格对齐;同时,900秒时限下的交互日志存在长度差异与噪声干扰,如何筛选有效回合、统一验证标准并保留完整推理路径,构成数据质量保障的关键难点。
常用场景
经典使用场景
在程序合成与自动化代码生成的学术探索中,该数据集充当了基于多语言编程竞赛任务的强化学习训练与评估基座。其经典使用场景聚焦于智能体在有限时间约束下,通过交互式对话与代码执行反馈,逐步生成满足复杂算法要求的程序。研究者常将其用于训练和测试模型在Python、Java、C++等多语言环境中的推理、调试与优化能力,对话轨迹中蕴含的思考过程与验证器输出为分析智能体决策模式提供了丰富素材。
实际应用
在工业级软件开发与编程教育场景中,该数据集支撑了智能编程助手的训练与评测。实际应用中,此类数据可用于构建能够理解自然语言需求、自主编写并调试多语言代码的自动化代理,辅助开发者快速完成算法竞赛题目、单元测试生成或遗留代码迁移。其记录的真实交互轨迹也为编程教学系统提供了范例,帮助学生观察专家级问题拆解与错误修正策略,从而提升编程实践能力。
衍生相关工作
围绕该数据集,学界与工业界衍生出多项经典工作。例如,基于其多语言代码竞赛环境,研究者提出了融合执行反馈的强化学习微调方法,显著提升了开源模型在HumanEval等基准上的通过率;同时,该数据集的结构化对话与验证器输出催生了过程奖励模型与代码批判模型的训练范式,推动了智能体自我修复与迭代优化框架的发展,为后续更大规模代码智能体数据集的设计奠定了基础。
以上内容由遇见数据集搜集并总结生成



