遇见数据集

DCAgent3/aider_polyglot_a3_rl_DCAgent_inferredbugs_sandboxes_verifier_55_8B_20260526_230125

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 57689010 num_examples: 869 download_size: 51122130 dataset_size: 57689010 configs: - config_name: default data_files: - split: train path: data/train-* ---

This dataset consists of multi-turn conversation records and related metadata, designed for analyzing and evaluating the interactive behaviors of AI agents or models. Features include conversations (with role and content fields), agent identifier, model information (model and model_provider), date, task type, episode number, run ID, trial name, result, verifier output, and trace source. The dataset contains 869 training examples with a total size of approximately 57.7 MB, suitable for natural language processing tasks such as dialogue system evaluation, agent behavior analysis, or model performance research.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/aider_polyglot_a3_rl_DCAgent_inferredbugs_sandboxes_verifier_55_8B_20260526_230125 数据集图片
构建方式
该数据集源于多语言编程任务中对智能体代码生成与验证能力的系统性评估需求,构建流程以Polyglot基准测试框架为基础,通过部署多个独立沙箱环境执行智能体生成的代码方案,并引入验证器对每一轮交互中的潜在缺陷进行推断与标记。每条训练样本完整记录智能体与外部工具或执行环境之间的多轮对话轨迹,同时保留模型标识、任务信息、运行标识及验证器输出等元数据,从而形成兼具交互过程与验证信号的训练语料。
特点
数据集聚焦于智能体在代码生成与调试场景中的推断缺陷识别,涵盖869条训练样本,每条样本均包含结构化的多轮对话记录以及智能体、模型、任务、验证器输出等十余项标注字段。数据以沙箱验证结果为核心线索,真实反映智能体在给定编程任务中的行为轨迹与潜在错误模式,具备较强的过程透明性与可追溯性。整体数据规模约57MB,适用于对智能体推理路径与代码验证机制进行细粒度分析。
使用方法
使用者可通过HuggingFace datasets库直接加载默认配置下的训练划分,利用conversations字段还原智能体的完整交互序列,并结合verifier_output与result字段对生成代码的正确性及缺陷类型进行判定。该数据集适用于训练或评估智能体的代码修复与自我验证能力,也可用于分析不同模型在Polyglot编程任务中的推断偏差。加载后可按task、model或episode等字段进行分组统计与对比实验,以支持多样化的研究需求。
背景与挑战
背景概述
面向多语言代码生成与程序修复的评测需求,该数据集依托Aider Polyglot基准构建,于2026年5月由相关研究团队整合强化学习驱动的DCAgent推断缺陷与沙箱验证机制形成。其核心研究问题在于评估大语言模型在跨语言编程任务中的缺陷定位与修复能力,并通过沙箱环境对模型输出进行可执行性验证。数据集收录869个训练样本,涵盖对话轨迹、智能体行为、模型来源及验证结果等多维字段。该工作为代码智能体在真实编程场景中的可靠性评估提供了可复现的测试平台,对推动程序合成与自动调试领域的发展具有参考价值。
当前挑战
该数据集所应对的领域问题在于多语言代码缺陷修复的自动化评估,其难点在于不同编程语言的语法与语义差异显著,模型需在缺乏人工标注的情况下精准推断缺陷位置并生成通过测试的补丁。构建过程中的挑战集中于沙箱验证环境的稳定性与安全性,既要确保代码执行不产生副作用,又需在有限资源下完成批量验证。此外,强化学习智能体生成的推断缺陷可能与真实缺陷分布存在偏差,导致评估结果受智能体策略影响。如何平衡自动化验证的覆盖率与误判率,并保证跨语言任务的可比性,仍是该数据集面临的关键挑战。
常用场景
经典使用场景
在多语言代码生成与程序修复的研究中,该数据集承载了基于Aider Polyglot基准的智能体交互轨迹,典型用法是训练与评估代码智能体在推断缺陷并生成修复补丁时的推理路径。每一条样本记录了智能体在多轮对话中针对特定编程任务的操作、验证器反馈及最终结果,使研究者能够复现智能体在沙箱环境下的决策序列,进而分析其代码理解、错误定位与修补策略。
衍生相关工作
围绕该数据集,衍生工作主要集中于基于验证器反馈的强化学习式代码智能体训练、多语言程序修复的基准评测以及沙箱环境下的智能体安全部署研究。这些工作借助数据集中的对话轨迹与验证器输出,探索缺陷推断的可解释性、修复策略的泛化能力,以及智能体在真实开发流程中的协作模式。
数据集最近研究
最新研究方向
针对多语言代码生成与修复任务中智能体推理轨迹的验证与优化,本数据集汇聚了基于Aider Polyglot基准的强化学习智能体在沙箱环境下的交互记录,涵盖对话历史、验证器输出及运行元数据。当前研究前沿聚焦于利用此类细粒度轨迹数据训练验证模型,以甄别并修正智能体在代码合成过程中产生的隐式缺陷,从而提升自主编程系统的可靠性与泛化能力。该方向与可验证奖励强化学习及过程监督等热点紧密关联,为构建更鲁棒的代码智能体提供了关键数据支撑,对软件工程自动化与程序理解领域具有重要的推动意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务