DCAgent3/bfcl_parity_sft__pymethods2test_selfsuccess_best1_jsonfmt__laion_GLM_4_7_swesmi28d0a993
收藏数据链接:
官方服务:
资源简介:
--- dataset_info: features: - name: conversations list: - name: role dtype: string - name: content dtype: string - name: agent dtype: string - name: model dtype: string - name: model_provider dtype: string - name: date dtype: string - name: task dtype: string - name: episode dtype: string - name: run_id dtype: string - name: trial_name dtype: string - name: result dtype: string - name: verifier_output dtype: string - name: trace_source dtype: string splits: - name: train num_bytes: 11736377 num_examples: 404 download_size: 11486897 dataset_size: 11736377 configs: - config_name: default data_files: - split: train path: data/train-* ---
提供机构:
DCAgent3搜集汇总
数据集介绍

构建方式
该数据集立足于智能体与代码生成领域,采用多阶段自动化流程完成构建。其核心数据源自对编程任务场景的模拟,通过让GLM-4等大语言模型在特定编程环境中生成解决方案,并利用自验证机制筛选出模型自身认为成功的最优响应,最终将对话轨迹、任务元数据及验证结果以JSON格式整合为监督微调样本。整个流程强调模型自我评估的准确性,仅保留自我判定为成功的案例,从而保证训练数据的质量与一致性。
特点
数据集以多轮对话为核心组织形式,每个样本均包含角色、内容、智能体标识、模型信息、任务描述及验证器输出等丰富字段,全面刻画了模型在编程任务中的推理与执行过程。其显著特点在于数据规模精炼(约404条训练样本),但每条样本均附带完整的执行轨迹与自我验证结果,涵盖模型供应商、时间戳、试次名称等元数据,为研究模型自我成功判定与代码生成能力提供了细粒度、可追溯的结构化资源。
使用方法
该数据集适用于监督微调任务,尤其针对代码生成与智能体决策场景。使用者可通过加载HuggingFace数据集接口直接获取训练集,利用conversations字段构造对话历史,结合task与verifier_output字段进行条件训练或评估。数据中的agent、model等标识可用于分析不同模型或智能体的表现差异,而result字段则提供了训练目标的直接监督信号。该数据集亦可用于研究自我成功验证机制对下游任务性能的影响。
背景与挑战
背景概述
面向函数调用与代码生成任务的评测需求日益增长,伯克利函数调用排行榜(BFCL)为衡量大语言模型在结构化工具调用中的能力提供了重要基准。该数据集由相关研究团队于近期构建,基于GLM-4等模型在Python方法到测试用例生成任务上的自成功轨迹,经筛选后保留最优样本,并以JSON格式组织对话与验证结果,共计404条训练实例。其核心研究问题在于探索模型如何通过监督微调实现可靠的函数调用与测试生成,进而提升在真实编程场景中的泛化性能,对智能体工具学习与代码生成领域具有参考价值。
当前挑战
该数据集所应对的领域问题在于函数调用与测试用例生成的正确性验证,模型需在复杂工具接口中准确理解意图并生成可执行代码,同时保持结构化输出的一致性。构建过程中的挑战体现在多个方面:从模型自成功轨迹中筛选可靠样本需设计严格的验证机制,避免错误传播;不同任务与智能体配置下的对话轨迹差异显著,统一格式化处理难度较高;验证器输出与最终结果的映射关系需要精确对齐,以确保监督信号的准确性。这些挑战共同构成了数据集质量与可用性的关键制约。
常用场景
经典使用场景
在智能体(Agent)与工具调用领域,该数据集构筑了基于对话的监督微调(SFT)经典范式。其核心使用场景在于训练语言模型依据多轮对话历史,生成结构化的Agent行为或函数调用指令,从而将自然语言理解转化为可执行的API请求或动作序列。404条训练样本均记录了完整对话、Agent身份、模型标识及执行结果,常被用于函数调用(Function Calling)基准的适配与对齐研究,尤其适用于需要严格JSON格式输出的工具使用任务,为评估智能体在复杂交互中的决策连贯性提供了细粒度监督信号。
解决学术问题
该数据集直面学术研究中智能体工具调用泛化能力不足与多轮对话状态跟踪困难的双重挑战。具体而言,它缓解了模型在动态环境里因缺乏执行反馈而导致的动作幻觉问题,通过引入验证器输出(verifier_output)与试验结果,为训练过程提供了可验证的奖励信号。这推动了从静态指令遵循向可执行程序合成的研究转向,对提升大语言模型在真实工具接口上的鲁棒性和自校正能力具有实证意义,也为程序辅助语言模型(PAL)与思维链(CoT)在函数调用场景的结合提供了数据支撑。
衍生相关工作
围绕该数据集,已衍生出若干经典工作方向:其一,基于其对话结构与工具调用格式,研究者拓展了多智能体协作与分层任务分解的SFT策略,如将任务分解为子目标并逐层验证;其二,利用模型与提供商元数据,开展了跨模型工具调用能力的对比分析与蒸馏研究,催生了轻量级函数调用适配器的开发;其三,结合验证器输出,推动了自成功(self-success)训练与拒绝采样微调在工具使用任务中的融合。此外,该数据集还被用于评估JSON格式约束下的生成稳定性,影响了后续结构化输出基准的设计。
以上内容由遇见数据集搜集并总结生成



