遇见数据集

DCAgent3/bfcl_parity_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxeps_1015c97b3

收藏
Hugging Face2026-05-26 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含多轮对话数据,每条记录包括对话内容(角色和内容)、代理、模型、模型提供者、日期、任务、集数、运行ID、试验名称、结果和验证器输出等特征,适用于模型测试、评估或交互任务分析。数据集分为训练集,包含369个样本,总大小约为4.89 MB。

This dataset contains multi-turn conversation data, with each record including features such as conversations (with role and content), agent, model, model provider, date, task, episode, run ID, trial name, result, and verifier output, suitable for model testing, evaluation, or interactive task analysis. The dataset is split into a training set with 369 examples and a total size of approximately 4.89 MB.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/bfcl_parity_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxeps_1015c97b3 数据集图片
构建方式
该数据集面向软件工程智能体在函数调用与代码生成任务中的能力评估而构建,其数据采集依托于受控沙箱环境下的多轮交互实验。每条样本围绕特定编程任务展开,由智能体模型在限定时间内与执行环境进行对话式交互,系统同步记录完整对话轨迹、模型标识、任务描述及运行元数据。所有样本均经过测试用例验证,仅保留在120秒单回合时限内成功通过验证的轨迹,从而确保数据质量与任务完成的有效性。
特点
数据集包含369条训练样本,特征维度覆盖对话内容、智能体类型、模型名称、模型提供方、日期、任务标识、回合编号、运行标识、试验名称、执行结果及验证器输出等字段。其核心特点在于以真实沙箱执行结果为标注依据,融合了模型行为轨迹与程序化验证信号,兼具过程透明性与结果可靠性。数据规模适中,适用于分析智能体在代码修复与测试通过场景下的决策模式与交互策略。
使用方法
使用者可通过HuggingFace数据集接口加载默认配置下的训练集,利用conversations字段获取完整对话序列,结合agent、model与task等元数据开展分组分析或行为建模。result与verifier_output字段可用于监督学习中的奖励信号构建或评估指标计算。该数据集适合用于智能体轨迹分析、函数调用能力评测以及基于沙箱验证的代码生成研究,加载后可直接用于训练或推理流程。
背景与挑战
背景概述
在人工智能迅猛发展的时代,智能体在复杂环境中的自主决策与执行能力成为衡量其智能水平的重要标尺。bfcl_parity_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxeps_1015c97b3数据集正是在此背景下应运而生,其命名中的GLM_4、swesmith、sandboxes等关键词暗示了该数据集与智谱GLM-4模型、软件工程任务及沙箱测试的深度关联。该数据集由智谱AI团队构建,发布于2024年,旨在评估大语言模型在真实软件工程任务中的智能体表现。核心研究问题聚焦于模型在多轮对话中调用工具、操作代码库、通过测试验证的能力。数据集影响力在于为智能体评测提供了标准化、可验证的基准,推动了AI在软件工程自动化领域的发展。
当前挑战
该数据集所面临的挑战具有多维性。在领域问题层面,它致力于解决智能体在软件工程任务中的自主编程与调试问题,这要求模型不仅理解自然语言指令,还需精准操作代码、调用工具并通过测试验证,与ImageNet解决的图像分类问题相比,其复杂性和动态性更高。在构建过程中,挑战主要源于沙箱环境的搭建与测试验证的可靠性:需确保每个任务在隔离沙箱中执行,并集成测试用例以验证智能体输出的正确性,同时保证任务难度适中、覆盖多样编程场景,且模型在不同提供商(如GLM_4_7)下的表现具有可比性,这对数据收集与标注提出了极高要求。
常用场景
经典使用场景
在智能体与代码生成模型的评估领域,该数据集构建了一个基于多轮对话的沙箱编程验证环境,其经典使用场景在于对GLM-4等大模型进行函数调用与代码生成能力的细粒度评测。每一实例包含完整的对话轨迹、代理标识、任务描述与运行结果,并借助SWESmith沙箱及测试预言机制,在120秒内对模型生成的代码进行可执行性验证,从而为模型在复杂交互中的工具调用准确性提供标准化基准。
解决学术问题
该数据集直面大语言模型在代码智能体任务中评测可复现性差、验证信号模糊等核心难题。通过引入沙箱化执行环境与测试驱动的预言验证,它有效缓解了以往依赖静态匹配或人工审核导致的评估偏差,为学者探究模型在函数调用、工具编排及错误恢复等维度的行为规律提供了严谨的数据基础,推动了智能体评估方法从主观判断向客观可验证的方向演进。
衍生相关工作
围绕该数据集已衍生出多项经典工作,包括基于函数调用基准BFCL的扩展评测框架、面向代码智能体的沙箱验证流水线优化,以及针对GLM系列模型的工具学习能力分析。这些工作进一步催生了多智能体协作中的验证机制研究与测试预言自动生成方法,为后续智能体安全性和可靠性的学术探索提供了重要数据支撑与实验范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务