遇见数据集

DCAgent3/gaia_127_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxeps_131k5dec893b

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含533个训练示例,主要特征包括对话记录(conversations,由角色和内容组成的列表)、代理(agent)、模型(model)、模型提供商(model_provider)、日期(date)、任务(task)、剧集(episode)、运行ID(run_id)、试验名称(trial_name)、结果(result)、验证器输出(verifier_output)和跟踪来源(trace_source)。数据集可能用于研究多轮对话系统、代理交互或任务执行评估,涉及不同模型和提供商的实验数据,每个示例记录了一次对话或任务的完整过程及其结果。数据以训练集形式提供,总大小约为25.1 MB。

This dataset consists of 533 training examples, with key features including conversations (a list comprising role and content), agent, model, model_provider, date, task, episode, run_id, trial_name, result, verifier_output, and trace_source. It is likely designed for research on multi-turn dialogue systems, agent interactions, or task execution evaluation, involving experimental data from various models and providers. Each example documents a complete dialogue or task process along with its outcome. The data is provided as a training split with a total size of approximately 25.1 MB.

提供机构:
DCAgent3
搜集汇总
数据集介绍
DCAgent3/gaia_127_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxeps_131k5dec893b 数据集图片
构建方式
该数据集基于GAIA基准测试构建,通过GLM-4-7B模型在沙盒环境中执行复杂代理任务,并利用Oracle验证器对每轮交互的结果进行严格校验。数据收集过程中,设定了120秒的最大执行时间及最多131k个回合的探索上限,确保了任务完成的质量与多样性。最终,所有通过验证的对话轨迹被整理为结构化数据,包含角色、内容、代理类型、模型信息、时间戳等字段,形成了包含533条训练样本的高质量交互语料库。
特点
数据集的最大特色在于其严谨的验证机制与丰富的元数据标注。每一条对话均附带Oracle验证器的输出结果,确保了任务执行的真实性与可靠性。此外,数据包含了从代理类型、模型提供方到具体任务、运行编号等多维度信息,为研究多轮对话中的代理行为、工具调用及决策过程提供了详尽的分析基础。其结构化设计便于研究人员深入探究复杂任务中语言模型与外部环境的交互模式。
使用方法
该数据集适用于训练和评估多轮对话代理系统,特别是在需要工具调用与复杂任务规划的场景中。用户可加载JSON格式的数据,利用'conversations'字段中的角色与内容进行序列化建模,并结合'result'与'verifier_output'字段作为监督信号或奖励函数。建议采用对话式预训练与强化学习相结合的方法,以提升模型在开放式任务中的自主决策与错误修正能力。数据默认分为单一训练集,可直接用于微调或作为基准测试的参考语料。
背景与挑战
背景概述
该数据集名为gaia_127_GLM_4_7_swesmith_sandboxes_with_tests_oracle_verified_120s_maxeps_131k5dec893b,由研究者基于GAIA基准构建,聚焦于多轮对话中智能体的推理与工具使用能力。创建于2024年之后,依托GLM-4-7B模型与Sandboxes环境,旨在评估智能体在复杂任务中调用外部工具、生成代码并验证结果的能力。核心研究问题围绕如何通过对话数据驱动智能体的自主决策与验证机制。该数据集对智能体学习与评估领域具有重要影响,为构建更鲁棒的自主系统提供了高可信度的训练与测试样本。
当前挑战
领域问题挑战在于智能体需在有限步骤内完成多步推理与工具调用,并应对开放域任务中的不确定性,例如代码执行错误或环境状态变化。构建过程中,挑战包括设计精确的oracle验证器以过滤失败轨迹,平衡数据多样性(涵盖127种任务类型)与质量,以及处理长时对话(120秒上限)中的逻辑一致性,确保每个episode的trace可复现且无歧义。
常用场景
经典使用场景
该数据集源自GAIA基准测试,专注于评估和训练具备工具调用与多步推理能力的智能体(Agent)。其经典使用场景在于构建和验证能够自主完成复杂任务的对话系统,例如在沙盒环境中通过执行代码、调用API或访问外部资源来解决结构化问题。数据集包含533条经过验证的轨迹,每条均记录了完整的多轮交互、任务描述、验证结果及环境反馈,为训练强化学习或模仿学习策略提供了高质量的细粒度监督信号。研究者常利用其“验证器输出”字段来设计奖励模型,从而优化智能体的决策路径,使其在有限步骤内达成目标。
解决学术问题
该数据集有效解决了学术研究中智能体泛化能力与鲁棒性评估的难题。在传统基准测试中,模型常因任务分布的局限性而表现出虚假的相关性,而GAIA_127的多样任务覆盖了数学推理、信息检索、代码生成等需要跨领域协作的场景,促使研究者关注智能体在未知环境中的零样本适应能力。通过记录执行轨迹与验证结果,它揭示了现有模型在工具选择、错误恢复及多步规划上的短板,推动了关于因果推理、反事实学习以及可解释性策略的探索。这一数据资源的开放显著加速了面向通用人工智能的自主决策系统的发展。
衍生相关工作
该数据集衍生了一系列关键工作,包括利用其验证结果改进的开放式问答Agent架构,以及基于其轨迹数据预训练的思维链生成模型。研究者在此基础上提出了“反事实回溯”微调方法,通过对比成功与失败的轨迹来优化智能体的错误纠正能力。此外,数据集中的多轮交互模式被用于改进内部语言模型的基础能力,例如在Meta-CoT(认知链)框架中作为稀疏监督信号,提升了模型在复杂推理任务中的透明度。这些衍生工作共同推动了从静态数据集到动态交互评估范式的转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务