遇见数据集

SPADE-Environments-ToolUse

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集包含由 SPADE 设计器在训练过程中生成的多轮工具使用环境,汇总自 7 次不同运行,涵盖 30B-A3B 和 4B 两种模型规模,共计 2,231 个环境。每个环境对应一个 Python 文件,按源运行和技能进行分类。技能类型包括 API 编排(479 个)、状态修改(389 个)、数据检索(388 个)、错误恢复(375 个)、工具选择(298 个)、多步工作流(286 个)以及未标记(16 个)。每个环境条目在 manifest.json 中记录,包含 source_run、model_scale、recipe、skill 和训练 step 等元数据。该数据集适用于训练和评估多轮工具使用场景中的智能体,例如 API 调用、状态操作、数据查询等任务。需要注意的是,数据集仅捕获了每次训练运行约 4-6% 的步骤,且缺少奖励或结果标签(mean_reward 和 solve_rate 为空)。环境文件需要通过 spade.core.envs.synthetic_game_env.make_synthetic_env 函数加载,而非直接导入。

This dataset contains multi-turn tool-use environments generated by the SPADE designer during training, aggregated from 7 different runs, covering two model scales (30B-A3B and 4B), with a total of 2,231 environments. Each environment corresponds to a Python file, categorized by source run and skill. Skill types include API orchestration (479), state modification (389), data retrieval (388), error recovery (375), tool selection (298), multi-step workflows (286), and unlabeled (16). Each environment entry is recorded in manifest.json with metadata such as source_run, model_scale, recipe, skill, and training step. The dataset is suitable for training and evaluating agents in multi-turn tool-use scenarios, such as API calls, state operations, and data queries. Note that the dataset captures only about 4-6% of steps per training run and lacks reward or outcome labels (mean_reward and solve_rate are empty). Environment files must be loaded via spade.core.envs.synthetic_game_env.make_synthetic_env function, not directly imported.

创建时间:
2026-08-20
原始信息汇总

SPADE生成环境数据集——工具使用

数据集概述

该数据集包含由SPADE设计器在训练过程中编写的多轮工具使用环境,跨7次运行和两种模型规模(30B-A3B和4B)汇总,共2,231个环境

数据构成

按来源运行划分

来源运行 模型规模 环境数量
qwen3-30b-0617-tooluse-regen32-mixed 30B-A3B 41
qwen3-30b-0624-tooluse-blend 30B-A3B 243
qwen3-30b-0703-tooluse-glory-kl005 30B-A3B 260
qwen3-4b-0630-tooluse-eval-aligned-r32 4B 456
qwen3-4b-0701-tooluse-glory-kl0 4B 350
qwen3-4b-0701-tooluse-glory-kl005 4B 450
qwen3-4b-0702-tooluse-kl015-guard 4B 431

按技能类型划分

技能 环境数量
API编排 479
状态修改 389
数据检索 388
错误恢复 375
工具选择 298
多步工作流 286
未标注 16

数据布局

  • manifest.json:权威列表,每个环境对应一个条目
  • environments/<source_run>/<file>.py:每个环境一个文件

每个条目包含source_runmodel_scalerecipeskill和训练step字段,可用于按运行、规模或配方进行筛选过滤。

注意事项

  • 部分捕获:每次来源运行仅捕获了训练步骤的4-6%,这是跨运行的并集,而非任何单次运行的完整输出。
  • 无结果标签:这些运行早于奖励合并,因此mean_rewardsolve_rate为空,reward_joined全部为false。
  • 环境继承:环境子类化由加载器注入的基类,应使用spade.core.envs.synthetic_game_env.make_synthetic_env而非直接导入。

审计结果

每个环境均经过加载、执行和13维度评分标准的评判,每个阻塞性发现均交由独立反驳者处理。2,231个环境中690个(31%)被推荐用于训练

处置类型 数量 含义
CLEAN 41 未经修改通过所有阻塞维度
REPAIRED 521 已修复;通过重新运行环境确认改进
REPAIRED_JUDGE_VERIFIED 128 已修复;通过独立重新评判确认,无运行时信号可用
QUARANTINE 1541 确认存在阻塞性缺陷;从推荐训练池中排除

关键说明

  • 未删除任何内容,未移动任何路径。修复的环境在原路径重写;隔离环境仍可下载,在清单中标记而非移除。
  • 每个文件的审计前状态可在仓库先前的git修订版中获取。
  • 可通过manifest.json中的audit_disposition字段进行筛选。
  • audit_blocking_findings命名失败的评分维度;audit_repairs记录所做的更改。
  • 详细评分标准、方法及审计未涵盖的内容参见AUDIT.md

已知数据集级别问题

145个清单条目指定的env_class_name并非加载器实际选择的类,例如:

  • environments/qwen3-4b-0630-tooluse-eval-aligned-r32/game_00092_092_api_orchestration.py
  • environments/qwen3-4b-0630-tooluse-eval-aligned-r32/game_00148_148_multi_step_workflows.py
  • environments/qwen3-4b-0630-tooluse-eval-aligned-r32/game_00194_194_api_orchestration.py

相关资源

搜集汇总
数据集介绍
SPADE-Environments-ToolUse 数据集图片
构建方式
该数据集由SPADE设计器在训练过程中生成的多轮工具使用环境构成,汇集了七次运行及两种模型规模(30B-A3B和4B)的产出,共计2,231个环境。每个环境以Python文件形式存储,并按运行来源分目录组织,同时通过清单文件记录其所属运行、模型规模、配方、技能类别及训练步数,便于按需筛选。
使用方法
使用时需通过spade.core.envs.synthetic_game_env.make_synthetic_env加载环境,避免直接导入。清单文件提供audit_disposition字段,可据此过滤出推荐训练的环境,也可依据技能类别或模型规模对数据集进行切片,以适配不同的研究需求。
背景与挑战
背景概述
SPADE-Environments-ToolUse数据集由SPADE项目团队于近期创建,旨在支持多轮工具使用场景的强化学习环境生成。该数据集汇集了SPADE设计器在训练过程中生成的2,231个环境,覆盖两种模型规模(30B-A3B和4B)的七次运行,其核心研究问题在于探索如何利用大型语言模型自主设计多样且可评估的交互环境,以推动智能体在工具调用、错误恢复及多步工作流等技能上的泛化能力。该数据集通过开源发布,为环境生成领域提供了丰富的训练资源与基准,对基于语言模型的环境设计研究具有重要影响。
当前挑战
该数据集面临的领域挑战在于多轮工具使用环境的复杂性与多样性,涉及API编排、状态修改、数据检索等技能,要求环境不仅需模拟真实交互逻辑,还需具备可解性与可评估性。构建过程中遇到若干挑战:首先,采样覆盖率有限,每个训练运行仅捕获4-6%的步骤,导致环境集合不完整;其次,缺乏结果标签,因运行早于奖励机制整合,无法提供奖励或解决率等监督信号;此外,环境代码依赖特定加载器基础类,直接导入可能出错。经审计,仅31%的环境被推荐用于训练,凸显了环境质量参差不齐的问题,包括类名不匹配等缺陷,需依赖自动生成与修复流程来提升可用性。
常用场景
经典使用场景
SPADE-Environments-ToolUse数据集为多轮工具使用环境的设计与评估提供了丰富的基准资源。该数据集包含2,231个由SPADE设计器在训练过程中生成的环境,覆盖API编排、状态修改、数据检索、错误恢复、工具选择以及多步工作流等关键技能范畴。研究者可基于此数据集构建和验证工具使用智能体的性能,尤其是在动态、分布外环境中的泛化能力。每个环境均以Python脚本形式存储,并配有manifest.json元数据,便于按需筛选和加载,为工具使用领域的强化学习研究提供了可复现的实验平台。
解决学术问题
该数据集解决了工具使用智能体研究中环境稀缺和多样性不足的核心问题。传统基准环境多由人工设计,规模有限且难以覆盖复杂工具交互场景。SPADE-Environments-ToolUse通过自动化生成大量多轮工具使用环境,使研究者能够系统性地评估智能体在任务规划、工具选择、错误恢复等方面的鲁棒性。其细粒度的技能标注和审计状态(如CLEAN、REPAIRED、QUARANTINE)为训练数据的质量控制提供了参考标准,有助于推动工具使用强化学习算法的可靠评估与对比。
实际应用
在实际应用中,该数据集可服务于企业级智能助手、自动化运维系统以及对话式AI产品的开发。这些系统需处理复杂的用户请求,涉及调用多个API、管理状态变更并处理异常。通过在此类环境下训练和测试模型,可提升智能体在真实业务场景中的工具调用准确性和容错能力。例如,在客户服务、IT自动化或数据分析等场景中,智能体依赖自然语言理解来编排工具流程,该数据集的环境设计贴近此类需求,为产品落地提供模拟训练场。
数据集最近研究
最新研究方向
SPADE-Environments-ToolUse数据集代表了多轮工具使用智能体训练环境生成领域的前沿探索,其核心创新在于利用自博弈强化学习框架(SPADE)动态合成复杂环境,突破了传统静态基准的局限。该数据集汇聚了2,231个由不同规模模型(30B-A3B与4B)在训练过程中生成的环境,覆盖API编排、状态修改、数据检索、错误恢复、工具选择及多步工作流等关键技能维度,为研究工具使用智能体的泛化能力与鲁棒性提供了丰富素材。尤为值得关注的是,数据集引入了严格的审计机制,通过13维度评估与独立反驳者复核,对31%的环境推荐用于训练,这一方法论为生成式环境的质量控制树立了新标杆。当前研究热点聚焦于环境生成的多样性-质量权衡、跨尺度模型的迁移特性以及基于审计标签的过滤策略对下游训练效果的影响,该资源为构建更强大、更可靠的工具使用智能体奠定了重要基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务