SPADE-Environments-ToolUse
收藏资源简介:
该数据集包含由 SPADE 设计器在训练过程中生成的多轮工具使用环境,汇总自 7 次不同运行,涵盖 30B-A3B 和 4B 两种模型规模,共计 2,231 个环境。每个环境对应一个 Python 文件,按源运行和技能进行分类。技能类型包括 API 编排(479 个)、状态修改(389 个)、数据检索(388 个)、错误恢复(375 个)、工具选择(298 个)、多步工作流(286 个)以及未标记(16 个)。每个环境条目在 manifest.json 中记录,包含 source_run、model_scale、recipe、skill 和训练 step 等元数据。该数据集适用于训练和评估多轮工具使用场景中的智能体,例如 API 调用、状态操作、数据查询等任务。需要注意的是,数据集仅捕获了每次训练运行约 4-6% 的步骤,且缺少奖励或结果标签(mean_reward 和 solve_rate 为空)。环境文件需要通过 spade.core.envs.synthetic_game_env.make_synthetic_env 函数加载,而非直接导入。
This dataset contains multi-turn tool-use environments generated by the SPADE designer during training, aggregated from 7 different runs, covering two model scales (30B-A3B and 4B), with a total of 2,231 environments. Each environment corresponds to a Python file, categorized by source run and skill. Skill types include API orchestration (479), state modification (389), data retrieval (388), error recovery (375), tool selection (298), multi-step workflows (286), and unlabeled (16). Each environment entry is recorded in manifest.json with metadata such as source_run, model_scale, recipe, skill, and training step. The dataset is suitable for training and evaluating agents in multi-turn tool-use scenarios, such as API calls, state operations, and data queries. Note that the dataset captures only about 4-6% of steps per training run and lacks reward or outcome labels (mean_reward and solve_rate are empty). Environment files must be loaded via spade.core.envs.synthetic_game_env.make_synthetic_env function, not directly imported.
SPADE生成环境数据集——工具使用
数据集概述
该数据集包含由SPADE设计器在训练过程中编写的多轮工具使用环境,跨7次运行和两种模型规模(30B-A3B和4B)汇总,共2,231个环境。
数据构成
按来源运行划分
| 来源运行 | 模型规模 | 环境数量 |
|---|---|---|
qwen3-30b-0617-tooluse-regen32-mixed |
30B-A3B | 41 |
qwen3-30b-0624-tooluse-blend |
30B-A3B | 243 |
qwen3-30b-0703-tooluse-glory-kl005 |
30B-A3B | 260 |
qwen3-4b-0630-tooluse-eval-aligned-r32 |
4B | 456 |
qwen3-4b-0701-tooluse-glory-kl0 |
4B | 350 |
qwen3-4b-0701-tooluse-glory-kl005 |
4B | 450 |
qwen3-4b-0702-tooluse-kl015-guard |
4B | 431 |
按技能类型划分
| 技能 | 环境数量 |
|---|---|
| API编排 | 479 |
| 状态修改 | 389 |
| 数据检索 | 388 |
| 错误恢复 | 375 |
| 工具选择 | 298 |
| 多步工作流 | 286 |
| 未标注 | 16 |
数据布局
manifest.json:权威列表,每个环境对应一个条目environments/<source_run>/<file>.py:每个环境一个文件
每个条目包含source_run、model_scale、recipe、skill和训练step字段,可用于按运行、规模或配方进行筛选过滤。
注意事项
- 部分捕获:每次来源运行仅捕获了训练步骤的4-6%,这是跨运行的并集,而非任何单次运行的完整输出。
- 无结果标签:这些运行早于奖励合并,因此
mean_reward和solve_rate为空,reward_joined全部为false。 - 环境继承:环境子类化由加载器注入的基类,应使用
spade.core.envs.synthetic_game_env.make_synthetic_env而非直接导入。
审计结果
每个环境均经过加载、执行和13维度评分标准的评判,每个阻塞性发现均交由独立反驳者处理。2,231个环境中690个(31%)被推荐用于训练。
| 处置类型 | 数量 | 含义 |
|---|---|---|
CLEAN |
41 | 未经修改通过所有阻塞维度 |
REPAIRED |
521 | 已修复;通过重新运行环境确认改进 |
REPAIRED_JUDGE_VERIFIED |
128 | 已修复;通过独立重新评判确认,无运行时信号可用 |
QUARANTINE |
1541 | 确认存在阻塞性缺陷;从推荐训练池中排除 |
关键说明
- 未删除任何内容,未移动任何路径。修复的环境在原路径重写;隔离环境仍可下载,在清单中标记而非移除。
- 每个文件的审计前状态可在仓库先前的git修订版中获取。
- 可通过
manifest.json中的audit_disposition字段进行筛选。 audit_blocking_findings命名失败的评分维度;audit_repairs记录所做的更改。- 详细评分标准、方法及审计未涵盖的内容参见
AUDIT.md。
已知数据集级别问题
145个清单条目指定的env_class_name并非加载器实际选择的类,例如:
environments/qwen3-4b-0630-tooluse-eval-aligned-r32/game_00092_092_api_orchestration.pyenvironments/qwen3-4b-0630-tooluse-eval-aligned-r32/game_00148_148_multi_step_workflows.pyenvironments/qwen3-4b-0630-tooluse-eval-aligned-r32/game_00194_194_api_orchestration.py
相关资源




