ToolMind
收藏资源简介:
ToolMind 是一个大规模、高质量的增强推理工具使用数据集,旨在促进工具调用和函数调用相关任务的研究与模型训练。该数据集包含 160,000 个合成数据实例,这些实例基于超过 20,000 个工具生成,并通过一个创新的数据合成流程构建。该流程首先根据工具参数之间的相关性构建一个有向函数图,然后通过涉及用户、助手和工具三种角色的多智能体框架,模拟真实的多轮次用户-助手-工具交互轨迹,以合成代表现实用户目标的意图。为确保数据质量,采用了严格的两阶段过滤机制:先进行轨迹级过滤以保持目标一致性和连贯性,再进行细粒度的回合级过滤,移除错误或未对齐的步骤,最终仅保留高质量的推理轨迹。此外,数据集还整合了约 200,000 个经过处理的增强开源数据实例,来源包括 xlam-function-calling-60k、When2Call、glaive-function-calling-v2、ToolACE、BUTTONInstruct、APIGen-MT-5k 和 Tau-bench 训练集等,这些数据经过了与合成数据相同的拆分和质量过滤流程。数据集主要用于文本生成任务,特别侧重于函数调用和工具调用场景,包含单轮和多轮交互样本。基准测试(如 BFCL-v4, τ-bench, τ²-bench)和消融研究结果表明,使用 ToolMind 数据训练的模型在工具使用相关评估中展现出显著的性能提升。数据集语言为英语,采用 Apache 2.0 许可证发布。
ToolMind is a large-scale, high-quality enhanced reasoning tool usage dataset designed to promote research and model training in tool calling and function calling tasks. The dataset contains 160,000 synthetic data instances, generated from over 20,000 tools, and constructed through an innovative data synthesis process. This process begins by building a directed function graph based on correlations between tool parameters, followed by a multi-agent framework involving user, assistant, and tool roles to simulate realistic multi-turn user-assistant-tool interaction trajectories, synthesizing intents that represent real-world user goals. To ensure data quality, a strict two-stage filtering mechanism is employed: first, trajectory-level filtering to maintain goal consistency and coherence, and then fine-grained turn-level filtering to remove erroneous or misaligned steps, ultimately retaining only high-quality reasoning trajectories. Additionally, the dataset integrates approximately 200,000 processed enhanced open-source data instances from sources including xlam-function-calling-60k, When2Call, glaive-function-calling-v2, ToolACE, BUTTONInstruct, APIGen-MT-5k, and the Tau-bench training set, all of which undergo the same splitting and quality filtering processes as the synthetic data. The dataset is primarily used for text generation tasks, with a particular focus on function calling and tool calling scenarios, including both single-turn and multi-turn interaction samples. Benchmark tests (e.g., BFCL-v4, τ-bench, τ²-bench) and ablation study results show that models trained with ToolMind data exhibit significant performance improvements in tool usage evaluations. The dataset is in English and released under the Apache 2.0 license.
数据集概述:ToolMind
- 名称: ToolMind: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
- 许可证: Apache-2.0
- 语言: 英语 (en)
- 任务类别: 文本生成 (text-generation)
- 标签: 函数调用 (function-calling)、工具调用 (tool-calling)、合成数据 (synthetic)
- 相关论文: https://arxiv.org/abs/2511.15718 (技术报告)
核心特点与规模
- 规模: 包含16万条通过合成管道生成的高质量工具代理数据集实例,以及超过20万条经过增强的开源数据实例。
- 工具数量: 使用了超过2万个工具进行数据生成。
- 数据合成管道: 首先基于参数相关性构建函数图,然后使用多智能体框架模拟真实的用户-助手-工具交互流程。
- 质量控制: 在轨迹级别验证的基础上,采用了细粒度的轮次级别过滤,移除错误或次优步骤,确保只保留高质量的推理轨迹。
数据组成
数据集包含两个主要部分:
- 合成数据 (Synthesized Data): 通过数据合成流程生成,流程包括:
- 图构建与函数链采样:构建函数间的有向图以建模输入输出兼容性,并通过随机游走采样函数链。
- 多智能体多轮轨迹合成:合成用户意图,并通过三个不同智能体的模拟创建交互轨迹。
- 质量过滤:应用轨迹级过滤(保持目标对齐和连贯性)和轮次级过滤(移除错误或不一致步骤)。
- 增强的开源数据 (Augmented Open-Source Data): 处理并整合了大量开源数据集,包括:
- xlam-function-calling-60k
- When2Call
- glaive-function-calling-v2
- ToolACE
- BUTTONInstruct
- APIGen-MT-5k
- Tau-bench training set
- 所有开源多轮数据都经过了与合成数据相同的分割和质量过滤流程。
数据配置
- 配置名称:
test - 数据文件:
- 分割
graph_syn_datasets:graph_syn_datasets/* - 分割
open_datasets:open_datasets/*
- 分割
性能表现
- BFCL-v4 2510 基准测试: 在多个模型上展示了性能提升,例如Qwen3-8B和Qwen3-14B在使用ToolMind数据微调后,在“Overall”、“Multi Turn”、“Agentic (Search)”等指标上均有显著提升。
- τ-bench 和 τ²-bench 基准测试: 使用ToolMind数据微调后,Qwen3-8B和Qwen3-14B在零售、航空等领域的平均得分均有显著提高。




