遇见数据集

ToolMind

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

ToolMind 是一个大规模、高质量的增强推理工具使用数据集,旨在促进工具调用和函数调用相关任务的研究与模型训练。该数据集包含 160,000 个合成数据实例,这些实例基于超过 20,000 个工具生成,并通过一个创新的数据合成流程构建。该流程首先根据工具参数之间的相关性构建一个有向函数图,然后通过涉及用户、助手和工具三种角色的多智能体框架,模拟真实的多轮次用户-助手-工具交互轨迹,以合成代表现实用户目标的意图。为确保数据质量,采用了严格的两阶段过滤机制:先进行轨迹级过滤以保持目标一致性和连贯性,再进行细粒度的回合级过滤,移除错误或未对齐的步骤,最终仅保留高质量的推理轨迹。此外,数据集还整合了约 200,000 个经过处理的增强开源数据实例,来源包括 xlam-function-calling-60k、When2Call、glaive-function-calling-v2、ToolACE、BUTTONInstruct、APIGen-MT-5k 和 Tau-bench 训练集等,这些数据经过了与合成数据相同的拆分和质量过滤流程。数据集主要用于文本生成任务,特别侧重于函数调用和工具调用场景,包含单轮和多轮交互样本。基准测试(如 BFCL-v4, τ-bench, τ²-bench)和消融研究结果表明,使用 ToolMind 数据训练的模型在工具使用相关评估中展现出显著的性能提升。数据集语言为英语,采用 Apache 2.0 许可证发布。

ToolMind is a large-scale, high-quality enhanced reasoning tool usage dataset designed to promote research and model training in tool calling and function calling tasks. The dataset contains 160,000 synthetic data instances, generated from over 20,000 tools, and constructed through an innovative data synthesis process. This process begins by building a directed function graph based on correlations between tool parameters, followed by a multi-agent framework involving user, assistant, and tool roles to simulate realistic multi-turn user-assistant-tool interaction trajectories, synthesizing intents that represent real-world user goals. To ensure data quality, a strict two-stage filtering mechanism is employed: first, trajectory-level filtering to maintain goal consistency and coherence, and then fine-grained turn-level filtering to remove erroneous or misaligned steps, ultimately retaining only high-quality reasoning trajectories. Additionally, the dataset integrates approximately 200,000 processed enhanced open-source data instances from sources including xlam-function-calling-60k, When2Call, glaive-function-calling-v2, ToolACE, BUTTONInstruct, APIGen-MT-5k, and the Tau-bench training set, all of which undergo the same splitting and quality filtering processes as the synthetic data. The dataset is primarily used for text generation tasks, with a particular focus on function calling and tool calling scenarios, including both single-turn and multi-turn interaction samples. Benchmark tests (e.g., BFCL-v4, τ-bench, τ²-bench) and ablation study results show that models trained with ToolMind data exhibit significant performance improvements in tool usage evaluations. The dataset is in English and released under the Apache 2.0 license.

提供机构:
MLX Community
创建时间:
2026-06-06
原始信息汇总

数据集概述:ToolMind

  • 名称: ToolMind: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
  • 许可证: Apache-2.0
  • 语言: 英语 (en)
  • 任务类别: 文本生成 (text-generation)
  • 标签: 函数调用 (function-calling)、工具调用 (tool-calling)、合成数据 (synthetic)
  • 相关论文: https://arxiv.org/abs/2511.15718 (技术报告)

核心特点与规模

  • 规模: 包含16万条通过合成管道生成的高质量工具代理数据集实例,以及超过20万条经过增强的开源数据实例。
  • 工具数量: 使用了超过2万个工具进行数据生成。
  • 数据合成管道: 首先基于参数相关性构建函数图,然后使用多智能体框架模拟真实的用户-助手-工具交互流程。
  • 质量控制: 在轨迹级别验证的基础上,采用了细粒度的轮次级别过滤,移除错误或次优步骤,确保只保留高质量的推理轨迹。

数据组成

数据集包含两个主要部分:

  1. 合成数据 (Synthesized Data): 通过数据合成流程生成,流程包括:
    • 图构建与函数链采样:构建函数间的有向图以建模输入输出兼容性,并通过随机游走采样函数链。
    • 多智能体多轮轨迹合成:合成用户意图,并通过三个不同智能体的模拟创建交互轨迹。
    • 质量过滤:应用轨迹级过滤(保持目标对齐和连贯性)和轮次级过滤(移除错误或不一致步骤)。
  2. 增强的开源数据 (Augmented Open-Source Data): 处理并整合了大量开源数据集,包括:
    • xlam-function-calling-60k
    • When2Call
    • glaive-function-calling-v2
    • ToolACE
    • BUTTONInstruct
    • APIGen-MT-5k
    • Tau-bench training set
    • 所有开源多轮数据都经过了与合成数据相同的分割和质量过滤流程。

数据配置

  • 配置名称: test
  • 数据文件:
    • 分割 graph_syn_datasets: graph_syn_datasets/*
    • 分割 open_datasets: open_datasets/*

性能表现

  • BFCL-v4 2510 基准测试: 在多个模型上展示了性能提升,例如Qwen3-8B和Qwen3-14B在使用ToolMind数据微调后,在“Overall”、“Multi Turn”、“Agentic (Search)”等指标上均有显著提升。
  • τ-bench 和 τ²-bench 基准测试: 使用ToolMind数据微调后,Qwen3-8B和Qwen3-14B在零售、航空等领域的平均得分均有显著提高。
搜集汇总
数据集介绍
ToolMind 数据集图片
构建方式
ToolMind数据集的构建遵循一套严谨的多阶段流水线。首先,基于收集到的海量函数,通过分析其输入输出参数的兼容性,构建一个有向函数图。随后,在该图上执行随机游走以采样函数链,为后续轨迹合成奠定结构化基础。接着,引入一个多智能体仿真框架,分别模拟用户、助手与工具三个角色,根据采样的函数链生成多轮交互轨迹。为确保数据质量,采用双层过滤机制:先是轨迹级别过滤,保证整体目标一致性与逻辑连贯性,再是更加精细的回合级别过滤,剔除其中错误的或次优的步骤,仅保留高质量推理痕迹。最终,融合大量经过同等质量过滤与响应重构流程的开源数据集,形成混合训练集。
使用方法
ToolMind数据集专为文本生成任务设计,尤其适用于函数调用与工具使用场景下的模型微调与评估。用户可通过HuggingFace平台直接加载,数据集包含'test'配置下的'graph_syn_datasets'与'open_datasets'两部分。在模型训练中,可将ToolMind与其他开源工具调用数据集(如xlam-function-calling-60k)结合使用,数据加载后需按原始划分与过滤流程处理,以保持一致性。使用时,每条数据包含多轮对话与对应的工具调用轨迹,建议将其拆分为符合质量过滤标准的片段以最大化训练效率。实验表明,在Qwen3等模型上以标准监督微调方式使用ToolMind,可显著提升其在BFCL-v4、τ-bench等基准上的性能表现。
背景与挑战
背景概述
ToolMind数据集由Yang等人于2025年提出,旨在解决大语言模型在工具调用时缺乏复杂推理能力的问题。随着智能体系统对动态多步工具协同的需求日益增长,现有数据集多局限于单步调用或静态场景,难以支撑模型处理真实世界中的函数链式依赖。该数据集通过构建20余万工具的异构函数图谱,结合多智能体框架模拟用户-助手-工具的多轮交互,生成了16万条高质量合成轨迹,并整合20万条增强开源数据。研究团队来自学术界与工业界,其技术报告发表于arXiv,为提升模型在复杂工具编排任务中的泛化性与鲁棒性提供了关键基准资源。
当前挑战
当前数据集面临的核心挑战源于工具调用任务的复杂性:一是领域问题层面,真实场景中工具调用常涉及跨函数参数耦合与长链依赖,模型需同时保证单步准确性与多轮推理连贯性,现有评估体系如BFCL、τ-bench仍难以全面刻画此类动态协同;二是构建过程中,合成轨迹需通过图采样确保函数链的输入-输出兼容性,但随机游走可能产生逻辑断裂或冗余路径。此外,多智能体模拟生成的用户意图天然带有噪声,须经轨迹级与回合级两级过滤剔除错误步骤,这一过程在保证数据规模的同时极易引入品质波动,对过滤算法的精确性提出了严峻考验。
常用场景
经典使用场景
ToolMind作为大规模、高质量的智能体工具使用数据集,其最经典的应用场景在于训练和评估大型语言模型(LLMs)的函数调用与工具协同能力。该数据集通过构建基于参数相关性的函数图,并采用多智能体框架模拟真实的用户-助手-工具交互轨迹,生成了超过16万条合成实例和20万条增强开源数据。研究者可以借助ToolMind对模型进行多轮对话中的工具选择、参数填充与结果解析等核心能力的训练,从而提升模型在复杂任务中的工具推理与执行性能。
解决学术问题
ToolMind的提出有效解决了当前智能体工具使用研究中高质量训练数据匮乏与合成数据质量难以保证的两大难题。现有数据集往往局限于简单的单轮调用或缺乏对推理链路的精细验证,而ToolMind通过双层质量过滤机制(轨迹级与回合级)剔除了错误或次优步骤,保留了具备可靠学习信号的高质量推理过程。这一设计显著提升了模型在τ-bench、τ²-bench以及BFCL-v4等主流基准测试中的表现,为工具增强型语言模型的学术研究提供了坚实的数据基础与标准化的评估资源。
实际应用
在实际应用中,ToolMind能够赋能各类需要动态工具调用的智能系统,例如智能客服、自动化工作流引擎以及个人数字助手。通过在该数据集上训练的模型,可以更精准地理解用户意图并主动检索和调用外部API(如天气查询、航班预订、数据库操作等),完成跨领域的复杂事务处理。此外,ToolMind还支持live AST和agentic search/memory等高级场景,使其在需要长期记忆与动态信息检索的实时交互系统中具有极高的实用价值。
数据集最近研究
最新研究方向
在工具调用与智能体系统领域,ToolMind数据集通过融合函数图构建与多智能体仿真框架,开创了大规模、高质量推理增强型工具使用数据合成的新范式。该数据集依托超两万工具的图结构参数关联性采样,结合细粒度逐轮过滤机制剔除次优轨迹,显著提升了模型在多轮交互与代理任务中的鲁棒性。其混合训练策略整合多种开源数据源,在BFCL-v4、τ-bench等权威基准上对Qwen3系列模型的性能提升高达14%,揭示了结构化合成数据与质量筛选在工具泛化能力中的关键作用,为构建更可靠的自主智能体奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务