遇见数据集

autoscientist-toolcaller-dataset

收藏
Hugging Face2026-07-05 更新2026-07-06 收录
官方服务:

资源简介:

AutoScientist Tool-Calling 数据集是一个专门为Adaption AutoScientist Challenge策划的函数调用/工具使用数据集。其核心特点是包含了大量困难负样本和专注于模型可靠性的案例,在这些案例中,正确的行为并非简单的工具调用。数据集旨在用于监督微调(及偏好调优)那些必须可靠决定是否以及如何调用工具(包括安全地拒绝调用)的函数调用模型。数据集包含3,346个示例,划分为训练集、验证集、测试集以及一个专门的test_novel集(包含训练中从未出现过的工具,用于泛化测试)。每个示例采用规范的JSON格式,包含tools(工具列表,含名称、描述和参数)、query(用户查询)、answer(回答,类型为工具调用、拒绝或澄清,并包含具体调用内容和文本)和meta(元数据,标明示例来源和具体种类)字段。数据由多个切片构成:正样本来自ToolACE的真实工具调用示例(经过模式验证),以及一小部分来自确定性工具环境的执行验证示例;困难负样本包括应拒绝调用、应澄清参数缺失或歧义、应坚持调用(针对可满足但表述模糊的请求)以及应进行完整调用(处理部分并行请求)等多种场景;多轮对话涵盖参数缺失、函数缺失、长上下文以及已验证的多调用环境轨迹;模式漂移模拟工具模式在模型使用期间发生变更的场景,如新增必填参数、更改枚举类型或重命名字段,并要求模型做出正确响应。所有工具调用的答案在构建时都经过模式验证,确保零模式无效答案。数据集进行了严格的去重(MinHash + 语义)和去污染处理(检查与公开探针的重叠)。此外,还提供了一个平台增强变体,对提示和补全进行了改写以提升数据质量。数据来源方面,正样本源自并改编自Team-ACE/ToolACE数据集(Apache-2.0许可),所有困难负样本、多轮对话和模式漂移示例均为原创,基于真实工具模式通过模板合成。整个数据集在Apache-2.0许可下发布。当前版本仅限于英语,且合成示例的措辞基于模板,多样性不及完全自然的查询。

The AutoScientist Tool-Calling dataset is a function-calling/tool-use dataset specifically curated for the Adaption AutoScientist Challenge. Its core features include a large number of hard negative samples and cases focused on model reliability, where the correct behavior is not simply tool invocation. The dataset is intended for supervised fine-tuning (and preference tuning) of function-calling models that must reliably decide whether and how to call tools, including safely refusing calls. It contains 3,346 examples, divided into training, validation, test sets, and a dedicated test_novel set (containing tools never seen during training for generalization testing). Each example follows a standardized JSON format with fields: tools (a list of tools with names, descriptions, and parameters), query (user query), answer (response, which can be a tool call, refusal, or clarification, including specific call content and text), and meta (metadata indicating the example source and specific category). The data consists of multiple slices: 1) Positive samples: real tool-calling examples from ToolACE (with schema validation) and a small set of execution-verified examples from deterministic tool environments. 2) Hard negative samples: include scenarios where calls should be refused, clarifications should be made for missing or ambiguous parameters, calls should be persisted (for satisfiable but vaguely expressed requests), and full calls should be made (handling partially parallel requests). 3) Multi-turn dialogues: cover parameter absence, function absence, long contexts, and verified multi-call environment trajectories. 4) Schema drift: simulates scenarios where tool schemas change during model usage, such as adding required parameters, modifying enumeration types, or renaming fields, requiring the model to respond correctly. All tool-call answers are schema-validated during construction to ensure zero schema-invalid answers. The dataset undergoes rigorous deduplication (MinHash + semantic) and decontamination (checking overlaps with public probes). Additionally, a platform-enhanced variant is provided, with rewritten prompts and completions to improve data quality. In terms of data sources, positive samples are derived and adapted from the Team-ACE/ToolACE dataset (Apache-2.0 license). All hard negative samples, multi-turn dialogues, and schema drift examples are original, synthesized via templates based on real tool schemas. The entire dataset is released under the Apache-2.0 license. The current version is English-only, and the phrasing of synthetic examples is template-based, with less diversity than fully natural queries.

创建时间:
2026-07-03
原始信息汇总

数据集概述:AutoScientist Tool-Calling Dataset

基本信息

  • 许可证: Apache-2.0
  • 语言: 英语、西班牙语、法语、印地语
  • 任务类型: 文本生成
  • 标签: 函数调用、工具使用、智能体、硬负样本、AutoScientist
  • 数据规模: 1K < n < 10K

数据分割

数据集包含四个分割:

  • train (train.jsonl)
  • validation (val.jsonl)
  • test (test.jsonl)
  • test_novel (test_novel.jsonl):包含训练中从未见过的工具示例,用于泛化测试

总样本量: 7,566 条(训练/验证/测试集共 7,323 条 + test_novel 243 条),覆盖 7,315 个独特工具

数据格式

每条数据包含以下字段:

  • tools: 工具列表(名称、描述、参数)
  • query: 用户查询
  • answer: 答案(类型为 tool_call / refuse / clarify,包含调用列表和文本内容)
  • meta: 元数据(来源、硬负样本种类、多轮对话种类、模式漂移种类、语言、文档格式、配对ID等)

数据切片与核心特征

正样本

  • 来自 ToolACE 的真实工具调用示例(经过模式验证)
  • 包含少量来自确定性工具环境的执行验证示例

硬负样本(~8.8% 占比,644条)

  • no_tool → 应拒绝调用
  • missing_arg / ambiguous → 应澄清
  • over_refusal → 必须调用(对冲拒绝偏见的满足性请求)
  • partial_parallel → 需要两次调用

多轮对话

  • 缺失参数、缺失函数、长上下文(BFCL v3/v4 风格)
  • 已验证的多调用环境轨迹(2–3个顺序无关的调用)

模式漂移

工具模式在模型使用过程中发生变化:

  • 添加必填参数 / 重命名枚举 → 应澄清
  • 重命名字段 → 映射到新字段

格式不变性孪生数据

同一示例的工具文档以 Python 签名 / XML / 紧凑列表形式渲染,答案相同,用于测试模型对工具文档格式的敏感性。

掩码孪生数据

采用 Hammer 风格的函数掩码:中性名称(func_i / arg_j)保留描述,调用名称一致性重命名,消除命名约定捷径。

故障恢复轨迹

脚本化的临时工具错误(503 / 429 / 超时 / 格式错误负载)中断步骤,黄金答案是重试相同调用。

质量保证

  • 模式验证: 所有 tool_call 黄金答案在构建时经过模式验证,零模式无效样本
  • 去污染: 每个训练查询通过 n-gram 和嵌入检查与公开的 BFCL/ToolACE 测试集重叠,在 stats.json 中记录污染情况
  • 数据质量审计: 修复了拒绝/澄清样本在去重时被静默丢弃的问题,已进行回归测试

来源与许可

  • 正样本源自 Team-ACE/ToolACE(Apache-2.0)
  • 所有硬负样本、多轮对话和模式漂移示例均为原创,基于真实工具模式合成
  • 全部在 Apache-2.0 下发布

预期用途

  • 监督微调和偏好微调,训练函数调用模型可靠地决定是否以及如何调用工具,包括安全拒绝

局限性

  • 主要为英语;多语言孪生切片约 175 条(西班牙语/法语/印地语/印地语罗马化)
  • 合成硬负样本/多轮对话的措辞模板化,多样性有限

复现方法

bash python -m autoscientist_toolcaller.build_dataset --config config.yaml

代码仓库:https://github.com/ankit25bcs10610/adaption-ai-lab

搜集汇总
数据集介绍
autoscientist-toolcaller-dataset 数据集图片
构建方式
AutoScientist Tool-Calling Dataset 的构建基于对现有工具调用数据集的精细筛选与合成扩充。其正向样本源自 Team-ACE/ToolACE,经过严格的 schema 校验,并辅以从确定性工具环境中执行验证的小规模样本。关键的难点负样本、多轮交互样本以及 schema 漂移样本则均为原创,依托真实工具 schema 通过模板化与种子化方法合成。所有样本均经过 schema 校验,并通过 MinHash 和语义去重确保无泄漏与冗余。数据集划分为训练集、验证集、测试集,以及一个专门用于检验泛化能力的测试集,后者包含训练阶段未曾见过的工具。
特点
该数据集最突出的特征在于其大规模的**难点负样本**设计,涵盖拒绝调用、澄清请求、过度拒绝、部分并行调用等精细场景,并保持约 8.8% 的研究最优占比。数据集中引入了**多轮交互**(如缺失参数、缺失函数、长上下文)和**schema 漂移**(如新增必填字段、字段重命名、枚举类型变更),要求模型具备动态适应能力。此外,为对抗格式敏感性与命名捷径,设计了**格式无关孪生对**与**掩码孪生对**,同一样本以不同文档格式呈现或使用中性名称。数据还包含脚本化 transient 工具错误模拟的**故障恢复轨迹**,提供执行标注的偏好配对数据。
使用方法
该数据集主要用于对函数调用模型进行监督微调与偏好调优,以增强其判断“是否”及“如何”调用工具的可靠性。用户可通过 Hugging Face 的 `datasets` 库直接加载预划分的 JSONL 文件,或从 GitHub 仓库运行 `build_dataset.py` 脚本复现构建流程。平台增强变体可通过 `fetch_improved.py` 脚本获取,其包含经过数据中心化重写的丰富提示与补全。推荐的使用流程包括:基于标注数据微调基础模型,再结合偏好数据进行 DPO 训练以提升决策边界,最后在包含未见工具的测试集上评估泛化能力。
背景与挑战
背景概述
AutoScientist Tool-Calling数据集由Adaption机构的研究团队于2024年创建,旨在应对大型语言模型在工具调用场景中的精准决策挑战。该数据集聚焦于函数调用中的鲁棒性与可靠性问题,特别是在模型需要判断何时调用工具、何时拒绝或澄清请求的复杂情境下。其核心创新在于引入了大量硬负样本(hard negatives)、多轮对话(multi-turn)及模式漂移(schema-drift)案例,填补了既有基准测试(如BFCL)对模型安全规避能力评估不足的空白。数据集包含超过7500个示例,覆盖7315种独特工具,并设计了泛化测试集(test_novel)以评估模型对未见工具的适应能力。通过自适应数据增强技术,该数据集在平台评估中实现了模型质量评分从C级到B级的显著提升,对工具增强型语言模型的研究具有重要推进作用。
当前挑战
该数据集致力于解决的核心挑战在于:传统工具调用评测多聚焦于正向调用场景,而实际部署中模型需面对大量需拒绝或澄清的模糊查询(如缺失参数、过度拒绝等),同时需处理工具文档格式敏感、多步调用协调及模式变更等复杂问题。构建过程中面临的首要挑战是确保硬负样本的质量与分布平衡,例如团队曾发现去重流程意外将关键的反例类别(如no_tool)从644条缩减至仅8条,需通过严格的数据质量审计与回归测试修复。此外,多语言覆盖(仅含约175条配对样本)与合成数据模板化导致的语言多样性不足,限制了数据集的跨语言泛化能力。为保持泛化性,还需对训练查询进行n-gram与语义双重去污染检查,以避免与现有基准测试的重叠。
常用场景
经典使用场景
在函数调用与工具使用的前沿研究中,该数据集作为监督微调与偏好优化的核心基准,尤其聚焦于模型在复杂交互场景下的决策可靠性。其经典用例涵盖三大维度:其一,通过硬负样本强制模型学习何时应当拒绝工具调用或请求澄清,而非盲目执行;其二,借助多轮对话与模式漂移样本,检验模型对动态变化工具架构的适应能力;其三,利用格式不变与掩码双胞胎机制,消除模型对特定文档格式或命名约定的过拟合倾向。这一设计使其成为评估大语言模型工具调用鲁棒性的黄金标准。
衍生相关工作
该数据集的架构设计启发了多项延伸工作:其硬负样本构建方法被借鉴用于开发拒绝感知的指令微调策略;多轮模式漂移的生成管道催生了面向动态工具环境的持续学习评估套件;格式双胞胎机制则衍生出针对文档格式鲁棒性的对抗攻击基准。此外,执行验证的偏好数据集直接支撑了基于DPO的工具调用安全对齐研究,而异常恢复轨迹的建模思路已融入故障容忍型智能体框架的设计中。
数据集最近研究
最新研究方向
该数据集聚焦于函数调用场景下的复杂决策边界,尤其通过引入大量硬负样本(如拒绝调用、澄清需求、过拒纠正、部分并行调用等)和多轮对话中的参数缺失、模式漂移等前沿挑战,推动模型从粗暴的“全调或全不调”转向精细化的工具调用推理。其与AutoScientist竞赛及BFCL v3/v4基准接轨,通过格式不变性双胞胎、掩码双胞胎和故障恢复轨迹等设计,系统性检验模型对抗文档格式过拟合、命名捷径及瞬时故障的鲁棒性。平台数据质量评测显示,此类精细构建的示例可将模型质量评分提升10%-15.7%,为构建可信赖的代理系统提供了关键的数据驱动方法论。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务