遇见数据集

Turnstile-Synthetic-Domains

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

Data Turnstile — Synthetic Domains 是一个大规模合成函数调用数据集,包含链式思维推理轨迹,专为训练小语言模型在工具使用任务上设计。数据集包含100,262个交互,每个交互由角色序列组成,覆盖1,025个唯一API,每个交互含有5个干扰API,并采用17种模板类型来模拟不同的交互结构。平均每个交互包含约10个角色和约972个token,所有内容为英文。数据由Qwen2.5-32B-Instruct通过Data Turnstile框架生成,该框架采用逐角色分解、结构验证、验证-再生成和重试机制确保质量。数据集包含两个文件:data.jsonl和api_definitions.json。每个交互的字段包括:interaction_template_name、api_names、distractors、interaction。角色包括:SYSTEM、USER、THINKING、API_CALL、API_OBS、ASST。该数据集适用于训练模型进行函数调用和工具选择,支持带或不带链式思维(CoT)的训练模式。实验中,在Qwen3-0.6B上微调该数据集(不含CoT)在Berkeley Function Calling Leaderboard (BFCL v3) 单轮基准上总体准确率从58.2%提升至67.4%(+9.2个百分点)。数据集的限制包括:API定义为合成、交互为LLM生成、API响应为模拟、仅英文、存在教师模型偏差。伦理方面:所有姓名、邮箱、电话、地址均为合成,API定义已过滤不适内容,许可证为CC-BY-NC-4.0。

Data Turnstile — Synthetic Domains is a large-scale synthetic function calling dataset with chain-of-thought reasoning trajectories, designed for training small language models on tool-use tasks. The dataset contains 100,262 interactions, each consisting of a sequence of roles, covering 1,025 unique APIs, with 5 distractors per interaction, and 17 template types to simulate different interaction structures. On average, each interaction has about 10 roles and 972 tokens, all in English. The data was generated by Qwen2.5-32B-Instruct using the Data Turnstile framework, which employs role-by-role decomposition, structural validation, verify-regenerate, and retry mechanisms to ensure quality. The dataset includes two files: data.jsonl and api_definitions.json. Fields per interaction include: interaction_template_name, api_names, distractors, and interaction. Roles include: SYSTEM, USER, THINKING, API_CALL, API_OBS, and ASST. The dataset is suitable for training models on function calling and tool selection, supporting training with or without chain-of-thought (CoT). In experiments, fine-tuning Qwen3-0.6B on this dataset (without CoT) improved overall accuracy on the Berkeley Function Calling Leaderboard (BFCL v3) single-turn benchmark from 58.2% to 67.4% (+9.2 percentage points). Limitations include: synthetic API definitions, LLM-generated interactions may not reflect real distributions, simulated API responses, English-only, and bias from the teacher model (Qwen2.5-32B-Instruct). Ethically, all names, emails, phones, addresses are synthetic; API definitions have been filtered for demographics, adult content, weapons, and surveillance; no harmful tool usage; no proprietary data contamination; licensed under CC-BY-NC-4.0.

提供机构:
Amazon Web Services
创建时间:
2026-07-31
原始信息汇总

Data Turnstile — Synthetic Domains 数据集详情

数据集概述

Data Turnstile — Synthetic Domains 是一个大规模合成函数调用(function-calling)交互数据集,包含思维链(chain-of-thought)推理轨迹,专为训练小型语言模型的工具使用(tool-use)能力而设计。

核心统计

指标 数值
交互总数 100,262
唯一API数量 1,025
每次交互的干扰项数量 5
模板类型 17
每次交互平均角色数 ~10
每次交互平均token数 ~972
语言 英语
生成模型 Qwen2.5-32B-Instruct

数据集文件

  • data.jsonl — 100,262 条交互记录(每行一个JSON对象)
  • api_definitions.json — 1,025 个API定义,包含完整参数模式

数据结构与模式

字段说明

字段 描述
interaction_template_name 描述交互结构的模板类型
api_names 本次交互中实际调用的API列表
distractors 额外5个可用但未使用的API(训练时用于工具选择能力)
interaction 有序的角色字典列表

角色类型

角色 描述
SYSTEM 用于交互时间锚定的日期上下文
USER 自然语言用户请求
THINKING 解释API选择和参数映射的思维链推理
API_CALL Python语法函数调用
API_OBS 模拟的API响应(JSON对象)
ASST 面向用户的助手自然语言回复

模板类型与分布

单轮(1个用户请求,1-4个API调用):

  • TURNS_1_APIS_1(8.7%)
  • TURNS_1_APIS_N_PARALLEL_SINGLE 系列
  • TURNS_1_APIS_N_PARALLEL_MULTIPLE 系列
  • *_SPLITS_X_Y 子组拆分变体

多轮(2-3个连续用户请求):

  • TURNS_2_APIS_2_SINGLE(7.1%)/ TURNS_2_APIS_2_MULTIPLE(5.3%)
  • TURNS_3_APIS_3_SINGLE(5.9%)/ TURNS_3_APIS_3_MULTIPLE(3.7%)

无关性:

  • TURNS_1_IRRELEVANCE(2.5%)— 用户请求无法由可用API满足

数据集用途

训练方式

  • 含思维链训练:使用包括 THINKING 在内的所有角色,训练模型在调用工具前先推理
  • 无思维链训练:移除 THINKING 角色,进行直接函数调用训练(无推理步骤)

并行调用处理

并行API调用以顺序方式存储(API_CALL → API_OBS → API_CALL → API_OBS),如需分组格式可将连续的API_CALL/API_OBS对合并为单个工具调用轮次。

生成方法论

采用 Data Turnstile 框架生成:

  • 角色级分解:每个交互分解为类型化角色的DAG,由教师LLM逐角色生成并验证
  • 结构验证:每个角色通过格式检查(JSON解析、API模式符合性、引用一致性)
  • 验证后生成:质量门控在继续前检查每个角色的正确性
  • 带反馈重试:失败角色在错误上下文中重新生成(最多3次重试)

实验效果

在Qwen3-0.6B上仅使用该数据集微调后,在Berkeley Function Calling Leaderboard (BFCL v3) 单轮基准上:

  • 整体准确率从58.2%提升至67.4%(+9.2个百分点)
  • 匹配基础模型思考模式的表现,且无思维链推理开销

局限性

  • 合成API:API定义为合成生成,非真实服务
  • 合成数据:LLM生成,可能无法反映真实使用分布
  • 模拟观察:API响应为生成,有时不具代表性
  • 仅英文:所有内容均为英语
  • 教师偏差:可能继承Qwen2.5-32B-Instruct的模式和偏见

道德考量

  • 无真实个人身份信息:所有姓名、邮箱、电话和地址均为合成
  • 无攻击性内容:API定义已排除人口统计、成人内容、武器和监控领域
  • 无有害工具使用:API不模拟危险或非法活动
  • 开源权重生成:使用开源权重模型生成,无专有数据污染

许可证

  • 数据集许可证:CC-BY-NC-4.0
搜集汇总
数据集介绍
Turnstile-Synthetic-Domains 数据集图片
构建方式
该数据集依托Data Turnstile框架完成规模化合成,其构建逻辑承袭函数调用领域对结构化监督信号的迫切需求。生成流程采用角色分解策略,将每次交互拆解为具备类型标记的有向无环图,由Qwen2.5-32B-Instruct作为教师模型逐角色生成,并在每一步施以格式校验与模式一致性检查。生成前设置质量门控,对角色正确性进行前置验证;若校验未通过,则携带错误上下文重新生成,最多重试三次。该机制确保所产出的十万余条交互在语法、API模式及指代关系上均满足结构约束,为后续工具选择与参数映射训练奠定可靠基础。
特点
数据集以十万余条函数调用交互为核心,涵盖一千零二十五个合成API定义,并配有完整的参数模式。其显著特征在于引入思维链推理轨迹,以显式角色记录API选择与参数映射的推理过程;同时每条交互附设五个干扰项API,用以强化模型在候选工具池中的甄别能力。模板体系包含十七种类型,涉及单轮与多轮对话、并行调用与拆分调用,以及无法由现有API满足的无关请求场景。平均每条交互约含十个角色、九百七十二个词元,语言为英文,整体规模处于十万至百万区间,为小规模语言模型的工具使用训练提供了充分的结构化语料。
使用方法
使用时可借助HuggingFace Datasets库直接加载,数据集划分为默认配置并指向data.jsonl文件。训练策略具有灵活性:保留THINKING角色可培育具备推理步骤的工具调用模型,剥离该角色则转向直接函数调用训练,且经实验验证后者可在不增加思维链推理开销的前提下达到与思维模式相当的准确率。对于并行调用模板,数据以API_CALL与API_OBS顺序交替的形式存储,若需适配分组式并行训练格式,可将连续调用与观测对合并为单一工具调用轮次。该数据集适用于单轮及多轮函数调用基准评估,亦可用于工具选择与无关请求拒答能力的专项训练。
背景与挑战
背景概述
随着大语言模型在自主智能体与工具调用领域的迅猛发展,函数调用能力已成为衡量模型实用性的关键指标。然而,高质量、大规模且涵盖复杂推理链条的功能调用数据长期匮乏,制约了小型语言模型在该方向上的性能提升。2026年,亚马逊研究者Goutham Ramakrishnan与Megha Sharma提出Data Turnstile框架,并发布Turnstile-Synthetic-Domains数据集。该数据集包含逾十万条合成交互,覆盖1025个API定义与17种模板结构,旨在通过链式思维推理痕迹赋能小模型的工具使用能力,为函数调用数据生成提供了可扩展的开源范式。
当前挑战
该数据集所应对的领域核心挑战在于,现实场景中的函数调用往往涉及多轮对话、并行调用、干扰项筛选及无关请求拒答等复杂情形,而现有资源难以同时兼顾规模与结构多样性。构建过程中亦面临多重困难:需确保每一步推理与API调用在语法和语义上严格合规,维持角色间引用一致性,并通过验证前置与反馈重试机制保障生成质量。此外,合成API与模拟观测的局限性可能引入分布偏差,教师模型的固有偏见亦可能渗透至数据之中,对模型的泛化能力构成潜在影响。
常用场景
经典使用场景
在大规模语言模型工具调用能力的训练中,该数据集以函数调用交互与思维链推理轨迹的联合建模为核心场景。每一则交互样本均涵盖系统日期上下文、用户自然语言请求、思维链推理、Python语法的函数调用、模拟API观测以及助手自然语言回复等完整角色序列,并配备五个干扰API以强化工具选择能力。研究者可借助该数据集训练小规模语言模型在单轮与多轮对话中执行单调用、并行多调用以及无关请求识别等任务,进而系统性地提升模型对复杂工具编排场景的适应能力。
衍生相关工作
该数据集作为Data Turnstile开放框架的组成部分,催生了一系列围绕可扩展函数调用数据生成与评估的后续研究。其配套论文系统阐述了角色分解、结构验证与反馈重试相结合的生成方法论,为后续合成数据工作提供了可复用的技术路线。基于该数据集微调的Qwen3-0.6B模型在BFCL v3单轮基准上取得显著提升,相关实验结果为小模型工具调用能力的边界探索提供了实证参照。此外,数据集中并行调用格式向分组格式转换的说明,也为BFCL等评测体系的格式适配研究提供了实践指引。
数据集最近研究
最新研究方向
在大语言模型智能体与工具调用能力快速演进的背景下,函数调用数据的规模化构建已成为提升小模型工具使用能力的关键瓶颈。Turnstile-Synthetic-Domains依托角色分解与验证先行(Validate-before-Generate)的生成框架,构建了涵盖十万余条交互、逾千个合成API的大规模链式思维函数调用数据集,并系统引入干扰API以强化工具选择能力。该方向的前沿探索集中于以纯合成数据替代昂贵的人工标注,在BFCL v3等基准上验证了仅凭该数据集微调即可使Qwen3-0.6B准确率提升9.2个百分点,并匹配思维链推理的性能而无需推理开销,为小模型智能体的高效部署与可扩展数据生成范式提供了重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务