遇见数据集

Turnstile-Synthetic-Domains

收藏
arXiv2026-07-31 更新2026-08-04 收录
官方服务:

资源简介:

Turnstile-Synthetic-Domains数据集由亚马逊AGI团队创建,是一个基于Data Turnstile框架生成的高质量函数调用合成数据集。该数据集包含1000多个API定义和超过10万条多轮交互样本,平均每条交互包含约972个令牌,涵盖从简单单轮到复杂多API调用场景。数据集通过解耦角色生成、逐步骤验证和错误反馈循环的流程创建,确保API调用格式正确、参数真实且交互自然。该数据集旨在为小型语言模型提供高质量监督微调数据,解决其在工具使用任务中训练数据稀缺和噪声大的问题,显著提升模型在函数调用基准上的表现。

The Turnstile-Synthetic-Domains dataset, created by the Amazon AGI team, is a high-quality function-calling synthetic dataset generated based on the Data Turnstile framework. It contains over 1000 API definitions and more than 100,000 multi-turn interaction samples, with an average of approximately 972 tokens per interaction, covering scenarios ranging from simple single-turn to complex multi-API call cases. The dataset is developed through a workflow that decouples role generation, step-by-step validation, and error feedback loops, ensuring correct API call formats, realistic parameters, and natural interactions. This dataset aims to provide high-quality supervised fine-tuning data for small language models, addressing the issues of scarce training data and high noise in tool-use tasks, and significantly improving the model's performance on function-calling benchmarks.

提供机构:
亚马逊AGI
创建时间:
2026-07-31
原始信息汇总

Data Turnstile - Synthetic Domains 数据集详情

数据集概览

这是一个大规模的函数调用交互合成数据集,包含思维链推理轨迹,专为训练小型语言模型在工具使用任务上的能力而设计。

指标 数值
交互数量 100,262
唯一API数量 1,025
每次交互的干扰项数量 5
模板类型 17
每次交互平均角色数 ~10
每次交互平均令牌数 ~972
语言 英语
生成模型 Qwen2.5-32B-Instruct

文件结构

  • data.jsonl — 包含100,262条交互记录(每行一个JSON对象)
  • api_definitions.json — 包含1,025个带有完整参数模式的API定义

数据模式

每条交互记录包含以下字段:

字段 描述
interaction_template_name 描述交互结构的模板类型
api_names 实际调用的API列表
distractors 可用但未使用的5个额外API(用于训练工具选择能力)
interaction 有序的角色字典列表

角色类型

角色 描述
SYSTEM 用于交互基础的时间日期上下文
USER 自然语言用户请求
THINKING 解释API选择和参数映射的思维链推理
API_CALL Python语法函数调用
API_OBS 模拟的API响应(JSON对象)
ASST 助手对用户的自然语言响应

模板类型

单轮模板(1个用户请求,1-4次API调用)

  • TURNS_1_APIS_1 — 单次调用
  • TURNS_1_APIS_N_PARALLEL_SINGLE — 对同一API的N次不同参数调用
  • TURNS_1_APIS_N_PARALLEL_MULTIPLE — 对多个不同API的N次调用
  • *_SPLITS_X_Y — N次调用分布在子组中

多轮模板(2-3个顺序用户请求)

  • TURNS_2_APIS_2_SINGLE / TURNS_2_APIS_2_MULTIPLE — 2轮,每轮1次调用
  • TURNS_3_APIS_3_SINGLE / TURNS_3_APIS_3_MULTIPLE — 3轮,每轮1次调用

无关性模板

  • TURNS_1_IRRELEVANCE — 用户请求无法由可用API满足(无API_CALL/API_OBS)

模板分布

主要模板及占比:

  • TURNS_1_APIS_1:8.7%
  • TURNS_1_APIS_2_PARALLEL_SINGLE:8.0%
  • TURNS_1_APIS_3_PARALLEL_SINGLE:8.5%
  • TURNS_1_APIS_4_PARALLEL_SINGLE:8.1%
  • TURNS_2_APIS_2_SINGLE:7.1%
  • TURNS_1_APIS_2_PARALLEL_MULTIPLE:6.3%
  • 其余模板占比从2.5%到6.0%不等

使用方法

训练选项

  • 带思维链训练:使用所有角色(包括THINKING)训练模型在调用工具前进行推理
  • 无思维链训练:移除THINKING角色,进行直接函数调用训练

并行API调用处理

并行API调用以顺序方式存储在交互中(API_CALL → API_OBS → API_CALL → API_OBS),如需分组(如BFCL格式),可将连续的API_CALL/API_OBS对合并为单个工具调用轮次。

生成方法

使用 Data Turnstile 框架生成:

  • 角色级分解:将交互分解为类型化角色的DAG,由教师LLM逐个生成并验证
  • 结构验证:每个角色通过格式检查(JSON解析、API模式一致性、引用一致性)
  • 先生成后验证:质量门控检查每个角色的正确性
  • 带反馈的重试:失败角色在错误上下文中重新生成(最多3次重试)

生成硬件:p5.48xlarge EC2实例(8xH100),使用vLLM服务。

基准测试结果

使用Qwen3-0.6B模型在BFCL v3单轮基准上评估(无思维链模式,移除THINKING角色):

模型 总体准确率 非实时准确率 实时准确率 无关性
Qwen3-0.6B基础(无思维链) 58.20% 63% 53.40% 90.60%
Qwen3-0.6B基础(思维链) 67.40% 72.30% 62.50% 81%
Qwen3-0.6B + 本数据集(无思维链) 67.40% 75.90% 58.90% 75.60%

使用本数据集训练可将Qwen3-0.6B的准确率从58.2%提升至67.4%(+9.2个百分点),在无思维链推理开销的情况下达到基础模型思维链模式的性能。

局限性

  • 合成API:1,025个API定义为合成生成,非真实服务
  • 合成数据:所有交互由LLM生成,可能无法反映真实使用分布
  • 模拟观测:API响应为生成内容,非真实执行结果
  • 仅英语:所有内容均为英文
  • 教师偏差:Qwen2.5-32B-Instruct的模式和偏差可能已传入生成数据

伦理考量

  • 无真实PII:所有姓名、邮箱、电话和地址均为合成
  • 无冒犯性内容:API定义已过滤人口统计、成人内容、武器和监控领域
  • 无有害工具使用:API不模拟危险或非法活动
  • 开源权重生成:使用开源权重模型生成,无专有数据污染

许可证

  • 数据集:CC-BY-NC-4.0

引用信息

论文标题:"Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation",作者:Goutham Ramakrishnan 和 Megha Sharma,年份:2026,arXiv编号:2607.29250。

联系方式

  • Goutham Ramakrishnan(gorama@amazon.com)
  • Megha Sharma(meghshar@amazon.com)
搜集汇总
数据集介绍
Turnstile-Synthetic-Domains 数据集图片
构建方式
Turnstile-Synthetic-Domains数据集基于Data Turnstile框架构建,该框架将多轮工具使用交互分解为有向无环图(DAG)中的角色序列,包括用户查询、推理轨迹、API调用、执行输出及助手响应。每个角色独立生成,并配备约束条件与验证机制,通过错误反馈循环进行重试,确保生成内容的结构完整性与参数真实性。数据集涵盖1,025个API,覆盖金融、天气、地图、电子商务等50多个领域类别,共计约10万次交互,并包含详细的思维链推理轨迹,以支持小语言模型的高质量微调。
特点
该数据集具有高度的多样性与质量保障。通过模板级和参数级控制,实现了交互结构的多样化,包括单次调用、并行调用、多轮对话等多种模式。动态模板扰动进一步模拟了工具执行失败、信息不完整等真实场景,增强了模型的鲁棒性。此外,数据生成过程中采用了验证前置、错误反馈与提前终止机制,确保每个样本符合语法规范且无参数幻觉。人类评估显示,数据在正确性、自然性和基础性方面均获得高分,表明其具有极高的实用价值。
使用方法
该数据集适用于监督微调(SFT)小语言模型,以提升其函数调用能力。模型训练时,可结合语义相似的干扰工具,增强工具选择的判别能力。在单轮基准BFCL上,使用该数据集微调的Qwen3-0.6B模型无需思维链即可达到75.9%的准确率,接近更大的模型。对于多轮代理任务,如电信领域的τ2-bench,该数据集能显著提升模型性能,甚至超越32B规模的模型。研究人员还可根据自身需求,利用Data Turnstile框架生成定制化数据,以适配特定领域或API集合。
背景与挑战
背景概述
Turnstile-Synthetic-Domains数据集由亚马逊AGI团队于2026年推出,旨在解决小语言模型(SLM)在函数调用任务中训练数据稀缺且质量不佳的核心瓶颈。该数据集基于Data Turnstile框架生成,通过分解多轮工具交互为逐步生成与验证的过程,严格控制API多样性、对话复杂性和输出正确性。数据集包含超过1000个API和10万次多轮交互,覆盖金融、天气、地图、电商等50多个领域,显著提升了SLM的函数调用能力。研究团队通过BFCL和τ2-bench基准验证了其有效性,证明基于该数据集微调的0.6B模型在单轮任务上接近3倍大的模型性能,在多轮任务上甚至超越32B模型。这一数据集为SLM在边缘部署和低延迟场景中的应用提供了高质量训练资源,推动了函数调用数据生成方法的创新。
当前挑战
该数据集面临多方面的挑战。在领域问题层面,函数调用任务要求模型精准理解用户意图、正确选择并调用API、解析参数并处理多轮对话中的复杂依赖关系,而SLM容量有限,难以像大模型那样从噪声数据中泛化。构建过程中,挑战尤为突出:端到端生成方法在多轮交互中易产生不自然对话、格式错误和幻觉参数;执行验证方法依赖API实现,限制了数据覆盖范围。Turnstile通过分解生成步骤、逐角色验证、错误反馈重试和模板化多样性控制应对这些难题,但仍需面对生成失败率随交互复杂度上升(单轮并行调用从7%升至22%)、复杂场景下数据质量下降,以及确保生成数据满足策略一致性和内容安全性等挑战。
常用场景
经典使用场景
Turnstile-Synthetic-Domains数据集作为函数调用领域的大规模合成训练语料,其最经典的使用场景在于为小型语言模型(SLMs)提供高质量的监督微调(SFT)数据,以增强其工具调用与智能体任务执行能力。该数据集涵盖超过1000个API定义和10万+多轮交互样本,覆盖金融、天气、地图、电子商务等50余个领域类别,并包含单轮、并行、多API并行及多轮等多种交互模板。研究者可直接利用该数据集对SLMs进行全参数微调,使其在未见过的API模式上表现出优异的泛化性能,相较于使用原始开源数据训练的模型,其准确性显著提升,从而为资源受限环境下的高效智能体部署奠定坚实基础。
实际应用
在实际应用层面,Turnstile-Synthetic-Domains数据集为边缘计算、隐私敏感场景下的智能客服、个人助理及自动化工作流等提供了直接可用的训练资源。企业可以依据自身API定义,借助Turnstile框架快速生成定制化的函数调用数据,从而免去昂贵且耗时的人工数据采集与标注流程。该数据集在电信、银行等特定领域的域适应实验中,使0.6B参数的模型在多轮智能体基准上达到甚至超越32B模型的零样本性能,展示了其在降低部署成本、提升响应速度的同时维持任务完成率的能力,为行业落地SLM驱动的智能体系统提供了可复用的数据基础设施。
衍生相关工作
该数据集的发布推动了多项后续研究工作,包括对合成数据生成质量评估指标的完善、SLM在无思维链推理模式下的能力边界探索,以及工具调用数据增强与权重策略的优化。基于此数据集,研究者进一步探索了结合强化学习的偏好数据生成、多智能体交互数据的自动构建,以及跨模型架构的迁移学习策略。此外,该数据集还催生了对数据多样性量化方法的研究,促进了如ToolWeave、APIGen-MT等后续工作的发展,这些工作或借鉴其模板化生成思路,或在其基础上扩展策略文档驱动的生成范式,共同促进了函数调用数据生成领域的繁荣。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务