遇见数据集

Nexus-Agents-ToolCalling

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

Nexus Agents是一个用于训练工具调用代理的合成对话数据集,专门为Nexus Projects代理训练设计。该数据集包含经过模式验证的工具调用对话,采用OpenAI/mlx_lm的messages+tools格式(包含system、user、assistant-with-tool_calls、tool字段)。数据集涵盖三种核心代理技能:Setup interview(从自由文本想法推断行业/平台/目标,在模糊或歧义时提问)、Discovery(构建用户故事树)和Task generation(将设置和故事转化为具体的、特定堆栈的任务)。每个数据行都包含真实的工具模式(tools字段),确保训练与服务环境一致。数据集包含多个配置:原始v1语料库(599,267行,默认配置分割为539,581行训练和59,688行验证)、stage1配置(60,185行,用于完整LoRA训练,教授三种核心技能)和stage2-recovery配置(16,015行,用于错误恢复训练,包含约50%的stage1重放以防止遗忘)。数据集还包含27个案例的行为面试评估验证数据,用于评估模型性能。数据通过程序化生成,具有高请求措辞和参数多样性(独特消息比率约0.88),经过去重和模式验证(每个工具调用都根据其工具的JSON模式进行验证)。该数据集适用于文本生成、工具调用、函数调用和代理训练等任务,是训练Nexus Projects代理的基础数据。

Nexus Agents is a synthetic dialogue dataset for training tool-calling agents, specifically designed for Nexus Projects agent training. It contains pattern-validated tool-calling dialogues in the OpenAI/mlx_lm messages+tools format (including system, user, assistant-with-tool_calls, and tool fields). The dataset covers three core agent skills: Setup interview (inferring industry/platform/goals from free-text ideas, asking questions in case of ambiguity or vagueness), Discovery (building user story trees), and Task generation (transforming setups and stories into concrete, stack-specific tasks). Each data row includes real tool patterns (tools field), ensuring consistency between training and serving environments. The dataset includes multiple configurations: the original v1 corpus (599,267 rows, default split into 539,581 training and 59,688 validation rows), stage1 configuration (60,185 rows, for full LoRA training to teach the three core skills), and stage2-recovery configuration (16,015 rows, for error recovery training, containing about 50% stage1 replays to prevent forgetting). It also includes behavioral interview evaluation validation data from 27 cases for model performance assessment. The data is programmatically generated with high request phrasing and parameter diversity (unique message ratio approximately 0.88), and undergoes deduplication and pattern validation (each tool call is validated against its tools JSON schema). This dataset is suitable for tasks such as text generation, tool calling, function calling, and agent training, serving as foundational data for training Nexus Projects agents.

创建时间:
2026-06-09
原始信息汇总

数据集概述

数据集名称: Nexus Agents — Tool-Calling Conversations
许可证: Apache-2.0
任务类型: 文本生成
标签: 工具调用、函数调用、智能体、合成数据、nexus
数据规模: 100K < n < 1M

数据集内容

该数据集包含三种智能体技能对话,均采用 OpenAI/mlx_lmmessages + tools 格式(system / user / assistant-with-tool_calls / tool):

  • Setup interview:从自由文本想法推断行业/平台/目标,遇到模糊或歧义时提问(例如“柠檬水摊”→询问“食品饮料还是零售?”),在添加库之前进行查找,并最终确定。
  • Discovery:构建用户故事树。
  • Task generation:将设置和故事转换为具体的、技术栈相关的任务。

每条数据都携带真实工具 schemastools 字段,训练即服务。

训练数据(两个阶段)

发布的 GGUF 模型分两个 LoRA 阶段训练(rank 16,注意力层 + Mamba 混合器 + 共享专家 MLP):

阶段 配置 行数 内容
1 — 全量 LoRA stage1 60,185 (训练 54,648 / 验证 5,540) 三种核心技能
2 — 加法恢复 stage2-recovery 16,015 (训练 14,553 / 验证 1,465) 错误恢复纪律:从损坏的板状态恢复,不再重复询问,最终确定。约 50% 为第一阶段回放以防止遗忘。

阶段 2 数据编码了八次训练运行的经验教训:短/拆分标签批次(长统一工具调用数组成为贪婪解码重复吸引子)和每个陷阱状态恰好一个训练延续(两个近似的上下文使用不同延续会使 temp-0 平局随机化)。

验证数据

verification/ 目录包含 27 个案例的行为面试评估,用于每次发布的门控——包含完整的多轮对话记录(.md 人类可读 + .json 原始)以及基础模型和发布微调模型的得分。案例通过条件:模型覆盖所有必需字段、不重复询问已回答的问题、干净地结束。

指标 基础模型 微调模型
通过场景数 13/27 27/27
每个问题最多询问一次 52% 100%
每次面试平均冗余重新询问次数 4.92 0.89

文件结构

文件 行数 说明
dataset.jsonl 599,267 原始 v1 语料库 ({id, source, messages, tools})
train.jsonl / validation.jsonl 539,581 / 59,688 v1 数据划分(default 配置)
stage1/… 60,185 发布模型的全量 LoRA 语料库
stage2-recovery/… 16,015 发布模型的加法恢复语料库
verification/… 27 个案例 × 2 个模型 行为评估记录 + 分数

数据生成方法

通过程序化生成,具有高请求措辞和参数多样性(唯一消息比率约 0.88),经过去重模式验证(每次工具调用都根据其工具的 JSON 模式进行验证)。生成器 + 种子数据 + 评估框架位于:https://github.com/Geramy/Nexus-Training-Studio-public

搜集汇总
数据集介绍
Nexus-Agents-ToolCalling 数据集图片
构建方式
Nexus-Agents-ToolCalling数据集通过程序化生成管道构建,辅以高请求措辞与参数多样性策略,确保样本的独特性(唯一消息比率约0.88)。生成后的数据经过严格去重处理,并通过JSON模式验证,确保每条工具调用记录均符合其对应工具的模式定义。该数据集涵盖三个核心智能体技能:设置访谈、发现与任务生成,每行数据均包含真实的工具模式信息,以OpenAI或mlx_lm标准的'messages' + 'tools'格式存储。训练采用两阶段LoRA策略,第一阶段专注于核心技能的完整微调,第二阶段则引入错误恢复机制,通过从受损状态恢复、避免重复提问等专项训练,增强模型的鲁棒性。
特点
该数据集最显著的特点在于其高度的专业性与实战导向性。所有对话均基于真实工具模式生成,训练环境与推理环境高度一致。其两阶段训练策略别具匠心,第一阶段覆盖60,185条数据,教授三大核心技能;第二阶段包含16,015条数据,专门强化错误恢复能力,其中约50%为第一阶段的回放数据以防止遗忘。特别地,该数据集在构建过程中融入了多次训练迭代的宝贵经验,通过采用短小或分组的工具调用批次避免贪婪解码重复,以及为每个陷阱状态仅提供单一正确延续,从而优化模型的决策稳定性。
使用方法
该数据集专为训练和评估工具调用型智能体模型而设计。用户可通过HuggingFace的datasets库载入不同的配置(如default、stage1、stage2-recovery),以获取训练与验证拆分。数据集采用标准的多轮对话格式,其中'assistant'角色的响应包含工具调用字段(tool_calls),每轮对话的'tools'字段定义了可供调用的工具模式。训练时,建议按照两阶段顺序依次使用strage1和stage2-recovery配置。对于模型推理,需注意该微调模型具有推理能力,应设置enable_thinking=false,并解析Nemotron模型特有的'<function=…>'工具调用格式。
背景与挑战
背景概述
Nexus-Agents-ToolCalling数据集由Nexus Projects团队于2024年构建,旨在提升大语言模型在工具调用场景下的智能体能力。该数据集专注解决三个核心技能:设置访谈、需求发现与任务生成,通过合成对话数据模拟真实智能体与外部工具的交互流程。其影响力体现在所微调的模型Nemotron-3-Nano-30B-A3B在行为面试评估中实现27/27的满分,较基线的13/27实现显著跃升,为智能体工具调用研究提供了可复现的基准与高质量训练资源。
当前挑战
该数据集直面两大挑战:其一,解决智能体在工具调用中易出现的重复提问与错误恢复问题,通过两阶段训练(核心技能与错误恢复)强化模型仅单次提问、从中断状态恢复及正确终结的能力;其二,构建过程中克服合成数据质量与验证难题,采用程序化生成确保请求措辞与参数多样性,并通过模式验证逐条检验工具调用的JSON结构合规性,最终以27例多轮行为面试作为严格发布门禁,确保数据可靠性。
常用场景
经典使用场景
在智能代理与工具调用领域,Nexus-Agents-ToolCalling 数据集被视为训练语言模型与外部工具进行结构化交互的经典基准。其核心应用涵盖三类关键技能:通过“设置面谈”从用户模糊想法中推断行业、平台与目标,利用“发现”过程构建用户故事树,以及基于上下文生成具体的技术栈任务。该数据集以 OpenAI/ mlx_lm 兼容的 messages + tools 格式呈现,每一行均包含真实工具模式(schemas),使得训练环境与部署环境无缝对齐,为开发可靠的工具调用能力提供了标准化训练素材。
衍生相关工作
该数据集直接催生了 Nemotron-3-Nano-30B-A3B-Nexus-Agents 模型的微调发布,该模型在工具调用评测中取得 27/27 满分,而基础模型仅获 13/27。此外,其配套的 Nexus Training Studio 开源了数据生成器、种子数据与评测工具,为后续研究提供了可复现的框架。相关衍生工作还包括对长工具调用序列中贪婪解码重复吸引问题的深入探讨,以及两阶段训练策略中知识遗忘缓解方法的设计,这些成果共同推动了工具增强型语言模型领域的标准化与实证研究的发展。
数据集最近研究
最新研究方向
在智能体与工具调用领域的当前浪潮中,Nexus-Agents-ToolCalling数据集凭借其合成生成与架构验证的双重特性,成为训练高保真工具调用智能体的标杆性资源。该数据集聚焦于三大核心技能——设置访谈、需求发现与任务生成,通过两阶段低秩适应(LoRA)训练策略,不仅实现了27/27的满分行为面试评估,更在错误恢复、冗余提问消除等关键指标上取得突破性进展。其独特之处在于,每条数据均携带真实的工具架构描述,确保了训练环境与服务场景的无缝对齐。该工作不仅推动了Nemotron-3-Nano-30B-A3B等轻量级模型的智能体能力跃迁,更为工具调用领域的标准化训练数据构建提供了可复现的范式,标志着从传统微调向精准行为调控的重要转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务