Nexus-Agents-ToolCalling
收藏资源简介:
Nexus Agents是一个用于训练工具调用代理的合成对话数据集,专门为Nexus Projects代理训练设计。该数据集包含经过模式验证的工具调用对话,采用OpenAI/mlx_lm的messages+tools格式(包含system、user、assistant-with-tool_calls、tool字段)。数据集涵盖三种核心代理技能:Setup interview(从自由文本想法推断行业/平台/目标,在模糊或歧义时提问)、Discovery(构建用户故事树)和Task generation(将设置和故事转化为具体的、特定堆栈的任务)。每个数据行都包含真实的工具模式(tools字段),确保训练与服务环境一致。数据集包含多个配置:原始v1语料库(599,267行,默认配置分割为539,581行训练和59,688行验证)、stage1配置(60,185行,用于完整LoRA训练,教授三种核心技能)和stage2-recovery配置(16,015行,用于错误恢复训练,包含约50%的stage1重放以防止遗忘)。数据集还包含27个案例的行为面试评估验证数据,用于评估模型性能。数据通过程序化生成,具有高请求措辞和参数多样性(独特消息比率约0.88),经过去重和模式验证(每个工具调用都根据其工具的JSON模式进行验证)。该数据集适用于文本生成、工具调用、函数调用和代理训练等任务,是训练Nexus Projects代理的基础数据。
Nexus Agents is a synthetic dialogue dataset for training tool-calling agents, specifically designed for Nexus Projects agent training. It contains pattern-validated tool-calling dialogues in the OpenAI/mlx_lm messages+tools format (including system, user, assistant-with-tool_calls, and tool fields). The dataset covers three core agent skills: Setup interview (inferring industry/platform/goals from free-text ideas, asking questions in case of ambiguity or vagueness), Discovery (building user story trees), and Task generation (transforming setups and stories into concrete, stack-specific tasks). Each data row includes real tool patterns (tools field), ensuring consistency between training and serving environments. The dataset includes multiple configurations: the original v1 corpus (599,267 rows, default split into 539,581 training and 59,688 validation rows), stage1 configuration (60,185 rows, for full LoRA training to teach the three core skills), and stage2-recovery configuration (16,015 rows, for error recovery training, containing about 50% stage1 replays to prevent forgetting). It also includes behavioral interview evaluation validation data from 27 cases for model performance assessment. The data is programmatically generated with high request phrasing and parameter diversity (unique message ratio approximately 0.88), and undergoes deduplication and pattern validation (each tool call is validated against its tools JSON schema). This dataset is suitable for tasks such as text generation, tool calling, function calling, and agent training, serving as foundational data for training Nexus Projects agents.
数据集概述
数据集名称: Nexus Agents — Tool-Calling Conversations
许可证: Apache-2.0
任务类型: 文本生成
标签: 工具调用、函数调用、智能体、合成数据、nexus
数据规模: 100K < n < 1M
数据集内容
该数据集包含三种智能体技能对话,均采用 OpenAI/mlx_lm 的 messages + tools 格式(system / user / assistant-with-tool_calls / tool):
- Setup interview:从自由文本想法推断行业/平台/目标,遇到模糊或歧义时提问(例如“柠檬水摊”→询问“食品饮料还是零售?”),在添加库之前进行查找,并最终确定。
- Discovery:构建用户故事树。
- Task generation:将设置和故事转换为具体的、技术栈相关的任务。
每条数据都携带真实工具 schemas 的 tools 字段,训练即服务。
训练数据(两个阶段)
发布的 GGUF 模型分两个 LoRA 阶段训练(rank 16,注意力层 + Mamba 混合器 + 共享专家 MLP):
| 阶段 | 配置 | 行数 | 内容 |
|---|---|---|---|
| 1 — 全量 LoRA | stage1 |
60,185 (训练 54,648 / 验证 5,540) | 三种核心技能 |
| 2 — 加法恢复 | stage2-recovery |
16,015 (训练 14,553 / 验证 1,465) | 错误恢复纪律:从损坏的板状态恢复,不再重复询问,最终确定。约 50% 为第一阶段回放以防止遗忘。 |
阶段 2 数据编码了八次训练运行的经验教训:短/拆分标签批次(长统一工具调用数组成为贪婪解码重复吸引子)和每个陷阱状态恰好一个训练延续(两个近似的上下文使用不同延续会使 temp-0 平局随机化)。
验证数据
verification/ 目录包含 27 个案例的行为面试评估,用于每次发布的门控——包含完整的多轮对话记录(.md 人类可读 + .json 原始)以及基础模型和发布微调模型的得分。案例通过条件:模型覆盖所有必需字段、不重复询问已回答的问题、干净地结束。
| 指标 | 基础模型 | 微调模型 |
|---|---|---|
| 通过场景数 | 13/27 | 27/27 |
| 每个问题最多询问一次 | 52% | 100% |
| 每次面试平均冗余重新询问次数 | 4.92 | 0.89 |
文件结构
| 文件 | 行数 | 说明 |
|---|---|---|
dataset.jsonl |
599,267 | 原始 v1 语料库 ({id, source, messages, tools}) |
train.jsonl / validation.jsonl |
539,581 / 59,688 | v1 数据划分(default 配置) |
stage1/… |
60,185 | 发布模型的全量 LoRA 语料库 |
stage2-recovery/… |
16,015 | 发布模型的加法恢复语料库 |
verification/… |
27 个案例 × 2 个模型 | 行为评估记录 + 分数 |
数据生成方法
通过程序化生成,具有高请求措辞和参数多样性(唯一消息比率约 0.88),经过去重和模式验证(每次工具调用都根据其工具的 JSON 模式进行验证)。生成器 + 种子数据 + 评估框架位于:https://github.com/Geramy/Nexus-Training-Studio-public。




