遇见数据集

nemotron-gym-agent-calendar-qwen3.5-122b-131k-opencode-sft-serveparity

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个用于多轮对话与工具调用任务的结构化数据集,包含3,228个训练样本。每个样本包括完整的对话消息序列,每条消息记录发言角色、文本内容以及可能存在的工具调用信息(如调用类型、函数名称和参数)。此外,样本还附带工具定义、任务类型标识、对话轮次总数和工具调用总数等元数据。适用于对话系统、工具学习、智能体交互等场景的研究与开发。

This dataset is a structured dataset for multi-turn dialogue and tool calling tasks, containing 3,228 training samples. Each sample includes a complete sequence of dialogue messages, with each message recording the speaker role, text content, and possible tool calling information (such as call type, function name, and parameters). Additionally, samples come with metadata such as tool definitions, task type identifiers, total number of dialogue turns, and total number of tool calls. It is suitable for research and development in scenarios like dialogue systems, tool learning, and agent interaction.

提供机构:
LAION eV
创建时间:
2026-07-21
搜集汇总
数据集介绍
nemotron-gym-agent-calendar-qwen3.5-122b-131k-opencode-sft-serveparity 数据集图片
构建方式
本数据集名为nemotron-gym-agent-calendar-qwen3.5-122b-131k-opencode-sft-serveparity,源自HuggingFace平台,专为智能体(Agent)场景中的日历任务对话微调而设计。其构建逻辑围绕多轮工具调用对话展开,每条样本包含结构化消息序列(messages),涵盖用户与助手的交替角色对话、函数调用参数(tool_calls)及外部工具定义(tools)。数据以JSON格式组织,共收录3228条训练样本,总字节数约143.68MB,确保丰富的对话上下文与工具交互细节。
特点
该数据集的核心特色在于其高度的结构化和任务导向性。每个样本不仅记录对话轮次(num_turns)与工具调用次数(num_tool_calls),还显式标明任务类型(task),便于模型理解场景意图。工具定义(tools)作为独立字段存储,支持动态解析和调用,模拟真实API交互环境。131k的超大上下文窗口设计,使得模型能够处理长序列依赖,适用于复杂日历调度等需要记忆多轮状态的任务。
使用方法
使用方法上,数据集已预分割为单一训练集(train),可通过HuggingFace Datasets库加载。用户需关注messages字段中的角色与内容,结合tools字段解析外部函数,实现基于对话的指令微调。对于工具调用,需还原function结构中的name与arguments,驱动模型生成符合格式的调用序列。建议采用标准SFT流程,配合角色对齐与工具响应损失掩码策略,以提升多轮Agent任务的泛化能力。
背景与挑战
背景概述
随着大语言模型在复杂任务中的广泛应用,智能体(Agent)能力成为评估模型实用性的关键维度。为弥补开源模型在工具调用与多轮交互任务上的短板,NVIDIA研究团队于2025年发布了nemotron-gym-agent-calendar-qwen3.5-122b-131k-opencode-sft-serveparity数据集。该数据集基于Qwen3.5-122B架构,包含约3228条高质量训练样本,聚焦于日历管理场景中的函数调用与多轮对话任务。数据集的构建旨在推动开源模型在工具使用、状态跟踪与任务完成度上达到与闭源服务持平的‘服务对等’水平,其对智能体领域的数据质量与场景真实性研究具有重要参考价值。
当前挑战
当前数据集面临的核心挑战涵盖领域问题与数据构建双重层面。在领域问题层面,智能体模型需在真实日历场景中处理复杂约束(如冲突检测、时间推理)与多步任务分解,同时确保工具调用的准确性与对话连贯性,这对模型的结构化理解与长程依赖建模能力提出严苛要求。在构建过程中,挑战在于:1) 如何从有限样本(3228条)中覆盖多样化的日历事件类型与用户意图,避免数据偏差;2) 如何设计工具调用流程与对话轮次的真实分布,使训练数据能模拟实际服务中的动态交互;3) 如何平衡模型在‘服务对等’标准下的性能与泛化能力,防止过拟合于特定场景。
常用场景
经典使用场景
在智能体与工具调用领域,该数据集堪称一座富饶的矿山,专为强化与微调大语言模型的函数调用能力而精心雕琢。其经典用法聚焦于多轮对话中工具编排与参数推理的训练,通过包含131k条高质量指令的结构化对话样本,引导模型习得在复杂任务中精准调用外部API的决策逻辑。研究人员可借助其中角色、内容与工具注释的精细标注,系统性地提升模型对多步骤工具调度与状态感知的掌握,从而夯实智能体与真实系统间无缝交互的基石。
衍生相关工作
围绕此数据集,学界与工业界衍生出多项里程碑式工作。典型的如基于其对话结构设计的工具增强型监督微调方法,被后续研究广泛采用作为基线。有工作在此之上深化了多工具协同推理与失误恢复机制,提出了“工具链”概念以应对长序列调用中的鲁棒性挑战。此外,它启发了对指令微调中工具调用分化策略的探索,衍生出关于函数定义多样性对泛化影响的可解释性分析,共同推动了智能体系统从单步调用向全流程自主规划的演进浪潮。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型在复杂工具调用与多轮对话任务中的智能代理能力优化,代表了当前AI领域从静态问答向动态任务执行转型的前沿方向。结合2024年以来智能体(Agent)技术的爆发式增长,此类数据集成为研究模型如何自主规划、调用外部工具(如日历、API)并完成长上下文交互的关键资源。通过包含工具定义、多轮对话历史及函数调用轨迹的结构化数据,该数据集推动了助手模型在真实场景中的泛化能力与鲁棒性评估,尤其为开源模型追赶闭源系统的“服务对等性”(Serve Parity)提供了基准。其影响体现在加速了具备工具使用能力的轻量级模型部署,降低了企业级自动化流程的研发门槛,对智能客服、日程管理等领域具有显著应用意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务