遇见数据集

laion/nemotron-gym-instruction-following-structured-qwen3.5-122b-131k-opencode-sft-serveparity

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集包含多轮对话历史,每条对话包含角色、消息内容和工具调用信息。此外,还提供了工具定义、任务类型、对话轮数和工具调用次数。训练集共9037个样本,适用于训练具有工具调用能力的对话模型。

This dataset contains multi-turn conversation histories, each with roles, message content, and tool call information. It also provides tool definitions, task types, number of turns, and number of tool calls. The training set has 9037 samples, suitable for training dialogue models with tool-calling capabilities.

提供机构:
laion
搜集汇总
数据集介绍
laion/nemotron-gym-instruction-following-structured-qwen3.5-122b-131k-opencode-sft-serveparity 数据集图片
构建方式
该数据集基于结构化指令遵循任务构建,采用Qwen3.5-122B模型生成的对话数据,通过结合OpenCode SFT范式与ServeParity机制进行优化。数据以多轮对话形式组织,每条样本包含messages序列(角色、内容及工具调用信息)、tools字段(工具定义)、task标签、对话轮次及工具调用次数统计。训练集包含9037条样本,数据以parquet格式存储,分片压缩后约191MB。
特点
数据集聚焦于指令遵循与工具调用能力的联合训练,支持结构化工具使用场景。每条样本记录了多轮对话中的角色切换、工具调用参数及返回结果,覆盖多样化的任务类型。num_turns与num_tool_calls字段为分析对话复杂度和工具调用频率提供了量化指标,适用于评估模型在长程交互中的表现。
使用方法
数据可直接通过HuggingFace Datasets库加载,使用load_dataset函数指定默认配置即可获取训练集。数据格式兼容标准对话模型微调框架,需将messages字段映射为模型输入模板,tools字段用于解析工具定义。建议结合transformers库进行数据预处理,或直接使用内置的tokenize_function进行批量化训练。
背景与挑战
背景概述
随着大型语言模型(LLM)在复杂任务中的应用日益广泛,指令遵循能力成为评估模型实用性的关键指标。Nemotron-Gym-Instruction-Following-Structured-QWEN3.5-122B-131K-OpenCode-SFT-ServeParity数据集由NVIDIA研究团队创建,旨在通过结构化指令和多轮工具调用场景,提升模型对复杂指令的精确执行能力。该数据集包含超过9000个训练样本,覆盖多轮对话和工具调用任务,为研究指令遵循、工具使用与模型对齐提供了高质量的训练资源。其发布推动了LLM在自动化编程、智能客服等领域的实用性研究,成为评估模型服务性能的基准之一。
当前挑战
该数据集面临的核心挑战在于多轮对话中指令理解的深度与工具调用的精度。领域问题方面,现有模型常因指令模糊或上下文依赖而导致错误响应,尤其在高复杂度工具调用场景中表现不稳定。构建过程中,数据集的生成需确保对话逻辑的真实性与工具调用的语法严谨性,同时平衡样本多样性以覆盖广泛的指令类型。此外,数据标注的标准化与工具函数定义的准确性构成技术瓶颈,如何在海量场景中保持指令与工具行为的一致性,仍是评估模型服务性能的关键难题。
常用场景
经典使用场景
在自然语言处理与智能体系统交汇的前沿领域,指令遵循与工具调用能力的对齐是衡量大语言模型实用性的关键标杆。nemotron-gym-instruction-following-structured-qwen3.5-122b-131k-opencode-sft-serveparity数据集专为多轮对话与结构化工具调用场景设计,其经典使用场景聚焦于训练模型精准理解用户意图,并在复杂交互中自主选择、编排和执行外部函数。数据集内含9,037条高质量训练样本,每条均包含多轮消息序列、工具定义及任务标签,使得研究者能够构建具备真实世界任务解决能力的对话代理,探索模型在动态环境下遵循结构化指令的边界。
实际应用
从产业落地的维度审视,该数据集天然适配于需要高可靠性工具编排的实战场景。例如在智能客服系统中,代理需调用查询库存、创建订单及计算物流时效等API,nemotron-gym训练出的模型能依据用户分步指令自主串联这些操作,避免逻辑断层。在金融数据分析助手中,模型可依据自然语言请求依次调用数据清洗、统计建模及可视化函数,生成结构化报告。其数据格式对多工具组合场景的显式支持,使得领域内开发者能够低门槛地定制专用智能体,显著降低从原型到生产环境的工程化成本。
衍生相关工作
围绕nemotron-gym数据集,学术社区已衍生出若干里程碑式工作。一方面,研究者基于其结构化特性,提出了多轮工具调用链的对比学习框架,通过数据增强策略提升模型对罕见函数组合的泛化能力。另一方面,该数据集成为评测指令遵循型智能体竞赛的标准化基准,催生了诸如渐进式提示退火与混合专家路由等训练方法论创新。此外,数据集中对工具调用与自由文本回复的交替标注,启发了对话系统与API编排统一建模的研究路径,推动了将隐式意图解析转换为显式代码执行的跨范式融合探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务