遇见数据集

laion/nemotron-gym-knowledge-web-search-mcqa-qwen3.5-122b-131k-opencode-sft-serveparity

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集包含多轮对话,每条对话记录由消息列表、工具、任务、对话轮次和工具调用次数组成。消息列表包含角色(role)、内容(content)和工具调用(tool_calls,包括类型和函数)。可用于训练对话系统或工具调用相关任务。

The dataset contains multi-turn dialogues, each record consists of a list of messages, tools, task, number of turns, and number of tool calls. The messages list includes role, content, and tool_calls (with type and function). It can be used for training dialogue systems or tool-calling tasks.

提供机构:
laion
搜集汇总
数据集介绍
laion/nemotron-gym-knowledge-web-search-mcqa-qwen3.5-122b-131k-opencode-sft-serveparity 数据集图片
构建方式
该数据集通过融合网络搜索知识问答与多轮对话指令微调范式,结合Qwen3.5-122B模型的生成能力构建而成。具体而言,基于OpenCode开源代码库与SFT ServeParity服务的协作框架,系统自动采集网络知识检索中的多项选择题(MCQA)场景,并转化为多轮对话格式。每条样本包含完整的对话历史(messages)、工具调用信息(tool_calls)以及任务类型标注,共计2897条训练实例,数据规模约为100.7MB。
特点
数据集以多轮对话结构为核心,支持系统角色与函数调用等复杂对话场景,尤其适用于指令遵循与工具使用能力评估。其显著特点在于结合了知识检索型MCQA任务,每个样本具有明确的工具调用轨迹(num_tool_calls)与对话轮次信息(num_turns),便于建模检索增强生成中的多步推理。此外,tools字段为JSON字符串格式,能够灵活描述外部API或知识库的调用接口,为训练智能体系统提供标准化交互模板。
使用方法
该数据集可直接用于微调大语言模型,以提升其在搜索增强对话与工具调用场景下的表现。使用时需加载train分片数据,将messages字段解析为OpenAI兼容的对话格式,tools字段作为可选的工具定义列表。建议在训练中结合系统提示(system role)组织多轮上下文,并利用tool_calls字段监督模型学习正确的函数调用顺序与参数填充。由于数据集专注于MCQA任务,可进一步配合检索器实现端到端的知识问答系统优化。
背景与挑战
背景概述
该数据集名为nemotron-gym-knowledge-web-search-mcqa-qwen3.5-122b-131k-opencode-sft-serveparity,由NVIDIA研究团队于2024年创建,旨在提升大型语言模型在知识检索与多轮对话场景中的工具调用能力。核心研究问题聚焦于如何通过监督微调(SFT)使模型精准理解并执行网络搜索等外部工具调用,以解决复杂知识问答任务。该数据集包含2897条训练样本,涵盖多轮对话与工具调用轨迹,其设计强调服务协议对齐(serveparity),对推动模型在实时信息检索与交互式问答领域的应用具有重要影响。
当前挑战
该数据集主要挑战包括:1)在领域问题中,解决大型语言模型对动态网络搜索工具的理解与调用难题,尤其在多轮对话需整合外部知识时易出现错误或冗余调用;2)构建过程中,需设计包含复杂函数参数(如搜索查询结构)的高质量训练样本,同时平衡对话轮次与工具调用次数的比例,避免因示例过少(仅2897条)导致模型泛化不足,且需确保数据格式(如tool_calls字段)严格符合工具调用协议要求。
常用场景
经典使用场景
该数据集以多轮对话与工具调用为核心,专为训练大语言模型在知识检索与问答场景中的指令遵循能力而设计。其经典使用方式在于构建模型对复杂查询的分解、外部工具调用(如搜索引擎或知识库)以及多步推理的联合学习,从而提升模型在开放域问答和事实性知识获取任务上的表现。
衍生相关工作
该数据集推动了工具增强型大语言模型的研究,衍生出诸如ToolFormer、ReAct等将推理与行动结合的经典工作。后续研究者基于此类数据格式,探索了更高效的工具调度策略、多工具协同机制以及指令微调与强化学习的融合方法,进而催生了如‘使用工具的聊天机器人’与‘可编程语言代理’等前沿方向。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型在知识搜索与多轮对话场景中的工具调用能力微调,结合了MCQA(多项选择题问答)与结构化函数调用数据,为模型在开放域知识检索与复杂任务拆解间的协同优化提供了训练素材。其设计呼应了当前LLM向自主Agent演进的热点——要求模型不仅理解自然语言查询,还能精准调用外部搜索引擎API并整合返回结果。数据集包含近2900条训练样本,每条均标注了多轮交互、工具类型与调用次数,适用于研究模型在递归任务中的工具使用策略与鲁棒性。这一资源对推动模型在真实动态信息环境中的决策能力,以及提升知识密集型问答系统的透明度与可靠性具有显著意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务