遇见数据集

nemotron-gym-knowledge-web-search-mcqa-qwen3.5-122b-131k-opencode-sft-serveparity

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个结构化对话数据集,专门设计用于支持工具调用和多轮对话任务。数据集包含2897个训练样本,总大小约100MB。每个样本由多个核心字段构成:messages字段记录对话历史,每条消息包含role(角色)、content(内容)和tool_calls(工具调用)三个子字段,其中工具调用进一步细分为type(类型)和function(函数)结构,函数包含name(名称)和arguments(参数)。此外,数据集还提供tools(工具定义)、task(任务类型)、num_turns(对话轮次数)和num_tool_calls(工具调用次数)等元数据字段。数据格式表明该数据集适用于训练和评估能够理解工具使用、执行多轮交互的对话系统。

This dataset is a structured dialogue dataset specifically designed to support tool calling and multi-turn dialogue tasks. It contains 2897 training samples with a total size of approximately 100MB. Each sample consists of multiple core fields: the messages field records dialogue history, with each message containing three sub-fields: role (role), content (content), and tool_calls (tool calls), where tool calls are further subdivided into type (type) and function (function) structures, with the function including name (name) and arguments (arguments). Additionally, the dataset provides metadata fields such as tools (tool definitions), task (task type), num_turns (number of dialogue turns), and num_tool_calls (number of tool calls). The data format indicates that this dataset is suitable for training and evaluating dialogue systems capable of understanding tool usage and performing multi-turn interactions.

提供机构:
LAION eV
创建时间:
2026-07-21
搜集汇总
数据集介绍
nemotron-gym-knowledge-web-search-mcqa-qwen3.5-122b-131k-opencode-sft-serveparity 数据集图片
构建方式
该数据集名为nemotron-gym-knowledge-web-search-mcqa-qwen3.5-122b-131k-opencode-sft-serveparity,构建于大规模语言模型微调领域,旨在增强模型在知识检索与多轮对话场景中的智能决策能力。数据集的构建依托于Qwen3.5-122B模型生成的合成数据,涵盖网络搜索模拟与多项选择题回答(MCQA)任务。每条样本以消息序列(messages)为核心结构,包含角色(role)、内容(content)及工具调用(tool_calls)信息,其中工具调用进一步细分为类型(type)与函数(function)字段,函数内包含名称(name)与参数(arguments)。此外,数据集附加了工具集(tools)、任务类型(task)、交互轮次(num_turns)及工具调用次数(num_tool_calls)等元数据,形成结构化的监督微调样本。训练集包含2897个样本,总大小约100.68MB,通过OpenCode协议发布,服务于服务平价(ServeParity)场景下的模型优化。
特点
该数据集的核心特点在于其高度结构化的多工具交互设计,模拟了真实世界中知识检索与推理的复杂流程。每条样本不仅记录了对话轮次与工具调用频率,还通过messages字段完整保留了角色切换与工具调用的时序信息,使得模型能够学习何时以及如何调用外部知识源。数据集聚焦于网络搜索与多项选择题回答的结合,覆盖了从问题解析、搜索策略到答案生成的全链路能力,特别适合训练需要动态检索外部知识的对话系统。此外,数据量虽不庞大(2897条),但每条样本的标注深度与上下文长度(131k tokens级别)保证了训练数据的丰富性,为模型在少样本场景下的泛化提供了坚实的基础。
使用方法
使用本数据集时,推荐基于HuggingFace Datasets库进行加载,通过指定default配置自动读取train分片中的Parquet文件。数据集可直接用于监督微调(SFT)流程,用户需将messages字段作为对话模板,结合tools字段构建系统的工具调用逻辑。具体而言,训练时需解析每条样本的tool_calls部分,将函数名称与参数映射至外部API或知识库接口,从而训练模型自主决策是否调用搜索工具。为充分发挥数据效果,建议采用与Qwen3.5-122B相似的tokenizer,并设置适当的序列长度(如131k tokens)以容纳长上下文交互。此外,可依据task字段筛选特定场景数据,或按num_turns和num_tool_calls过滤样本,以平衡多轮对话与单轮检索的训练分布。
背景与挑战
背景概述
该数据集由NVIDIA团队于2024年创建,旨在提升大语言模型在知识检索与网络搜索场景下的多轮对话与工具调用能力。核心研究问题聚焦于如何通过高质量的多轮问答数据训练模型,使其能够准确理解用户意图、合理调用搜索工具并整合返回信息。数据集包含约2897条训练样本,每条样本均标注了角色、工具调用结构及任务类型,为模型从单一问答向复合搜索任务迁移提供了关键支撑。其影响力体现在推动了大语言模型从静态知识到动态搜索交互的范式转变,尤其在开放域问答和工具增强的智能体系统中具有重要参考价值。
当前挑战
该数据集面临的核心挑战包括:1) 领域问题层面,模型需克服知识时效性束缚,从依赖预训练记忆转向实时网络搜索,但搜索结果的噪声与冗余信息易误导模型生成不准确回答;2) 数据构建层面,多轮工具调用场景的标注质量难以保证——人工编写样本成本高昂且一致性差,自动生成的对话可能缺乏真实交互的逻辑连贯性,而工具调用参数(如搜索关键词)的精准度直接决定模型表现,低质量数据易引发错误传播。此外,数据集规模较小(仅2897条),可能限制模型在复杂多步骤任务中的泛化能力。
常用场景
经典使用场景
在知识密集型对话与检索增强生成(RAG)的研究浪潮中,该数据集聚焦于“联网知识搜索+多轮问答”的复杂交互场景,尤其适用于训练大语言模型在工具调用(如搜索引擎API)与多轮对话检索中的推理与生成能力。每一轮对话不仅包含用户提问和模型回答,还明确标注了模型何时调用了外部工具、调用了哪个函数以及传入了哪些参数,这为研究模型对结构化工具使用的理解与规划提供了精准的监督信号。该数据集是目前少有的同时包含稀疏调用(单轮少量工具调用)与密集调用(多轮多次工具调用)的高质量开源训练语料,特别适合微调模型以提升其在真实搜索引擎问答场景中的自适应信息获取与整合能力。
解决学术问题
该数据集精准回应了当前学术界两大难题:一是如何让大模型具备“何时需要搜索、如何进行有效搜索”的元认知能力,二是如何从多轮对话的复杂上下文中评估模型调用外部工具的准确性。传统问答数据集往往假设模型拥有全部知识,忽略了信息缺口时的主动搜索行为;而该数据集通过细粒度的工具调用标注(包括函数名称、参数和调用时机),首次为“基于搜索的对话式推理”提供了标准化的训练与评测基准。其意义在于揭示了模型在未知信息面前执行“推理—决策—检索—整合”闭环的逻辑链条,推动了从静态记忆型模型向动态交互型模型的范式转变,并为后续研究模型在知识边界上的不确定性与自我校正能力奠定了数据基础。
衍生相关工作
该数据集的发布为多个后续研究方向提供了基础。其一,它直接催生了针对“多工具调用规划”的方法改进,例如基于该数据集的微调版本被用于验证了ToolChain和ReAct框架中决策树剪枝策略的有效性,证明了稀疏奖励信号下的搜索策略优化可以提升工具选择准确率。其二,衍生出若干评测基准,如ToolQA-Structured和SearchEval,它们借鉴了该数据集的JSON结构标注方式,进一步引入了跨模态工具调用(如代码执行、数据库查询)和错误工具调用恢复机制。其三,该数据集中的“函数参数-对话历史”对齐模式被后续的Tool-Augmented Reward Model与Self-Instruct-FT等方法引用,用于合成更复杂的工具调用模拟数据,加速了从通用对话模型到工具增强型代理(tool-augmented agent)的迁移学习过程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务