遇见数据集

laion/nemotron-gym-math-advanced-calculations-v3-qwen3.5-122b-131k-opencode-sft-serveparity

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

--- dataset_info: features: - name: messages list: - name: role dtype: string - name: content dtype: string - name: tool_calls list: - name: type dtype: string - name: function struct: - name: name dtype: string - name: arguments dtype: string - name: tools dtype: string - name: task dtype: string - name: num_turns dtype: int32 - name: num_tool_calls dtype: int32 splits: - name: train num_bytes: 175274600 num_examples: 5233 download_size: 64479039 dataset_size: 175274600 configs: - config_name: default data_files: - split: train path: data/train-* ---

提供机构:
laion
搜集汇总
数据集介绍
laion/nemotron-gym-math-advanced-calculations-v3-qwen3.5-122b-131k-opencode-sft-serveparity 数据集图片
构建方式
该数据集基于高级数学计算任务构建,利用Qwen3.5-122B模型生成了13.1万条指令微调样本。数据采用多轮对话(multi-turn)结构,每条样本包含messages字段(记录角色、内容及工具调用信息)、tools字段(定义可用工具)、task字段(标注任务类型)以及num_turns和num_tool_calls字段(统计交互轮次与工具调用次数)。训练集共5233条样本,总数据量达175MB,经高效压缩后下载大小约为64MB。
特点
数据集聚焦于高等数学领域的复杂计算场景,具备多轮交互与工具调用能力,支持函数链式调用与参数解析。每条样本均标注了任务类型与交互深度,便于模型学习分步推理与工具协作。数据由强模型(Qwen3.5-122B)生成,保证了样本的高质量与逻辑严密性,适用于提升大语言模型在数学推理与结构化任务中的表现。
使用方法
该数据集适用于监督微调(SFT)场景,可直接用于训练支持工具调用与多轮对话的对话模型。使用时需解析messages中的role与content字段,并利用tools字段注入外部工具定义。建议采用标准ChatML格式转换,并依据num_turns和num_tool_calls字段设计批处理策略,以优化训练效率。数据仅含训练集拆分,开发者可根据需求自行划分验证集。
背景与挑战
背景概述
nemotron-gym-math-advanced-calculations-v3-qwen3.5-122b-131k-opencode-sft-serveparity是一个面向高级数学计算与推理的多轮对话数据集,由NVIDIA研究团队于2025年构建,旨在为大语言模型提供复杂的数学工具调用与多步推理训练样本。该数据集包含5233个训练样本,每个样本涵盖多轮对话、工具调用记录与结构化函数定义,聚焦于微积分、线性代数等高等数学领域的模拟计算任务。作为Nemotron系列的一部分,它延续了NVIDIA在科学计算与数学推理领域的数据积累,通过引入工具调用范式,推动模型从单纯生成答案向具备工具使用能力的智能体转变。该数据集在数学推理、程序合成与AI辅助科学计算等方向具有重要影响,为评估和提升模型在高级数学任务上的工具辅助推理能力提供了标准化基准。
当前挑战
该数据集面临的核心挑战在于高级数学计算的复杂性与模型工具调用能力的协同提升。一方面,高等数学任务如多元微积分、偏微分方程求解等需要多步逻辑推导与精确数值计算,对模型的数学理解与推理深度提出极高要求,传统语言模型往往难以处理符号性与数值性交织的复杂问题。另一方面,构建过程中需设计自然的多轮交互流程,确保模型能正确解析数学表达式并触发相应的计算工具函数,而工具调用的准确性与容错机制仍是瓶颈。此外,数据集的规模相对有限,难以覆盖所有数学分支的变体题型,可能导致模型泛化能力不足。同时,如何平衡模型在自由文本生成与结构化工具调用之间的切换,避免在连续对话中产生逻辑断裂或工具误用,亦是亟待解决的挑战。
常用场景
经典使用场景
在数学推理与复杂计算领域,nemotron-gym-math-advanced-calculations-v3-qwen3.5-122b-131k-opencode-sft-serveparity数据集为高级数学问题的求解提供了宝贵的训练资源。该数据集包含超过五千条多轮对话样本,每条样本均以结构化消息形式呈现,涵盖用户与助手之间的交互历史及工具调用记录,特别适用于训练具备函数调用能力的大语言模型。研究者可借助此数据集,使模型掌握逐步推导、代数运算和符号计算等高级数学技能,从而在数学竞赛题、积分求解和方程推导等场景中展现出类人推理能力。此外,数据集中的工具字段为模型提供了调用外部计算工具的机会,进一步增强了其解决复杂数学问题的实用性与准确性。
衍生相关工作
该数据集的发布催生了一系列富有影响力的相关研究。研究者基于其多轮工具调用设计,提出了强化学习与监督微调相结合的混合训练策略,如MathCoder系列工作,进一步优化了模型在复杂数学任务上的表现。另一方向是围绕对话式数学辅导展开的工作,例如MathQA和MetaMath数据集借鉴其结构化交互形式,构建了更具挑战性的多步推理基准。此外,在函数调用与工具增强的交叉领域,ToolLLM和Gorilla等模型参考了该数据集的消息格式与工具定义,拓展了大语言模型调用外部API的能力边界,推动了人工参与度更低的自动化科研流程的实现。
数据集最近研究
最新研究方向
在数学推理与工具增强学习的交汇点上,nemotron-gym-math-advanced-calculations-v3-qwen3.5-122b-131k-opencode-sft-serveparity 数据集聚焦于复杂数学计算的多轮对话与工具调用能力提升。该数据集包含5233个训练样本,每个样本不仅记录了多轮对话中的角色与内容,还结构化地标注了工具调用细节(如函数名称与参数),旨在推动大语言模型在高级数学问题求解中从“被动问答”向“主动计算代理”的范式转变。近期研究热点集中在利用此类数据微调模型,使其具备调用外部计算工具(如符号代数系统)解决高阶微积分、线性代数等难题的能力,并与OpenCode等编码基准形成协同,以衡量模型在真实科研与工程场景中的工具感知与任务分解能力。这一方向对于构建可验证、可解释的AI数学助手具有里程碑意义,尤其在自动定理验证与科学计算自动化领域引发广泛关注。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务