遇见数据集

math-toolcall-tr

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

math-toolcall-tr是一个专门为训练大型语言模型(LLM)正确调用数学函数并清晰呈现结果而创建的土耳其语合成数据集。该数据集包含2,127个采用ShareGPT格式的多轮对话,每个对话都嵌入了模型思考链(`<think>...</think>`)。其核心目标是同步训练模型的两项关键技能:1) 在需要时准确选择工具并推断参数,避免不必要的调用;2) 将原始数值结果转化为自然、流畅的语言向用户解释。数据集有意包含了多样性:约29.6%的样本(629个)不涉及任何工具调用,用于训练模型判断问题是否可通过已有知识解答或参数是否缺失;同时,有761个样本包含多次工具调用,用于训练复杂场景下的推理能力。数据内容全面覆盖了13个数学子领域(包括代数、分析、金融数学、几何、算术、三角学、数论、线性代数、概率组合、单位换算、统计学、离散数学和优化)下的70个具体主题。此外,数据集设计了8种不同的工具调用场景来模拟现实挑战,例如:判断工具是否必要(`arac_gereksiz`)、处理错误(如除以零,`hata_yonetimi`)、在相似工具中做出正确选择(`yanlis_arac_tuzagi`)、对缺失参数进行澄清提问而非捏造(`eksik_parametre`),以及处理多步骤任务(`cok_adimli_gorev`)、并行调用(`paralel_cagri`)和链式调用(`zincirli_cagri`)。样本还按难度分为简单(819个)、中等(603个)和困难(705个)三个级别。数据采用标准的对话列表格式,每个样本的`conversations`字段包含一系列由`from`(角色,如`human`, `gpt`)和`value`(内容)组成的消息。在需要工具调用的样本中,对话通常为四轮结构,依次为用户问题、带思考链和工具调用的模型响应、模拟的工具响应结果,以及模型最终的自然语言解答。该数据集通过两阶段合成流程生成,全部使用`gpt-5.4-mini`模型完成。首先生成涵盖特定主题、场景和难度的问题及可能用到的函数模式,然后由同一模型生成包含推理步骤、工具调用、预期工具结果和最终答案的完整对话。需要注意的是,数据集是合成且未经人工验证的,`tool_response`中的工具结果是模型生成的而非真实计算得出,可能存在数学错误或少量场景不一致,并且其风格和推理模式受限于单一的源模型。它专为土耳其语数学工具调用任务设计,不适用于其他语言或领域。

math-toolcall-tr is a synthetic Turkish dataset created specifically for training large language models (LLMs) to correctly call mathematical functions and clearly present results. The dataset contains 2,127 multi-turn dialogues in ShareGPT format, each embedded with model chain-of-thought (`<think>...</think>`). Its core objective is to simultaneously train two key model skills: 1) accurately selecting tools and inferring parameters when needed, avoiding unnecessary calls; 2) transforming raw numerical results into natural, fluent language explanations for users. The dataset intentionally includes diversity: approximately 29.6% of samples (629) involve no tool calls, training the model to judge whether problems can be solved with existing knowledge or if parameters are missing; meanwhile, 761 samples contain multiple tool calls for training reasoning in complex scenarios. Data content comprehensively covers 70 specific topics across 13 mathematical subfields (including algebra, analysis, financial mathematics, geometry, arithmetic, trigonometry, number theory, linear algebra, probability and combinatorics, unit conversion, statistics, discrete mathematics, and optimization). Additionally, the dataset designs 8 different tool-calling scenarios to simulate real-world challenges, such as: determining if tools are necessary (`arac_gereksiz`), handling errors (e.g., division by zero, `hata_yonetimi`), making correct choices among similar tools (`yanlis_arac_tuzagi`), clarifying missing parameters instead of fabricating them (`eksik_parametre`), as well as handling multi-step tasks (`cok_adimli_gorev`), parallel calls (`paralel_cagri`), and chained calls (`zincirli_cagri`). Samples are also categorized by difficulty into simple (819), medium (603), and hard (705) levels. The data uses a standard dialogue list format, where each samples `conversations` field contains a series of messages consisting of `from` (role, e.g., `human`, `gpt`) and `value` (content). In samples requiring tool calls, dialogues typically follow a four-turn structure: user question, model response with chain-of-thought and tool call, simulated tool response result, and the models final natural language answer. The dataset is generated through a two-stage synthetic process, entirely using the `gpt-5.4-mini` model. First, problems and potential function patterns covering specific topics, scenarios, and difficulties are generated, then the same model generates complete dialogues including reasoning steps, tool calls, expected tool results, and final answers. It is important to note that the dataset is synthetic and not manually verified; tool results in `tool_response` are generated by the model rather than real calculations, potentially containing mathematical errors or minor scenario inconsistencies, and its style and reasoning patterns are limited by the single source model. It is designed specifically for Turkish mathematical tool-calling tasks and is not suitable for other languages or domains.

创建时间:
2026-07-23
原始信息汇总

数据集名称

  • math-toolcall-tr:土耳其语数学导向的函数调用数据集,包含 2,127 个 ShareGPT 格式的对话样本,带有推理步骤(<think>)。

任务与标签

  • 任务类别:文本生成、问答。
  • 标签:函数调用、工具使用、数学、土耳其语、合成、推理、ShareGPT、Unsloth。

数据集规模与结构

  • 大小:1,000 < 样本数 < 10,000。
  • 特征conversations 列表,每条含 from(角色)和 value(内容)。
  • 划分:仅训练集 (train),包含 2,127 个样本。

文件格式

  • 配置:默认配置 (default),数据文件路径为 data/train-*

核心教学内容

  1. 正确选择工具与参数推断:包括避免不必要的调用。
  2. 将数值结果转换为自然语言反馈
  • 无工具调用样本占比 29.6%:当问题可直接回答或参数缺失时,模型应提问澄清而非虚构。

对话格式

  • 工具调用样本:4 轮对话。

    • 第 1 轮:human – 用户问题。
    • 第 2 轮:gpt – 包含 <think>…</think><tool_call>{"name":…,"arguments":…}</tool_call>
    • 第 3 轮:human – 包含 <tool_response>{…}</tool_response>
    • 第 4 轮:gpt – 自然语言最终回答。
  • 无需工具样本:仅 1 轮 gpt,包含 <think> 和回答。

  • 训练时建议使用 train_on_responses_only,仅计算 gpt 轮的损失,掩码 tool_response 轮。

覆盖范围

  • 13 个子领域,70 个主题
子领域 样本数 子领域 样本数
代数 275 概率与组合 145
分析 192 单位与测量 140
金融数学 186 统计 155
几何 205 离散数学 105
算术 171 优化 86
三角学 146
数论 181
线性代数 140

场景分布

场景 样本数 教学目标
工具不必要 318 不调用不必要的工具
单次调用 305 正确参数调用单个工具
错误处理 276 解释除以零等错误
工具混淆陷阱 286 从相似工具中选择正确工具
参数缺失 237 提问澄清而非虚构
多步骤任务 220 单次请求完成 3 次以上调用
并行调用 255 同时进行独立计算
链式调用 230 第二个调用的输入来自第一个调用的结果
  • 难度:容易 819 / 中等 603 / 困难 705。
  • 无工具调用样本:629。
  • 多调用样本:761。

使用方式

python from datasets import load_dataset dataset = load_dataset("bilalabic/math-toolcall-tr", split="train")

  • 可与 Unsloth 配合,使用 standardize_data_formatsapply_chat_template 进行格式化。

生成方法

  • 两阶段合成生成,全部基于 gpt-5.4-mini(推理努力程度:中等)。

    1. 问题生成:为每个(子领域,主题,场景,难度)组合选择 2-4 个函数模式,其中仅 1-2 个真正需要,其余为干扰项。
    2. 回答生成:生成推理步骤、工具调用、预期工具结果和最终回答。
  • 排除重复问题。通过优先处理未覆盖主题达成 70/70 主题全覆盖。

  • 生成代码:完全开源,地址为 https://github.com/BilalAbic/math-toolcall-tr

相关模型

  • LoRA 适配器:https://huggingface.co/bilalabic/gemma_4_math-toolcall-tr_lora

  • 训练笔记本:https://github.com/BilalAbic/math-toolcall-tr/blob/main/notebooks/gemma4_e4b_math_toolcall_lora.ipynb

  • GitHub 仓库:https://github.com/BilalAbic/math-toolcall-tr

  • 基于 Gemma-4 E4B 使用 LoRA (r=8) 训练 3 个 epoch,采用 train_on_responses_only

  • ⚠️ 该适配器基于数据集早期 757 个样本 快照训练,而非当前完整的 2,127 个样本。

模型基准测试结果(基于 757 样本训练)

  • 评估:在 150 个未见过的样本(按场景均衡选取)上测试。
数学工具调用指标 基座模型 微调后 差异
总体准确率 56.67% 59.33% +2.66 分
工具选择 53.77% 54.72% +0.95 分
不回答(abstain) 63.64% 70.45% +6.81 分
格式有效性 98.67% 99.33% +0.66 分
  • 完整评估(含土耳其语 MMLU 和 GSM8K)见模型卡。

局限性

  • 合成数据,未经人工验证
  • 工具结果不真实tool_response 由模型生成,未实际执行函数。
  • 可能存在数学错误:虽然提示要求数学正确性,但未逐条验证。
  • 场景不一致性:约 3.5%(74 个样本)中预期有工具调用但调用的列表为空,主要集中在错误处理场景。
  • 单一模型来源:风格和推理模式受限于单一模型。
  • 仅限土耳其语和数学:无法泛化到其他领域或语言。

引用格式

bibtex @misc{math-toolcall-tr, title = {math-toolcall-tr: Turkish Math Tool-Calling Dataset}, author = {Bilal Abiç}, year = {2026}, url = {https://huggingface.co/datasets/bilalabic/math-toolcall-tr} }

搜集汇总
数据集介绍
math-toolcall-tr 数据集图片
构建方式
该数据集采用两阶段合成生成策略,完全基于gpt-5.4-mini模型(推理努力度设置为中等)构建。首先,在问题生成阶段,系统从13个子领域、70个数学主题及8种工具调用场景中随机选取组合,并生成2至4个函数架构,其中仅1至2个为实际所需,其余作为逼真的干扰项。随后,在答案生成阶段,同一模型负责输出包含推理轨迹(封装于<think>标签)、工具调用指令、预期的工具响应及最终自然语言答案的完整对话。生成过程中自动去重,并通过优先处理未覆盖主题的方式确保70个主题的全面覆盖。所有生成代码均已开源。
特点
该数据集具有鲜明的教学导向与结构化设计。它核心旨在训练模型同时掌握两项技能:准确选择工具与提取参数,以及将原始数值结果转化为自然语言描述。特别值得注意的是,约29.6%的样本故意不涉及任何工具调用,用以培养模型区分何时无需调用工具的能力。数据集包含8种工具调用场景,如多步任务、并行调用、错误处理及参数缺失处理等,并设有简单、中等、困难三个难度级别,样本数量分别为819、603和705,形成了多层次、多维度的训练挑战。
使用方法
数据集以ShareGPT格式存储,每行包含一个完整的对话实例。使用时可借助HuggingFace的datasets库通过load_dataset函数直接加载。针对Unsloth框架,推荐利用standardize_data_formats函数标准化格式,并通过tokenizer的apply_chat_template方法将对话转换为文本。训练时强烈建议启用train_on_responses_only选项,以屏蔽用户消息和工具响应轮次,使损失仅在模型生成的gpt回合中计算,从而确保模型学习的是正确解读工具结果而非虚构信息。此外,数据集中约3.5%存在场景不一致的样本可在关键应用中过滤处理。
背景与挑战
背景概述
随着大语言模型在数学推理与工具调用领域的交叉应用日益深入,如何使模型精准选择并调用数学函数、同时以自然语言清晰呈现计算结果,成为当前研究的重要课题。在此背景下,由研究者Bilal Abiç于2026年创建的math-toolcall-tr数据集应运而生,该数据集聚焦土耳其语数学场景,以ShareGPT格式包含2127条对话样本,覆盖13个数学子领域与8种工具调用场景。其核心研究问题在于训练模型同时掌握工具选择、参数推理与结果解读能力,并在近30%的样本中刻意设计无需调用工具或参数缺失的情况,以培养模型拒绝不当调用与主动澄清的能力。该数据集通过gpt-5.4-mini两阶段合成生成,并提供了配套的LoRA微调模型与公开生成代码,为土耳其语数学工具调用领域的数据资源与模型训练奠定了重要基础。
当前挑战
该数据集面临多维挑战。首先,在领域问题层面,数学工具调用需解决模型在复杂推理中准确识别适用工具、避免工具滥用,并处理参数缺失或异常输入等边缘场景,例如近30%样本要求模型主动拒绝调用或提出澄清,而非盲目假设。其次,在构建过程中,数据集完全由单一模型合成生成,未经过人工验证,因此存在约3.5%的场景标签不一致(如预期工具调用但样本中缺失),且工具响应内容为模型模拟而非真实函数执行结果,可能包含数学误差或风格偏差。此外,数据集仅涵盖土耳其语数学领域,语言与领域的单一性限制了其跨语言、跨学科的泛化能力,且所有样本源自同一基座模型,可能继承其固有的推理局限性与表述惯性。
常用场景
经典使用场景
在训练语言模型执行数学推理与工具调用相结合的任务时,math-toolcall-tr 数据集扮演着不可替代的角色。该数据集以土耳其语构建,包含2127条精心设计的对话样本,覆盖代数、几何、金融数学等13个数学子领域与70个具体主题。每条样本均以ShareGPT格式组织,其中嵌入模型在调用数学工具前的思考轨迹(<think>标记),以及工具调用与自然语言结果阐述的完整交互流程。特别值得注意的是,约29.6%的样本刻意不调用任何工具,旨在训练模型自主判断何时无需借助外部计算资源,从而培养其决策与克制的双重能力。
解决学术问题
该数据集直面当前大语言模型在数学推理与工具使用结合中的若干关键难题。传统数据集往往侧重于让模型学会调用工具,却忽略了何时不应调用工具的决策合理性。math-toolcall-tr 通过引入'工具不必要'、'错误工具陷阱'、'参数缺失'等多种反事实与边界性场景,系统性地研究了模型在数学问题解决中的工具选择偏差与过度调用倾向。此外,它首次在土耳其语环境下构建了包含并行调用、链式调用与多步骤任务的基准,为跨语言数学推理与函数调用机制的交叉研究提供了坚实的实验平台,推动了该领域从单一工具执行向智能工具决策的范式演进。
衍生相关工作
基于math-toolcall-tr数据集衍生了若干重要工作。最直接的成果是bilalabic/gemma_4_math-toolcall-tr_lora这一LoRA适配器,该适配器在Gemma-4 E4B模型上微调后,在非训练样本上实现了总体准确率2.66个百分点的提升,其中模型'审慎回避'(abstain)能力提升了6.81个百分点,证明了数据集在纠正模型过度调用工具倾向上的显著效果。数据集的生成代码已完全开源,为后续合成高质量工具调用数据提供了可复现的技术框架。该项目还催生了关于ShareGPT格式下工具调用数据标准化及train_on_responses_only训练策略的实践讨论,成为土耳其语数学推理与函数调用交叉研究的重要参照基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务