遇见数据集

sakthai-combined-v12

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

SakThai Combined v12 是 SakThai 模型家族的一部分,专为第二轮再训练(0.5B 和 1.5B 工具调用模型,对应 -r2 仓库)而设计的微调语料库。数据集包含 7,437 个示例,以 JSONL 格式存储在 data/train.jsonl 文件中。每个示例包含多轮对话消息(messages)和结构化工具定义(tools)字段。该数据集由多个来源组合而成:sakthai-combined-v10(2,965 行)、sakthai-combined-v11(2,965 行)、sakthai-irrelevance-supplement(60 行)、sakthai-coder-browser(247 行)、以及三种合成数据——简单单工具调用(600 行)、并行多工具调用(400 行)和保留缺失工具处理(200 行)。合成数据专门针对 sakthai-bench-v2/v3 中评估的弱工具调用类别(简单、并行、保留)进行补充,并在构建时验证了类别平衡。该数据集适用于文本生成任务,特别是工具调用、函数调用、智能体对话和指令微调等场景。

SakThai Combined v12 is part of the SakThai model family, a fine-tuning corpus designed for the second round of retraining (0.5B and 1.5B tool-calling models, corresponding to the -r2 repository). The dataset contains 7,437 examples stored in JSONL format in the data/train.jsonl file. Each example includes multi-turn conversation messages and structured tool definitions (tools) fields. The dataset is composed of multiple sources: sakthai-combined-v10 (2,965 rows), sakthai-combined-v11 (2,965 rows), sakthai-irrelevance-supplement (60 rows), sakthai-coder-browser (247 rows), and three types of synthetic data—simple single-tool calls (600 rows), parallel multi-tool calls (400 rows), and reserved missing tool handling (200 rows). The synthetic data specifically supplements the weak tool-calling categories (simple, parallel, reserved) evaluated in sakthai-bench-v2/v3, and class balance was verified during construction. This dataset is suitable for text generation tasks, particularly tool calling, function calling, agent dialogue, and instruction fine-tuning scenarios.

创建时间:
2026-08-05
原始信息汇总

SakThai Combined v12 数据集详情

基本信息

  • 许可证: Apache 2.0
  • 语言: 英语(English)
  • 数据规模: 1K < n < 10K(具体为 7,437 行)
  • 任务类型: 文本生成(Text Generation)
  • 标签: sakthai、house-of-sak、tool-calling、function-calling、agent、instruction-tuning

所属系列

该数据集属于 SakThai 模型家族,是用于第二轮再训练(retrain round v2)的微调语料库,目标为 0.5B 和 1.5B 的工具调用模型(对应 -r2 仓库)。

数据结构

  • 文件: data/train.jsonl
  • 格式: JSONL,每行一个示例
  • 字段:
    • messages:多轮对话消息
    • tools:结构化工具定义
  • 总行数: 7,437

数据构成

该数据集由 Sak-Family-Agent 仓库中的 scripts/dataset_prep/build_v12.py 脚本构建,来源如下:

数据来源 行数
sakthai-combined-v10 2,965
sakthai-combined-v11 2,965
sakthai-irrelevance-supplement 60
sakthai-coder-browser 247
合成简单数据(单工具调用) 600
合成并行数据(多工具调用) 400
合成保留数据(缺失工具时拒绝) 200

构建目的

合成数据针对 sakthai-bench-v2/v3 中测量的薄弱工具调用类别(简单、并行、保留场景)进行优化,并在构建时严格执行类别平衡验证。

加载方式

python from datasets import load_dataset

ds = load_dataset("Nanthasit/sakthai-combined-v12", split="train")

搜集汇总
数据集介绍
sakthai-combined-v12 数据集图片
构建方式
在工具调用与指令微调研究领域,高质量多轮对话语料对模型习得函数调用能力至关重要。该数据集由Sak-Family-Agent仓库中的dataset_prep脚本自动化构建,以v10与v11两个历史版本为基础,分别引入2,965条样本,并融合无关性补充集60条与编码浏览任务集247条,同时通过程序化合成生成简单单工具调用600条、并行多工具调用400条及缺失工具拒绝调用200条样本,最终在构建阶段施加类别均衡校验,形成总计7,437条训练实例。
特点
该数据集在功能调用训练语料中呈现出鲜明的分类均衡与任务导向特征。语料以JSONL格式组织,每一行样本包含messages多轮消息序列与tools结构化工具定义两类字段,支持多轮工具调用场景的建模。其组成覆盖简单调用、并行调用与缺失工具拒绝三类薄弱能力,并针对sakthai-bench-v2/v3评测中暴露的短板进行定向补齐,兼顾历史数据延续性与合成数据针对性,为工具调用模型的重训练提供了结构化、可复现的监督信号。
使用方法
研究者在文本生成与智能体训练任务中可直接加载该数据集进行微调。调用时通过datasets库的load_dataset函数指定仓库名Nanthasit/sakthai-combined-v12与train划分,即可获得包含messages与tools字段的训练集。该语料适配0.5B与1.5B参数规模的工具调用模型重训练轮次,可依据messages中的多轮对话与tools定义监督模型生成函数调用,也可用于评估模型在简单、并行及工具缺失场景下的调用与拒绝能力。
背景与挑战
背景概述
工具调用与函数调用能力是当前大语言模型智能体研究的核心议题,其关键在于模型能否准确理解外部工具的结构化定义并在多轮对话中完成调用决策。SakThai Combined v12于2024年发布,隶属SakThai模型家族,由Nanthasit等研究人员构建,为0.5B与1.5B规模工具调用模型retrain round v2的微调语料。该数据集汇聚v10与v11两版语料并补充多类合成样本,构成7,437条多轮对话与结构化工具定义,直接服务于轻量化智能体在函数调用任务上的能力提升,为该领域的低资源部署研究提供了可复用的调优资源。
当前挑战
该数据集所要应对的领域问题在于,工具调用任务要求模型在语义理解、参数绑定与调用时机判断之间取得精确平衡,而小规模模型在此类任务上常表现乏力。在构建层面,其挑战尤为突出:语料需从v10与v11中合并以保持版本一致性,同时针对sakthai-bench-v2/v3所测得的simple、parallel及held-out三类薄弱能力定向合成样本,并须在构建时强制实施类别平衡校验,以规避能力偏斜。此外,缺失工具时拒答样本的引入对模型拒绝行为的可靠性提出了更高要求。
常用场景
经典使用场景
在大语言模型工具调用能力的微调实践中,该数据集主要服务于指令微调阶段的监督训练。其典型使用方式是将每一条样本中的多轮对话消息与结构化工具定义一并输入模型,促使模型学会依据用户意图选择恰当的工具、生成符合规范的调用参数,并在必要时给出合理的拒绝回应。由于数据集中同时包含简单单工具调用、并行多工具调用以及工具缺失时的拒答样本,研究者常将其用于评估模型在工具调用任务上的泛化能力与鲁棒性。
解决学术问题
该数据集针对工具调用研究中长期存在的类别不均衡与弱项覆盖不足问题提供了系统化的解决方案。通过对简单调用、并行调用与工具缺失拒答三类薄弱能力进行定向合成与配比校验,它有效缓解了模型在复杂工具组合场景下调用失败、参数错配或盲目编造工具等常见缺陷。其学术意义在于为工具调用能力的细粒度评测与可复现训练提供了标准化语料,推动了智能体指令微调研究从粗放式数据堆叠向能力导向的数据构建范式转变。
衍生相关工作
围绕该数据集,SakThai 模型家族衍生出多轮迭代的微调语料版本与配套评测基准,包括 sakthai-bench-v2 与 v3 等工具调用能力测评集。这些工作以能力类别划分为核心,形成了从数据构建、模型微调到基准评测的闭环体系。相关衍生模型涵盖 0.5B 与 1.5B 参数规模的工具调用模型,为小参数智能体的工具使用研究提供了可复现的实验基础与对照基线。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务