遇见数据集

sakthai-combined-v11

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

SakThai Combined v11 是 SakThai 模型家族中的一个数据集,专注于多轮智能体式对话和工具调用。该数据集包含 2965 个训练样本,每个样本由 messages(多轮对话,包含 system、user、assistant、tool 角色,assistant 消息可包含 tool_calls)和 tools(可用工具定义,包括类型、函数名称、描述和参数)两个字段组成。数据格式为 Parquet,大小约 5.32 MB,语言为英语。该数据集专为指令微调设计,尤其适用于训练模型执行函数调用和智能体任务,也可用于函数调用评估、多步推理训练以及少样本提示工程。数据集采用 Apache 2.0 许可证。

SakThai Combined v11 is a dataset from the SakThai model family, focusing on multi-turn agent-style dialogue and tool calling. This dataset contains 2965 training examples, where each sample consists of two fields: `messages` (multi-turn dialogue including roles of system, user, assistant, and tool, with assistant messages possibly containing tool_calls) and `tools` (definitions of available tools, covering type, function name, description, and parameters). The dataset is stored in Parquet format, with a size of approximately 5.32 MB, and uses English as its language. This dataset is specifically designed for instruction tuning, and is particularly suitable for training models to perform function calling and agent tasks. It can also be used for function calling evaluation, multi-step reasoning training, and few-shot prompt engineering. The dataset is released under the Apache 2.0 license.

创建时间:
2026-07-31
原始信息汇总

SakThai Combined v11 数据集详情

数据集概述

SakThai Combined v11 是 SakThai 模型家族中的对话/工具使用数据集,包含多轮 代理风格对话,带有结构化工具定义,专为指令微调函数调用助手而设计。该数据集属于文本生成任务类别,语言为英语。

数据集结构

  • 配置(Config): default
  • 拆分(Split): train
  • 行数: 2,965 行
  • 列数: 2 列(messagestools
  • 格式: Parquet
  • 文件大小: 约 5.32 MB
  • 估计内存占用: 约 5.32 MB
  • 平均每示例消息轮数: 约 6.2 轮

数据字段

字段 类型 描述
messages list[dict] 多轮对话。每个字典包含 rolesystem/user/assistant/tool)和 content。助手回合可能包含 tool_calls
tools list[dict] 对话中可用的工具定义。每个字典包含 typefunction.namefunction.descriptionfunction.parameters
tool_calls list[dict](位于助手消息内) 结构化调用,包含 idtype 以及 function.name / function.arguments
tool_call_id str(位于工具消息内) 用于将工具结果与其之前的 tool_calls 条目关联的 ID。

数据集拆分

拆分 行数 格式 备注
train 2,965 Parquet 用于指令微调的单一合并拆分。

数据集构建

该数据集将多个 SakThai 家族数据集中的示例合并而成,针对小型模型的函数调用和代理任务指令微调进行了优化。

应用场景

  • 指令微调: 在工具调用行为上微调小型模型。
  • 函数调用评估: 评估模型选择和调用工具的能力。
  • 代理训练: 训练模型进行带工具访问的多步推理。
  • 提示工程: 作为少样本提示的参考示例。

许可协议

Apache License 2.0 — 可自由使用、修改和分发,需注明出处。

验证快照

  • 来源: Nanthasit/sakthai-combined-v11
  • 验证方: SakThai / HF Hub 元数据及文件检查
  • 最后验证时间: 2026-08-01
搜集汇总
数据集介绍
sakthai-combined-v11 数据集图片
构建方式
SakThai Combined v11数据集是SakThai模型家族的重要组成部分,其构建过程精心整合了多个SakThai系列数据集的精华,旨在为指令微调提供高质量的训练资源。该数据集以多轮智能体风格对话为核心,每条样本都包含结构化的工具定义,适用于函数调用助手的训练。其数据格式采用Parquet,包含`messages`和`tools`两个核心字段,其中`messages`记录了系统、用户、助手及工具角色间的完整交互,而`tools`则提供了可供调用的函数定义,包括函数名称、描述及参数结构,为模型学习工具调用提供了丰富而规范的示例。
特点
该数据集具有鲜明的技术特点,主要体现在其专为工具调用与智能体任务设计的结构化多轮对话上。平均每个样本包含约6.2轮对话,充分模拟了真实交互场景中的复杂性和连贯性,使得模型能够学习到多步骤推理与工具选择的能力。数据集的`messages`字段内嵌了结构化的`tool_calls`,而`tool`消息通过`tool_call_id`与之前的调用精准关联,形成了闭环的调用链,这对于训练模型准确执行函数调用至关重要。此外,数据集规模适中,共2965行,大小约5.32 MB,便于高效加载和处理,适合小型模型的指令微调与函数调用能力评估。
使用方法
使用SakThai Combined v11数据集十分便捷,其设计兼顾了多种研究与应用场景。研究人员可通过Hugging Face的`datasets`库轻松加载数据,支持全量加载或流式处理以应对大规模任务。数据集的`messages`与`tools`字段可直接用于指令微调,使模型学习函数调用的输出格式;亦可作为基准测试集,评估模型在工具选择与调用上的准确性。此外,数据还能作为少样本提示的参考示例,辅助提示工程。借助`filter`方法,用户还能根据工具数量筛选样本,灵活构建针对性的训练或测试子集,满足多样化需求。
背景与挑战
背景概述
SakThai Combined v11数据集由Beer于2026年创建,隶属于SakThai模型家族,旨在为小型语言模型的指令微调提供高质量的工具调用与智能体对话数据。该数据集包含2,965条多轮对话,每条对话均配有结构化的工具定义,覆盖系统、用户、助手及工具等多种角色,平均对话轮次约6.2轮。其核心研究问题聚焦于提升模型在函数调用与多步推理任务中的表现,为智能体训练与评估提供基准。作为Apache 2.0许可的开源资源,该数据集在Hugging Face平台上发布,为自然语言处理领域的小模型工具调用能力研究提供了重要支撑,尤其在指令微调与少样本提示工程中展现出广泛的应用潜力。
当前挑战
该数据集所面临的挑战主要体现在两方面。在领域问题层面,尽管专门为工具调用与智能体任务设计,但面对复杂多变的真实场景,模型仍需克服工具选择准确性与参数生成的可靠性等难题,且多轮交互中的状态跟踪与错误恢复能力有待强化。在构建过程层面,数据集的规模相对有限(不足3,000条),可能限制模型的泛化能力;同时,工具定义与对话标注的一致性维护颇具难度,需确保多样性与质量的平衡。此外,作为合成数据,其来源的真实性与覆盖范围的局限性也可能制约模型在未见工具或边缘情形下的表现,对后续扩展与验证提出挑战。
常用场景
经典使用场景
SakThai Combined v11数据集作为SakThai模型家族的核心组成部分,专为指令微调与工具调用场景而设计。其包含近三千条多轮对话样本,每条样本均携带结构化的工具定义与函数调用标注,为训练能够自主选择并执行工具的小型语言模型提供了高质量语料。该数据集在模型微调过程中扮演着关键角色,通过模拟真实代理对话流程,使模型学会在系统、用户、助手及工具消息间灵活切换,进而掌握参数解析、工具调度与结果整合等核心技能,是构建高效函数调用助手的理想训练资源。
实际应用
在实际应用中,SakThai Combined v11数据集广泛适用于构建各类自动化代理系统,如智能客服、个人助理及代码生成工具。开发者可利用该数据集微调专用模型,使其能够对接外部API、数据库或软件环境,实现从自然语言指令到具体操作的平滑转换。此外,该数据集还可用于少样本提示模板的设计,通过参考其对话范例增强现有模型在不额外微调情况下的工具调用能力,从而降低部署成本,加速智能代理在工业界与消费级产品中的落地。
衍生相关工作
围绕SakThai Combined v11数据集,衍生出了一系列相关研究工作。一方面,该数据集被用作基准,用于比较不同微调策略对函数调用效果的影响,催生了对参数高效微调方法如LoRA在工具调用任务上适配性的深入探讨。另一方面,其多工具交互场景激发了研究者对模型规划能力的关注,促使了面向代理的多步推理评估框架的提出。此外,该数据集的设计模式也被后续数据集构建项目所借鉴,推动了更为复杂、多代理协同的对话数据集的开发,形成了良性发展的学术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务