遇见数据集

sakthai-bench-v1

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

SakThai Bench v1 是 SakThai 系列的一部分,是一个紧凑的基准测试数据集,专门用于评估文本生成模型在工具调用(tool-calling)和函数调用(function-calling)方面的能力。该数据集包含 235 个测试样本,每个样本都包含多轮对话(messages)、可用的工具定义(tools)、基准类别(category)、被排除的工具名称(held_out_tool)、预期调用的工具名称列表(gold_tools)、提供的工具数量(n_tools_offered)、源数据标签(source_split)、内容哈希指纹(fingerprint)以及用于评分参考的预期调用详情(gold_calls)。数据集的构建基于多个源数据集(combined-v6、combined-v7、combined-v8),并通过指纹去重和排除工具采样来确保评估的泛化性。该数据集仅提供测试集,不包含训练数据,主要用于评估模型对未见工具的泛化能力、多轮对话理解以及正确的工具调用格式。适用场景包括:模型评估(测量对未见函数的工具调用准确率)、微调指导(识别工具使用模型的失败模式)、基准测试(在标准化排除工具场景下比较模型)以及指令调优(研究函数调用前的对话模式)。数据集以 MIT 许可证发布,可通过 Hugging Face Datasets 库加载。

SakThai Bench v1 is part of the SakThai series, a compact benchmark dataset specifically designed to evaluate the ability of text generation models in tool-calling and function-calling. The dataset contains 235 test samples, each with multi-turn conversations (messages), available tool definitions (tools), benchmark categories (category), held-out tool names (held_out_tool), expected tool call name lists (gold_tools), number of tools offered (n_tools_offered), source split labels (source_split), content hash fingerprints (fingerprint), and expected call details for scoring reference (gold_calls). The dataset is built from multiple source datasets (combined-v6, combined-v7, combined-v8) and ensures generalization of evaluation through fingerprint deduplication and held-out tool sampling. This dataset provides only a test set, no training data, and is mainly used to evaluate model generalization to unseen tools, multi-turn conversation understanding, and correct tool call format. Applicable scenarios include: model evaluation (measuring tool call accuracy on unseen functions), fine-tuning guidance (identifying failure modes of tool-use models), benchmarking (comparing models under standardized held-out tool scenarios), and instruction tuning (studying conversation patterns before function calls). The dataset is released under the MIT license and can be loaded via the Hugging Face Datasets library.

创建时间:
2026-07-30
原始信息汇总

SakThai Bench v1 数据集详情

基本信息

  • 数据集名称:SakThai Bench v1
  • 许可证:MIT
  • 语言:英语(单语)
  • 数据集规模:1K < n < 10K
  • 任务类别:文本生成、工具使用
  • 具体任务:函数调用、工具调用
  • 标注方式:无人工标注(从已有标注数据集和合成生成中派生)
  • 数据来源:Nanthasit/sakthai-combined-v6、Nanthasit/sakthai-combined-v7、Nanthasit/sakthai-combined-v8

数据集概述

SakThai Bench v1 是 SakThai 系列的一部分,是一个用于评估文本生成模型中工具调用和函数调用能力的紧凑型基准数据集。数据集包含 235 个测试示例,用于评估模型是否能够:

  • 理解提供的工具/函数 JSON 结构
  • 生成格式正确的工具调用
  • 处理实际不可用的保留工具
  • 维持多轮对话上下文

数据字段

字段 类型 描述
messages list[dict] 包含 rolecontent 字段的多轮对话
tools list[dict] 包含 typefunction.namefunction.descriptionfunction.parameters JSON 结构的函数定义
category string 基准类别(如 mathwebcodereasoning
held_out_tool string 对模型保留的函数名称
gold_tools list[string] 预期调用的工具名称
n_tools_offered int 示例中提供的工具定义数量
source_split string 原始数据集标签
fingerprint string 用于可复现性的内容哈希
gold_calls list[dict] 用于评分的预期工具调用详情

数据划分

划分 配置 行数 说明
test default 235 主要基准示例,包含消息、工具和黄金调用
train default 0 仅元数据;训练去重工件当前不在仓库中

数据集规模

指标 数值
测试划分文件 data/test.jsonl
已验证测试行数 235(直接行计数)
格式 JSONL
许可证 MIT

仓库文件

文件 用途
README.md 数据卡片
data/test.jsonl 主要基准数据(235 个示例)
build_bench.py 数据集构建脚本
eval_bench.py 评估工具
validate_eval.py 验证检查
upgrade_bench.py 迁移工具
results/20260729T192409Z.json 基准结果快照

数据集创建

  • 方法论:从多个源数据集(combined-v6combined-v7combined-v8)策划基准示例,进行指纹去重和保留工具采样
  • 策划理由:评估对未见工具的泛化能力、多轮理解能力以及正确的工具调用格式
  • 标注过程:不适用,从已有标注数据集和合成生成中派生,无新的人工标注

使用场景

  1. 模型评估:衡量在未见函数上的工具调用准确率
  2. 微调指南:识别工具使用模型中的失败模式
  3. 基准测试:在标准化保留工具场景下比较模型
  4. 指令调优:研究函数调用前的对话模式

优点与局限性

优点

  • 真实的多轮对话格式
  • JSON 结构一致性检查
  • 保留工具泛化场景

局限性

  • 规模较小(235 个示例),适合作为快速评估基准,而非完整测试套件
  • 仅包含测试划分,用于评估而非训练
  • 可能反映源数据集(combined-v6combined-v7combined-v8)的偏差

加载方式

python from datasets import load_dataset

ds = load_dataset("Nanthasit/sakthai-bench-v1") print(ds)

访问基准划分

test_split = ds["test"] print(f"测试示例数: {len(test_split)}")

检查单个示例

example = test_split[0] print(example["messages"]) print(example["tools"]) print(example["gold_calls"])

基准测试说明

  • 评分格式:基于 test 划分的工具调用准确率 + 格式遵循度
  • 参考模型Nanthasit/sakthai-context-1.5b-merged-v2Nanthasit/sakthai-plus-1.5bNanthasit/sakthai-coder-1.5bNanthasit/sakthai-context-7b-tools
  • 结果存储:仓库中的 results/*.json 存储评估快照
  • 运行方式python eval_bench.py --model <model_id> --dataset Nanthasit/sakthai-bench-v1
搜集汇总
数据集介绍
sakthai-bench-v1 数据集图片
构建方式
SakThai Bench v1的构建过程凝聚了对多个源数据集(如combined-v6、combined-v7及combined-v8)的精选整合,辅以指纹去重技术以确保样本的独特性。构建脚本精心设计了留出工具(held-out tool)采样策略,模拟模型面对未知工具的泛化情境。每一测试样例均包含多轮对话消息、可用工具定义、基准类别、留出工具名称、期望调用的工具列表以及用于评分的目标调用细节,形成了结构化的评测体系。该过程完全依托已有标注数据与合成生成,未引入新的人工标注,保证了构建的自动化与高效性。
特点
SakThai Bench v1作为紧凑型基准数据集,其突出特点在于聚焦于评估模型在工具调用与函数调用方面的能力,尤其强调对未见工具的泛化性能及多轮对话上下文的保持。数据集内含235条精炼测试样本,覆盖数学、网络、代码、推理等多个类别,每条样本均配备了完整的工具JSON模式与目标调用参照,便于细粒度评分。此外,明确的指纹字段确保了结果的可复现性,而MIT许可协议则赋予其广泛使用的灵活性。作为仅测试基准,其设计初衷即用于快速评估,而非训练数据。
使用方法
使用SakThai Bench v1进行模型评估极为便捷,研究者可通过HuggingFace datasets库直接加载,如`load_dataset`即可获取测试分割,进而逐条检查消息、工具定义与目标调用。评估流程依托内置的`eval_bench.py`脚本,通过指定模型标识与数据集名称即可运行,系统将依据工具调用准确性与格式遵从度进行打分。该基准特别适用于对比不同模型在标准化留出工具场景下的表现,亦可用于诊断工具使用模型的失败模式,从而指导后续的微调优化。其结果快照可存储为JSON文件,便于追踪模型迭代过程中的性能变化。
背景与挑战
背景概述
SakThai Bench v1是由Nanthasit(Beer)于2026年创建的一个紧凑型基准数据集,旨在评估文本生成模型在工具调用和函数调用方面的能力。该数据集隶属于SakThai家族,通过整合来自多个源数据集(如combined-v6、combined-v7和combined-v8)的示例,并采用指纹去重和保留工具采样方法构建而成。其核心研究问题在于检验模型是否能够理解所提供的工具/函数JSON模式、生成格式正确的工具调用、处理实际不可用的保留工具,以及维护多轮对话上下文。作为仅包含测试集的基准,SakThai Bench v1提供了235个测试示例,每个示例包含多轮消息、可用工具、基准类别、保留工具名称、黄金工具名称和参考黄金调用。该数据集在工具调用评估领域具有潜在影响力,为模型比较和失败模式分析提供了标准化场景,尤其关注模型对未见工具的泛化能力。
当前挑战
SakThai Bench v1所面临的挑战主要分为领域问题和构建过程两方面。在领域问题层面,工具调用和函数调用是大型语言模型在现实应用中(如智能代理、自动化工作流)的关键能力,然而模型常常难以准确理解工具模式、生成符合格式的调用,并在多轮对话中保持一致性。该数据集通过包含保留工具来测试模型的泛化能力,这一设计挑战了模型对已知工具的过度拟合,要求其推断未见工具的功能。在构建过程中,挑战包括从多个源数据集中整合和去重,确保数据质量和一致性,同时避免引入源数据集的偏差。由于数据集规模较小(仅235个示例),其作为快速评估基准的效用受限于统计显著性和覆盖范围。此外,数据集的构建依赖于现有注释和合成生成,缺乏新的人工注释,这可能影响数据的真实性和多样性。构建过程中的另一个挑战是处理训练元数据的不完整(如训练排除指纹文件缺失),这限制了数据集的复用和扩展性。
常用场景
经典使用场景
SakThai Bench v1作为专为评估文本生成模型中工具调用与函数调用能力而设计的紧凑型基准数据集,其核心应用场景在于对模型在理解工具JSON模式、生成规范化的工具调用格式以及处理未见工具(held-out tools)方面的性能进行标准化测试。该基准通过多轮对话上下文中提供可用工具集,并要求模型依据对话历史推断并调用正确函数,从而精确衡量模型在动态工具环境下的适应性。研究者可借助该数据集对各自模型进行快速评估,以量化其在结构化工具使用任务中的表现,尤其在需要结合上下文语境进行函数选择的场景中,该基准提供了严谨且可复现的评测框架。
衍生相关工作
围绕SakThai Bench v1,系列研究可在此基准之上展开,包括构建更大规模的多领域工具调用测试集,以扩展评测覆盖面;亦可基于其评测结果,开发针对工具使用失败模式的优化训练策略,如增强格式一致性或引入反事实工具推理。该基准还可能催生面向特定行业(如医疗、金融)的定制化工具调用基准,以及探索多模态输入下的函数调用评估新维度。参考文献中提及的SakThai家族模型(如sakthai-context系列)或可依据此基准进行微调,从而形成“评测-改进-再评测”的闭环研究,推动工具增强型语言模型的系统化演进。
数据集最近研究
最新研究方向
当前,大语言模型在工具调用与函数调用领域的研究前沿聚焦于提升模型对未见工具的泛化能力与多轮对话中的意图解析精度。SakThai Bench v1 作为此方向的轻量级基准,通过精心构造的235例测试样本,系统性地评估模型在遵循JSON Schema、生成格式正确的工具调用及处理保留工具等关键维度的表现。该基准的发布为工具调用模型的稳健性验证提供了标准化范式,特别是在避免训练数据泄漏、确保评价客观性方面具有标杆意义。其数据构建方法融合了多源数据去重与保留工具采样策略,有助于推动模型从记忆式调用向语义理解式调用的转变,并对工具增强型智能体的开发与迭代产生深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务