遇见数据集

sakthai-bench-v2

收藏
Hugging Face2026-08-01 更新2026-08-02 收录
官方服务:

资源简介:

SakThai Bench v2 是一个用于评估工具使用和函数调用行为的基准测试数据集,归属于 SakThai 模型家族。该数据集仅包含测试集,共 500 个样本,以 JSONL 格式存储于 data/test.jsonl 文件中。每个样本包含完整的对话消息(messages)、提供的工具定义(tools)、预期工具名称(gold_tools)、预期工具调用详情(gold_calls)、类别(category)、是否为多轮对话(multi_turn)、提供的工具数量(n_tools_offered)、来源分割(source_split)、指纹(fingerprint)、是否为保留工具(held_out_tool)、是否出现在 v1 版本中(in_v1)以及轮次索引(turn_index)。数据集涵盖四个基准类别:simple(150 个单轮简单工具调用)、parallel(150 个并行多工具调用)、irrelevance_tools(150 个有相关工具但存在干扰项)、irrelevance_no_tools(50 个提供的工具集中无正确工具)。其中包含 164 个多轮对话样本、41 个保留工具样本和 235 个与 v1 重叠的样本。数据集总大小为 1,529,551 字节,仅有一个默认配置(default)和测试分割。该基准测试旨在评估模型在正确工具调用、参数遵守、泛化到未见工具以及多轮工具状态跟踪方面的能力。数据来源于已有标注数据集和合成生成,经过指纹去重和保留工具采样。适用于模型评估、微调指导、标准化基准测试和指令微调研究。许可证为 MIT。

SakThai Bench v2 is a benchmark dataset for evaluating tool use and function calling behavior, belonging to the SakThai model family. The dataset contains only a test set with 500 samples, stored in JSONL format in the data/test.jsonl file. Each sample includes complete conversation messages (messages), provided tool definitions (tools), expected tool names (gold_tools), expected tool call details (gold_calls), category, whether it is a multi-turn conversation (multi_turn), number of tools offered (n_tools_offered), source split (source_split), fingerprint (fingerprint), whether it is a held-out tool (held_out_tool), whether it appears in v1 (in_v1), and turn index (turn_index). The dataset covers four benchmark categories: simple (150 single-turn simple tool calls), parallel (150 parallel multi-tool calls), irrelevance_tools (150 with relevant tools but distractors), and irrelevance_no_tools (50 with no correct tool in the provided tool set). It includes 164 multi-turn dialogue samples, 41 held-out tool samples, and 235 samples overlapping with v1. The total dataset size is 1,529,551 bytes, with only one default configuration and test split. This benchmark aims to evaluate model capabilities in correct tool invocation, parameter adherence, generalization to unseen tools, and multi-turn tool state tracking. Data sources include existing annotated datasets and synthetic generation, with fingerprint deduplication and held-out tool sampling. It is suitable for model evaluation, fine-tuning guidance, standardized benchmarking, and instruction-tuning research. License: MIT.

创建时间:
2026-07-30
原始信息汇总

SakThai Bench v2 数据集详情

基本信息

  • 数据集名称:SakThai Bench v2
  • 作者:SakThai Agent (Nanthasit)
  • 许可证:MIT
  • 语言:英语
  • 任务类型:工具使用 / 函数调用基准测试(text-generation / dialogue-generation)
  • 所属系列:SakThai Model Family

数据集概述

SakThai Bench v2 是一个用于评估工具使用和函数调用行为的基准测试数据集。它包含 500 个标注示例data/test.jsonl),用于测试模型是否能在简单和多轮对话场景中调用正确的工具并传递正确的参数,同时评估模型对未见过的工具(held-out tools)的泛化能力以及与 v1 版本的重叠情况。

基准分类

类别 数量 说明
simple 150 单轮、直接的工具调用
parallel 150 需要并行调用的多工具轮次
irrelevance_tools 150 在干扰工具中提供相关工具
irrelevance_no_tools 50 所提供的工具集中没有正确工具

总计:500 个示例

其他统计信息:

  • 多轮对话(multi_turn):164 个
  • 包含未见工具(held_out_tool):41 个
  • 与 v1 重叠(in_v1):235 个

数据字段

字段 类型 描述
messages list[dict] 对话消息,包含工具调用和工具结果
tools list[dict] 该轮提供的工具定义
gold_tools list[str] 预期的工具名称
gold_calls list[dict] 预期工具调用详情,用于评分
category string 基准类别
multi_turn bool 是否为多轮对话
n_tools_offered int 该轮工具定义的数量
source_split string 来源数据集或分割
fingerprint string 可复现性/内容哈希
held_out_tool bool 是否为泛化测试而保留的工具
in_v1 bool 是否在 v1 中出现过
turn_index int 对话轮次索引

数据集结构

  • 配置:default
  • 数据划分:仅 test 拆分(500 行)
  • 格式:JSONL(data/test.jsonl

基准文件

文件 作用
data/test.jsonl 标准基准示例
train_exclude_fingerprints.json 可复现性辅助文件:保留的工具名称及训练时过滤的指纹
results/*.json 保存的评估运行结果

注意train_exclude_fingerprints.json 用于训练时排除和复现性目的,不属于 test 拆分的一部分。

数据集规模

指标
总行数 500
拆分数量 1(test)
主文件大小 1,529,551 字节

验证快照

检查项
已验证 true
最后验证时间 2026-08-01
验证者 SakThai Agent
主要来源 data/test.jsonl
验证文件大小 1,529,551 字节
验证行数 500
Datasets Server 预览 false
Datasets Server 查看器 false

注意:Datasets Server 目前不提供此仓库的预览/查看器功能(preview=false, viewer=false)。上述验证计数来自标准的 data/test.jsonl 文件和 README YAML 元数据。

数据集创建

  • 方法论:从多个来源整理基准示例,通过指纹去重和保留工具抽样生成
  • 整理逻辑:评估对未见工具的泛化能力、多轮理解能力和正确的工具调用格式
  • 标注过程:不适用(源自现有标注数据集和合成生成)

加载方式

python from datasets import load_dataset

ds = load_dataset("Nanthasit/sakthai-bench-v2") test_split = ds["test"] print(f"Test examples: {len(test_split)}")

按类别筛选示例

simple = [ex for ex in test_split if ex["category"] == "simple"] print(f"Simple examples: {len(simple)}")

使用场景

  1. 模型评估:衡量未见/未知工具上的工具调用准确性
  2. 微调指导:识别并行和多轮工具使用中的失败模式
  3. 基准测试:在标准化工具调用任务上对比模型
  4. 指令微调:研究函数调用前的对话模式

优点与局限

优点

  • 包含带工具结果的真实多轮对话格式
  • 通过 gold_calls 测试 JSON schema 遵循性
  • 包含保留工具泛化场景和 v1 重叠标记

局限

  • 中等规模(500 个示例)——适合快速评估,不适合作为完整测试套件
  • 仅有 test 拆分——仅用于评估,不适合训练
  • 可能反映来源数据集的偏差

引用

bibtex @dataset{sakthai_bench_v2, title = {SakThai Bench v2}, author = {Nanthasit (Beer)}, year = {2026}, url = {https://huggingface.co/datasets/Nanthasit/sakthai-bench-v2} }

搜集汇总
数据集介绍
sakthai-bench-v2 数据集图片
构建方式
SakThai Bench v2 是面向工具调用与函数调用行为评估的基准数据集,由 SakThai Agent 团队构建。其构建过程融合了多源数据的精心策展,基于 Nanthasit/sakthai-combined-v6 与 v7 等既有数据集进行衍生与合成生成,并运用指纹去重技术与留出工具采样策略,确保了样本的独特性和泛化评估的可行性。数据集以 JSONL 格式存储于 data/test.jsonl,包含 500 条标注样例,每条记录涵盖对话消息、工具定义、预期工具名称及调用细节等字段,类别覆盖简单调用、并行调用、干扰项存在与否等场景,并标注了多轮对话与工具留出标志,为模型工具调用能力的多维度评估提供了结构化基础。
特点
该数据集的特点在于其精细的评估维度和真实对话格式。它模拟了多轮对话中工具调用的完整流程,包含工具结果反馈,能够严格检验模型在参数遵循上的准确性(通过 gold_calls 字段)。数据集特别设计了留出工具(held_out_tool)样本,专门用于测试模型对未见工具的泛化能力,同时提供了 in_v1 重叠标志,便于与上一版本进行对比分析。类别划分明确,包括简单、并行、无关工具等场景,其中并行调用类别占比显著,可有效考察模型同时处理多个工具请求的能力。此外,数据集包含 164 个多轮对话样本,为评估对话状态追踪和上下文依赖下的工具选择提供了契机。
使用方法
SakThai Bench v2 的使用方法简便直观,通过 HuggingFace datasets 库即可一键加载,默认仅包含 test 分割,专为评估而非训练设计。用户可依据 category 字段筛选特定类别的样例,如简单或并行调用,进行针对性分析。评估流程通常配合 eval_bench.py 脚本,对 SakThai 模型家族中的适配器或合并变体进行标准化测试,结果可保存至 results/ 目录供后续对比。此外,数据集还提供了 train_exclude_fingerprints.json 文件,用于在训练阶段排除重叠指纹,保障评估的公正性。该基准适用于模型工具调用准确率测评、微调指导、多模型对比以及指令调优研究,但需注意其规模适中(500 条),更适合作为快速验证的基准而非全面测试套件。
背景与挑战
背景概述
SakThai Bench v2是由SakThai Agent (Nanthasit)于2026年创建的工具调用与函数调用基准测试数据集,隶属于SakThai模型家族。该数据集旨在评估语言模型在工具调用场景下的准确性与泛化能力,涵盖简单调用、并行调用、无关工具判别等任务,并包含多轮对话与未见工具的泛化测试。作为SakThai系列模型(0.5B至7B规模)的核心评估基准,它促进了工具调用领域标准化评测的发展,为模型开发与迭代提供了可靠依据。
当前挑战
该数据集所解决的领域问题在于工具调用任务中模型对工具选择的准确性、参数遵循度以及多轮状态下工具调用的连贯性,其挑战在于构建中需处理多源数据整合与去重,确保类别均衡及多轮样本的代表性。此外,数据集包含刻意留出的未见工具样本,以测试模型泛化能力,但规模较小(500例)限制了其全面性,且仅含测试集,无法用于训练,可能引入来源偏差,需后续扩充以增强稳健性。
常用场景
经典使用场景
在自然语言处理领域,工具调用与函数调用是构建智能代理系统的核心能力。SakThai Bench v2 作为一项专为评估这一能力而设计的基准测试,其经典使用场景在于对模型在标准化环境下的工具选择、参数生成及多轮对话中状态追踪能力进行精确度量。该基准涵盖简单、并行及无关工具三类任务,通过500个精心标注的测试样本,系统性地检验模型能否依据对话历史与当前需求,从候选工具集中准确调用恰当工具并生成符合JSON模式的调用参数,为研究模型在复杂工具交互场景中的表现提供了严谨的评估平台。
衍生相关工作
围绕SakThai Bench v2,衍生出一系列深化工具调用研究的经典工作。标准化的评估方案催生了针对不同规模SakThai模型家族的全面性能对比,揭示了模型容量与工具使用能力之间的关联规律。训练集指纹信息与排除机制的引入,促进了数据泄漏防护策略的探索,推动了模型泛化能力评估的严谨性。此外,该基准还被用作微调训练的验证集,指导研究者设计对抗性示例和多轮对话数据增强方法,显著提升了模型在动态工具环境中的适应性,为工具增强型语言模型的发展奠定了重要基础。
数据集最近研究
最新研究方向
在工具调用与函数调用基准测试的前沿领域,SakThai Bench v2致力于推动语言模型在复杂多轮对话中的工具使用能力评估。该数据集精心设计了简单、并行及干扰工具等多样化场景,并引入了未见工具与多轮状态跟踪的泛化测试,为研究者提供了标准化、可复现的评测框架。其与SakThai模型家族的紧密耦合,以及针对0.5B至7B不同规模适配器变体的验证,彰显了其在模型鲁棒性与可扩展性研究中的关键价值。通过精细的指纹去重与类别平衡,该基准不仅助力识别模型在并行调用和参数遵循上的薄弱环节,更为指令微调与工具选择策略的优化提供了数据驱动的洞见,对推动智能体系统在真实世界中的应用具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务