sakthai-bench-v2
收藏资源简介:
SakThai Bench v2 是一个用于评估工具使用和函数调用行为的基准测试数据集,归属于 SakThai 模型家族。该数据集仅包含测试集,共 500 个样本,以 JSONL 格式存储于 data/test.jsonl 文件中。每个样本包含完整的对话消息(messages)、提供的工具定义(tools)、预期工具名称(gold_tools)、预期工具调用详情(gold_calls)、类别(category)、是否为多轮对话(multi_turn)、提供的工具数量(n_tools_offered)、来源分割(source_split)、指纹(fingerprint)、是否为保留工具(held_out_tool)、是否出现在 v1 版本中(in_v1)以及轮次索引(turn_index)。数据集涵盖四个基准类别:simple(150 个单轮简单工具调用)、parallel(150 个并行多工具调用)、irrelevance_tools(150 个有相关工具但存在干扰项)、irrelevance_no_tools(50 个提供的工具集中无正确工具)。其中包含 164 个多轮对话样本、41 个保留工具样本和 235 个与 v1 重叠的样本。数据集总大小为 1,529,551 字节,仅有一个默认配置(default)和测试分割。该基准测试旨在评估模型在正确工具调用、参数遵守、泛化到未见工具以及多轮工具状态跟踪方面的能力。数据来源于已有标注数据集和合成生成,经过指纹去重和保留工具采样。适用于模型评估、微调指导、标准化基准测试和指令微调研究。许可证为 MIT。
SakThai Bench v2 is a benchmark dataset for evaluating tool use and function calling behavior, belonging to the SakThai model family. The dataset contains only a test set with 500 samples, stored in JSONL format in the data/test.jsonl file. Each sample includes complete conversation messages (messages), provided tool definitions (tools), expected tool names (gold_tools), expected tool call details (gold_calls), category, whether it is a multi-turn conversation (multi_turn), number of tools offered (n_tools_offered), source split (source_split), fingerprint (fingerprint), whether it is a held-out tool (held_out_tool), whether it appears in v1 (in_v1), and turn index (turn_index). The dataset covers four benchmark categories: simple (150 single-turn simple tool calls), parallel (150 parallel multi-tool calls), irrelevance_tools (150 with relevant tools but distractors), and irrelevance_no_tools (50 with no correct tool in the provided tool set). It includes 164 multi-turn dialogue samples, 41 held-out tool samples, and 235 samples overlapping with v1. The total dataset size is 1,529,551 bytes, with only one default configuration and test split. This benchmark aims to evaluate model capabilities in correct tool invocation, parameter adherence, generalization to unseen tools, and multi-turn tool state tracking. Data sources include existing annotated datasets and synthetic generation, with fingerprint deduplication and held-out tool sampling. It is suitable for model evaluation, fine-tuning guidance, standardized benchmarking, and instruction-tuning research. License: MIT.
SakThai Bench v2 数据集详情
基本信息
- 数据集名称:SakThai Bench v2
- 作者:SakThai Agent (Nanthasit)
- 许可证:MIT
- 语言:英语
- 任务类型:工具使用 / 函数调用基准测试(text-generation / dialogue-generation)
- 所属系列:SakThai Model Family
数据集概述
SakThai Bench v2 是一个用于评估工具使用和函数调用行为的基准测试数据集。它包含 500 个标注示例(data/test.jsonl),用于测试模型是否能在简单和多轮对话场景中调用正确的工具并传递正确的参数,同时评估模型对未见过的工具(held-out tools)的泛化能力以及与 v1 版本的重叠情况。
基准分类
| 类别 | 数量 | 说明 |
|---|---|---|
| simple | 150 | 单轮、直接的工具调用 |
| parallel | 150 | 需要并行调用的多工具轮次 |
| irrelevance_tools | 150 | 在干扰工具中提供相关工具 |
| irrelevance_no_tools | 50 | 所提供的工具集中没有正确工具 |
总计:500 个示例
其他统计信息:
- 多轮对话(multi_turn):164 个
- 包含未见工具(held_out_tool):41 个
- 与 v1 重叠(in_v1):235 个
数据字段
| 字段 | 类型 | 描述 |
|---|---|---|
messages |
list[dict] | 对话消息,包含工具调用和工具结果 |
tools |
list[dict] | 该轮提供的工具定义 |
gold_tools |
list[str] | 预期的工具名称 |
gold_calls |
list[dict] | 预期工具调用详情,用于评分 |
category |
string | 基准类别 |
multi_turn |
bool | 是否为多轮对话 |
n_tools_offered |
int | 该轮工具定义的数量 |
source_split |
string | 来源数据集或分割 |
fingerprint |
string | 可复现性/内容哈希 |
held_out_tool |
bool | 是否为泛化测试而保留的工具 |
in_v1 |
bool | 是否在 v1 中出现过 |
turn_index |
int | 对话轮次索引 |
数据集结构
- 配置:default
- 数据划分:仅 test 拆分(500 行)
- 格式:JSONL(
data/test.jsonl)
基准文件
| 文件 | 作用 |
|---|---|
data/test.jsonl |
标准基准示例 |
train_exclude_fingerprints.json |
可复现性辅助文件:保留的工具名称及训练时过滤的指纹 |
results/*.json |
保存的评估运行结果 |
注意:
train_exclude_fingerprints.json用于训练时排除和复现性目的,不属于 test 拆分的一部分。
数据集规模
| 指标 | 值 |
|---|---|
| 总行数 | 500 |
| 拆分数量 | 1(test) |
| 主文件大小 | 1,529,551 字节 |
验证快照
| 检查项 | 值 |
|---|---|
| 已验证 | true |
| 最后验证时间 | 2026-08-01 |
| 验证者 | SakThai Agent |
| 主要来源 | data/test.jsonl |
| 验证文件大小 | 1,529,551 字节 |
| 验证行数 | 500 |
| Datasets Server 预览 | false |
| Datasets Server 查看器 | false |
注意:Datasets Server 目前不提供此仓库的预览/查看器功能(
preview=false, viewer=false)。上述验证计数来自标准的data/test.jsonl文件和 README YAML 元数据。
数据集创建
- 方法论:从多个来源整理基准示例,通过指纹去重和保留工具抽样生成
- 整理逻辑:评估对未见工具的泛化能力、多轮理解能力和正确的工具调用格式
- 标注过程:不适用(源自现有标注数据集和合成生成)
加载方式
python from datasets import load_dataset
ds = load_dataset("Nanthasit/sakthai-bench-v2") test_split = ds["test"] print(f"Test examples: {len(test_split)}")
按类别筛选示例
simple = [ex for ex in test_split if ex["category"] == "simple"] print(f"Simple examples: {len(simple)}")
使用场景
- 模型评估:衡量未见/未知工具上的工具调用准确性
- 微调指导:识别并行和多轮工具使用中的失败模式
- 基准测试:在标准化工具调用任务上对比模型
- 指令微调:研究函数调用前的对话模式
优点与局限
优点:
- 包含带工具结果的真实多轮对话格式
- 通过
gold_calls测试 JSON schema 遵循性 - 包含保留工具泛化场景和 v1 重叠标记
局限:
- 中等规模(500 个示例)——适合快速评估,不适合作为完整测试套件
- 仅有 test 拆分——仅用于评估,不适合训练
- 可能反映来源数据集的偏差
引用
bibtex @dataset{sakthai_bench_v2, title = {SakThai Bench v2}, author = {Nanthasit (Beer)}, year = {2026}, url = {https://huggingface.co/datasets/Nanthasit/sakthai-bench-v2} }




