sakthai-bench-v1
收藏资源简介:
SakThai Bench v1 是 SakThai 系列的一部分,是一个紧凑的基准测试数据集,专门用于评估文本生成模型在工具调用(tool-calling)和函数调用(function-calling)方面的能力。该数据集包含 235 个测试样本,每个样本都包含多轮对话(messages)、可用的工具定义(tools)、基准类别(category)、被排除的工具名称(held_out_tool)、预期调用的工具名称列表(gold_tools)、提供的工具数量(n_tools_offered)、源数据标签(source_split)、内容哈希指纹(fingerprint)以及用于评分参考的预期调用详情(gold_calls)。数据集的构建基于多个源数据集(combined-v6、combined-v7、combined-v8),并通过指纹去重和排除工具采样来确保评估的泛化性。该数据集仅提供测试集,不包含训练数据,主要用于评估模型对未见工具的泛化能力、多轮对话理解以及正确的工具调用格式。适用场景包括:模型评估(测量对未见函数的工具调用准确率)、微调指导(识别工具使用模型的失败模式)、基准测试(在标准化排除工具场景下比较模型)以及指令调优(研究函数调用前的对话模式)。数据集以 MIT 许可证发布,可通过 Hugging Face Datasets 库加载。
SakThai Bench v1 is part of the SakThai series, a compact benchmark dataset specifically designed to evaluate the ability of text generation models in tool-calling and function-calling. The dataset contains 235 test samples, each with multi-turn conversations (messages), available tool definitions (tools), benchmark categories (category), held-out tool names (held_out_tool), expected tool call name lists (gold_tools), number of tools offered (n_tools_offered), source split labels (source_split), content hash fingerprints (fingerprint), and expected call details for scoring reference (gold_calls). The dataset is built from multiple source datasets (combined-v6, combined-v7, combined-v8) and ensures generalization of evaluation through fingerprint deduplication and held-out tool sampling. This dataset provides only a test set, no training data, and is mainly used to evaluate model generalization to unseen tools, multi-turn conversation understanding, and correct tool call format. Applicable scenarios include: model evaluation (measuring tool call accuracy on unseen functions), fine-tuning guidance (identifying failure modes of tool-use models), benchmarking (comparing models under standardized held-out tool scenarios), and instruction tuning (studying conversation patterns before function calls). The dataset is released under the MIT license and can be loaded via the Hugging Face Datasets library.
SakThai Bench v1 数据集详情
基本信息
- 数据集名称:SakThai Bench v1
- 许可证:MIT
- 语言:英语(单语)
- 数据集规模:1K < n < 10K
- 任务类别:文本生成、工具使用
- 具体任务:函数调用、工具调用
- 标注方式:无人工标注(从已有标注数据集和合成生成中派生)
- 数据来源:Nanthasit/sakthai-combined-v6、Nanthasit/sakthai-combined-v7、Nanthasit/sakthai-combined-v8
数据集概述
SakThai Bench v1 是 SakThai 系列的一部分,是一个用于评估文本生成模型中工具调用和函数调用能力的紧凑型基准数据集。数据集包含 235 个测试示例,用于评估模型是否能够:
- 理解提供的工具/函数 JSON 结构
- 生成格式正确的工具调用
- 处理实际不可用的保留工具
- 维持多轮对话上下文
数据字段
| 字段 | 类型 | 描述 |
|---|---|---|
messages |
list[dict] | 包含 role 和 content 字段的多轮对话 |
tools |
list[dict] | 包含 type、function.name、function.description 和 function.parameters JSON 结构的函数定义 |
category |
string | 基准类别(如 math、web、code、reasoning) |
held_out_tool |
string | 对模型保留的函数名称 |
gold_tools |
list[string] | 预期调用的工具名称 |
n_tools_offered |
int | 示例中提供的工具定义数量 |
source_split |
string | 原始数据集标签 |
fingerprint |
string | 用于可复现性的内容哈希 |
gold_calls |
list[dict] | 用于评分的预期工具调用详情 |
数据划分
| 划分 | 配置 | 行数 | 说明 |
|---|---|---|---|
test |
default |
235 | 主要基准示例,包含消息、工具和黄金调用 |
train |
default |
0 | 仅元数据;训练去重工件当前不在仓库中 |
数据集规模
| 指标 | 数值 |
|---|---|
| 测试划分文件 | data/test.jsonl |
| 已验证测试行数 | 235(直接行计数) |
| 格式 | JSONL |
| 许可证 | MIT |
仓库文件
| 文件 | 用途 |
|---|---|
README.md |
数据卡片 |
data/test.jsonl |
主要基准数据(235 个示例) |
build_bench.py |
数据集构建脚本 |
eval_bench.py |
评估工具 |
validate_eval.py |
验证检查 |
upgrade_bench.py |
迁移工具 |
results/20260729T192409Z.json |
基准结果快照 |
数据集创建
- 方法论:从多个源数据集(
combined-v6、combined-v7、combined-v8)策划基准示例,进行指纹去重和保留工具采样 - 策划理由:评估对未见工具的泛化能力、多轮理解能力以及正确的工具调用格式
- 标注过程:不适用,从已有标注数据集和合成生成中派生,无新的人工标注
使用场景
- 模型评估:衡量在未见函数上的工具调用准确率
- 微调指南:识别工具使用模型中的失败模式
- 基准测试:在标准化保留工具场景下比较模型
- 指令调优:研究函数调用前的对话模式
优点与局限性
优点:
- 真实的多轮对话格式
- JSON 结构一致性检查
- 保留工具泛化场景
局限性:
- 规模较小(235 个示例),适合作为快速评估基准,而非完整测试套件
- 仅包含测试划分,用于评估而非训练
- 可能反映源数据集(
combined-v6、combined-v7、combined-v8)的偏差
加载方式
python from datasets import load_dataset
ds = load_dataset("Nanthasit/sakthai-bench-v1") print(ds)
访问基准划分
test_split = ds["test"] print(f"测试示例数: {len(test_split)}")
检查单个示例
example = test_split[0] print(example["messages"]) print(example["tools"]) print(example["gold_calls"])
基准测试说明
- 评分格式:基于
test划分的工具调用准确率 + 格式遵循度 - 参考模型:
Nanthasit/sakthai-context-1.5b-merged-v2、Nanthasit/sakthai-plus-1.5b、Nanthasit/sakthai-coder-1.5b、Nanthasit/sakthai-context-7b-tools - 结果存储:仓库中的
results/*.json存储评估快照 - 运行方式:
python eval_bench.py --model <model_id> --dataset Nanthasit/sakthai-bench-v1




