turkish-tool-calling
收藏资源简介:
Türkçe Tool-Calling Veri Seti(土耳其语工具调用数据集)是Mustafaege/qwen3.5-toolcalling-v2数据集的土耳其语翻译子集,专门为土耳其语工具调用(Tool-Calling)或函数调用(Function-Calling)任务而设计。该数据集包含14,225个对话样本,划分为13,514个训练样本和711个测试样本。每个样本以messages字段表示,该字段是一个由字典组成的列表,每个字典包含role和content键,角色包括system、user、assistant和answer。在翻译过程中,用户查询、助手回复、推理过程、工具描述和系统指令等自然语言内容被翻译成土耳其语,而函数名称、JSON键、<tool_call>参数、<tool_response>输出、代码和XML标签等技术结构则保留原始英语形式,以确保结构完整性。翻译工作使用GPT-5.4-mini模型完成,并已验证了JSON工具调用和XML标签的结构有效性,过滤了损坏行。该数据集适用于训练或评估土耳其语大语言模型在工具调用、智能体(Agentic)交互等文本生成任务上的能力。数据集由伊斯坦布尔技术大学(ITU)的ITU Perceptron学生团队开发。
数据集概述
- 数据集名称: Türkçe Tool-Calling Veri Seti (Turkish Tool-Calling Dataset)
- 许可证: Apache-2.0
- 语言: 土耳其语 (tr)
- 任务类别: 文本生成 (text-generation)
- 标签: tool-calling, function-calling, agentic, turkish
- 数据规模: 10K < n < 100K
数据规模与划分
- 总行数: 14,225
- 训练集: 13,514 条
- 测试集: 711 条
数据来源
该数据集是 Mustafaege/qwen3.5-toolcalling-v2 数据集的土耳其语翻译子集。
数据字段
- messages: 每条对话由包含
{"role", "content"}字典的列表组成。角色包括:system,user,assistant,answer。
翻译策略
- 翻译内容: 自然语言部分(用户问题、助手回答、
<think>推理、工具描述、系统指令)被翻译为土耳其语。 - 保留原样: 技术结构部分(函数名称、JSON 键、
<tool_call>参数、<tool_response>输出、代码和 XML 标签)保持英文/原始形式。 - 翻译模型: GPT-5.4-mini
- 质量验证: 验证了结构完整性(有效 JSON
tool_call、平衡 XML 标签),过滤了格式错误的行。
数据使用示例
python import pandas as pd from datasets import load_dataset
ds = load_dataset("ituperceptron/turkish-tool-calling") df = pd.DataFrame(ds["train"]) print(df.head())
开发团队
由伊斯坦布尔理工大学 (İstanbul Teknik Üniversitesi) 学生组成的 ITU Perceptron 团队开发。联系方式: ituperceptron@gmail.com





